Запись архива

Claude 3: как Anthropic догнала GPT-4 в марте 2024 года

Разбираем, что на самом деле показал релиз Claude 3 от 4 марта 2024 года: где Opus вышел на уровень GPT-4, почему Sonnet был не менее важен и где таблицы Anthropic требуют осторожности.

Сравнительная таблица Claude 3 Opus, Sonnet и Haiku против GPT-4, GPT-3.5 и Gemini 1.0 на MMLU, GPQA, GSM8K, HumanEval и MMMU в контексте релиза марта 2024 года

4 марта 2024 года Anthropic представила семейство Claude 3: Haiku, Sonnet и Opus. По собственной мартовской таблице компании, Opus впервые для Anthropic выглядел не как просто сильная альтернатива рядом с GPT-4, а как модель, которая на ряде стандартных текстовых и визуальных тестов уже идет вровень или выше.

Это важно в историческом смысле. После релиза GPT-4 14 марта 2023 года именно он оставался основной точкой отсчета в публичных сравнениях больших моделей. Но слово «догнала» здесь нужно понимать узко: речь о конкретном срезе оценок на 4 марта 2024 года, а не о доказанном превосходстве Claude 3 на всех задачах.

Коротко

  • Claude 3 был не одной моделью, а линейкой из трех уровней: Haiku, Sonnet и Opus. Для рынка это было не менее важно, чем один флагманский результат.
  • По мартовской таблице Anthropic, Claude 3 Opus выглядел на уровне или выше GPT-4 на MMLU, GSM8K, HumanEval, HellaSwag и ряде других текстовых тестов; в мультимодальности он тоже оказался в верхнем эшелоне.
  • Сравнение нельзя читать как окончательный вердикт: протоколы отличаются, shot-настройки отличаются, а числа для Claude 3 в прямом head-to-head в основном опубликованы самой Anthropic.
  • Практический смысл релиза был таким: к марту 2024 года Anthropic стала восприниматься как поставщик не только длинного контекста и «безопасного» чат-бота, но и полноценной фронтирной альтернативы GPT-4.
  • Если говорить строго, Claude 3 не «закрыл вопрос навсегда», а вошел в зону паритета с GPT-4 на тогдашних публичных бенчмарках.

Контекст

Чтобы понять эффект Claude 3, важно вспомнить, что задавал планку до него. OpenAI выпустила публичный анонс GPT-4 14 марта 2023 года, а технический отчет датирован 27 марта 2023 года. В нем GPT-4 сообщал 86.4% на MMLU, 92.0% на GSM8K и 67.0% на HumanEval; те же числа затем фигурируют и в сравнительной таблице Anthropic. Иными словами, к весне 2024 года у рынка уже был устоявшийся «референсный» набор результатов GPT-4.

Google попыталась сместить эту точку сравнения релизом Gemini 1.0 6 декабря 2023 года. Но и Google, и Anthropic по сути все равно сравнивали себя с GPT-4. Поэтому в марте 2024 года вопрос был не в том, появился ли еще один сильный LLM, а в том, может ли кто-то кроме OpenAI всерьез претендовать на статус модели уровня фронтира.

На этом фоне Claude 3 выглядел переломом. До него Anthropic обычно ассоциировалась с длинным контекстом, аккуратным поведением модели и корпоративными сценариями. После релиза Opus и Sonnet разговор сместился к общей способности: рассуждение, код, математика, визуальные задачи и качество ответа без явной деградации по сравнению с GPT-4.

Метод

Главная методическая деталь: мартовская таблица Anthropic сравнивала модели не в одном универсальном режиме, а в наборе разных протоколов. Для текста там соседствуют, например, MMLU 5-shot, GPQA Diamond 0-shot CoT, GSM8K 0-shot CoT, HumanEval 0-shot, DROP 3-shot и HellaSwag 10-shot. Для vision-задач отдельно идут MMMU (val), MathVista, AI2D и Chart QA.

Это важно по двум причинам. Во-первых, счет зависит не только от модели, но и от режима оценки. Во-вторых, разные лаборатории публиковали числа в разных условиях. Самый наглядный пример — MMLU для Gemini. В декабрьском анонсе Google пишет о 90.0% у Gemini Ultra на MMLU с «новым подходом» к этому тесту, тогда как в таблице Anthropic для Gemini 1.0 Ultra стоит 83.7% в режиме 5-shot. Это не обязательно противоречие; это демонстрация того, что «один benchmark, одно число» — слишком грубая схема.

Есть и третья оговорка. OpenAI в GPT-4 Technical Report прямо указала, что multiple-choice оценки GPT-4 в отчете были получены на snapshot от 1 марта 2023 года. Для GSM8K OpenAI также отдельно оговорила, что часть тренировочного набора этого benchmark была добавлена в pretraining mix GPT-4. То есть даже числа самой базовой точки отсчета уже нужно читать с методическими примечаниями, а не как чистую «сущность модели».

Результаты

Ниже — результаты из мартовской сравнительной таблицы Anthropic от 4 марта 2024 года. Для Claude 3 это в основном единственный первичный источник прямого head-to-head на дату релиза, поэтому значения стоит читать как заявленные автором релиза числа, а не как независимую общую репликацию всей таблицы.

Бенчмарк Что измеряет Claude 3 Opus GPT-4 / GPT-4V Как это читать
MMLU Широкое академическое знание и решение задач по 57 предметам 86.8% 86.4% Число GPT-4 совпадает с Technical Report OpenAI; Opus в таблице Anthropic выходит чуть выше.
GPQA Diamond Сложные «google-proof» вопросы по естественным наукам 50.4% 35.7% Здесь преимущество Opus выглядит одним из самых заметных, но прямой matched результат опубликован самой Anthropic.
GSM8K Школьная математика с многошаговым выводом 95.0% 92.0% Число GPT-4 подтверждается OpenAI; для Claude 3 это авторский замер Anthropic.
HumanEval Генерация кода по docstring-спецификации 84.9% 67.0% Один из ключевых сигналов, что Anthropic стала конкурентоспособной не только в чате, но и в коде.
HellaSwag Бытовой commonsense 95.4% 95.3% Скорее паритет, чем перелом.
MMMU (val) Мультимодальное понимание на задачах уровня колледжа 59.4% 56.8% у GPT-4V Anthropic показала Opus выше GPT-4V; сам paper MMMU тоже описывает GPT-4V и Gemini Ultra как модели порядка 56% и 59% на этом тесте.

Если вынести за скобки шум конкретных benchmark-режимов, то картина была простой. Opus впервые сделал для Anthropic правдоподобным тезис «мы уже не позади GPT-4 по общей способности». Особенно это было видно по сочетанию MMLU, GSM8K и HumanEval: знание, математика и код — три категории, на которых рынок тогда очень быстро судил о классе модели.

Отдельно стоит отметить Sonnet. По той же таблице Anthropic это была не «облегченная модель для галочки», а сильный средний уровень с 79.0% на MMLU, 92.3% на GSM8K, 73.0% на HumanEval и 53.1% на MMMU. Даже если смотреть только на данные самой Anthropic, именно Sonnet делал релиз продуктово зрелым: не один дорогой флагман, а линейка, где есть баланс между качеством и эксплуатационной ценой.

В vision-сравнении сигнал был чуть более тонким. Google сама сообщала 59.4% для Gemini Ultra на MMMU, и ровно такое же число Anthropic показала для Opus в своей таблице. То есть на мультимодальных задачах Claude 3 не обязательно выглядел безусловным лидером, но он явно переставал быть моделью «только про текстовый чат».

Интерпретация

Наш комментарий

Если убрать маркетинговую обвязку, Claude 3 значил не столько «Anthropic обогнала OpenAI», сколько «Anthropic стала второй лабораторией, у которой появился широкий и убедительный фронтирный портфель». Для практиков это важнее, чем спор о нескольких десятых долях процента на MMLU.

Почему? Потому что в реальных закупках и интеграциях редко выбирают модель по одному benchmark. Команды смотрят на несколько осей сразу: общая способность, код, визуальные входы, стабильность API, цена, latency, поведение на длинном контексте и предсказуемость в production. Claude 3 впервые выглядел как семейство, которое можно подставить в этот чек-лист без автоматической скидки на «это все-таки не GPT-4».

Вторая важная вещь — момент времени. Мы говорим именно о марте 2024 года, то есть о периоде до поворота индустрии к test-time compute и reasoning-моделям нового поколения. На том этапе фронтир еще в значительной степени оценивали по статическим benchmark-таблицам и качеству обычного inference, а не по длинным скрытым цепочкам рассуждения или агентным контурам. В этой системе координат Claude 3 действительно выглядел как догоняющий релиз.

Ограничения и критика

Во-первых, почти весь прямой head-to-head для Claude 3 Opus против GPT-4 в момент релиза идет из собственной таблицы Anthropic. Это нормальная практика для анонсов, но не независимая валидация. Поэтому формулировка «Claude 3 доказанно лучше GPT-4» была бы слишком сильной.

Во-вторых, benchmark-режимы неоднородны. Разные числа могут описывать не только разницу между моделями, но и разницу между prompt-схемами, shot-настройками, sampling и версиями snapshot. Разрыв между 83.7% у Gemini 1.0 Ultra в таблице Anthropic и 90.0% в анонсе Google на том же MMLU — наглядное напоминание, что сравнение моделей по скриншоту одной таблицы легко переоценить.

В-третьих, уже после релиза Claude 3 вышли работы, которые усложнили саму картину benchmark-сравнений. Исследование Are We Done with MMLU? показало, что в MMLU есть ошибки и проблемные вопросы, а работа When Benchmarks are Targets показала чувствительность лидербордов к мелким изменениям формата. Это не отменяет релиз Claude 3, но заставляет осторожнее относиться к выводам уровня «модель А окончательно сильнее модели Б» на основании одной таблицы.

В-четвертых, даже сильный мартовский benchmark-срез не отвечал на все практические вопросы. Таблица почти ничего не говорит о tool use, агентности, надежности long-context поиска, устойчивости под adversarial prompts и стоимости владения в конкретной инфраструктуре. Для production эти оси часто не менее важны, чем MMLU или HumanEval.

Вывод

Если держать историческую рамку, тезис из заголовка в целом оправдан. 4 марта 2024 года Anthropic действительно показала релиз, после которого Claude 3 Opus стало разумно ставить рядом с GPT-4 как модель того же класса. Не на всех задачах, не без оговорок и не как финальный приговор рынку, но уже без прежней скидки на «вторая лига».

Самый точный вывод для практиков такой: Claude 3 был не мифическим «убийцей GPT-4», а моментом, когда Anthropic вошла в устойчивый паритет по значительной части тогдашних публичных тестов и предложила зрелую продуктовую линейку вокруг этого паритета.

Источники

FAQ

Claude 3 — это одна модель или несколько?

Это семейство из трех моделей: Haiku, Sonnet и Opus. В мартовском релизе именно Opus отвечал за фронтирную планку, но Sonnet был не менее важен как рабочий компромисс для production.

Правда ли, что Claude 3 победил GPT-4?

Корректнее говорить так: по мартовской таблице Anthropic, Claude 3 Opus выглядел на уровне или выше GPT-4 на ряде публичных benchmark-ов. Но это не то же самое, что независимое доказательство универсального превосходства на всех задачах.

Почему таблицы разных лабораторий расходятся даже по одному и тому же benchmark?

Потому что benchmark — это не только набор вопросов, но и протокол: shot-настройка, chain-of-thought, prompt-формат, snapshot модели и правила подсчета. Один и тот же MMLU может давать разные числа при разных режимах оценки.

Что было главным итогом релиза для практиков?

Появление реальной альтернативы GPT-4 в верхнем сегменте. После Claude 3 выбор фронтирной модели перестал выглядеть как игра с одним очевидным победителем и несколькими догоняющими.

Читайте также