4 марта 2024 года Anthropic представила семейство Claude 3: Haiku, Sonnet и Opus. По собственной мартовской таблице компании, Opus впервые для Anthropic выглядел не как просто сильная альтернатива рядом с GPT-4, а как модель, которая на ряде стандартных текстовых и визуальных тестов уже идет вровень или выше.
Это важно в историческом смысле. После релиза GPT-4 14 марта 2023 года именно он оставался основной точкой отсчета в публичных сравнениях больших моделей. Но слово «догнала» здесь нужно понимать узко: речь о конкретном срезе оценок на 4 марта 2024 года, а не о доказанном превосходстве Claude 3 на всех задачах.
Коротко
- Claude 3 был не одной моделью, а линейкой из трех уровней: Haiku, Sonnet и Opus. Для рынка это было не менее важно, чем один флагманский результат.
- По мартовской таблице Anthropic, Claude 3 Opus выглядел на уровне или выше GPT-4 на MMLU, GSM8K, HumanEval, HellaSwag и ряде других текстовых тестов; в мультимодальности он тоже оказался в верхнем эшелоне.
- Сравнение нельзя читать как окончательный вердикт: протоколы отличаются, shot-настройки отличаются, а числа для Claude 3 в прямом head-to-head в основном опубликованы самой Anthropic.
- Практический смысл релиза был таким: к марту 2024 года Anthropic стала восприниматься как поставщик не только длинного контекста и «безопасного» чат-бота, но и полноценной фронтирной альтернативы GPT-4.
- Если говорить строго, Claude 3 не «закрыл вопрос навсегда», а вошел в зону паритета с GPT-4 на тогдашних публичных бенчмарках.
Контекст
Чтобы понять эффект Claude 3, важно вспомнить, что задавал планку до него. OpenAI выпустила публичный анонс GPT-4 14 марта 2023 года, а технический отчет датирован 27 марта 2023 года. В нем GPT-4 сообщал 86.4% на MMLU, 92.0% на GSM8K и 67.0% на HumanEval; те же числа затем фигурируют и в сравнительной таблице Anthropic. Иными словами, к весне 2024 года у рынка уже был устоявшийся «референсный» набор результатов GPT-4.
Google попыталась сместить эту точку сравнения релизом Gemini 1.0 6 декабря 2023 года. Но и Google, и Anthropic по сути все равно сравнивали себя с GPT-4. Поэтому в марте 2024 года вопрос был не в том, появился ли еще один сильный LLM, а в том, может ли кто-то кроме OpenAI всерьез претендовать на статус модели уровня фронтира.
На этом фоне Claude 3 выглядел переломом. До него Anthropic обычно ассоциировалась с длинным контекстом, аккуратным поведением модели и корпоративными сценариями. После релиза Opus и Sonnet разговор сместился к общей способности: рассуждение, код, математика, визуальные задачи и качество ответа без явной деградации по сравнению с GPT-4.
Метод
Главная методическая деталь: мартовская таблица Anthropic сравнивала модели не в одном универсальном режиме, а в наборе разных протоколов. Для текста там соседствуют, например, MMLU 5-shot, GPQA Diamond 0-shot CoT, GSM8K 0-shot CoT, HumanEval 0-shot, DROP 3-shot и HellaSwag 10-shot. Для vision-задач отдельно идут MMMU (val), MathVista, AI2D и Chart QA.
Это важно по двум причинам. Во-первых, счет зависит не только от модели, но и от режима оценки. Во-вторых, разные лаборатории публиковали числа в разных условиях. Самый наглядный пример — MMLU для Gemini. В декабрьском анонсе Google пишет о 90.0% у Gemini Ultra на MMLU с «новым подходом» к этому тесту, тогда как в таблице Anthropic для Gemini 1.0 Ultra стоит 83.7% в режиме 5-shot. Это не обязательно противоречие; это демонстрация того, что «один benchmark, одно число» — слишком грубая схема.
Есть и третья оговорка. OpenAI в GPT-4 Technical Report прямо указала, что multiple-choice оценки GPT-4 в отчете были получены на snapshot от 1 марта 2023 года. Для GSM8K OpenAI также отдельно оговорила, что часть тренировочного набора этого benchmark была добавлена в pretraining mix GPT-4. То есть даже числа самой базовой точки отсчета уже нужно читать с методическими примечаниями, а не как чистую «сущность модели».
Результаты
Ниже — результаты из мартовской сравнительной таблицы Anthropic от 4 марта 2024 года. Для Claude 3 это в основном единственный первичный источник прямого head-to-head на дату релиза, поэтому значения стоит читать как заявленные автором релиза числа, а не как независимую общую репликацию всей таблицы.
| Бенчмарк | Что измеряет | Claude 3 Opus | GPT-4 / GPT-4V | Как это читать |
|---|---|---|---|---|
| MMLU | Широкое академическое знание и решение задач по 57 предметам | 86.8% | 86.4% | Число GPT-4 совпадает с Technical Report OpenAI; Opus в таблице Anthropic выходит чуть выше. |
| GPQA Diamond | Сложные «google-proof» вопросы по естественным наукам | 50.4% | 35.7% | Здесь преимущество Opus выглядит одним из самых заметных, но прямой matched результат опубликован самой Anthropic. |
| GSM8K | Школьная математика с многошаговым выводом | 95.0% | 92.0% | Число GPT-4 подтверждается OpenAI; для Claude 3 это авторский замер Anthropic. |
| HumanEval | Генерация кода по docstring-спецификации | 84.9% | 67.0% | Один из ключевых сигналов, что Anthropic стала конкурентоспособной не только в чате, но и в коде. |
| HellaSwag | Бытовой commonsense | 95.4% | 95.3% | Скорее паритет, чем перелом. |
| MMMU (val) | Мультимодальное понимание на задачах уровня колледжа | 59.4% | 56.8% у GPT-4V | Anthropic показала Opus выше GPT-4V; сам paper MMMU тоже описывает GPT-4V и Gemini Ultra как модели порядка 56% и 59% на этом тесте. |
Если вынести за скобки шум конкретных benchmark-режимов, то картина была простой. Opus впервые сделал для Anthropic правдоподобным тезис «мы уже не позади GPT-4 по общей способности». Особенно это было видно по сочетанию MMLU, GSM8K и HumanEval: знание, математика и код — три категории, на которых рынок тогда очень быстро судил о классе модели.
Отдельно стоит отметить Sonnet. По той же таблице Anthropic это была не «облегченная модель для галочки», а сильный средний уровень с 79.0% на MMLU, 92.3% на GSM8K, 73.0% на HumanEval и 53.1% на MMMU. Даже если смотреть только на данные самой Anthropic, именно Sonnet делал релиз продуктово зрелым: не один дорогой флагман, а линейка, где есть баланс между качеством и эксплуатационной ценой.
В vision-сравнении сигнал был чуть более тонким. Google сама сообщала 59.4% для Gemini Ultra на MMMU, и ровно такое же число Anthropic показала для Opus в своей таблице. То есть на мультимодальных задачах Claude 3 не обязательно выглядел безусловным лидером, но он явно переставал быть моделью «только про текстовый чат».
Интерпретация
Наш комментарий
Если убрать маркетинговую обвязку, Claude 3 значил не столько «Anthropic обогнала OpenAI», сколько «Anthropic стала второй лабораторией, у которой появился широкий и убедительный фронтирный портфель». Для практиков это важнее, чем спор о нескольких десятых долях процента на MMLU.
Почему? Потому что в реальных закупках и интеграциях редко выбирают модель по одному benchmark. Команды смотрят на несколько осей сразу: общая способность, код, визуальные входы, стабильность API, цена, latency, поведение на длинном контексте и предсказуемость в production. Claude 3 впервые выглядел как семейство, которое можно подставить в этот чек-лист без автоматической скидки на «это все-таки не GPT-4».
Вторая важная вещь — момент времени. Мы говорим именно о марте 2024 года, то есть о периоде до поворота индустрии к test-time compute и reasoning-моделям нового поколения. На том этапе фронтир еще в значительной степени оценивали по статическим benchmark-таблицам и качеству обычного inference, а не по длинным скрытым цепочкам рассуждения или агентным контурам. В этой системе координат Claude 3 действительно выглядел как догоняющий релиз.
Ограничения и критика
Во-первых, почти весь прямой head-to-head для Claude 3 Opus против GPT-4 в момент релиза идет из собственной таблицы Anthropic. Это нормальная практика для анонсов, но не независимая валидация. Поэтому формулировка «Claude 3 доказанно лучше GPT-4» была бы слишком сильной.
Во-вторых, benchmark-режимы неоднородны. Разные числа могут описывать не только разницу между моделями, но и разницу между prompt-схемами, shot-настройками, sampling и версиями snapshot. Разрыв между 83.7% у Gemini 1.0 Ultra в таблице Anthropic и 90.0% в анонсе Google на том же MMLU — наглядное напоминание, что сравнение моделей по скриншоту одной таблицы легко переоценить.
В-третьих, уже после релиза Claude 3 вышли работы, которые усложнили саму картину benchmark-сравнений. Исследование Are We Done with MMLU? показало, что в MMLU есть ошибки и проблемные вопросы, а работа When Benchmarks are Targets показала чувствительность лидербордов к мелким изменениям формата. Это не отменяет релиз Claude 3, но заставляет осторожнее относиться к выводам уровня «модель А окончательно сильнее модели Б» на основании одной таблицы.
В-четвертых, даже сильный мартовский benchmark-срез не отвечал на все практические вопросы. Таблица почти ничего не говорит о tool use, агентности, надежности long-context поиска, устойчивости под adversarial prompts и стоимости владения в конкретной инфраструктуре. Для production эти оси часто не менее важны, чем MMLU или HumanEval.
Вывод
Если держать историческую рамку, тезис из заголовка в целом оправдан. 4 марта 2024 года Anthropic действительно показала релиз, после которого Claude 3 Opus стало разумно ставить рядом с GPT-4 как модель того же класса. Не на всех задачах, не без оговорок и не как финальный приговор рынку, но уже без прежней скидки на «вторая лига».
Самый точный вывод для практиков такой: Claude 3 был не мифическим «убийцей GPT-4», а моментом, когда Anthropic вошла в устойчивый паритет по значительной части тогдашних публичных тестов и предложила зрелую продуктовую линейку вокруг этого паритета.
Источники
- Introducing the next generation of Claude — анонс Claude 3 от 4 марта 2024 года, позиционирование семейства и сравнительные таблицы.
- Model system cards | Anthropic — индекс системных карт Anthropic с датировкой Claude 3 как March 2024.
- The Claude 3 Model Family: Opus, Sonnet, Haiku — системная карта Claude 3.
- GPT-4 | OpenAI — публичный анонс GPT-4 от 14 марта 2023 года.
- GPT-4 Technical Report — базовые числа GPT-4 на MMLU, GSM8K, HumanEval, DROP и примечания по snapshot и contamination.
- Introducing Gemini: our largest and most capable AI model — анонс Gemini 1.0 от 6 декабря 2023 года, включая MMLU и MMMU.
- Gemini: A Family of Highly Capable Multimodal Models — технический отчет Gemini 1.0.
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark — описание GPQA и baseline-результаты GPT-4 на сложных научных вопросах.
- Measuring Massive Multitask Language Understanding — исходный paper по MMLU.
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI — исходный paper по MMMU и ориентир по уровням GPT-4V и Gemini Ultra.
- Evaluating Large Language Models Trained on Code — исходный paper по HumanEval.
- Are We Done with MMLU? — критика качества и ошибок в MMLU.
- When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards — работа о чувствительности лидербордов к деталям формата оценки.
FAQ
Claude 3 — это одна модель или несколько?
Это семейство из трех моделей: Haiku, Sonnet и Opus. В мартовском релизе именно Opus отвечал за фронтирную планку, но Sonnet был не менее важен как рабочий компромисс для production.
Правда ли, что Claude 3 победил GPT-4?
Корректнее говорить так: по мартовской таблице Anthropic, Claude 3 Opus выглядел на уровне или выше GPT-4 на ряде публичных benchmark-ов. Но это не то же самое, что независимое доказательство универсального превосходства на всех задачах.
Почему таблицы разных лабораторий расходятся даже по одному и тому же benchmark?
Потому что benchmark — это не только набор вопросов, но и протокол: shot-настройка, chain-of-thought, prompt-формат, snapshot модели и правила подсчета. Один и тот же MMLU может давать разные числа при разных режимах оценки.
Что было главным итогом релиза для практиков?
Появление реальной альтернативы GPT-4 в верхнем сегменте. После Claude 3 выбор фронтирной модели перестал выглядеть как игра с одним очевидным победителем и несколькими догоняющими.
