22 мая 2025 года Anthropic представила Claude Opus 4 и Claude Sonnet 4. Если смотреть только на рекламные тезисы, это выглядит как обычное обновление семейства моделей; если читать первоисточники, картина интереснее: компания одновременно изменила структуру линейки, усилила агентный сценарий работы и по-разному классифицировала риски для Opus и Sonnet.
Важно про рамку этой статьи: ниже речь именно о первом релизе Claude 4 из материалов Anthropic за май 2025 года, а не о более поздних ревизиях семейства 4.x. Это существенное уточнение, потому что в последующих документах исходные модели claude-sonnet-4@20250514 и claude-opus-4@20250514 уже фигурируют как устаревающие или снятые с Claude API, а часть практических возможностей вокруг линейки успела измениться.
Коротко
- Claude 4 — это не просто «лучше, чем Claude 3.7», а возврат к двухуровневой линейке: отдельный флагман Opus и более массовый Sonnet.
- Главное продуктово-методическое изменение — связка hybrid reasoning с инструментами: extended thinking, tool use во время размышления, параллельные вызовы инструментов и более явная память через локальные файлы.
- Anthropic продвинула не только сами модели, но и рабочую среду: Claude Code перешёл из research preview в general availability, а API получил инструменты, удобные именно для агентных сценариев.
- Opus 4 и Sonnet 4 различаются не только уровнем возможностей, но и режимом безопасности: Opus 4 выпущен под ASL-3, Sonnet 4 — под ASL-2.
- Бенчмарки в релизных материалах полезны, но их нельзя читать как одно простое число: Anthropic смешивает обычный режим, extended thinking и более дорогие high-compute-прогоны, а для части тестов меняет методику обвязки.
Контекст
Чтобы понять Claude 4, нужно начать не с Opus 4, а с Claude 3.7 Sonnet. 24 февраля 2025 года Anthropic выпустила Claude 3.7 Sonnet как гибридную модель: она могла отвечать быстро или переключаться в extended thinking, то есть тратить больше вычислений на один ответ. Там же появился Claude Code, но только как limited research preview.
Claude 4 сохраняет эту линию, но меняет упаковку. Вместо одной центральной модели уровня Sonnet Anthropic снова строит линейку из двух ролей: Claude Sonnet 4 как более универсального и экономичного варианта и Claude Opus 4 как флагмана для более длинных, сложных и агентных задач.
Поэтому вопрос «что изменилось» лучше формулировать так: не «насколько выросли цифры», а «как Anthropic перестроила связку модель + инструменты + среда разработки + безопасность». Именно это и отличает Claude 4 от обычного минорного обновления.
Ещё один важный исторический маркер: в документации Google Cloud для Agent Platform исходным моделям соответствуют идентификаторы claude-sonnet-4@20250514 и claude-opus-4@20250514. Это помогает не смешивать первый релиз Claude 4 с более поздними 4.x-ветками, которые в 2025–2026 годах заметно изменили практический ландшафт Anthropic.
Метод
Если читать анонс Claude 4 и системную карту вместе, изменения удобно разбить на пять слоёв.
1. Возврат к двухуровневой линейке
Claude 3.7 Sonnet был одной моделью, которая закрывала и повседневные сценарии, и reasoning-режим. В Claude 4 Anthropic снова разводит роли: Sonnet 4 — «рабочая лошадка» для массовых задач, Opus 4 — верхний уровень для более тяжёлых задач, особенно в кодинге и длительных агентных траекториях.
2. Hybrid reasoning остаётся, но становится агентнее
Anthropic прямо описывает Opus 4 и Sonnet 4 как hybrid reasoning large language models. То есть это по-прежнему не отдельная «модель для думания» рядом с обычной LLM, а единый класс моделей, который умеет работать и в почти мгновенном режиме, и в extended thinking.
Новое здесь не само наличие extended thinking, а то, как оно связано с инструментами. В Claude 4 Anthropic добавляет extended thinking with tool use: модель может не только «думать дольше», но и чередовать рассуждение с обращением к инструментам, например к поиску или рабочему окружению. Для практики это важнее, чем просто рост качества на сухом бенчмарке: reasoning перестаёт быть изолированным внутренним шагом и становится частью агентного цикла.
3. Параллельные инструменты, steerability и память
В релизе Claude 4 Anthropic отдельно подчёркивает три вещи: параллельное использование инструментов, более точное следование инструкциям и улучшенные memory-возможности при доступе к локальным файлам. Последнее особенно показательно: модель может извлекать и сохранять факты в файлы памяти, чтобы поддерживать длинную непрерывную работу.
Это сдвиг от «чат-модели, которая иногда вызывает tool» к «агенту, который живёт в рабочем окружении и накапливает локальный контекст». Для разработчиков это означает, что улучшение идёт не только по линии base model, но и по линии долговременного процесса: многошаговый рефакторинг, работа с репозиторием, проверка гипотез, возвращение к промежуточным артефактам.
4. Claude Code перестаёт быть экспериментом
В феврале 2025 года Claude Code запускался как research preview. В анонсе Claude 4 Anthropic переводит его в general availability и одновременно добавляет более зрелые интеграции: GitHub Actions, VS Code и JetBrains. Это важный маркер зрелости: модельный релиз здесь тесно связан с инфраструктурой, в которой модель реально используется.
5. Безопасность становится частью сравнения моделей
Системная карта Claude 4 и отдельный материал про ASL-3 показывают, что различие между Opus 4 и Sonnet 4 — не только в «силе модели». Claude Opus 4 выпущен под AI Safety Level 3, тогда как Claude Sonnet 4 — под AI Safety Level 2. При этом Anthropic отдельно поясняет: ASL-3 для Opus 4 включён как осторожная мера, потому что компания уже не могла уверенно исключить соответствующий риск-порог, особенно вокруг CBRN-сценариев, хотя и не утверждала, что Opus 4 однозначно этот порог перешёл.
Результаты
Если убрать маркетинговые формулировки, Claude 4 даёт не одно изменение, а сразу несколько. Ниже — практическая таблица различий между Claude 3.7 Sonnet, Claude Sonnet 4 и Claude Opus 4 по данным первоисточников Anthropic.
| Что сравнивать | Claude 3.7 Sonnet | Claude Sonnet 4 | Claude Opus 4 | Что это означает на практике |
|---|---|---|---|---|
| Структура линейки | Одна центральная модель Sonnet | Старшая «рабочая» модель в новой паре | Отдельный флагман над Sonnet | Anthropic снова разводит баланс «стоимость/массовое применение» и «максимальные возможности» |
| Режим reasoning | Hybrid reasoning с обычным и extended режимом | Hybrid reasoning сохраняется | Hybrid reasoning сохраняется | Claude 4 не меняет парадигму, а развивает идею Claude 3.7 |
| Reasoning + инструменты | Extended thinking уже был, но релиз 3.7 не делал акцент на tool use внутри thinking | Extended thinking with tool use | Extended thinking with tool use | Модель лучше подходит для агентных циклов, где нужно думать и действовать по очереди |
| Оркестрация инструментов | Claude Code в preview, обычные tool-сценарии | Параллельные инструменты, точнее follow instructions, локальная память через файлы | То же, но как более сильный флагман | Улучшение касается не только ответов, но и длительного workflow |
| Среда разработки | Claude Code как limited research preview | Claude Code уже в GA | Claude Code уже в GA | Anthropic продвигает не только модель, но и полноценный developer workflow |
| Безопасностный режим | Предыдущие модели выпускались под ASL-2; для 3.7 Anthropic отдельно писала, что ASL-3 не потребовался | ASL-2 | ASL-3 как precautionary deployment | Сравнивать Opus и Sonnet нужно с учётом не только качества, но и различий в governance |
| Позиционирование в кодинге | Сильный coding-модель и база для Claude Code | Прямой апгрейд от 3.7 с упором на coding и steerability | Флагман для сложных и длинных coding/agent задач | Для команд это выбор между более дешёвым default и более тяжёлым верхним tier |
| Цена на старте | $3 за миллион входных токенов и $15 за миллион выходных |
$3 и $15 |
$15 и $75 |
Sonnet 4 сохранил экономику 3.7, а Opus 4 остался отдельным дорогим классом |
Что показывали собственные тесты Anthropic? В релизном посте компания делает акцент прежде всего на coding- и agent-бенчмарках: SWE-bench Verified, Terminal-bench, TAU-bench, а также на reasoning-наборах вроде GPQA Diamond, AIME, MMMLU и MMMU. Но важнее не список названий, а методологическая оговорка в приложении: часть результатов считается без extended thinking, часть — с ним, а часть — в более дорогом режиме high compute с параллельными попытками и внутренней моделью-оценщиком.
Для SWE-bench Anthropic также отдельно уточняет, что в Claude 4 убрана planning tool-обвязка, использованная для Claude 3.7 Sonnet, а high-compute-результаты строятся уже не на одном запуске, а на нескольких параллельных попытках с последующим отбором лучшего кандидата. Это не делает цифры «неправильными», но делает их менее похожими на простой ответ на вопрос «какая модель сама по себе лучше».
Интерпретация
Наш комментарий
На наш взгляд, главное изменение Claude 4 — не в отдельной таблице бенчмарков, а в том, что Anthropic фактически нормализует новый объект разработки: не статическую чат-модель, а reasoning-модель, встроенную в агентный цикл. Extended thinking, tool use во время рассуждения, локальная память, Claude Code и новые API-возможности в сумме выглядят как единый стек.
Отсюда и практический вывод. Claude Sonnet 4 — это не «облегчённый Opus», а базовый рабочий уровень для команд, которым нужен разумный баланс между стоимостью и агентными сценариями. Claude Opus 4 — это модель для случаев, когда нужно дольше удерживать траекторию задачи, работать по многошаговому workflow и мириться с более жёстким режимом безопасности вокруг модели.
Ещё один важный вывод: Claude 4 хорошо показывает, как быстро меняется ось масштабирования в прикладном ИИ. Раньше обсуждение шло в терминах размера модели и качества на одном проходе. Здесь всё сильнее видно другое: сколько вычислений модель тратит во время ответа, умеет ли она сама оркестрировать инструменты и может ли стабильно держать длинный процесс.
Ограничения
Во-первых, значительная часть сравнений в публичном поле идёт из материалов самой Anthropic. В этой статье мы сознательно опираемся на первоисточники компании, но это не то же самое, что независимая репликация всех заявленных результатов.
Во-вторых, релизные бенчмарки не образуют один «чистый» рейтинг. В приложении к анонсу Anthropic прямо указывает, что результаты могут быть получены в обычном режиме, в extended thinking или в более дорогом high-compute-сценарии. Для части тестов меняются и параметры прогона, и инструментальная обвязка. Поэтому читать такие таблицы как прямое сравнение одной голой модели с другой было бы неверно.
В-третьих, исторический контекст вокруг Claude 4 быстро менялся. Позднее Anthropic обновляла семейство 4.x, а исходные идентификаторы Claude 4 в документации платформ уже помечены как устаревшие или снятые с Claude API. Если не фиксировать точную версию и дату, легко начать обсуждать не один и тот же объект.
В-четвёртых, системная карта Claude 4 полезна прежде всего для понимания логики Anthropic вокруг рисков, но не закрывает вопрос независимой внешней валидации всех safety-выводов. Это особенно важно для интерпретации различия между ASL-2 и ASL-3: оно информативно, но не превращает публичные материалы в окончательный внешний аудит.
Вывод
Claude 4 важен не тем, что Anthropic выпустила ещё две более сильные модели. Важнее другое: компания превратила hybrid reasoning из свойства одной модели в основу более широкого агентного стека — с tool use во время размышления, локальной памятью, зрелым coding-интерфейсом и разнесением ролей между Sonnet и Opus.
Если запомнить одну вещь, то вот она: Claude 4 — это переход от «LLM с режимом думания» к более цельной модели-агенту, у которой качество, инструменты, среда разработки и безопасность начинают проектироваться как одно целое.
Источники
- Introducing Claude 4
- Claude 4 System Card
- Activating AI Safety Level 3 protections
- Claude 3.7 Sonnet and Claude Code
- Claude’s extended thinking
- Anthropic’s Transparency Hub — Model report
- Claude on Google Cloud / Vertex AI documentation
- Claude Platform release notes
- Pricing — Claude Platform Docs
FAQ
Claude 4 — это новая архитектура reasoning или продолжение Claude 3.7?
Скорее продолжение. Claude 3.7 уже ввёл hybrid reasoning, а Claude 4 сохраняет эту идею и делает больший акцент на агентном использовании: thinking вместе с tool use, параллельные инструменты и память через локальные файлы.
Чем Sonnet 4 отличается от Opus 4 на практике?
По описанию Anthropic, Sonnet 4 — более массовый и экономичный рабочий уровень, а Opus 4 — верхний уровень для более длинных и сложных задач, особенно в кодинге и агентных траекториях. Различается и режим безопасности: Sonnet 4 выпущен под ASL-2, Opus 4 — под ASL-3.
Почему нельзя просто смотреть на одну таблицу бенчмарков?
Потому что в материалах Anthropic сравнения строятся в разных режимах: без extended thinking, с ним и в high-compute-конфигурациях. Для части тестов меняется и методика прогона, поэтому «одно число на модель» скрывает слишком много деталей.
Нужно ли сегодня читать про Claude 4 как про актуальную линейку?
Только если вы фиксируете исторический срез. Для понимания майского релиза 2025 года — да. Для практической интеграции в 2026 году нужно отдельно проверять актуальные release notes, pricing и lifecycle-статус конкретных model IDs.
