Anthropic выпустила Claude Sonnet 5.5: модель быстрее, а бесплатный Claude получил более мощный вариант

Claude Sonnet 5.5, по заявлению Anthropic, работает более чем на 30% быстрее и обходится до 30% дешевле для большинства задач при сохранении прежней цены. Модель также стала основой бесплатного уровня Claude.ai, но независимых масштабных бенчмарков пока нет.

Claude Sonnet 5.5 — новая языковая модель Anthropic
Claude Sonnet 5.5 — новая языковая модель Anthropic
Изображение из исходного материала

28 сентября Anthropic представила Claude Sonnet 5.5 — новую версию средней по уровню модели в семействе Claude. По заявлению компании, она работает более чем на 30% быстрее и стоит до 30% дешевле для большинства рабочих сценариев. При этом номинальная цена модели, как утверждается, осталась на уровне Sonnet 5.

Наиболее заметное изменение касается не API, а обычных пользователей: Sonnet 5.5 стал моделью бесплатного уровня на Claude.ai. Об этом сообщил разработчик и автор блога Simon Willison в своей заметке о релизе. Его наблюдения показывают, что Anthropic делает ставку не только на разработчиков, но и на качество бесплатного доступа к чат-боту.

Что именно заявляет Anthropic

Формулировка «до 30% дешевле» не означает автоматического снижения цены каждого запроса. Речь идёт об эффективности выполнения задач: если модель тратит меньше времени или токенов на сопоставимый результат, итоговая стоимость работы может снизиться даже при неизменных тарифах.

Это особенно важно для приложений, которые регулярно отправляют большие объёмы запросов. Для разового диалога разница в скорости и расходе токенов может быть почти незаметной. В программном продукте, где модель вызывается тысячи раз в день, снижение средней стоимости выполнения уже может повлиять на экономику сервиса.

При этом в доступных материалах нет независимой полной проверки всех заявленных показателей. Simon Willison пишет, что Sonnet 5.5 выглядит сильнее Sonnet 5 на опубликованных тестах и близок к Opus 5.5 в отдельных задачах, но это не заменяет сопоставительного исследования с единой методологией. Поэтому заявление о превосходстве «по всем бенчмаркам» следует считать позицией Anthropic, а не окончательным результатом отраслевого тестирования.

Информация о линейке опубликована на официальном сайте Anthropic, а доступность бесплатного уровня можно проверить непосредственно в Claude.ai.

Проверка на WebGL и генерации SVG

В качестве практического теста Willison попросил бесплатный уровень Claude создать HTML-страницу, которая отображает трёхмерного пеликана на велосипеде с помощью WebGL. По его оценке, модель выдала работоспособный результат и достаточно убедительную трёхмерную сцену. Такой пример не является формальным бенчмарком, но хорошо показывает, как Sonnet 5.5 справляется с задачей, где нужно одновременно написать код, использовать графический API и собрать визуальный результат.

Автор также проверил разные уровни усилия рассуждения. В режиме `xhigh` ответ обошёлся примерно в 5,74 цента и занял 41 секунду. В другом запуске, с максимальным уровнем `max`, модель израсходовала 128 000 токенов — около 1,28 доллара по приведённой оценке — и завершилась без готового SVG.

Эта проблема, по словам Willison, напоминает дефект, который он ранее наблюдал у Opus 5.5. Модель продолжает расходовать контекст на рассуждения, но в итоге не оставляет достаточно ресурсов для вывода результата. Для разработчика это означает, что максимальный режим не всегда является лучшим выбором: более длительное рассуждение может увеличить счёт и привести к незавершённому ответу.

Почему бесплатный уровень важнее самого релиза

Переход Sonnet 5.5 на бесплатный уровень меняет практическую ценность выпуска. Пользователю теперь не обязательно оформлять платную подписку или подключать API, чтобы попробовать более производительную модель на задачах программирования и генерации интерфейсов.

Willison сравнивает предложение Anthropic с бесплатным уровнем ChatGPT, где, по его описанию, используется Luna 5.6. Это наблюдение относится к его конкретному сравнению и не подтверждает универсальное превосходство одной системы над другой: качество зависит от типа запроса, ограничений бесплатного тарифа, доступного контекста и режима рассуждения.

Для пользователя главный вывод проще: бесплатный доступ к модели не означает неограниченное использование. Даже если Sonnet 5.5 доступен без оплаты, сервис может ограничивать частоту запросов, объём контекста или доступ к отдельным функциям. Перед переносом рабочего процесса в Claude стоит проверить актуальные ограничения непосредственно в интерфейсе, а не ориентироваться только на название модели.

Что это меняет для разработчиков

Sonnet 5.5 выглядит наиболее интересным для задач, где важны баланс качества и задержки. Это может быть генерация кода, исправление ошибок, создание прототипов интерфейсов, анализ документации и подготовка небольших WebGL- или JavaScript-демонстраций.

Однако данные одного автора не позволяют заранее утверждать, что модель заменит Opus 5.5 во всех проектах. В задачах, где критичны длинная последовательность рассуждений, точность преобразования форматов или стабильное завершение больших ответов, потребуется собственная проверка. Особенно внимательно следует тестировать режимы с повышенным усилием рассуждения: пример с SVG показывает, что более дорогой режим может не только увеличить затраты, но и ухудшить практический результат.

Перед подключением Sonnet 5.5 к продакшену разумно прогнать на нём собственный набор запросов и отдельно измерить четыре показателя: долю успешно завершённых ответов, среднее время, расход токенов и стоимость одного принятого результата. Для WebGL, генерации кода и структурированных форматов полезно проверять не красоту ответа, а возможность выполнить его без ручного исправления.

Anthropic также подтвердила, что Haiku 5.5 должна выйти «в ближайшие недели». Срок и цена этой модели пока не раскрыты в приведённом материале, поэтому сравнивать её с другими быстрыми и дешёвыми моделями преждевременно. На данный момент наиболее проверяемое изменение — появление Sonnet 5.5 на бесплатном уровне и заявленное улучшение эффективности, тогда как масштабное независимое подтверждение производительности ещё предстоит.

Источники