Запись архива

Claude Opus 4 5 20251101 High 32K: обзор, возможности и ограничения

Claude Opus 4.5 — закрытая reasoning-модель Anthropic с сильным пользовательским рейтингом и кодингом, но без данных о скорости и с нулевым баллом эффективности в редакционной оценке.

Claude Opus 4.5 от Anthropic — обзор рейтинга, цены API и возможностей модели

Claude Opus 4.5 — модель для задач, где важнее качество рассуждения, следование сложным требованиям и работа с кодом, чем минимальная стоимость или максимальная скорость. В срезе COMRAD404 2026 H2 она занимает 70-е место с COMRAD Score 62,4. Профиль неоднородный: высокий результат в пользовательских слепых сравнениях сочетается с нулевым суббаллом эффективности, а независимые данные о скорости и Artificial Analysis Intelligence Index в паспорте отсутствуют.

Речь идёт о конкретной версии Claude Opus 4 5 20251101 High 32K, каноническое обозначение которой в API — claude-opus-4-5-20251101. Это не preview, не open-weights-модель и не открытое программное обеспечение: разработчик Anthropic распространяет её на проприетарных условиях.

Коротко

  • Для чего подходит: сложный анализ, программирование, ревью и рефакторинг кода, многошаговые рабочие процессы, подготовка содержательных документов.
  • Главный сигнал рейтинга: LMArena Text rating 1472,9 и 30-е место при 36 267 голосах.
  • Код: LMArena Code rating 1494,8 и 38-е место.
  • Стоимость в паспорте: 5 долларов за миллион входных токенов и 25 долларов за миллион выходных.
  • Контекст: 200 000 токенов.
  • Чего не хватает: Artificial Analysis Intelligence Index, output tokens per second и time to first token в зафиксированном срезе нет.

Итоговый вывод практический: Opus 4.5 стоит рассматривать, если ошибка в рассуждении или коде обходится дороже, чем разница в тарифе. Для потоковой обработки коротких однотипных запросов паспорт не даёт оснований считать её эффективным выбором.

Паспорт модели

Параметр Значение
Модель Claude Opus 4 5 20251101 High 32K
Разработчик Anthropic
Канонический slug claude-opus-4-5
API-идентификатор claude-opus-4-5-20251101
Лицензия Proprietary
Open weights Нет
Reasoning Да
Preview Нет
Контекст 200 000 токенов
COMRAD Score 62,4 из 100
Уверенность оценки Средняя

Название с суффиксом High 32K сохранено ровно в том виде, в каком оно указано в редакционном паспорте. Не следует автоматически трактовать этот суффикс как официальное описание архитектуры, отдельного размера модели или гарантированного лимита вывода: таких сведений в переданном срезе нет.

Место в рейтинге

В выпуске рейтинга COMRAD404 2026 H2 Claude Opus 4.5 находится на 70-й позиции. COMRAD Score 62,4 — нормализованная редакционная оценка по шкале от 0 до 100, а не процент правильных ответов и не вероятность успешного выполнения задачи.

Рейтинг нужно читать вместе с профилем суббаллов. Сильная сторона модели — human preference: 99,2 из 100. Это означает, что в используемой редакцией системе нормализации она получила очень высокий результат по пользовательскому предпочтению, а не то, что 99,2% людей предпочли каждый её ответ. Второй заметный показатель — coding 70,2. Он поддерживает сценарии разработки, но не превращает модель в универсально лучшую для любого программного проекта.

Общий балл сдерживают quality 50,0, access 41,5 и прежде всего efficiency 0,0. Нулевой efficiency не означает, что модель всегда медленная или непригодна для экономного использования. В данном паспорте нет независимого измерения output tokens per second и времени до первого токена, поэтому редакционная шкала эффективности не получила положительного подтверждённого сигнала. Восстанавливать его по рекламным заявлениям или впечатлениям пользователей нельзя.

Разбор пяти суббаллов

Суббалл Оценка Как читать
Quality 50,0 из 100 Средний редакционный сигнал общего качества; не эквивалентен точности на одном бенчмарке.
Human preference 99,2 из 100 Очень сильное предпочтение в слепых пользовательских сравнениях.
Coding 70,2 из 100 Заметное преимущество профиля для задач разработки и работы с кодом.
Efficiency 0,0 из 100 В срезе нет подтверждённых данных о скорости и эффективности, поэтому суббалл не поддержан.
Access 41,5 из 100 Доступность оценивается отдельно от качества; закрытая модель требует доступа через экосистему провайдера.

Веса также важны: quality даёт 40% итоговой оценки, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Поэтому очень высокий human preference заметно поддерживает общий балл, но не компенсирует полностью отсутствие сигнала по эффективности.

Что показывают LMArena

LMArena Text rating 1472,9 — это статистический рейтинг, рассчитанный по слепым попарным сравнениям ответов. Это не процент правильных ответов и не средняя оценка по школьному тесту. В текстовой арене модель занимает 30-е место, а число голосов в паспорте составляет 36 267. Такой объём делает показатель полезным ориентиром пользовательского восприятия, но не заменяет тестирование на собственных данных.

В Code Arena указаны rating 1494,8 и 38-е место. Кодовый рейтинг нельзя напрямую складывать с текстовым или сравнивать с ценой: это отдельная статистическая шкала для другой выборки задач. Разница между 30-м местом в тексте и 38-м в коде показывает, что сильное общее впечатление от модели не следует автоматически переносить на любой тип программирования.

В паспорте нет Artificial Analysis Intelligence Index. Поэтому в этой статье не приводится оценка Intelligence Index и не делается вывод о месте модели на соответствующей платформе. Независимые результаты LMArena и официальные заявления Anthropic также не смешиваются: первые описывают внешнее пользовательское сравнение, вторые — позицию разработчика и его внутренние оценки.

Возможности и сценарии

Разработка и сопровождение кода

Кодовый суббалл 70,2 и Code Arena rating 1494,8 делают модель кандидатом для задач, где нужно не просто сгенерировать фрагмент, а разобраться в существующей системе. Практически это означает полезность для поиска причин ошибок, рефакторинга, миграций, написания тестов, ревью pull request и подготовки плана изменений. Наиболее разумный режим — давать модели репродукцию проблемы, ограничения проекта и критерии приёмки, а не просить «улучшить код» без границ.

Для агентных сценариев важна проверяемость действий. Модель может предложить последовательность шагов, но доступ к репозиторию, терминалу или внешним инструментам должен быть ограничен разрешениями, веткой и автоматическими тестами. Сильный результат в рейтинге не отменяет code review человеком.

Аналитика и документы

Reasoning-профиль подходит для сравнения вариантов, разбора противоречивых требований, подготовки технических записок и многошагового анализа. Контекст 200 000 токенов позволяет передавать крупные подборки документов, но вместить материал в окно — не то же самое, что гарантировать безошибочное извлечение каждой детали. Для важных выводов нужно просить ссылки на исходные фрагменты, таблицу допущений и список неопределённостей.

Работа с изображениями и интерфейсами

В официальном описании Anthropic для Opus 4.5 отдельно заявлены улучшения в vision, reasoning и computer use. Это делает модель потенциально полезной для разбора скриншотов, интерфейсных ошибок, визуальных требований и автоматизации офисных действий. Однако паспорт COMRAD404 не содержит отдельного vision-балла, поэтому визуальные возможности не следует выдавать за измеренное преимущество в рейтинге.

Когда выбор оправдан

Модель имеет смысл для прототипа сложного агента, внутреннего помощника разработчика, анализа большого набора материалов и задач с дорогой ошибкой. Если запросы короткие, шаблонные и массовые, сначала нужно измерить стоимость полного рабочего процесса: входные токены, выход, повторы, вызовы инструментов и долю ручных исправлений.

Цена и скорость

В редакционном паспорте указаны 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Это разные единицы тарификации: стоимость входа нельзя сравнивать со стоимостью вывода как с одной общей «ценой ответа». Например, длинный контекст и короткий результат создают одну структуру затрат, а продолжительное рассуждение или большой файл кода — другую.

Фактическая цена зависит от API-провайдера, режима, кэширования, пакетной обработки, региональной маршрутизации и дополнительных инструментов. Значения паспорта нужно считать срезом, а не бессрочным обещанием тарифа. Перед запуском в production следует проверить актуальную таблицу провайдера и условия конкретного endpoint.

Показатели output tokens per second и time to first token в паспорте отсутствуют. Поэтому нельзя честно утверждать, что Claude Opus 4.5 быстрая или медленная модель. Для интерактивного продукта скорость нужно измерить самостоятельно на типичных промптах, с тем же провайдером, регионом, длиной контекста и настройками reasoning.

Доступ, лицензия и эксплуатационная модель

Модель закрытая: open_weights — false, лицензия — Proprietary. Пользователь получает доступ к сервису или API, но не веса для локального запуска и не право свободно изменять и распространять саму модель. Это влияет на требования к закупкам, обработке данных, региону размещения, журналированию и зависимости от поставщика.

Официальный релиз Anthropic датирован 24 ноября 2025 года. В нём указано API-имя claude-opus-4-5-20251101 и цена 5/25 долларов за миллион токенов. Система card Anthropic описывает возможности и safety-профиль, но значительная часть приведённых там оценок выполнена самой Anthropic. Это официальные материалы разработчика, а не независимая валидация COMRAD404.

На 31 августа 2026 года в материалах Anthropic уже упоминаются более новые модели семейства Opus. Это не меняет идентичность рассматриваемой версии: статья оценивает именно Claude Opus 4.5 с датой 20251101, а не последующий alias или другое поколение.

Ограничения

  • Неполный профиль эффективности. Нет скорости генерации и времени до первого токена, а efficiency равен 0,0.
  • Нет Intelligence Index. Artificial Analysis не покрывает модель в данном срезе, поэтому соответствующая метрика отсутствует.
  • Закрытая поставка. Нельзя рассчитывать на локальный запуск с собственными весами.
  • Цена вывода заметна. Длинные ответы, расширенное reasoning и циклы исправлений могут существенно увеличить бюджет.
  • Рейтинги не гарантируют результат. LMArena отражает попарные пользовательские предпочтения, а не успех на вашем репозитории, языке, домене или наборе документов.
  • Средняя уверенность. Паспорт прямо указывает confidence «средняя», поэтому итоговый балл следует использовать как ориентир, а не как окончательный вердикт.
  • Контекст не равен памяти. Окно 200 000 токенов не гарантирует одинаково внимательное использование всех переданных данных.

Как проверить на своей задаче

Соберите небольшой, но репрезентативный набор из 20–50 задач. Для разработки включите реальные баги, тесты, незнакомый код, изменения в нескольких файлах и задачи на объяснение решения. Для документов добавьте длинные материалы, противоречия, таблицы и вопросы, где ответ можно проверить по первоисточнику.

  1. Зафиксируйте модель, провайдера, регион, дату, лимит вывода и настройки reasoning.
  2. Подготовьте единый набор инструкций и не меняйте формулировку между прогонами без отдельной маркировки.
  3. Запускайте каждую задачу несколько раз, если ответ вероятностный; сохраняйте полный запрос, ответ, ошибки и вызовы инструментов.
  4. Оценивайте не только первый ответ, но и стоимость достижения принятого результата: повторы, исправления, ручную проверку и время инженера.
  5. Для кода применяйте автоматические тесты, линтеры, type checking и проверку безопасности. Для аналитики используйте эталонные ответы и проверку цитат.
  6. Отдельно измерьте time to first token и output tokens per second на коротком, среднем и длинном контексте.
  7. Сравните результат с вашим текущим baseline, даже если его чисел нет в рейтинге COMRAD404: это локальный эксперимент, а не дополнительная публичная позиция модели.

Минимальный критерий выбора можно сформулировать так: Opus 4.5 должна либо повышать долю задач, принятых без существенной доработки, либо сокращать время специалиста настолько, чтобы компенсировать цену токенов. Если преимущество проявляется только в красивой формулировке ответа, его недостаточно для перехода в рабочий контур.

Редакционная оценка

Claude Opus 4.5 — не универсальный бюджетный вариант, а специализированный кандидат для сложных задач с высокой ценой ошибки. Её наиболее убедительная часть профиля — почти максимальный human preference и заметный coding-сигнал. На практике это поддерживает выбор для разработки, анализа и многошаговых процессов.

Но COMRAD Score 62,4 и 70-е место требуют сдержанного прочтения. Нулевой efficiency, отсутствующие данные о скорости и отсутствие Artificial Analysis Index оставляют важные вопросы без ответа. Поэтому модель можно рекомендовать к пилоту, но нельзя обосновывать закупку только местом в LMArena или официальными формулировками Anthropic.

FAQ

Что такое Claude Opus 4.5 в этом обзоре?

Это конкретная версия Claude Opus 4.5 с API-идентификатором claude-opus-4-5-20251101, а не обобщённое описание всего семейства Claude Opus.

Какое место модель занимает в рейтинге COMRAD404?

В выпуске 2026 H2 модель занимает 70-е место и получает COMRAD Score 62,4 из 100. Это редакционная нормализованная оценка, а не процент правильных ответов.

Почему у модели efficiency равен 0,0?

В переданном срезе нет подтверждённых значений output tokens per second и time to first token. Нулевой суббалл отражает отсутствие поддержанного сигнала эффективности, а не доказательство того, что модель всегда работает медленно.

Сколько стоит Claude Opus 4.5?

В паспорте указано 5 долларов за миллион входных токенов и 25 долларов за миллион выходных. Реальная сумма зависит от API-провайдера, режима и дополнительных условий тарификации.

Какой у модели размер контекста?

В редакционном паспорте указан контекст 200 000 токенов. Это лимит контекстного окна, а не гарантия одинакового качества работы с каждой частью длинного ввода.

Можно ли запустить модель локально?

Паспорт указывает open_weights false и проприетарную лицензию. Поэтому рассматривать её как модель для локального запуска с доступными весами нельзя.

Есть ли у модели независимый Artificial Analysis Intelligence Index?

Нет, в зафиксированном срезе COMRAD404 эта метрика отсутствует. В статье она не восстанавливается по другим рейтингам.

Источники

Anthropic: Introducing Claude Opus 4.5 — официальная дата релиза, API-идентификатор, заявленные возможности и базовая цена.

Claude Opus 4.5 System Card — официальный документ с описанием модели, capability- и safety-оценок Anthropic.

Anthropic Claude pricing — документация о тарификации, кэшировании и особенностях расчёта стоимости; актуальные условия могут отличаться от среза паспорта.

Claude on Amazon Bedrock — официальная документация по идентификатору Claude Opus 4.5 и вариантам доступа через облачного провайдера.

LMArena Text Leaderboard — источник текстового рейтинга и попарных пользовательских сравнений.

LMArena Leaderboard — источник данных Code Arena.

Редакционный срез и числа COMRAD404: 31 августа 2026 года. Числа рейтинга, суббаллы и отсутствие метрик приведены по переданному паспорту модели.