Claude Opus 4.6 High — модель для задач, где важнее глубина рассуждения, работа с большим контекстом и качество результата, чем минимальная цена или максимальная скорость ответа. В срезе COMRAD404 2026 H2 она получила 65,0 балла и заняла 44-е место, однако отдельные независимые показатели выглядят заметно сильнее общего места: текстовый рейтинг LMArena составляет 1504,8 при втором месте в текстовой арене, а кодовый рейтинг — 1546,0 при 21-м месте.
Такое расхождение не означает ошибку в рейтинге. COMRAD Score — нормализованная редакционная оценка, собранная из пяти суббаллов с разными весами. Она учитывает не только предпочтение пользователей и программирование, но и качество, эффективность и доступность. У Claude Opus 4.6 High сильная сторона — качество работы в диалоге, агентных задачах и коде. Слабое место профиля — эффективность: в переданном срезе этот суббалл равен 0, а данные о скорости ответа отсутствуют.
Коротко
- Модель: Claude Opus 4.6 High.
- Разработчик: Anthropic.
- Статус: полноценная модель, не preview.
- Лицензия: Proprietary; веса не открыты.
- COMRAD Score: 65,0 из 100.
- Позиция: 44-е место в редакции COMRAD404 2026 H2.
- Контекст: 1 000 000 токенов.
- Цена в паспорте: 5 долларов за миллион входных токенов и 25 долларов за миллион выходных.
- Скорость: данных о токенах в секунду и time to first token в срезе нет.
Anthropic представила Claude Opus 4.6 5 февраля 2026 года. В официальном анонсе компания указала поддержку контекста в 1 млн токенов в бета-режиме на Claude Developer Platform, адаптивное мышление, управление уровнем усилий, контекстную компрессию и выход до 128 тыс. токенов. Эти возможности нужно отличать от чисел COMRAD404: первые относятся к заявленным функциям платформы, вторые — к редакционному срезу и независимым измерениям.
Паспорт модели
| Параметр | Значение | Как читать показатель |
|---|---|---|
| Название в рейтинге | Claude Opus 4.6 High | Конкретная конфигурация, указанная в паспорте |
| Каноническое имя | claude-opus-4-6 |
Идентификатор модели в паспорте |
| Разработчик | Anthropic | Коммерческий поставщик модели |
| Лицензия | Proprietary | Закрытая лицензия; условия использования задаёт поставщик |
| Open weights | Нет | Веса модели публично не представлены |
| Рассуждение | Да | Модель поддерживает reasoning-подход и связанные режимы API |
| Preview | Нет | В паспорте модель не обозначена как предварительная |
| Контекст | 1 000 000 токенов | Единица измерения — токены контекста, не страницы и не символы |
| COMRAD Score | 65,0 из 100 | Нормализованная редакционная оценка, не процент качества |
Место в рейтинге
44-я позиция показывает место модели в конкретном выпуске рейтинга COMRAD404, а не абсолютный уровень возможностей всех существующих ИИ-систем. Рейтинг построен на пяти суббаллах: качество имеет вес 0,40, human preference — 0,30, coding — 0,15, efficiency — 0,10, access — 0,05. Поэтому сильные результаты в одной арене не могут автоматически компенсировать нулевую оценку эффективности и ограниченную доступность закрытой модели.
Для читателя практический вывод такой: Claude Opus 4.6 High нельзя оценивать только по строке с 44-м местом. Если задача состоит в написании и ревью кода, многошаговом анализе или обработке большого корпуса документов, профиль модели выглядит интереснее, чем её общий ранг. Если же главным критерием является дешёвая массовая генерация или предсказуемая задержка, общий балл лучше читать вместе с суббаллами, а не с отдельным вторым местом в текстовой арене.
Внутри независимых измерений LMArena модель показывает особенно сильный текстовый результат: рейтинг 1504,8, второе место и 72 104 голоса. Это статистический рейтинг по слепым попарным сравнениям пользовательских ответов, а не доля правильных ответов и не процент побед во всех возможных задачах. В Code Arena результат ниже относительно текстовой позиции: 1546,0 и 21-е место. Такое сочетание указывает на высокую воспринимаемую универсальность в тексте и одновременно на более неоднородный профиль в кодовых сравнениях.
Artificial Analysis Intelligence Index для этой модели в переданном паспорте отсутствует. Поэтому редакция не подставляет оценку по памяти, не выводит её из LMArena и не делает вид, что разные шкалы взаимозаменяемы.
Смотреть полный рейтинг COMRAD404.
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Интерпретация |
|---|---|---|---|
| Quality | 50,0 | 0,40 | Средняя редакционная оценка качества в общей формуле; не означает 50% правильных ответов |
| Human preference | 100,0 | 0,30 | Максимальный нормализованный результат среди пяти компонентов; согласуется с сильной позицией в текстовой арене |
| Coding | 83,2 | 0,15 | Сильный кодовый профиль, подтверждённый отдельным результатом Code Arena |
| Efficiency | 0,0 | 0,10 | В срезе эффективность не получила положительной редакционной оценки; скорость в raw metrics не указана |
| Access | 49,8 | 0,05 | Средняя нормализованная оценка доступности коммерческой закрытой модели |
Суббаллы — это шкала COMRAD404 от 0 до 100, а не проценты качества. Особенно важно не читать efficiency как утверждение, что модель «не умеет быть быстрой». Корректная формулировка скромнее: в переданном срезе нет чисел для output tokens per second и time to first token, а редакционный efficiency-суббалл равен 0.
Возможности и сценарии
Claude Opus 4.6 High рассчитана на сложные задачи с несколькими этапами. В официальном материале Anthropic отдельно выделяет программирование, длительные агентные процессы, работу с большими кодовыми базами, code review, отладку, финансовый анализ, исследование и подготовку документов, таблиц и презентаций. Это описание разработчика, поэтому его стоит воспринимать как карту заявленных сценариев, а не как независимое доказательство превосходства во всех них.
Разработка и ревью кода
Высокий coding-суббалл 83,2 делает модель кандидатом для задач, где нужно не просто дописать функцию, а разобраться в существующем репозитории, проследить зависимости, предложить изменения и проверить их. На практике это означает полезность в миграциях, диагностике регрессий, написании тестов, анализе pull request и подготовке технических объяснений.
При этом кодовый рейтинг LMArena — 1546,0 и 21-е место — не даёт основания обещать безошибочную автономную разработку. Для production-кода нужны запуск тестов, статический анализ, проверка безопасности и ручное принятие изменений. Модель следует использовать как участника инженерного процесса, а не как замену CI и code review.
Исследования и длинные документы
Контекст в 1 млн токенов полезен для больших наборов документов, длинной истории проекта, нескольких спецификаций или крупного корпуса исходников. Но большой лимит не гарантирует одинаково точное извлечение каждой детали. На длинных входах следует проверять цитаты, ссылки на фрагменты, арифметику и выводы, особенно если документы противоречат друг другу.
Агентные процессы
Адаптивное мышление и уровни effort позволяют выбирать баланс между глубиной, задержкой и расходом токенов. Для многошаговых операций модель может быть полезна в связке с инструментами: поиском, файловой системой, исполнением кода, базой знаний и системами контроля изменений. Чем шире набор разрешённых действий, тем важнее ограничения прав и подтверждение необратимых операций.
Текстовая работа
Результат human preference 100,0 и второе место в Text Arena указывают, что модель особенно хорошо подходит для редактуры, структурирования, аналитических записок, сложных ответов и преобразования материала под заданный формат. Однако попарный рейтинг отражает предпочтения пользователей в конкретной процедуре сравнения, а не юридическую, медицинскую или финансовую достоверность.
Цена и скорость
В паспорте указана цена 5 долларов за 1 млн входных токенов и 25 долларов за 1 млн выходных токенов. Это разные единицы тарификации: стоимость входа и выхода нельзя складывать без знания объёма каждого типа токенов. Например, запрос с большим контекстом и коротким ответом будет иметь иной профиль расходов, чем короткая инструкция с длинным результатом.
Anthropic в официальном анонсе также указывает отдельные условия для запросов, превышающих 200 тыс. токенов в режиме 1 млн токенов: 10 долларов за миллион входных и 37,50 доллара за миллион выходных токенов на Claude Platform. Эти условия относятся к конкретному режиму и провайдеру. В паспорте COMRAD404 зафиксированы базовые 5 и 25 долларов, поэтому не следует распространять премиальную ставку на все запросы или обещать одинаковую цену у каждого API-поставщика.
Данные о output_tokens_per_second и time_to_first_token_seconds отсутствуют. Следовательно, статья не делает вывода о том, насколько быстро Claude Opus 4.6 High отвечает. Скорость зависит от провайдера, региона, нагрузки, режима рассуждения, размера запроса и настроек потоковой выдачи. Перед закупкой нужно измерять задержку на собственном маршруте, а не ориентироваться на цену как на косвенный показатель производительности.
Доступ, лицензия и эксплуатационная модель
Claude Opus 4.6 High — проприетарная модель Anthropic, без открытых весов. Это не open-source и не self-hosted-компонент: пользователь получает доступ через продукты Anthropic, API или интеграции, доступные у провайдера. Закрытая модель может быть удобной для быстрого запуска, но ограничивает самостоятельный контроль над весами, инфраструктурой и воспроизводимостью локального инференса.
В официальной документации Anthropic для отдельных облачных маршрутов указаны модельные идентификаторы, региональные варианты и поддержка контекста в 1 млн токенов. Конкретная доступность функций, регионов, лимитов и цен может различаться между Anthropic API, Amazon Bedrock и другими каналами. Перед внедрением необходимо сверить именно тот endpoint, который будет использоваться в проекте.
Ограничения
- Нет открытых весов. Модель нельзя развернуть локально только на основании публичного имени или API-идентификатора.
- Неизвестна скорость в паспорте. Нет измерений токенов в секунду и времени до первого токена.
- Эффективность получила 0,0. Это редакционный суббалл текущего среза, а не универсальное утверждение о поведении модели во всех режимах.
- Высокая цена выхода. Длинные ответы и включённое рассуждение могут быстро увеличить стоимость.
- Риск переусложнения. Официальные рекомендации Anthropic предупреждают, что модель может избыточно исследовать задачу, создавать лишние файлы или слишком активно использовать субагентов.
- Контекст не равен памяти. Миллион токенов позволяет передать большой объём материала, но не гарантирует идеальное внимание ко всем его частям.
- Агентные действия требуют контроля. При доступе к файлам, репозиториям и внешним сервисам нужны ограничения прав, песочницы и подтверждение опасных операций.
- Метрики не универсальны. LMArena, COMRAD Score и возможный Artificial Analysis Index используют разные шкалы и методики.
Отдельное ограничение связано с самим срезом. Artificial Analysis Intelligence Index отсутствует, а coverage для него отмечен как false. Поэтому профиль модели нельзя полноценно сопоставить по этой метрике с системами, для которых индекс опубликован. Это не пробел, который следует заполнять оценкой «примерно».
Кому стоит выбрать эту модель
Claude Opus 4.6 High разумно рассматривать командам, которым нужны качественные ответы на сложные текстовые запросы, глубокое ревью кода, работа с большими документами и длительные агентные цепочки. Особенно оправдан выбор там, где цена ошибки выше стоимости токенов: внутренние исследования, архитектурный анализ, подготовка технических материалов, проверка сложных изменений и поддержка экспертных рабочих процессов.
Модель подходит хуже для простых массовых операций, где запросы короткие, ответы шаблонные, а основным KPI являются цена и задержка. Для таких сценариев сначала нужно проверить, действительно ли требуется Opus-класс и включённое рассуждение. Более рациональная схема — маршрутизация: сложные случаи отправлять Claude Opus 4.6 High, а простые — более дешёвому классу, если он доступен в вашей инфраструктуре и проходит контроль качества.
Как проверить на своей задаче
- Соберите набор из 50–200 реальных примеров. Включите обычные, пограничные и заведомо сложные случаи. Не ограничивайтесь демонстрационными промптами.
- Разделите задачи по типам. Отдельно оценивайте текст, код, анализ документов, извлечение фактов, вызов инструментов и длинные цепочки действий.
- Зафиксируйте режим. Запишите провайдера, регион, модельный ID, уровень effort, наличие adaptive thinking, лимит вывода, инструменты и настройки потоковой выдачи.
- Измеряйте не только итог. Считайте стоимость входных и выходных токенов, время до первого токена, полную задержку, число повторных вызовов и долю ручных исправлений.
- Для кода используйте исполняемые проверки. Запускайте тесты, линтеры, type checker, security scanner и проверку диффа. Ответ «выглядит правильно» недостаточен.
- Для длинного контекста проверяйте позиционный эффект. Размещайте ключевые факты в начале, середине и конце документов, затем проверяйте точность извлечения.
- Сравнивайте стоимость успешного результата. Дешёвый вызов с несколькими повторами может оказаться дороже одного тщательно настроенного запуска, а дорогой ответ — неоправданным для простой задачи.
- Добавьте человеческую оценку. Для редактуры и аналитики используйте слепое сравнение, а критерии качества определите до просмотра результатов.
Минимальный пилот должен завершаться не средним впечатлением, а таблицей: задача, режим, стоимость, задержка, ошибка, необходимость доработки и итоговое решение. Такой протокол покажет, приносит ли модель пользу именно вашему процессу.
FAQ
Какое место занимает Claude Opus 4.6 High?
В редакции COMRAD404 2026 H2 модель занимает 44-е место и имеет COMRAD Score 65,0 из 100.
Почему модель находится на 44-м месте, если у неё второе место в Text Arena?
Потому что это разные показатели. Text Arena использует рейтинг попарных предпочтений, а COMRAD Score объединяет пять нормализованных суббаллов. В формуле COMRAD404 учитываются качество, human preference, coding, efficiency и access.
Сколько стоит Claude Opus 4.6 High?
В паспорте указано 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Для контекстов свыше 200 тыс. токенов Anthropic указывает отдельную премиальную ставку в конкретном режиме Claude Platform. Тарифы нужно проверять у выбранного провайдера.
Какой у модели контекст?
В срезе COMRAD404 указан контекст 1 000 000 токенов. Anthropic описывает этот режим как бета-возможность для Claude Developer Platform; поддержка и условия могут зависеть от канала доступа.
Известна ли скорость ответа?
Нет. В переданном паспорте отсутствуют значения output tokens per second и time to first token. Поэтому точное обещание по скорости было бы необоснованным.
Можно ли запустить модель локально?
В паспорте указаны проприетарная лицензия и отсутствие открытых весов. Это означает, что статья не рассматривает локальный запуск как доступный вариант; модель следует проверять через официальные или облачные API-каналы.
Для каких задач модель подходит лучше всего?
Для сложного программирования и ревью, длинных документов, многошагового анализа, агентных процессов, исследовательской работы и текстовых задач, где важны качество и устойчивость результата.
Источники
- Anthropic: Introducing Claude Opus 4.6 — официальный анонс, дата релиза 5 февраля 2026 года, заявленные возможности, API-имя, контекст, цены и режимы работы.
- Claude Opus 4.6 System Card — официальный системный документ Anthropic с описанием модели, оценок и безопасности.
- Anthropic Platform Docs: Prompting best practices — рекомендации по adaptive thinking, effort, длинному контексту, агентным сценариям и ограничениям поведения.
- Anthropic Platform Docs: Pricing — официальная документация по тарификации API; условия могут зависеть от модели и режима.
- Anthropic Platform Docs: Claude on Amazon Bedrock — официальная информация о модельных идентификаторах, маршрутизации и доступности Claude Opus 4.6 в Bedrock.
- LMArena Text Leaderboard — источник текстового рейтинга, позиции и числа голосов в переданном паспорте.
- LMArena Leaderboard — источник результатов Code Arena, использованных в кодовом суббалле.
- Artificial Analysis: LLM Leaderboard — источник Intelligence Index, цен, скорости, контекста и API-функций; для данной модели метрика в паспорте отсутствует.
Фактический срез статьи: 31 августа 2026 года. Числа рейтинга COMRAD404 приведены только по переданному паспорту модели.
