Claude Opus 4.7 High стоит выбирать для сложных задач, где ценность точного разбора, качественного кода и устойчивой работы с большим контекстом выше минимальной цены и предсказуемой задержки. Профиль модели необычно контрастный: максимальный суббалл человеческого предпочтения и сильный кодинг соседствуют с нулём за эффективность. Поэтому 43-е место не означает слабые ответы — оно отражает неполное покрытие измерениями и дорогой профиль использования.
Коротко
- COMRAD Score: 65,4 из 100 — нормализованная редакционная оценка, а не процент качества.
- Место: 43-е в срезе COMRAD404 2026 H2.
- Сильные стороны: человеческое предпочтение — 100,0; кодинг — 86,0; контекст — 1 000 000 токенов.
- Главный риск выбора: в паспорте нет независимых значений скорости, времени до первого токена и Artificial Analysis Intelligence Index.
- Цена в срезе: $5 за миллион входных и $25 за миллион выходных токенов.
- Статус: проприетарная reasoning-модель Anthropic без открытых весов; это не preview.
Практический вывод: Opus 4.7 High логично включать в шорт-лист для программирования, анализа больших репозиториев, многошаговых агентов и ответственных текстовых задач. Для массовой классификации, коротких чат-ответов и потоков с жёстким SLA по задержке паспорт не даёт достаточных оснований считать её оптимальным вариантом.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Claude Opus 4 7 High |
| Разработчик | Anthropic |
| Место в рейтинге | 43 |
| COMRAD Score | 65,4 |
| Режим рассуждения | Да |
| Контекст | 1 000 000 токенов |
| Цена ввода | $5 за 1 млн токенов |
| Цена вывода | $25 за 1 млн токенов |
| Лицензия | Proprietary |
| Открытые веса | Нет |
| Уверенность профиля | Средняя |
Слово High здесь обозначает конфигурацию усилия, использованную для рейтинговой записи, а не отдельную архитектуру или открытую модификацию весов. В документации Anthropic уровень high описан как стандартный режим API для Claude Opus 4.7; его можно менять параметром усилия. Это важно при воспроизведении тестов: сравнивать результат High с более экономным режимом без явной пометки некорректно. ([platform.claude.com](https://platform.claude.com/docs/en/build-with-claude/effort?utm_source=openai))
Место в рейтинге
В рейтинге ИИ-моделей COMRAD404 редакции 2026 H2 Claude Opus 4.7 High занимает 43-е место с оценкой 65,4. Итог рассчитан по методологии 1.0 с весами: качество — 40%, человеческое предпочтение — 30%, кодинг — 15%, эффективность — 10%, доступ — 5%.
Вклад суббаллов составляет 20,0 балла от качества, 30,0 от человеческого предпочтения, 12,9 от кодинга, 0 от эффективности и 2,49 от доступа. Сумма равна 65,39 и после округления даёт опубликованные 65,4. Это объясняет позицию лучше, чем одно место: почти две трети итоговой оценки обеспечены человеческим предпочтением и кодингом, тогда как блок эффективности не добавляет ничего.
LMArena Text rating равен 1502,1 при третьем месте и 60 136 голосах. Это статистический рейтинг по слепым попарным сравнениям ответов, а не 1502 правильных ответа и не процент точности. Большое число голосов делает сигнал пользовательского предпочтения содержательным, но не превращает его в гарантию фактической достоверности на конкретной профессиональной задаче.
В Code Arena паспорт фиксирует rating 1557,0 и 18-е место. Здесь действует то же ограничение интерпретации: рейтинг показывает сравнительный результат в арене, а не долю успешно выполненных тестов, покрытие языков программирования или готовность к автономному внесению изменений в production.
Разбор пяти суббаллов
| Суббалл | Оценка | Как читать |
|---|---|---|
| Качество | 50,0 | Средняя нормализованная редакционная оценка при отсутствии Intelligence Index в паспорте |
| Человеческое предпочтение | 100,0 | Главная опора профиля; связана с сильным результатом Text Arena |
| Кодинг | 86,0 | Высокий редакционный суббалл, подтверждённый наличием результата Code Arena |
| Эффективность | 0,0 | В срезе нет измерений скорости и времени до первого токена |
| Доступ | 49,8 | Проприетарный API-доступ при сравнительно высокой цене вывода |
Quality 50,0 нельзя подменять отсутствующим Artificial Analysis Intelligence Index. В паспорте значение этого индекса прямо отмечено как отсутствующее и не оценённое приблизительно. Следовательно, нельзя восстанавливать его по памяти, графикам другого дня или результатам соседней версии.
Нулевой суббалл эффективности также не доказывает, что модель буквально не генерирует токены или всегда медленнее альтернатив. В срезе просто нет значений output tokens per second и time to first token. Это штраф рейтингового профиля за отсутствие измеряемого сигнала, а не лабораторный вывод о физической скорости модели.
Что представляет собой Claude Opus 4.7 High
Anthropic представила Claude Opus 4.7 16 апреля 2026 года как общедоступную, а не предварительную модель. Официальный идентификатор Claude API — claude-opus-4-7. Компания заявляла фокус на сложном программировании, длительных агентных задачах, следовании инструкциям, работе с изображениями и проверке собственных результатов. Это заявления разработчика; их следует отделять от независимых рейтингов LMArena и редакционных оценок COMRAD404. ([anthropic.com](https://www.anthropic.com/news/claude-opus-4-7?type=research&utm_source=openai))
Официальная документация подтверждает контекст до одного миллиона токенов, adaptive thinking, prompt caching, batch processing, работу с PDF и изображениями, а также поддержку серверных и клиентских инструментов. Наличие функции не означает одинаковое качество во всех интеграциях: результат зависит от системного промпта, набора инструментов, лимитов вывода, стратегии повторов и уровня effort. ([platform.claude.com](https://platform.claude.com/docs/en/about-claude/models/migration-guide?_bhlid=64fafc1f56ae023ef8bb155ffd499b95520ca648&f80ce999_sort_date=desc&utm_source=openai))
Архитектура, число параметров и веса модели в переданном паспорте и найденных первичных материалах не раскрыты. Называть предполагаемый размер или семейство архитектуры нельзя. Лицензия проприетарная, веса закрыты, поэтому модель нельзя развернуть локально как open-weights решение или независимо проверить на уровне параметров.
Возможности и сценарии
Разработка и разбор кода
Кодовый суббалл 86,0 делает модель кандидатом для анализа крупных pull request, поиска причин регрессии, проектирования миграций, написания тестов и работы с многофайловыми изменениями. Наиболее разумный режим — не просить «исправить всё», а дать репозиторий, команды проверки, критерии приёмки и запрет на изменение нерелевантных компонентов.
Особенно полезны задачи, где требуется связать документацию, трассировки, тесты и несколько уровней абстракции. Но Code Arena rank 18 не подтверждает автоматически безопасность патчей. Сгенерированный код должен проходить линтеры, тесты, статический анализ, проверку зависимостей и человеческое ревью.
Длинные документы и базы знаний
Контекст на 1 000 000 токенов позволяет передавать большие подборки документов, длинные журналы событий или значительную часть кодовой базы. Реальная полезная ёмкость обычно меньше номинальной: место занимают системные инструкции, история диалога, результаты инструментов, изображения и промежуточные рассуждения. Кроме того, большой контекст повышает стоимость входа и не гарантирует, что каждая деталь будет извлечена одинаково точно.
Агентные процессы
Reasoning и поддержка инструментов подходят для циклов «составить план — вызвать инструмент — проверить результат — продолжить». Типичные сценарии: диагностика инцидента, исследование внутренней базы знаний, подготовка миграции, обработка набора файлов или формирование отчёта с проверяемыми ссылками. Для таких процессов нужны ограничения числа шагов, бюджет токенов, тайм-ауты и журналирование действий.
Профессиональные тексты
Максимальный суббалл человеческого предпочтения указывает, что пользователи часто выбирали ответы модели в слепых сравнениях. Это полезный сигнал для редактуры, структурирования аналитики, подготовки спецификаций и объяснения сложных тем. Однако приятный стиль способен скрыть фактическую ошибку, поэтому юридические, медицинские, финансовые и иные ответственные выводы нельзя принимать без проверки первичных источников и профильного специалиста.
Цена и скорость
В рейтинговом срезе указана базовая цена $5 за миллион входных токенов и $25 за миллион выходных. Выход в пять раз дороже входа, поэтому длинные рассуждения, подробные отчёты и агентные циклы могут определять большую часть счёта. Например, запрос со 100 000 входных и 10 000 выходных токенов по этим ставкам стоит около $0,75 без учёта кэширования, повторов, инструментов, облачных наценок и специальных режимов.
Официальная документация Anthropic подтверждает такие базовые ставки для Claude API, но цена зависит от провайдера, пакетной обработки, кэширования промпта, региона и условий платформы. Поэтому цифры из паспорта следует использовать как зафиксированный ориентир на 31 августа 2026 года, а не как обещание неизменного тарифа. ([platform.claude.com](https://platform.claude.com/docs/en/about-claude/pricing?38d7aa68_page=1&fcdaa149_page=2&utm_source=openai))
Данных о скорости генерации и времени до первого токена в срезе нет. Нельзя обещать конкретное число токенов в секунду или задержку ответа. Более высокий уровень усилия способен увеличить расход выходных токенов и длительность выполнения; официальный режим high ориентирован на баланс глубины и потребления, но этот баланс нужно измерять в собственной инфраструктуре. ([platform.claude.com](https://platform.claude.com/docs/en/build-with-claude/effort?utm_source=openai))
Ограничения
- Неполное независимое покрытие. Artificial Analysis Intelligence Index отсутствует, как и показатели скорости.
- Высокая цена длинного вывода. Агентные циклы и подробные ответы могут быстро увеличить расход.
- Закрытая модель. Нет доступа к весам, архитектуре и локальному развёртыванию.
- Рейтинг предпочтения не равен истинности. Хорошо оформленный ответ всё ещё может содержать выдуманный факт или неверный вывод.
- Контекст не равен памяти. Миллион токенов не гарантирует безошибочное извлечение любой детали.
- Зависимость от режима. Результаты High нельзя автоматически переносить на low, medium, xhigh или max.
- Риск автономных действий. Инструменты требуют песочницы, ограниченных полномочий и подтверждения опасных операций.
Уверенность профиля обозначена как средняя. Причина не в количестве голосов Text Arena, а в неодинаковом покрытии групп метрик: предпочтение и кодинг представлены, тогда как Intelligence Index и эксплуатационная скорость отсутствуют. Итоговая оценка полезна для первичного отбора, но недостаточна для закупки без пилота.
Кому модель подойдёт
Claude Opus 4.7 High имеет смысл тестировать командам разработки, аналитикам, редакторам сложных материалов и создателям агентов, если стоимость ошибки выше стоимости дополнительных токенов. Она особенно уместна там, где задача включает несколько источников, неоднозначные требования, код, проверку результата и длинную последовательность шагов.
Модель менее очевидна для высоконагруженных сценариев с короткими однотипными запросами: маршрутизации обращений, простого извлечения полей, массовой модерации или генерации коротких шаблонов. Паспорт не содержит данных, которые доказали бы выгодную пропускную способность в таких потоках. В этих случаях разумнее сначала измерить цену успешной операции, а не ориентироваться на общий COMRAD Score.
Как проверить на своей задаче
- Соберите закрытый набор. Возьмите 30–100 реальных задач, которых не было в публичных примерах: баги, документы, запросы пользователей или агентные сценарии.
- Определите критерии заранее. Отдельно оценивайте фактическую точность, полноту, соблюдение формата, качество кода, число вызовов инструментов, задержку и стоимость.
- Зафиксируйте конфигурацию. Укажите модель
claude-opus-4-7, режимhigh, системный промпт, доступные инструменты, лимит вывода и параметры повторов. - Не меняйте условия между запусками. Одинаково подавайте контекст, файлы и инструкции. Для недетерминированных задач выполните несколько прогонов.
- Проверяйте код автоматически. Запускайте тесты, линтер, статический анализ и изолированную сборку. Отдельно считайте лишние изменения и новые уязвимости.
- Измеряйте полную стоимость. Учитывайте вход, выход, повторные запросы, кэш, неудачные попытки и стоимость инфраструктуры инструментов.
- Проведите слепую оценку. Эксперт не должен знать, какой системой создан ответ. Это уменьшает влияние бренда и ожиданий.
- Вводите порог внедрения. Например: модель допускается в production только при прохождении критических тестов, приемлемой цене успешной задачи и отсутствии опасных действий без подтверждения.
Для большого контекста полезен отдельный needle-тест: разместите проверяемые факты в начале, середине и конце корпуса, добавьте похожие отвлекающие фрагменты и потребуйте привести источник каждого вывода. Так проверяется не номинальный размер окна, а способность системы находить нужное и не смешивать документы.
FAQ
Claude Opus 4.7 High — отдельная модель?
В рейтинге это конфигурация Claude Opus 4.7 с уровнем усилия High. Официальный API ID — claude-opus-4-7; уровень усилия задаётся отдельно и влияет на глубину работы и расход токенов.
Почему при сильной Text Arena модель занимает только 43-е место?
Итог учитывает пять направлений. Максимальный суббалл предпочтения и кодинг 86,0 компенсируются качеством 50,0, доступом 49,8 и нулём за эффективность при отсутствии скоростных измерений.
COMRAD Score 65,4 означает 65,4% правильных ответов?
Нет. Это нормализованная редакционная оценка по шкале 0–100, рассчитанная из пяти суббаллов с разными весами.
LMArena rating 1502,1 — это точность модели?
Нет. Это статистический рейтинг, основанный на слепых попарных предпочтениях пользователей. Он не является процентом правильных ответов.
Какова скорость Claude Opus 4.7 High?
В паспорте нет значений токенов в секунду и времени до первого токена. Скорость необходимо измерять у выбранного API-провайдера на реальной длине запросов и ответов.
Можно ли запустить модель локально?
Нет доступного для этого набора открытых весов. Модель проприетарная и используется через продукты Anthropic или поддерживаемые облачные платформы.
Подходит ли она для автономного программирования?
Профиль кодинга и официальная поддержка инструментов делают её подходящим кандидатом для пилота, но автономные изменения следует выполнять в песочнице с тестами, журналированием и подтверждением опасных операций.
Источники
- Anthropic: Introducing Claude Opus 4.7 — официальный анонс, дата выпуска, статус доступности, цена и идентификатор API.
- Claude Platform: Models overview — официальный обзор контекста, режимов и возможностей модели.
- Claude Platform: Effort — назначение режима High и влияние уровня усилия.
- Claude Platform: Migration guide — поддерживаемые функции и особенности интеграции Opus 4.7.
- Claude Opus 4.7 System Card — официальный материал об оценке возможностей и безопасности.
- LMArena Text Leaderboard — источник рейтинга, места и числа голосов Text Arena в зафиксированном паспорте.
- LMArena Leaderboard — источник результата Code Arena в зафиксированном паспорте.
- Artificial Analysis LLM Leaderboard — проверенная независимая таблица; Intelligence Index и скоростные метрики для модели в паспорте среза отсутствуют.
