Запись архива

Opus 5: усилие «max» не всегда лучше — обсуждение на Reddit

На Reddit обратили внимание, что модель Opus 5 от Anthropic показывает снижение качества кода на максимальных настройках усилия. Обсуждение подкреплено данными из бенчмарков и документации.

График зависимости качества кода от уровня усилия у Opus 5
График зависимости качества кода от уровня усилия у Opus 5
Kurdish people protest against the Turkiish government at Hay Hill, Norwich | by Roger Blackwell | openverse | by

Суть обсуждения
Пользователь Reddit в разделе r/artificial обратил внимание на неочевидное поведение модели Opus 5 от Anthropic. У неё пять уровней усилия (low, medium, high, xhigh, max), но зависимость качества не монотонна: на кодовых задачах показатели выше high не растут, а падают. Причина — модель начинает вносить лишние рефакторинги и править код за пределами поставленной задачи. В документированном гайде по миграции от Anthropic предупреждается об убывающей отдаче и «передумывании» на простых задачах.

Подтверждённые данные
В обсуждении приведены цифры из нескольких источников:

Punkt Detail
FrontierCode Результаты падают выше high по сравнению с более низкими настройками.
AA-Omniscience (закрытая книга) Opus 5 на 11% точнее Opus 4.8, но уровень галлюцинаций выше на 6%.
CodeRabbit (xhigh) Точность ревью выросла (39.3% против 35.2%), но выявлено меньше известных проблем (55.2% против 61.1%), количество нитпиков возросло в 4 раза.
Zapier AutomationBench На низком усилии Opus 5 всё ещё проходит больше задач, чем любая другая модель.
Безопасный фолбэк При срабатывании safety-классификатора модель молчаливо переключается на Opus 4.8 — так было настроено и в собственном тесте Anthropic.

Неясные моменты
Пока неизвестно, как именно порог перелома зависит от конкретного кодовой базы, объёма контекста или размера репозитория. Данные о частоте срабатывания фолбэка на Opus 4.8 не публиковались. Также неясно, насколько стабильны результаты на разных версиях API.

Что проверять
Разработчикам, использующим Opus 5, стоит провести собственные тесты на своих задачах — найти уровень усилия, где качество перестаёт расти. Начинать можно с high, а не с max, и отслеживать показатели на реальных PR или ревью. Также полезно проверить, не срабатывает ли фолбэк на Opus 4.8 на чувствительных запросах — это может влиять на согласованность результатов.

Источник: Reddit r/artificial, пост https://www.reddit.com/r/artificial/comments/1v60pga/opus_5s_effort_dial_is_not_monotonic_above_high/
Верификация: Anthropic blog https://www.anthropic.com/news