Запись архива

OpenAI разобрала шум в бенчмарках кода: SWE-Bench Pro оказался ненадёжным

Новый анализ OpenAI выявил системные проблемы в популярном бенчмарке SWE-Bench Pro. Компания утверждает, что значительная часть результатов на тестах генерации кода неотличима от шума, что ставит под вопрос корректность сравнения моделей.

Диаграмма анализа шума в бенчмарке SWE-Bench Pro от OpenAI
Диаграмма анализа шума в бенчмарке SWE-Bench Pro от OpenAI
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

OpenAI опубликовала анализ, который ставит под сомнение достоверность одного из самых цитируемых бенчмарков для оценки способности AI-моделей писать код — SWE-Bench Pro. В заметке «Separating signal from noise in coding evaluations» компания утверждает, что значительная часть наблюдаемых различий в результатах моделей на этом тесте может быть объяснена статистическим шумом, а не реальной разницей в качестве.

Проблема в методологии

SWE-Bench Pro представляет собой набор задач, где модели должны самостоятельно написать исправление для реального бага из открытого репозитория. Бенчмарк считается одним из наиболее релевантных для оценки агентов, генерирующих код. Однако, как указывает OpenAI, вариативность результатов при повторных прогонах одной и той же модели на одном и том же наборе задач слишком высока.

Компания провела серию внутренних тестов, в ходе которых запускала несколько моделей многократно на подмножестве задач SWE-Bench Pro. Результаты показали, что доверительные интервалы многих оценок перекрываются. Это означает, что разница в один-два процентных пункта между двумя моделями, которую часто публикуют в отчётах и сравнительных таблицах, может быть статистически незначимой и обусловлена случайными факторами, такими как порядок выполнения задач или незначительные изменения в промпте.

«Если вы видите, что Модель A набирает 38%, а Модель B — 40%, это ещё не значит, что B лучше. С высокой вероятностью обе модели показывают один и тот же результат, а разница — это просто шум», — поясняется в статье.

Почему это важно для разработчиков и пользователей

Для инженеров, выбирающих модель для автоматизации написания кода, эта новость означает, что полагаться исключительно на таблицы лидеров SWE-Bench Pro рискованно. Сравнение, основанное на 2-3 процентных пунктах, не даёт надёжной информации о превосходстве одной модели над другой.

OpenAI рекомендует использовать более строгую методологию:

  • Многократный прогон: оценивать модель не один, а несколько (5-10) раз на одном наборе задач, чтобы получить распределение результатов.
  • Учёт доверительных интервалов: публиковать не только средний балл, но и 95% доверительный интервал.
  • Контрольные тесты: сравнивать новую модель не только с результатами из чужих статей, но и напрямую запуская её на той же конфигурации.

Шум в бенчмарках — известная, но редко обсуждаемая проблема

Проблема, поднятая OpenAI, не нова для сообщества. Ещё несколько месяцев назад на Hacker News активно обсуждался пост «Improving 15 LLMs at Coding in One Afternoon. Only the Harness Changed», где автор показал, что изменение обвязки (harness) для запуска модели может значительно изменить её результат на бенчмарке, причём без изменения самой модели. Это подтверждает, что результаты тестов сильно зависят от условий эксперимента.

В другом обсуждении на Hacker News пользователь с ником zmmmmm отметил, что AI-инструменты для ревью кода находят критические баги в 80% случаев, но соотношение сигнал/шум остаётся низким: вместе с одной действительно важной находкой модель выдаёт 20 сомнительных или ложных рекомендаций. Это делает использование таких инструментов «по умолчанию» для всех пулл-реквестов неэффективным.

Команда Cloudflare в своём блоге об организации AI-ревью кода в масштабе компании также столкнулась с этой проблемой. Они перешли от единого промпта к целой системе из семи специализированных агентов (безопасность, производительность, качество кода), чтобы уменьшить количество ложных срабатываний и улучшить качество финальной обратной связи.

Что это значит для рынка AI-моделей

Публикация OpenAI — это не просто технический анализ. Это сигнал о том, что компания, которая сама активно участвует в гонке бенчмарков, признаёт их ограничения. В условиях, когда каждый новый релиз модели сопровождается громкими заявлениями о превосходстве на SWE-Bench, подобный анализ может охладить маркетинговую риторику.

Для практикующих разработчиков и исследователей это означает, что при выборе модели для задач генерации кода стоит:

Не доверять единичным цифрам: искать публикации, где указаны результаты нескольких прогонов и доверительные интервалы.
2. Проводить собственные тесты: запускать модель на репрезентативном для вашей задачи наборе данных, а не полагаться на общие бенчмарки.
3. Оценивать не только бенчмарк: смотреть на практическое поведение модели в вашем пайплайне — качество кода, безопасность, стиль, а не только процент решённых задач.

Выводы и следующие шаги

OpenAI не предлагает готового решения для замены SWE-Bench Pro, но указывает направление: необходимо создавать более надёжные и статистически обоснованные методики оценки. Сама компания, судя по всему, будет использовать эти принципы для внутренней оценки своих моделей, включая GPT-6 Astra, о которой недавно был опубликован системный карт.

Пока же разработчикам и исследователям стоит относиться к любым единичным результатам на бенчмарках с осторожностью. Как показывает практика, за красивыми цифрами может скрываться не превосходство модели, а особенности тестовой обвязки или случайность выборки.

Источники