Запись архива

Real-SWE: Новый бенчмарк проверяет AI-агентов на реальных корпоративных кодовых базах

Разработчики представили Real-SWE — бенчмарк, который тестирует AI-модели на приватных, коммерческих кодовых базах. В отличие от синтетических задач, здесь используются реальные баги и фичи из продакшна.

Скриншот интерфейса бенчмарка Real-SWE с примером задачи по выставлению счетов и налогам
Скриншот интерфейса бенчмарка Real-SWE с примером задачи по выставлению счетов и налогам
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

На Hacker News появилось обсуждение нового бенчмарка Real-SWE, предназначенного для оценки frontier AI-моделей на приватных, реальных корпоративных кодовых базах. Проект опубликован командой withspecific.com и представляет собой попытку ответить на вопрос: может ли AI-агент действительно выполнять работу инженера-программиста в реальном мире?

Что такое Real-SWE

Real-SWE — это набор задач, взятых из приватных продакшн-кодовых баз, лицензированных у реальных компаний. В отличие от популярного SWE-bench, где задачи часто синтезируются или извлекаются из открытых репозиториев, Real-SWE использует «вербейтим» (дословные) реальные задачи, с которыми сталкиваются инженеры в enterprise-среде.

В контексте одной из задач описывается проблема с биллингом: «Исправьте выставление счетов, чтобы каждый бизнес взимал правильный налог, а освобожденные клиенты не облагались налогом». Это не абстрактный пример, а точная формулировка из реального production-кода.

Как это устроено

Бенчмарк использует «нативные обвязки» (native harnesses), которые отражают то, как enterprise-инженеры работают на практике. Вместо изолированной оценки модели, Real-SWE оценивает комбинацию «модель + обвязка». Это принципиально важно, поскольку в реальной разработке успех зависит не только от самой модели, но и от инструментов, которые её окружают: системы сборки, тестирования, CI/CD.

Ключевые отличия от существующих бенчмарков:
— Два измерения сложности: лежащий в основе артефакт кода и специфичность инструкции.
— Закрытые кодовые базы: нет риска «засветить» данные в обучающих датасетах.
— Реальные задачи: не синтетические, а те, которые действительно решали инженеры.

Практические ограничения

Из представленного материала видно, что задачи Real-SWE содержат высокую степень контекстной сложности. Например, в задаче по налогам упоминаются различные схемы налогообложения: одни предприятия устанавливают ставку сами, другие используют провайдера для расчёта по адресу покупателя, третьи вообще ничего не взимают. При этом есть клиенты с освобождением от налогов.

Это требует от AI-агента не просто генерации кода, а понимания бизнес-логики, которая в enterprise-системах часто неочевидна и не документирована должным образом. Бенчмарк, таким образом, выявляет не только способность модели писать код, но и её умение работать в условиях неполной информации.

Почему это важно

На данный момент большинство бенчмарков для AI-кодинга ориентированы на open-source проекты или синтетические задачи. Real-SWE заполняет важную нишу: он показывает, как модели справляются с «грязной» работой в legacy-коде, где каждый второй вызов функции — это не документация, а «магические константы».

Текущее состояние проекта: на момент публикации у задачи на Hacker News 6 очков и 0 комментариев, что говорит о ранней стадии обсуждения. Сам бенчмарк доступен на сайте withspecific.com/benchmarks/real-swe.

Источники
— Оригинальная публикация: https://withspecific.com/benchmarks/real-swe
— Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49676820