
На Hacker News появилось обсуждение нового бенчмарка Real-SWE, предназначенного для оценки frontier AI-моделей на приватных, реальных корпоративных кодовых базах. Проект опубликован командой withspecific.com и представляет собой попытку ответить на вопрос: может ли AI-агент действительно выполнять работу инженера-программиста в реальном мире?
Что такое Real-SWE
Real-SWE — это набор задач, взятых из приватных продакшн-кодовых баз, лицензированных у реальных компаний. В отличие от популярного SWE-bench, где задачи часто синтезируются или извлекаются из открытых репозиториев, Real-SWE использует «вербейтим» (дословные) реальные задачи, с которыми сталкиваются инженеры в enterprise-среде.
В контексте одной из задач описывается проблема с биллингом: «Исправьте выставление счетов, чтобы каждый бизнес взимал правильный налог, а освобожденные клиенты не облагались налогом». Это не абстрактный пример, а точная формулировка из реального production-кода.
Как это устроено
Бенчмарк использует «нативные обвязки» (native harnesses), которые отражают то, как enterprise-инженеры работают на практике. Вместо изолированной оценки модели, Real-SWE оценивает комбинацию «модель + обвязка». Это принципиально важно, поскольку в реальной разработке успех зависит не только от самой модели, но и от инструментов, которые её окружают: системы сборки, тестирования, CI/CD.
Ключевые отличия от существующих бенчмарков:
— Два измерения сложности: лежащий в основе артефакт кода и специфичность инструкции.
— Закрытые кодовые базы: нет риска «засветить» данные в обучающих датасетах.
— Реальные задачи: не синтетические, а те, которые действительно решали инженеры.
Практические ограничения
Из представленного материала видно, что задачи Real-SWE содержат высокую степень контекстной сложности. Например, в задаче по налогам упоминаются различные схемы налогообложения: одни предприятия устанавливают ставку сами, другие используют провайдера для расчёта по адресу покупателя, третьи вообще ничего не взимают. При этом есть клиенты с освобождением от налогов.
Это требует от AI-агента не просто генерации кода, а понимания бизнес-логики, которая в enterprise-системах часто неочевидна и не документирована должным образом. Бенчмарк, таким образом, выявляет не только способность модели писать код, но и её умение работать в условиях неполной информации.
Почему это важно
На данный момент большинство бенчмарков для AI-кодинга ориентированы на open-source проекты или синтетические задачи. Real-SWE заполняет важную нишу: он показывает, как модели справляются с «грязной» работой в legacy-коде, где каждый второй вызов функции — это не документация, а «магические константы».
Текущее состояние проекта: на момент публикации у задачи на Hacker News 6 очков и 0 комментариев, что говорит о ранней стадии обсуждения. Сам бенчмарк доступен на сайте withspecific.com/benchmarks/real-swe.
Источники
— Оригинальная публикация: https://withspecific.com/benchmarks/real-swe
— Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49676820
