Real-SWE: Новый бенчмарк проверяет AI-агентов на реальных корпоративных кодовых базах
Разработчики представили Real-SWE — бенчмарк, который тестирует AI-модели на приватных, коммерческих кодовых базах. В отличие от синтетических задач, здесь используются реальные баги и фичи из продакшна.
Открыть материал →
