
На arxiv опубликована работа AhaBench, предлагающая новый взгляд на оценку языковых агентов. Вместо традиционных тестов, где модель оценивается по одному изолированному ответу, AhaBench проверяет, способен ли агент улучшать свои результаты по мере накопления опыта в рамках длительной сессии взаимодействия.
Что измеряет AhaBench
Бенчмарк состоит из трёх компонентов, каждый из которых моделирует разные аспекты долгосрочного обучения:
Aha-Puzzle проверяет, может ли агент решать головоломки со скрытым состоянием без внешних подсказок после того, как ранее решил аналогичную задачу с подсказками. Aha-Euler трансформирует математические задачи Project Euler в пары «обучение — проверка» с точными валидаторами. Aha-Vending, реализованный на основе Vending-Bench, симулирует работу агента-торгового автомата, который должен оставаться прибыльным при отсроченной обратной связи и операционных инцидентах.
Система оценки и неожиданные результаты
Метрика бенчмарка состоит из трёх частей: начальная компетентность (Initial Score), результат после получения опыта (Post-Experience Score) и разница между ними — прирост обучения (Learning Lift). Именно декомпозиция оценки является ключевым вкладом работы.
Среди восьми протестированных моделей лидером по совокупному результату после обучения стал Claude Opus 4.6 с показателем 64.3 и приростом +25.8. Gemini 3.1 Pro продемонстрировал близкий результат — 63.4. Однако авторы подчёркивают, что модели, хорошо работающие с подсказками, часто не демонстрируют такого же прироста при переходе к самостоятельному решению. В Aha-Euler полное обучение даёт 78.6-100.0% успеха, тогда как перенос только ответов варьируется от 0.0 до 73.9%.
Практические ограничения и значимость
AhaBench не оценивает способность модели к обучению на новых данных в классическом понимании continual learning — речь идёт об обучении в пределах одной сессии взаимодействия. Кроме того, тесты не затрагивают мультимодальные сценарии и работу с внешними базами знаний. Тем не менее, бенчмарк закрывает важный пробел: существующие тесты либо сбрасывают состояние агента после каждого промпта, либо оценивают только финальный результат единичной траектории.
Что это значит для разработчиков
Для практикующих специалистов AhaBench предлагает готовый инструментарий: задачи, рубрики оценки, валидаторы, код симулятора и интерфейсы для тестирования новых агентов. Это позволяет воспроизводить результаты и сравнивать модели в условиях, приближенных к реальным сценариям, где агенту приходится адаптироваться к последствиям собственных действий.
Источники
Оригинальная статья на arXiv: arXiv:2609.05435
Дополнительная информация: страница проекта arXivLabs
