AhaBench: новый бенчмарк проверяет, учатся ли AI-агенты на собственном опыте
Исследователи представили AhaBench — набор тестов для оценки способности языковых моделей учиться на предыдущем опыте в долгосрочных сценариях. Бенчмарк включает три компонента и показывает, что модели, хорошо использующие подсказки, не всегда демонстрируют лучший прирост...
Открыть материал →
