
Что произошло. Исследователи представили Harbor Adapters — унифицированную инфраструктуру для оценки агентов на базе языковых моделей (LLM). В рамках проекта разработаны адаптеры, портирующие более 80 бенчмарков, проведено масштабное тестирование 8 моделей на 54 бенчмарках и создан кураторский набор задач Harbor-Index. Работа опубликована на arXiv.
Как это работает. Главная проблема оценки AI-агентов — каждый бенчмарк требует своей среды и интеграции. Harbor Adapters решает эту задачу через единый интерфейс: адаптеры портируют существующие бенчмарки так, чтобы их можно было запускать для произвольных агентов. Каждый адаптер проходит ревью кода и эксперименты на паритетность — то есть результаты на портированной версии должны совпадать с оригиналом.
Исследователи проверили 8 моделей разных уровней (от условно слабых до GPT-5.5) на 54 бенчмарках. Каждую модель запускали с фреймворком Terminus-2 и с одним из трёх нативных инструментариев. Это позволило провести более широкий анализ возможностей и типовых сбоев агентов, чем было возможно ранее.
Harbor-Index: отбор сложных задач. Из портированного набора авторы отобрали 82 задачи из 29 бенчмарков, которые прошли многоступенчатую фильтрацию: проверку на сложность (слишком лёгкие отсеивались), AI-аудит, человеческую проверку и цикл «аудит-исправление». Результат — набор, который сохраняет сложность и разнообразие, но остаётся доступным по вычислительным затратам.
Ключевой показатель: ни одна конфигурация модель-инструментарий не превысила 30% проходимости в Harbor-Index. Лучший результат (28.0%) показала GPT-5.5 с Codex. Это говорит о том, что задачи действительно сложные и современные модели ещё далеки от насыщения.
Практическое значение. Для разработчиков AI-агентов и исследователей это означает появление стандартизированной платформы для сравнения. Вместо того чтобы настраивать десятки разных сред вручную, можно использовать Harbor Adapters. Harbour-Index, в свою очередь, даёт бенчмарк, который одновременно репрезентативен и не требует огромных ресурсов для прогона.
Ограничения. Работа фокусируется на инфраструктуре, а не на новых алгоритмах. Адаптеры — это инструмент, а не решение проблем самих агентов. Кроме того, качество оценки зависит от корректности портирования: хотя авторы провели ревью, возможны скрытые расхождения. Также пока неясно, насколько легко сообщество сможет добавлять новые бенчмарки в эту экосистему.
Источники
Оригинальная публикация на arXiv: https://arxiv.org/abs/2609.04298
Платформа arXivLabs: https://arxiv.org/abs/2609.04298