
Когда речь заходит о выборе AI-агента для реальной задачи, маркетинговые описания моделей дают мало пользы. Производители заявляют «улучшенное рассуждение» и «лучшее следование инструкциям», но что это значит на практике? Ответ дают бенчмарки — стандартизированные тесты, которые измеряют конкретные способности агентов.
Проблема в том, что бенчмарков десятки, и каждый измеряет что-то своё. SWE-bench проверяет способность исправлять баги в коде, AgentBench — взаимодействие с окружением, GAIA — мультимодальные рассуждения. Выбор неправильного бенчмарка для оценки может привести к неверным выводам о возможностях агента.
Эта статья — практическое руководство по ключевым бенчмаркам для AI-агентов: что они измеряют, как интерпретировать результаты и какие ограничения нужно учитывать.
SWE-bench: золотой стандарт для кодинг-агентов
SWE-bench (Software Engineering Benchmark) стал де-факто стандартом для оценки способности AI-агентов решать реальные задачи разработки. Бенчмарк содержит 2 294 задачи из 12 популярных Python-репозиториев на GitHub, включая Django, Flask, SymPy и pytest.
Каждая задача представляет собой issue из реального репозитория с описанием бага или запроса на фичу. Агент должен:
1. Понять проблему из описания
2. Найти соответствующий код в репозитории
3. Сгенерировать патч, который проходит существующие тесты
Метрика — pass@1: процент задач, где сгенерированный патч совпадает с принятым разработчиками решением. По состоянию на август 2026 года лучшие модели показывают около 45-50% на полном наборе.
Ограничения
— Только Python-репозитории
— Задачи в основном касаются баг-фиксов, а не написания нового кода с нуля
— Агент получает всю историю issue, что не всегда соответствует реальному сценарию работы
AgentBench: многозадачная оценка агентов
AgentBench, представленный исследователями из Университета Цинхуа и Microsoft Research, предлагает более широкий взгляд на способности агентов. Бенчмарк включает 8 различных сред (environments), каждая из которых проверяет разные навыки:
- Operating System: выполнение команд в Linux-терминале
- WebShop: навигация по интернет-магазину и оформление заказов
- Database: написание SQL-запросов по текстовому описанию
- Householding: управление виртуальным домом
- AlfWorld: выполнение инструкций в текстовом игровом мире
- Mind2Web: веб-навигация на реальных сайтах
- WebArena: автономное выполнение веб-задач
- Knowledge Graph: ответы на вопросы по графу знаний
Каждая среда имеет собственную метрику успеха — от точности SQL-запросов до процента успешно выполненных операций в терминале. Итоговый скор агента — среднее по всем средам.
AgentBench показал интересный результат: даже лучшие на момент публикации модели (GPT-4, Claude 2) справлялись хорошо только в 3-4 средах из 8. Это означает, что универсальных агентов пока не существует — выбор модели зависит от конкретной задачи.
GAIA: мультимодальные рассуждения и планирование
GAIA (General AI Assistant) от Meta AI и Hugging Face проверяет способность агентов к многошаговым рассуждениям с использованием нескольких источников информации. Бенчмарк содержит 466 задач, требующих:
- Чтения и анализа текстов
- Обработки изображений
- Использования внешних инструментов (калькулятор, поиск, код)
- Многошагового планирования
Пример задачи: «Сколько стран имеют площадь меньше, чем площадь Монако, умноженная на площадь Ватикана?» Для ответа агенту нужно найти площади всех трёх территорий, выполнить вычисления и сравнить с данными по всем странам.
GAIA делится на три уровня сложности. Лучшие модели на август 2026 года показывают около 60% на уровне 1 и 35% на уровне 3. Интересно, что люди справляются с этими задачами с точностью выше 90% — разрыв остаётся значительным.
Harbor Adapters: новый стандарт гибкого тестирования
В июле 2026 года появился Harbour Adapters — фреймворк для тестирования AI-агентов на 80+ бенчмарках через единый интерфейс. Его ключевое преимущество — стандартизация: один и тот же агент можно прогнать через SWE-bench, AgentBench, GAIA и десятки других тестов без переписывания интеграции.
Harbour Adapters решает давнюю проблему: разработчики часто тестировали агентов только на 2-3 бенчмарках, что давало неполную картину. С Harbour можно получить профиль агента по десяткам метрик за один запуск.
Важный нюанс: Harbour не добавляет новые метрики, он только унифицирует доступ к существующим. Качество оценки по-прежнему зависит от качества отдельных бенчмарков.
Как интерпретировать результаты: что не говорят цифры
Любой бенчмарк — это упрощение реальности. Вот основные ловушки при интерпретации:
1. Переобучение на бенчмарк. Модели, которые показывают высокие результаты на SWE-bench, могут проваливаться на похожих, но не совпадающих задачах. Это особенно заметно на закрытых бенчмарках, где задачи не публикуются.
2. Разный контекст. На SWE-bench агент получает полную историю issue. В реальной работе такой контекст может отсутствовать — задача может быть сформулирована в две строки в Jira.
3. Метрики успеха. В AgentBench «успех» в среде WebShop означает успешное оформление заказа. Но агент мог сделать это неоптимальным путём, с лишними шагами. Бенчмарк это не учитывает.
4. Стоимость выполнения. Два агента могут показывать одинаковый pass@1 на SWE-bench, но один тратит на задачу в 10 раз больше токенов. Harbour Adapters начал добавлять метрики стоимости, но это пока редкость.
Практические рекомендации по выбору бенчмарка
| Ваша задача | Рекомендуемый бенчмарк | Почему |
|---|---|---|
| Исправление багов в коде | SWE-bench | Реальные задачи из Python-репозиториев |
| Веб-автоматизация | WebArena (часть AgentBench) | Работа с реальными сайтами |
| Многошаговые рассуждения | GAIA | Требует планирования и внешних инструментов |
| Работа с терминалом | OS (часть AgentBench) | Выполнение команд в Linux |
| Общая оценка агента | Harbour Adapters | Прогон по 80+ бенчмаркам за один раз |
Если вы выбираете модель для конкретной задачи, тестируйте на бенчмарке, который максимально приближен к вашему сценарию. Не полагайтесь на общие рейтинги — агент, который отлично пишет код, может оказаться бесполезным для веб-скрапинга.
Что проверять перед использованием результатов
Перед тем как делать выводы на основе бенчмарков, проверьте:
Дата публикации результатов. Бенчмарки быстро устаревают. Результаты годичной давности могут не отражать текущий уровень моделей.
Условия тестирования. Использовал ли агент внешние инструменты? Был ли доступ в интернет? Сколько попыток давалось на задачу?
Состав задач. В SWE-bench есть задачи разной сложности. Общий pass@1 может скрывать, что модель справляется с простыми багами, но проваливается на сложных.
Прозрачность методологии. Лучшие бенчмарки публикуют не только итоговые цифры, но и логи выполнения агентов. Это позволяет проверить, как именно агент пришёл к решению.
Практический пример: сравнение двух агентов
Допустим, вы выбираете между двумя моделями для задачи автоматического исправления багов в вашем Python-проекте. Вы смотрите на SWE-bench: Модель A показывает 48%, Модель B — 42%. Казалось бы, выбор очевиден.
Но при детальном анализе выясняется:
— Модель A использует в 3 раза больше токенов на задачу
— Модель B лучше справляется с задачами, где нужно понять архитектуру проекта, а не просто заменить строку
— Модель A часто генерирует патчи, которые проходят тесты, но нарушают стиль кода проекта
В вашем проекте важна стоимость выполнения (вы обрабатываете тысячи багов в месяц) и качество кода. Модель B может оказаться лучшим выбором, несмотря на более низкий pass@1.
Что дальше: куда движутся бенчмарки
Сообщество движется к более комплексной оценке агентов. Основные тренды:
- Динамические бенчмарки, где задачи генерируются на лету, чтобы исключить переобучение
- Метрики стоимости становятся стандартной частью отчётов
- Мультимодальные бенчмарки заменяют текстовые — агенты всё чаще работают с интерфейсами, а не API
- Бенчмарки безопасности проверяют не только способность выполнить задачу, но и отказ от опасных действий
Harbour Adapters уже сейчас позволяет агрегировать результаты по десяткам бенчмарков, и это направление будет развиваться. В идеале через год мы будем видеть не «модель X набрала Y на SWE-bench», а многомерный профиль способностей агента с учётом стоимости, скорости и безопасности.
Резюме и следующие шаги
Оценка AI-агентов через бенчмарки — единственный объективный способ сравнения, но только при правильной интерпретации. Ключевые выводы:
- Выбирайте бенчмарк под конкретную задачу, а не по общему рейтингу
- Проверяйте условия тестирования и методологию
- Учитывайте стоимость выполнения, а не только точность
- Используйте Harbour Adapters для комплексной оценки, если нужно сравнить агентов по нескольким параметрам
Для начала возьмите один-два бенчмарка, релевантных вашей задаче, и протестируйте на них 2-3 кандидата. Запишите не только итоговые проценты, но и логи выполнения — они скажут о поведении агента больше, чем сухая статистика.