Запись архива

Как оценить AI-агента: практическое руководство по бенчмаркам и метрикам

Разбираем, какие бенчмарки действительно показывают способности AI-агентов, как интерпретировать результаты и на что обращать внимание при выборе модели для агентных задач.

Интерфейс бенчмарка SWE-bench с результатами выполнения задач AI-агентами
Интерфейс бенчмарка SWE-bench с результатами выполнения задач AI-агентами
2457-Santiago de Mens en Malpica (Coruña) | by jl.cernadas | openverse | by

Когда речь заходит о выборе AI-агента для реальной задачи, маркетинговые описания моделей дают мало пользы. Производители заявляют «улучшенное рассуждение» и «лучшее следование инструкциям», но что это значит на практике? Ответ дают бенчмарки — стандартизированные тесты, которые измеряют конкретные способности агентов.

Проблема в том, что бенчмарков десятки, и каждый измеряет что-то своё. SWE-bench проверяет способность исправлять баги в коде, AgentBench — взаимодействие с окружением, GAIA — мультимодальные рассуждения. Выбор неправильного бенчмарка для оценки может привести к неверным выводам о возможностях агента.

Эта статья — практическое руководство по ключевым бенчмаркам для AI-агентов: что они измеряют, как интерпретировать результаты и какие ограничения нужно учитывать.

SWE-bench: золотой стандарт для кодинг-агентов

SWE-bench (Software Engineering Benchmark) стал де-факто стандартом для оценки способности AI-агентов решать реальные задачи разработки. Бенчмарк содержит 2 294 задачи из 12 популярных Python-репозиториев на GitHub, включая Django, Flask, SymPy и pytest.

Каждая задача представляет собой issue из реального репозитория с описанием бага или запроса на фичу. Агент должен:
1. Понять проблему из описания
2. Найти соответствующий код в репозитории
3. Сгенерировать патч, который проходит существующие тесты

Метрика — pass@1: процент задач, где сгенерированный патч совпадает с принятым разработчиками решением. По состоянию на август 2026 года лучшие модели показывают около 45-50% на полном наборе.

Ограничения

— Только Python-репозитории
— Задачи в основном касаются баг-фиксов, а не написания нового кода с нуля
— Агент получает всю историю issue, что не всегда соответствует реальному сценарию работы

AgentBench: многозадачная оценка агентов

AgentBench, представленный исследователями из Университета Цинхуа и Microsoft Research, предлагает более широкий взгляд на способности агентов. Бенчмарк включает 8 различных сред (environments), каждая из которых проверяет разные навыки:

  • Operating System: выполнение команд в Linux-терминале
  • WebShop: навигация по интернет-магазину и оформление заказов
  • Database: написание SQL-запросов по текстовому описанию
  • Householding: управление виртуальным домом
  • AlfWorld: выполнение инструкций в текстовом игровом мире
  • Mind2Web: веб-навигация на реальных сайтах
  • WebArena: автономное выполнение веб-задач
  • Knowledge Graph: ответы на вопросы по графу знаний

Каждая среда имеет собственную метрику успеха — от точности SQL-запросов до процента успешно выполненных операций в терминале. Итоговый скор агента — среднее по всем средам.

AgentBench показал интересный результат: даже лучшие на момент публикации модели (GPT-4, Claude 2) справлялись хорошо только в 3-4 средах из 8. Это означает, что универсальных агентов пока не существует — выбор модели зависит от конкретной задачи.

GAIA: мультимодальные рассуждения и планирование

GAIA (General AI Assistant) от Meta AI и Hugging Face проверяет способность агентов к многошаговым рассуждениям с использованием нескольких источников информации. Бенчмарк содержит 466 задач, требующих:

  • Чтения и анализа текстов
  • Обработки изображений
  • Использования внешних инструментов (калькулятор, поиск, код)
  • Многошагового планирования

Пример задачи: «Сколько стран имеют площадь меньше, чем площадь Монако, умноженная на площадь Ватикана?» Для ответа агенту нужно найти площади всех трёх территорий, выполнить вычисления и сравнить с данными по всем странам.

GAIA делится на три уровня сложности. Лучшие модели на август 2026 года показывают около 60% на уровне 1 и 35% на уровне 3. Интересно, что люди справляются с этими задачами с точностью выше 90% — разрыв остаётся значительным.

Harbor Adapters: новый стандарт гибкого тестирования

В июле 2026 года появился Harbour Adapters — фреймворк для тестирования AI-агентов на 80+ бенчмарках через единый интерфейс. Его ключевое преимущество — стандартизация: один и тот же агент можно прогнать через SWE-bench, AgentBench, GAIA и десятки других тестов без переписывания интеграции.

Harbour Adapters решает давнюю проблему: разработчики часто тестировали агентов только на 2-3 бенчмарках, что давало неполную картину. С Harbour можно получить профиль агента по десяткам метрик за один запуск.

Важный нюанс: Harbour не добавляет новые метрики, он только унифицирует доступ к существующим. Качество оценки по-прежнему зависит от качества отдельных бенчмарков.

Как интерпретировать результаты: что не говорят цифры

Любой бенчмарк — это упрощение реальности. Вот основные ловушки при интерпретации:

1. Переобучение на бенчмарк. Модели, которые показывают высокие результаты на SWE-bench, могут проваливаться на похожих, но не совпадающих задачах. Это особенно заметно на закрытых бенчмарках, где задачи не публикуются.

2. Разный контекст. На SWE-bench агент получает полную историю issue. В реальной работе такой контекст может отсутствовать — задача может быть сформулирована в две строки в Jira.

3. Метрики успеха. В AgentBench «успех» в среде WebShop означает успешное оформление заказа. Но агент мог сделать это неоптимальным путём, с лишними шагами. Бенчмарк это не учитывает.

4. Стоимость выполнения. Два агента могут показывать одинаковый pass@1 на SWE-bench, но один тратит на задачу в 10 раз больше токенов. Harbour Adapters начал добавлять метрики стоимости, но это пока редкость.

Практические рекомендации по выбору бенчмарка

Ваша задача Рекомендуемый бенчмарк Почему
Исправление багов в коде SWE-bench Реальные задачи из Python-репозиториев
Веб-автоматизация WebArena (часть AgentBench) Работа с реальными сайтами
Многошаговые рассуждения GAIA Требует планирования и внешних инструментов
Работа с терминалом OS (часть AgentBench) Выполнение команд в Linux
Общая оценка агента Harbour Adapters Прогон по 80+ бенчмаркам за один раз

Если вы выбираете модель для конкретной задачи, тестируйте на бенчмарке, который максимально приближен к вашему сценарию. Не полагайтесь на общие рейтинги — агент, который отлично пишет код, может оказаться бесполезным для веб-скрапинга.

Что проверять перед использованием результатов

Перед тем как делать выводы на основе бенчмарков, проверьте:

Дата публикации результатов. Бенчмарки быстро устаревают. Результаты годичной давности могут не отражать текущий уровень моделей.

Условия тестирования. Использовал ли агент внешние инструменты? Был ли доступ в интернет? Сколько попыток давалось на задачу?

Состав задач. В SWE-bench есть задачи разной сложности. Общий pass@1 может скрывать, что модель справляется с простыми багами, но проваливается на сложных.

Прозрачность методологии. Лучшие бенчмарки публикуют не только итоговые цифры, но и логи выполнения агентов. Это позволяет проверить, как именно агент пришёл к решению.

Практический пример: сравнение двух агентов

Допустим, вы выбираете между двумя моделями для задачи автоматического исправления багов в вашем Python-проекте. Вы смотрите на SWE-bench: Модель A показывает 48%, Модель B — 42%. Казалось бы, выбор очевиден.

Но при детальном анализе выясняется:
— Модель A использует в 3 раза больше токенов на задачу
— Модель B лучше справляется с задачами, где нужно понять архитектуру проекта, а не просто заменить строку
— Модель A часто генерирует патчи, которые проходят тесты, но нарушают стиль кода проекта

В вашем проекте важна стоимость выполнения (вы обрабатываете тысячи багов в месяц) и качество кода. Модель B может оказаться лучшим выбором, несмотря на более низкий pass@1.

Что дальше: куда движутся бенчмарки

Сообщество движется к более комплексной оценке агентов. Основные тренды:

  • Динамические бенчмарки, где задачи генерируются на лету, чтобы исключить переобучение
  • Метрики стоимости становятся стандартной частью отчётов
  • Мультимодальные бенчмарки заменяют текстовые — агенты всё чаще работают с интерфейсами, а не API
  • Бенчмарки безопасности проверяют не только способность выполнить задачу, но и отказ от опасных действий

Harbour Adapters уже сейчас позволяет агрегировать результаты по десяткам бенчмарков, и это направление будет развиваться. В идеале через год мы будем видеть не «модель X набрала Y на SWE-bench», а многомерный профиль способностей агента с учётом стоимости, скорости и безопасности.

Резюме и следующие шаги

Оценка AI-агентов через бенчмарки — единственный объективный способ сравнения, но только при правильной интерпретации. Ключевые выводы:

  • Выбирайте бенчмарк под конкретную задачу, а не по общему рейтингу
  • Проверяйте условия тестирования и методологию
  • Учитывайте стоимость выполнения, а не только точность
  • Используйте Harbour Adapters для комплексной оценки, если нужно сравнить агентов по нескольким параметрам

Для начала возьмите один-два бенчмарка, релевантных вашей задаче, и протестируйте на них 2-3 кандидата. Запишите не только итоговые проценты, но и логи выполнения — они скажут о поведении агента больше, чем сухая статистика.

Источники