Запись архива

Как измерить производительность AI-агента: пошаговое руководство по бенчмаркам и метрикам

Единого стандарта оценки агентов не существует. Разбираем, какие бенчмарки реально показывают эффективность кодинг-агентов, поисковых агентов и мультиагентных систем, и как интерпретировать их результаты без иллюзий.

Сравнение ключевых бенчмарков для AI-агентов — SWE-Bench, AgentBench, GAIA, WebArena
Сравнение ключевых бенчмарков для AI-агентов — SWE-Bench, AgentBench, GAIA, WebArena
FREE PHOTOS | by Pink Poppy Photography | openverse | by

Когда разработчик собирает AI-агента, первый вопрос — не «какую модель взять», а «как понять, что агент работает хорошо». В отличие от обычных LLM, где метрики вроде MMLU или HumanEval дают хоть какую-то точку отсчёта, для агентов единого стандарта нет. Более того, последние исследования показывают: популярные бенчмарки могут систематически завышать реальную производительность.

Разбираем, какие инструменты оценки существуют, что они на самом деле измеряют и как не попасть в ловушку ложных результатов.

Почему MMLU и HumanEval не подходят для агентов

Классические бенчмарки для LLM проверяют одношаговые ответы: модель получает вопрос и выдаёт ответ. Агент же работает в цикле — наблюдает, планирует, действует, получает обратную связь и корректирует поведение. MMLU не измеряет способность агента использовать инструменты, а HumanEval не проверяет, умеет ли модель запустить код, прочитать ошибку и исправить её.

Исследователи из Princeton NLP в работе «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?» (arXiv:2310.03611, 2023) показали, что даже лучшие на тот момент модели решали лишь 3-5% реальных задач из GitHub issues. При этом те же модели показывали высокие результаты на HumanEval. Разрыв между статическим тестированием кода и реальной работой с репозиторием оказался колоссальным.

Это стало отправной точкой для создания специализированных агентных бенчмарков.

SWE-Bench: главный бенчмарк для кодинг-агентов

SWE-Bench остаётся самым цитируемым бенчмарком для оценки способности AI-агентов решать реальные задачи разработки. Датасет содержит 2 294 задачи, основанные на реальных GitHub issues из 12 популярных Python-репозиториев, включая Django, Flask, SymPy и scikit-learn.

Как устроен SWE-Bench

— Агенту выдаётся описание бага или feature request из GitHub issue.
— Агент получает доступ к коду репозитория и может выполнять команды, читать файлы, запускать тесты.
— Успех измеряется прохождением тестов, которые разработчики добавили при мерже пул-реквеста.
— Дополнительно проверяется, что старые тесты не сломались.

В октябре 2024 года OpenAI выпустила SWE-Bench Pro — усложнённую версию, где задачи требуют глубокого понимания архитектуры проекта, а не просто локальных правок. В блоге компании отмечалось, что SWE-Bench Pro выявил, что многие агенты, успешные на базовой версии, проваливались на задачах, требующих изменений в нескольких модулях одновременно.

Ограничения SWE-Bench

— Только Python-репозитории (хотя в 2024 году добавили SWE-bench Multilingual).
— Только задачи, которые уже были решены человеком — это создаёт потенциальное смещение в сторону «решаемых» проблем.
— Успех на SWE-Bench не гарантирует, что агент справится с задачами, где нет готовых тестов.

AgentBench: мультизадачный полигон для агентов

AgentBench, представленный в работе «AgentBench: Evaluating LLMs as Agents» (arXiv:2308.03688, 2023), предлагает принципиально иной подход — оценку агента в восьми различных средах, от веб-навигации до управления операционной системой.

Что входит в AgentBench

— Веб-навигация (Shopping, WebArena-подобные задачи)
— Работа с командной строкой Linux
— Решение задач на доске (Database SQL)
— Управление домом в симуляции (ALFWorld)
— Поиск в цифровом лабиринте (MiniWoB++)
— Игра в вопросы на знание (WikiHow QA)

Каждая среда имеет собственную шкалу оценки, а итоговый результат усредняется. Такой подход позволяет увидеть, в каких сценариях агент силён, а где проваливается.

Ключевое наблюдение AgentBench: модели, которые показывают отличные результаты на MMLU, могут полностью провалиться в задачах на веб-навигацию, требующих долгосрочного планирования. GPT-4 на момент публикации обгонял все open-source модели с большим отрывом именно в агентных сценариях.

GAIA: проверка на рассуждения с использованием инструментов

GAIA (General AI Assistants) — бенчмарк от Meta AI и Hugging Face (arXiv:2311.11583, 2023), который проверяет способность агента решать задачи, требующие многошаговых рассуждений и использования внешних инструментов.

Пример задачи GAIA

«Сколько процентов населения Франции в 2020 году проживало в городах с населением более 100 000 человек?» — агент должен найти данные о населении Франции, определить города с населением >100 000, суммировать их население и вычислить процент.

GAIA содержит 466 задач трёх уровней сложности. Уровень 1 требует 2-3 шага рассуждения, уровень 3 — 8-10 шагов с использованием нескольких инструментов. По данным авторов, даже GPT-4 с плагинами решал лишь 35% задач уровня 1 и менее 10% уровня 3.

Чем GAIA отличается от других бенчмарков

— Задачи требуют не просто поиска информации, а её синтеза из нескольких источников.
— Проверяется способность агента выбирать правильный инструмент для каждого шага.
— Ответы верифицируются автоматически, что исключает субъективность оценки.

WebArena: автономная навигация в веб-среде

WebArena (arXiv:2307.13854, 2023) — это полностью автономная среда для оценки веб-агентов, созданная исследователями из CMU. В отличие от статичных датасетов, WebArena предоставляет живые веб-сайты (интернет-магазин, форум, Git-репозиторий, карты), развёрнутые в изолированном окружении.

Типичные задачи WebArena

— Забронировать отель с заданными параметрами.
— Найти и скачать файл с определённой лицензией на GitHub.
— Опубликовать пост на форуме и проверить, что он виден другим пользователям.

Успех измеряется по объективным критериям: изменилось ли состояние системы (например, появилось ли бронирование в базе данных). WebArena показала, что даже лучшие модели (GPT-4 на момент публикации) достигали успеха лишь в 30% задач, требующих более 5 шагов.

Проблема WebArena: среда требует значительных вычислительных ресурсов для развёртывания, что ограничивает её использование небольшими командами. Кроме того, задачи жёстко привязаны к конкретным сайтам, и агент может «заучить» их структуру.

Как интерпретировать результаты: ловушки и ограничения

Смещение в сторону решаемых задач

Все перечисленные бенчмарки используют задачи, которые уже решены людьми. Это означает, что они не измеряют способность агента справляться с принципиально новыми проблемами. Исследователи из Princeton NLP отмечают, что SWE-Bench может завышать реальную производительность на 20-30% именно из-за этого смещения.

Разные среды — разные результаты

Агент, который отлично работает на SWE-Bench, может провалиться на WebArena. В работе «Harbor Adapters: новый стандарт для тестирования AI-агентов на 80+ бенчмарках» (COMRAD404, 2026) показано, что корреляция между результатами в разных средах значительно ниже, чем предполагалось. Это значит, что выбор бенчмарка должен соответствовать реальному сценарию использования агента.

Проблема воспроизводимости

Бенчмарки с живыми окружениями (WebArena, AgentBench) страдают от проблем воспроизводимости. Изменение версий зависимостей, сетевых задержек или даже порядка запуска тестов может влиять на результаты. В документации SWE-Bench указано, что разброс результатов при повторных запусках может достигать 5-7%.

Игнорирование стоимости и скорости

Ни один из популярных бенчмарков не учитывает стоимость выполнения задачи и время работы агента. Агент, который решает задачу за 100 токенов и 5 секунд, может быть предпочтительнее того, кто тратит 10 000 токенов и 2 минуты, даже если второй показывает чуть более высокий процент успеха. В дашборде ежедневного мониторинга цен API (COMRAD404, 2026) разница между агентным и пакетным вызовом достигает 33x — при оценке агентов этот фактор игнорируется.

Практические рекомендации по оценке агентов

Для кодинг-агентов:

— Используйте SWE-Bench как базовую метрику, но обязательно дополняйте её тестами на вашем собственном коде.
— Обратите внимание на SWE-Bench Pro — он лучше выявляет слабые места в архитектурном понимании.
— Тестируйте не только успешность решения, но и количество итераций, затраченных токенов и время выполнения.

Для веб-агентов:

— WebArena остаётся золотым стандартом, но требует серьёзных ресурсов для развёртывания.
— AgentBench предоставляет более лёгкую альтернативу с восемью различными средами.
— Добавьте тесты на устойчивость к изменению DOM-структуры страниц — это слабое место многих агентов.

Для мультиагентных систем:

— GAIA подходит для оценки способности агента координировать несколько инструментов.
— Используйте бенчмарки с несколькими агентами, где оценивается не только индивидуальная производительность, но и коммуникация между агентами.
— Проверяйте, как система ведёт себя при частичном отказе компонентов.

Для исследовательских и поисковых агентов:

— GAIA с задачами уровня 3 — минимальный стандарт для оценки многошаговых рассуждений.
— Добавьте тесты на устойчивость к противоречивой информации и способность верифицировать источники.
— Проверяйте, возвращает ли агент источники своих утверждений — без этого оценка качества поиска невозможна.

Что дальше: движение к единому стандарту

Сообщество движется к созданию единого фреймворка оценки. Проект Harbor Adapters предлагает унифицированный интерфейс для запуска агентов на 80+ бенчмарках, а OpenAI работает над стандартизацией через SWE-Bench Pro. Однако полной унификации пока не произошло — и, вероятно, не произойдёт в ближайшее время, потому что разные сценарии использования требуют разных метрик.

На что обратить внимание при выборе бенчмарка: он должен соответствовать реальной задаче, которую вы решаете. Если вы строите кодинг-агента для поддержки legacy-проекта на PHP, SWE-Bench с Python-репозиториями даст вам ложное чувство уверенности. Если ваш агент должен работать с веб-интерфейсами, тестирование на статичных датасетах не покажет его реальную производительность.

Лучшая стратегия — комбинировать несколько бенчмарков и дополнять их тестами на собственных данных. Только так можно получить объективную картину того, на что способен ваш агент.

Источники