OSWorld, WebArena, GAIA и τ-bench часто упоминают как единый набор «бенчмарков агентов», но на практике это четыре разные модели мира. Один проверяет управление реальным компьютером, другой — работу в контролируемом вебе, третий — поиск и синтез ответа с инструментами, четвёртый — диалог с пользователем и API под правила домена. Этот обзор фиксирует именно исходные версии этих бенчмарков и отдельно помечает более поздние обновления, если они важны для воспроизводимости.
Коротко
- OSWorld лучше читать как тест computer-use: агент должен видеть экран, кликать, печатать и доводить задачу до изменения состояния ОС или приложения.
- WebArena — это не «интернет вообще», а воспроизводимая self-hosted веб-среда с проверкой функциональной корректности действий.
- GAIA меряет прежде всего tool-augmented problem solving: поиск, чтение файлов, рассуждение и выдачу короткого точного ответа.
- τ-bench добавляет то, чего часто нет в других наборах: многоходовый диалог с пользователем, доменные политики и метрику надёжности
pass^k. - Главный практический вывод: проценты на этих бенчмарках нельзя читать как одну шкалу качества агента.
Контекст
Обычные LLM-бенчмарки оценивают ответ в тексте. Агентные бенчмарки оценивают не только текст, но и действие: навигацию, вызовы инструментов, изменение внешнего состояния, соблюдение правил и устойчивость к длинным траекториям. Поэтому два одинаковых числа, например 40%, могут означать совершенно разный уровень практической полезности.
Если брать именно даты исходных публикаций по страницам arXiv, хронология такая: WebArena — 25 июля 2023 года, GAIA — 21 ноября 2023 года, OSWorld — 11 апреля 2024 года, τ-bench — 17 июня 2024 года. Это важно, потому что более поздние leaderboard-обновления, новые оболочки агентов и последующие версии сред уже меняют контекст сравнения.
Для практического чтения удобно сравнивать такие бенчмарки по пяти осям: среда, пространство действий, внешнее состояние, метрика успеха и источник стохастики. Ниже я использую именно эту рамку.
Метод
В этом обзоре я сопоставляю четыре бенчмарка не по «кто сложнее», а по тому, какой тип агентности они проверяют. Это полезнее для инженера: вместо общей оценки «модель умеет быть агентом» вы получаете карту того, какой риск закрывает конкретный benchmark.
OSWorld
OSWorld построен вокруг реальной компьютерной среды. По исходной статье авторы описывают поддержку Ubuntu, Windows и macOS, а сам benchmark — как набор задач, где агент взаимодействует с GUI и CLI, файлами и несколькими приложениями. Ключевая идея здесь — execution-based evaluation: успех подтверждается не совпадением с эталонной траекторией, а специальным исполняемым скриптом проверки.
Практически это делает OSWorld хорошим тестом на визуальное наведение, операционные знания и способность доводить длинную цепочку действий до изменения состояния системы. Если ваш агент должен реально «пользоваться компьютером», OSWorld обычно ближе к production-сценарию, чем question-answering benchmarks.
WebArena
WebArena — это контролируемая веб-среда, а не открытый интернет. В исходной работе авторы создают функциональные сайты из четырёх доменов: e-commerce, social forum, collaborative software development и content management. Агент действует внутри self-hosted мира, где можно воспроизводимо проверять итоговое состояние страниц и ответы.
С инженерной точки зрения WebArena полезен, когда вы строите browser agent и вам нужна строгая функциональная проверка: нажал ли агент правильные элементы, дошёл ли до нужной страницы, изменил ли нужный объект. Это более узкий, но и более контролируемый тест, чем «пошёл в веб и нашёл ответ».
GAIA
GAIA устроен иначе. Здесь агенту дают вопрос, иногда с дополнительным файлом, а задача — собрать сведения из разных источников, при необходимости воспользоваться вебом и инструментами, а затем вернуть короткий однозначный ответ. Официальный leaderboard GAIA прямо описывает оценку как quasi exact match: ответ должен совпасть с эталоном после нормализации формата.
Поэтому GAIA не проверяет управление состоянием интерфейса так же жёстко, как WebArena или OSWorld. Он сильнее нагружает поиск, чтение документов, мультимодальность, составные шаги рассуждения и дисциплину финального ответа.
τ-bench
τ-bench ориентирован на другой класс систем: агент разговаривает с пользователем, вызывает API и обязан соблюдать доменные политики. В исходной статье авторы моделируют такую среду через базы данных, API-инструменты, policy documents и LLM-симулятор пользователя. Итог оценивается по конечному состоянию базы, а не по буквальному совпадению реплик.
Самая полезная идея τ-bench — метрика pass^k. Она спрашивает не только «решил ли агент задачу один раз», но и «насколько стабильно он решает один и тот же тип задачи при повторных независимых прогонах». Для production-систем это часто важнее разового удачного эпизода.
Результаты
Ниже — компактное сравнение исходных версий бенчмарков. Числа в колонке масштаба даны либо по исходным статьям, либо по официальным dataset/repo pages, где это отдельно отмечено.
| Бенчмарк | Исторический масштаб исходной версии | Среда | Как считается успех | Что меряет лучше всего |
|---|---|---|---|---|
| OSWorld | По исходной статье — 369 задач. | Реальная компьютерная среда: GUI, CLI, файлы, несколько приложений, разные ОС. | Исполняемые скрипты проверки завершения задачи. | GUI-grounding, операционные знания, multi-app computer use. |
| WebArena | По исходной статье — 812 тестовых примеров из 241 шаблона. | Self-hosted веб-сайты и вспомогательные инструменты в контролируемом вебе. | Проверка функциональной корректности: ответ или состояние сайта. | Browser navigation и web task completion в воспроизводимой среде. |
| GAIA | По исходной статье — 466 вопросов; в статье также сказано, что ответы для 300 из них удерживаются для leaderboard. Официальный dataset card описывает набор как benchmark из более чем 450 вопросов, разделённых на 3 уровня. | Открытый веб и вложенные файлы: PDF, таблицы, изображения, аудио и другие артефакты. | Короткий финальный ответ, оцениваемый через quasi exact match. | Tool use для исследования, извлечения фактов и многошагового синтеза ответа. |
| τ-bench | По исходной статье — 115 retail-задач и 50 airline-задач. | Симулированный пользователь, API-инструменты, скрытое состояние БД и policy documents. | Сравнение конечного состояния БД с целевым; дополнительно pass^k. |
Диалог + tool use + policy following + надёжность на повторных прогонах. |
Отдельно полезно посмотреть на базовые разрывы, которые сами авторы сообщают в исходных публикациях. Эти проценты нельзя сравнивать между собой напрямую, но они хорошо показывают, где именно находится трудность.
| Бенчмарк | Что сообщают авторы в исходной работе | Как это читать |
|---|---|---|
| OSWorld | В исходной статье сообщается, что люди выполняют более 72.36% задач, а лучший базовый агент — 12.24%. | Большой разрыв по визуальному наведению, интерфейсным действиям и знанию компьютерных операций. |
| WebArena | Авторы сообщают 78.24% для людей и 14.41% для лучшего GPT-4-based агента в их постановке. | Даже в контролируемом вебе длинные траектории и функциональная корректность остаются трудной задачей. |
| GAIA | В статье сообщаются 92% для людей против 15% у GPT-4 с plugins. | Провал не в одном навыке, а в композиции: поиск, чтение, инструментальное действие и точный финальный ответ. |
| τ-bench | В arXiv PDF авторы показывают для gpt-4o function-calling около 61% pass^1 в retail и около 35% в airline; там же отмечается, что в retail pass^8 падает ниже 25%. |
Даже когда одноразовый успех выглядит приемлемо, стабильность на повторных прогонах остаётся слабой. |
Интерпретация
Если убрать маркетинговую лексику и оставить инженерную суть, эти четыре бенчмарка закрывают четыре разные поверхности ошибок. OSWorld — это ошибки восприятия и действия в интерфейсе. WebArena — ошибки навигации и state tracking в веб-приложениях. GAIA — ошибки композиции поиска, чтения и рассуждения. τ-bench — ошибки в диалоге, правилах и согласованности действий с внешним состоянием.
Наш комментарий
На наш взгляд, самая частая ошибка при чтении agent benchmarks — пытаться выбрать «лучший общий процент». Для практики полезнее выбирать benchmark от продукта, а не от хайпового leaderboard.
- Если вы строите browser agent для CRM, админок или e-commerce flows, первым кандидатом обычно будет WebArena.
- Если агент должен пользоваться компьютером, работать с файлами и нативными приложениями, ближе будет OSWorld.
- Если вам нужен research/assistant agent, который ищет, читает и возвращает короткий точный ответ, лучше смотреть на GAIA.
- Если продукт похож на поддержку клиентов с правилами, авторизацией и API-операциями, наиболее релевантен τ-bench.
Иными словами, эти benchmark’и не конкуренты в строгом смысле. Это разные тесты на разные формы агентности.
Ограничения и критика
- OSWorld силён в realism, но дорог и чувствителен к устройству agent harness. Кроме того, последующая работа OSWorld 2.0 уже отдельно фокусируется на long-horizon workflows, что полезно читать как указание на границы исходного OSWorld, а не как его отмену.
- WebArena воспроизводим именно потому, что мир контролируем. Это плюс для сравнения систем, но минус для переноса на живой веб с антибот-защитой, плавающим контентом и неидеальной вёрсткой.
- GAIA не тестирует state-changing actions так же жёстко, как OSWorld или WebArena. Высокий результат в GAIA ещё не означает, что агент надёжен в GUI или при многократных транзакциях.
- τ-bench зависит от LLM-симуляции пользователя. Это позволяет измерять устойчивость, но создаёт дополнительный слой вариативности. Для исторической корректности важно и то, что текущий README официального репозитория помечает исходные airline/retail tasks как устаревшие и рекомендует переход к τ³-bench для новых прогонов.
- Для всех четырёх наборов остаётся общий риск: публичность benchmark’ов со временем повышает вероятность contamination, а значит, score всё сильнее зависит не только от модели, но и от harness, prompting и знания конкретной среды.
Поэтому лучший способ использовать эти benchmark’и — не как «итоговую оценку интеллекта», а как диагностический набор на разные классы сбоев.
Вывод
OSWorld, WebArena, GAIA и τ-bench отвечают на разные вопросы об агенте. Первый спрашивает, умеет ли он пользоваться компьютером; второй — умеет ли он надёжно действовать в веб-приложениях; третий — умеет ли он добывать и синтезировать ответ с инструментами; четвёртый — умеет ли он разговаривать, соблюдать правила и стабильно менять внешнее состояние через API. Если держать это различие в голове, читать agent leaderboards становится заметно проще.
Источники
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- OSWORLD: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- GAIA: a benchmark for General AI Assistants
- GAIA dataset
- GAIA Leaderboard
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
- sierra-research/tau-bench
- OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
FAQ
Можно ли напрямую сравнивать проценты между OSWorld, WebArena, GAIA и τ-bench?
Нет. Эти наборы различаются по среде, типу действия и самой семантике успеха. 40% в GAIA и 40% в OSWorld — это не один и тот же уровень практической способности.
Какой бенчмарк выбрать для browser agent?
Если агент в основном живёт в веб-приложениях и вам нужна воспроизводимая среда с проверкой состояния страниц, чаще всего разумно начинать с WebArena. Если браузер — лишь часть общей работы на компьютере, релевантнее может быть OSWorld.
Почему τ-bench выделяется метрикой pass^k?
Потому что она измеряет не только разовый успех, но и устойчивость поведения на повторных прогонах. Для агентных систем, которые должны обслуживать много похожих запросов, это ближе к реальному требованию надёжности.
GAIA — это benchmark агента или benchmark рассуждения?
Скорее benchmark tool-augmented assistant behavior. Он проверяет рассуждение, поиск, чтение файлов и дисциплину финального ответа, но не заменяет тесты на GUI-управление или транзакционные действия с внешним состоянием.
