Запись архива

AWS-bench: открытый бенчмарк для оценки AI-агентов на реальных задачах облачной инфраструктуры

AWS-bench — новый открытый бенчмарк для оценки AI-агентов кодинга на реальных задачах AWS: от диагностики неисправностей до развертывания инфраструктуры. Тесты проходят в живых облачных окружениях.

Скриншот интерфейса AWS-bench с запуском тестового сценария
Скриншот интерфейса AWS-bench с запуском тестового сценария
Public sector strike march leaves Chapelfield Gardens to march through Norwich City centre | by Roger Blackwell | openverse | by

На Hacker News появился анонс проекта aws-bench — открытого бенчмарка для оценки AI-агентов кодинга на реальных задачах в AWS. Разработчики позиционируют его как инструмент, измеряющий, насколько хорошо комбинации агентов и моделей (например, Claude Code с Sonnet или Codex с GPT) справляются с повседневной работой облачного инженера.

Что такое aws-bench

Проект доступен на GitHub и построен на фреймворке Harbor, предназначенном для оценки AI-агентов и языковых моделей. Главное отличие от существующих бенчмарков — тестирование не на статичных фикстурах, а в одноразовых, но реальных облачных окружениях AWS. Это дает, по утверждению авторов, более достоверный сигнал о производительности агента в условиях, приближенных к боевым.

Архитектура и сценарии

Работа с aws-bench строится в три этапа: настройка окружения, запуск агента, верификация результатов. Бенчмарк оперирует несколькими ключевыми понятиями:

  • Задачи (Tasks) — делятся на два семейства: диагностика и устранение неисправностей (troubleshooting) и развертывание инфраструктуры (provisioning).
  • Сценарии (Scenarios) — конкретные наборы шагов с ожидаемым результатом.
  • Датасеты (Datasets) — версионированные коллекции задач.

Проект уже включает набор курируемых датасетов. Каждый сценарий также доступен как отдельный датасет, что позволяет запускать бенчмарк инкрементально, не прогоняя полный набор тестов.

Доступные категории задач

На данный момент опубликованы следующие датасеты:

  • api-and-observability
  • compute-and-data
  • databases-and-storage
  • ec2-multiregion
  • reference-architectures
  • serverless-apps
  • streaming-and-iot
  • troubleshooting-multiservice

Каждый из них можно запустить отдельной командой, например: `uv run aws-bench run -d ec2-multiregion@latest —env-name my-bench -a claude-code -m `.

Практические ограничения

На момент публикации у бенчмарка нет набранных очков или комментариев на HN (1 point, 0 comments), что указывает на очень раннюю стадию распространения. Проект требует наличия AWS-аккаунта с соответствующими правами и квотами, а также использует утилиту `uv` для управления зависимостями. Полный список поддерживаемых агентов и моделей пока не детализирован в доступном контексте.

Запуск и настройка

Быстрый старт включает клонирование репозитория, настройку AWS-профиля (через статические ключи или IAM Identity Center), инициализацию тестового окружения и выполнение команд через `uv`. Для работы потребуется management account с необходимыми разрешениями.

Значение для разработчиков

AWS-bench решает проблему, которая давно назрела: большинство существующих бенчмарков для AI-агентов кодинга тестируют на синтетических или изолированных задачах. Реальные сценарии включают работу с живыми облачными сервисами, сетевыми задержками, неочевидными ошибками конфигурации. Проект пытается восполнить этот пробел, предлагая воспроизводимую среду для оценки.

Тем не менее, стоит учитывать, что бенчмарк сам по себе не гарантирует переносимости результатов на production-среды — любые тесты в изолированных аккаунтах AWS могут не учитывать специфику конкретных организационных политик, лимитов сервисов и архитектурных компромиссов.

Источники

  • Оригинальный репозиторий: https://github.com/aws-bench/aws-bench
  • Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49570089
  • Фреймворк Harbor: https://github.com/aws-bench/aws-bench (встроенное описание)
  • Блог GitHub (verification lead): https://github.blog/