Jevman: открытый бенчмарк AI-моделей в Pac-Man

Opper.ai запустила Jevman — аркадный бенчмарк, где модели принятия решений соревнуются в Pac-Man. Шесть моделей сыграли по 100 игр, результаты опубликованы, код открыт — можно подключить свою модель и попасть в рейтинг.

Скриншот игры Pac-Man с управлением от AI-модели на бенчмарке Jevman
Скриншот игры Pac-Man с управлением от AI-модели на бенчмарке Jevman
Изображение из исходного материала

Opper.ai представила Jevman — открытый бенчмарк, оценивающий способность AI-моделей принимать быстрые решения в реальном времени. Тестовой средой выбрана классическая аркада Pac-Man: привидения управляются ботом, а Пакмен — моделью. Поводом стали недавние релизы OpenAI (decisions endpoint) и Cloudflare (Clef Flash), а также появление нескольких альтернатив вроде jev и kev. Разработчики решили сравнить популярные решения на понятной многим задаче.

Как устроен бенчмарк

Каждая модель сыграла 100 игр против оригинальных привидений на стандартных условиях: три жизни или пять минут, реальное время, не более двух секунд на ответ. На каждом перекрёстке лабиринт передаётся модели в виде JSON, а от неё требуется направление движения — с оценками вероятности, если они поддерживаются. Низкая задержка всех участников позволила вести игру без пауз.

Результаты опубликованы в публичной таблице лидеров. Модели, чьи результаты попали в пределы статистической погрешности, помечены знаком равенства — разница между ними несущественна. Окончательный рейтинг формируется после автоматического CI-воспроизведения каждой игры и сверки очков. Для желающих присоединиться предусмотрен быстрый старт: репозиторий содержит 34-строчный пример endpoint-сервера; достаточно запустить одну команду, чтобы сыграть серию по правилам лидеров. После проверки модель попадает в рейтинг как самозаявленная.

Интерактивная игра с моделями

Кроме автоматических партий, любой может сыграть за Пакмена против привидений, управляемых одной или несколькими моделями. Разработчики сообщают, что одна игра стоит примерно 2 цента, а на платформе Opper для теста начислены бесплатные кредиты. По отзывам создателей, побить максимальный счёт jev неожиданно трудно.

Практическая ценность

Бенчмарки в игровой среде дают воспроизводимый способ измерить «решительность» моделей при жёстких временных рамках. Pac-Man с простыми правилами и динамической картой подходит для первичного скрининга нейросетевых агентов. Открытый код и низкий порог входа делают Jevman полезным дополнением к инструментам оценки decision-making, выходящим за рамки текстовых задач.

Ограничения

Авторы честно указывают на статистические нюансы: разница в очках может быть незначимой, если модели попадают в зону погрешности. Статичные привидения-боты не адаптируются к поведению модели, что ограничивает глубину проверки. Бенчмарк пока работает только с достаточно быстрыми endpoint-моделями — медленные API не уложатся в таймауты.

Источники

  • Проект и таблица лидеров: https://opper.ai/jevman-benchmark/
  • Исходный код: https://github.com/opper-ai/jevman-benchmark
  • Анонс decisions endpoint от OpenAI: https://openai.com/news/