
Opper.ai представила Jevman — открытый бенчмарк, оценивающий способность AI-моделей принимать быстрые решения в реальном времени. Тестовой средой выбрана классическая аркада Pac-Man: привидения управляются ботом, а Пакмен — моделью. Поводом стали недавние релизы OpenAI (decisions endpoint) и Cloudflare (Clef Flash), а также появление нескольких альтернатив вроде jev и kev. Разработчики решили сравнить популярные решения на понятной многим задаче.
Как устроен бенчмарк
Каждая модель сыграла 100 игр против оригинальных привидений на стандартных условиях: три жизни или пять минут, реальное время, не более двух секунд на ответ. На каждом перекрёстке лабиринт передаётся модели в виде JSON, а от неё требуется направление движения — с оценками вероятности, если они поддерживаются. Низкая задержка всех участников позволила вести игру без пауз.
Результаты опубликованы в публичной таблице лидеров. Модели, чьи результаты попали в пределы статистической погрешности, помечены знаком равенства — разница между ними несущественна. Окончательный рейтинг формируется после автоматического CI-воспроизведения каждой игры и сверки очков. Для желающих присоединиться предусмотрен быстрый старт: репозиторий содержит 34-строчный пример endpoint-сервера; достаточно запустить одну команду, чтобы сыграть серию по правилам лидеров. После проверки модель попадает в рейтинг как самозаявленная.
Интерактивная игра с моделями
Кроме автоматических партий, любой может сыграть за Пакмена против привидений, управляемых одной или несколькими моделями. Разработчики сообщают, что одна игра стоит примерно 2 цента, а на платформе Opper для теста начислены бесплатные кредиты. По отзывам создателей, побить максимальный счёт jev неожиданно трудно.
Практическая ценность
Бенчмарки в игровой среде дают воспроизводимый способ измерить «решительность» моделей при жёстких временных рамках. Pac-Man с простыми правилами и динамической картой подходит для первичного скрининга нейросетевых агентов. Открытый код и низкий порог входа делают Jevman полезным дополнением к инструментам оценки decision-making, выходящим за рамки текстовых задач.
Ограничения
Авторы честно указывают на статистические нюансы: разница в очках может быть незначимой, если модели попадают в зону погрешности. Статичные привидения-боты не адаптируются к поведению модели, что ограничивает глубину проверки. Бенчмарк пока работает только с достаточно быстрыми endpoint-моделями — медленные API не уложатся в таймауты.
Источники










