Агенты научились менять игровые миры — но сложные правки даются хуже

Авторы IGMWorld и IGMBench проверили, могут ли coding-агенты менять работающие миры Minecraft и Terraria, сохраняя остальное. Главная сложность — не запустить изменённый мир, а добиться нужного поведения и визуальной согласованности.

Игровой мир Minecraft как пример среды для проверки редактирования мира ИИ-агентами
Игровой мир Minecraft как пример среды для проверки редактирования мира ИИ-агентами
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Авторы препринта World Editing: Intervening on Executable Worlds at Increasing Depth представили IGMWorld и IGMBench — среду и набор тестов, чтобы оценивать, как coding-агенты изменяют уже работающие игровые миры. В отличие от генерации мира с нуля, здесь нужно внести правку и сохранить свойства, которые менять не требуется.

Что проверяет бенчмарк

IGMBench включает 110 задач для Minecraft и Terraria и более 1,1 тысячи исполняемых критериев состояния и поведения. Задания охватывают правки отдельных свойств и объектов, изменение динамики и вмешательство в системы игры.

Исследователи называют глубиной вмешательства степень связанности правки с другими сущностями, правилами и системами мира. Чем глубже изменение, тем больше условий может затронуть его результат. Поэтому тесты проверяют не только, собирается ли проект и загружается ли мир, но и поведение, сохранение неизменённых свойств и визуальный результат.

Результаты агентов

По данным авторов, лучшая конфигурация решила 78,2% задач при строгой оценке на уровне задачи. На уровне отдельных критериев результат составил 94,8%. Эти показатели описывают разные уровни проверки: успешное выполнение отдельных условий не означает, что вся задача целиком пройдена.

Надёжность в целом снижалась с ростом глубины вмешательства. По сообщению авторов, эта зависимость сохранялась и при сравнении задач с похожим количеством критериев. Многие неудачные правки всё же собирались и загружались: основная проблема часто заключалась в том, чтобы заставить изменённый мир вести себя именно так, как требовало задание.

Отдельным слабым местом оказалась визуальная согласованность. Во всех проверенных конфигурациях доля задач, прошедших совместную визуальную проверку, была ниже 50%.

Почему это важно

Результаты показывают, что редактирование исполняемой среды — отдельная задача для ИИ-агентов, а не просто вариант генерации или взаимодействия с миром. Агенту нужно учитывать связи между объектами и правилами, проверять последствия правки и не ломать то, что должно остаться прежним.

Для разработчиков это полезное различие: успешная сборка мода ещё не подтверждает, что изменение работает по замыслу. Вместе с тем бенчмарк охватывает две игры и конкретный набор задач. Он не доказывает, что такие же результаты агенты покажут в других игровых движках или крупных проектах.

Источники:
— Препринт на arXiv
— arXiv