
Авторы препринта World Editing: Intervening on Executable Worlds at Increasing Depth представили IGMWorld и IGMBench — среду и набор тестов, чтобы оценивать, как coding-агенты изменяют уже работающие игровые миры. В отличие от генерации мира с нуля, здесь нужно внести правку и сохранить свойства, которые менять не требуется.
Что проверяет бенчмарк
IGMBench включает 110 задач для Minecraft и Terraria и более 1,1 тысячи исполняемых критериев состояния и поведения. Задания охватывают правки отдельных свойств и объектов, изменение динамики и вмешательство в системы игры.
Исследователи называют глубиной вмешательства степень связанности правки с другими сущностями, правилами и системами мира. Чем глубже изменение, тем больше условий может затронуть его результат. Поэтому тесты проверяют не только, собирается ли проект и загружается ли мир, но и поведение, сохранение неизменённых свойств и визуальный результат.
Результаты агентов
По данным авторов, лучшая конфигурация решила 78,2% задач при строгой оценке на уровне задачи. На уровне отдельных критериев результат составил 94,8%. Эти показатели описывают разные уровни проверки: успешное выполнение отдельных условий не означает, что вся задача целиком пройдена.
Надёжность в целом снижалась с ростом глубины вмешательства. По сообщению авторов, эта зависимость сохранялась и при сравнении задач с похожим количеством критериев. Многие неудачные правки всё же собирались и загружались: основная проблема часто заключалась в том, чтобы заставить изменённый мир вести себя именно так, как требовало задание.
Отдельным слабым местом оказалась визуальная согласованность. Во всех проверенных конфигурациях доля задач, прошедших совместную визуальную проверку, была ниже 50%.
Почему это важно
Результаты показывают, что редактирование исполняемой среды — отдельная задача для ИИ-агентов, а не просто вариант генерации или взаимодействия с миром. Агенту нужно учитывать связи между объектами и правилами, проверять последствия правки и не ломать то, что должно остаться прежним.
Для разработчиков это полезное различие: успешная сборка мода ещё не подтверждает, что изменение работает по замыслу. Вместе с тем бенчмарк охватывает две игры и конкретный набор задач. Он не доказывает, что такие же результаты агенты покажут в других игровых движках или крупных проектах.
Источники:
— Препринт на arXiv
— arXiv










