Запись архива

AutoWorldModel-Bench: кодинг-агенты как автономные исследователи моделей мира

Новый closed-loop бенчмарк arXiv: кодинг-агенты автономно улучшают модели мира в восьми игровых средах — успех в 63 из 64 сессий, 91% выигрышных правок носят исследовательский характер.

ИИ-агент-исследователь дорабатывает модель мира в игровой среде
ИИ-агент-исследователь дорабатывает модель мира в игровой среде
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

В arXiv опубликован препринт AutoWorldModel-Bench (arXiv:2608.11216): closed-loop бенчмарк, в котором кодинг-агенты работают как автономные исследователи. Агент получает стартовую модель мира и фиксированный бюджет вычислений — и должен сам решить, как её улучшить, без заранее заданного направления.

Что произошло
Бенчмарк охватывает восемь игровых сред с единым структурированным представлением состояний: ground-truth данные об объектах подаются через общий тензорный формат. Это изолирует задачу моделирования динамики от восприятия и сокращает итерацию до минут. По заявлению авторов, Codex-5.4 и Claude Opus 4.6 улучшили стартовую модель в 63 из 64 сессий; в 91% сессий выигрышная правка — не подбор гиперпараметров, а содержательное исследовательское изменение: новая функция потерь, представление состояния, процедура развёртки или архитектурное решение.

Почему обсуждают
World modeling остаётся нестабильной областью: архитектуры, цели обучения и представления состояний взаимодействуют сложным образом, единого рецепта нет. Поэтому задача «улучши модель мира» подходит для проверки агентов на открытом исследовании, а не на инженерии по спецификации, которая доминирует в текущих бенчмарках.

Что подтверждено и что неясно
Подтверждено: препринт вышел, методика и результаты изложены в тексте. Неясно: прошла ли работа рецензирование, воспроизводятся ли результаты на других моделях и средах, насколько бенчмарк устойчив к утечкам данных из обучающих выборок агентов.

Punkt Detail
Платформа arXiv cs.AI, препринт 2608.11216
Среды 8 игровых окружений, единый тензорный формат
Сессии 64; стартер улучшен в 63, 91% правок — research-style
Модели Codex-5.4, Claude Opus 4.6
Публикация 2026-08-13

Что смотреть дальше
Следить за ревизиями препринта, публикацией кода и данных бенчмарка, а также за официальными комментариями лабораторий — прежде всего Anthropic, чья модель фигурирует в работе.

Источники: оригинальный препринт arXiv — https://arxiv.org/abs/2608.11216; для проверки заявлений об участии моделей Anthropic — https://www.anthropic.com/news.