Запись архива

MindTopo: Microsoft проверяет, умеют ли ИИ-агенты думать «топологически»

Microsoft Research, Northwestern University и Stanford University представили бенчмарк MindTopo, который проверяет у мультимодальных моделей не расстояния, а связность, вложенность, порядок и узлы. Главный вывод: модели отвечают на статичные вопросы о топологии, но теряют понимание структуры при длинном планировании де

Иллюстрация топологических задач бенчмарка MindTopo: лабиринт, ограждение, узлы и пути
Иллюстрация топологических задач бенчмарка MindTopo: лабиринт, ограждение, узлы и пути
Imagen destacada del articulo fuente

12 августа 2026 года исследовательское подразделение Microsoft Research представило MindTopo — новый бенчмарк для оценки топологического мышления у мультимодальных больших языковых моделей. В работе участвовали исследователи Microsoft Research, Northwestern University и Stanford University. Тест построен не вокруг стандартных метрик вроде расстояния, углов или размеров, а вокруг структурных свойств: связности, вложенности, порядка и узлов, которые сохраняются при деформации объектов.

Ключевые факты

Что известно Детали
Дата публикации 12 августа 2026 года, блог Microsoft Research
Участники исследователи Microsoft Research, Northwestern University, Stanford University
Что проверяется топологические свойства: связность, вложенность, порядок, узлы
Формат 5 категорий задач, 2 когнитивных уровня: рассуждение и планирование
Главный результат статическое рассуждение заметно сильнее планирования; люди пока впереди

Что такое MindTopo

В основе бенчмарка лежит классификация топологических способностей, восходящая к работам Жана Пиаже и когнитивной литературе. Задачи MindTopo требуют понимать, что объекты остаются связанными, замкнутыми, упорядоченными или завязанными в узел даже тогда, когда их форма или положение меняются.

Это принципиально отличается от большинства визуальных тестов для мультимодальных моделей. Обычные датасеты проверяют евклидовы свойства: расстояние, направление, размер, взаимное расположение. MindTopo проверяет более глубокие отношения, которые важны для навигации, работы с физическими объектами и длинных цепочек действий.

Как устроен тест

MindTopo разбивает задачи на пять категорий. На уровне рассуждения модель получает одну или несколько отрисованных сцен и должна ответить, соединены ли две точки в лабиринте, находятся ли овцы внутри забора, является ли верёвка настоящим узлом. На уровне планирования модель взаимодействует с симулированной средой: вращает сегменты труб, рисует разделяющий путь, переставляет блоки, ловит движущегося агента или распутывает верёвки.

Важно, что среда запрещает физически некорректные действия. Модель не может «протянуть» одну верёвку сквозь другую, поэтому задачу нельзя решить обходным способом. Все сцены генерируются контролируемыми симуляторами с точной разметкой и настраиваемой сложностью. Это позволяет отделить две разные причины ошибки: визуальную сложность сцены и неспособность модели удержать отношение между объектами при движении.

Что показали эксперименты

По данным Microsoft, тестирование широкого набора проприетарных и открытых моделей показало устойчивый разрыв: статическое рассуждение о топологии даётся моделям заметно лучше, чем интерактивное планирование. При этом оба уровня пока сильно уступают человеческим результатам. Разрыв особенно заметен в задачах, где нужно сохранить нужное отношение на протяжении многих действий.

Характер ошибок тоже различается. На статичных заданиях модель обычно что-то не замечает: стену, проход, пересечение или ограждение. В планировании ошибки возникают уже после того, как сцена была понята. Модель выбирает локально правдоподобное действие, но не отслеживает его последствия, теряет цель через несколько ходов или нарушает динамику среды.

Дополнительно авторы проверили, помогают ли генеративные модели сохранять топологическое понимание. Генерация изображений иногда помогала, если нужное отношение видно в одном кадре, но отказывала на последовательностях пересечений и движений. Видео-роллауты часто меняли топологию или нарушали условия задачи. Визуальная симуляция оказывалась полезной только тогда, когда сохраняла структурные ограничения во времени.

Почему это важно для ИИ-агентов

Результаты MindTopo напрямую касаются разработчиков ИИ-агентов, робототехники, инструментов доступности и интерактивных ассистентов. Для таких систем недостаточно знать, где объект находится. Нужно понимать, что остаётся связанным, замкнутым, упорядоченным или завязанным в узел в процессе действий.

По мнению авторов, закрыть этот разрыв помогут