
Исследователи представили CLUE (Closed-Loop contextual Uncertainty rEsolution) — фреймворк для роботов, которым приходится выполнять неполные или неоднозначные инструкции на естественном языке. Работа опубликована на arXiv под номером 2609.30428.
Главная идея CLUE — не заставлять робота заранее угадывать единственно правильный смысл задания. Вместо этого система формирует несколько гипотез, проверяет их через действия в окружающей среде и перестраивает план по мере получения новых данных. Такой подход рассчитан на сценарии, где у робота нет полной карты местности и заранее описанного набора объектов.
Почему обычного языкового планирования недостаточно
Большинство языко-ориентированных политик для роботов предполагает, что цель уже сформулирована достаточно точно, а необходимые сведения доступны в начальном контексте или на предварительной карте. В лабораторном сценарии это упрощает задачу, но в реальной среде инструкция может оставлять несколько вопросов без ответа.
Например, команда найти «место, где можно оставить предмет», не сообщает, какой именно объект подходит, какие признаки делают его функционально пригодным и где искать нужный вариант. Роботу нужно одновременно понять, что считать успехом, какие признаки имеют отношение к задаче и существует ли нужная информация в текущем окружении.
В статье такую ситуацию описывают как контекстную неопределённость. Она отличается от простой ошибки распознавания: проблема не только в том, чтобы правильно увидеть объект, но и в том, чтобы определить, какие наблюдения вообще следует считать важными для выполнения инструкции.
Как устроен замкнутый цикл CLUE
CLUE использует языковую модель для выдвижения гипотез о релевантных понятиях и возможных планах действий. Затем эти гипотезы связываются с физическим окружением через языково-ориентированную карту, которая строится онлайн во время работы робота.
Система не ограничивается однократным запросом к карте. Она последовательно оценивает разные варианты, выбирает действия, способные принести новую информацию, и обновляет план после взаимодействия со средой. Поэтому движение робота становится не только способом приблизиться к цели, но и инструментом проверки предположений.
Важная деталь — карта используется как часть замкнутого цикла, а не как статичный справочник. Робот может обнаружить новый объект, уточнить его свойства, изменить трактовку инструкции и продолжить поиск уже с другой рабочей гипотезой. В представленной архитектуре языковая модель отвечает за выдвижение и пересмотр вариантов, а карта помогает связать эти варианты с наблюдаемыми объектами и действиями.
Испытания на Spot и заявленные результаты
Авторы протестировали CLUE на роботе Boston Dynamics Spot в трёх реальных средах — внутри помещений и на открытом воздухе. В экспериментальную серию вошли 15 задач. Они требовали от системы не только находить объекты, но и разрешать неоднозначность, делать выводы о возможном назначении предметов и учитывать ситуации, когда часть объекта скрыта или закрыта другим объектом.
В качестве одного из ориентиров использовалась оракульная политика с полной информацией о задаче и контексте. По данным авторов, CLUE показала результат в пределах 7 процентных пунктов от этого ориентира. Формулировка не означает, что фреймворк достиг фиксированной доли успешных запусков во всех задачах: в доступном описании приведено именно расстояние до оракульной политики, а не полный набор значений по каждому сценарию.
По сравнению с языковым планировщиком, который не получает обратной связи от среды в процессе выполнения, CLUE продемонстрировала преимущество примерно в четыре раза. Это сравнение подчёркивает не столько преимущество одной языковой модели над другой, сколько значение повторной проверки плана после фактического взаимодействия с окружением.
Дополнительные эксперименты дали ещё один результат. Подход, при котором сначала строится языково обогащённая карта, а затем выполняется её запрос, оказался недостаточным для сложных контекстных задач. По данным статьи, такие варианты достигали примерно трети показателя CLUE и при этом требовали более чем в десять раз больше токенов визуально-языковой модели.
Что это меняет для разработчиков роботов
Для разработчиков систем, управляемых естественным языком, CLUE предлагает другой способ распределить вычисления. Вместо попытки заранее описать все возможные объекты, функции и исключения система может активнее собирать сведения именно там, где они нужны для выбора следующего действия.
Это особенно релевантно для трёх классов задач:
- поиска объекта, название или признаки которого допускают несколько трактовок;
- определения функции предмета по его расположению, внешнему виду и окружению;
- работы с частично скрытыми объектами, когда первого наблюдения недостаточно для принятия решения.
Результаты также указывают на практическую разницу между пассивным накоплением данных и активным разрешением неопределённости. Простое добавление описаний в карту не гарантирует, что робот поймёт, какие сведения важны для конкретной инструкции. CLUE пытается связать сбор информации с текущими гипотезами и планом, что может уменьшить лишние запросы к визуально-языковой модели.
При этом переносить заявленные показатели напрямую на промышленные или бытовые роботы пока нельзя. Эксперимент охватывает 15 задач в трёх средах, а доступное описание не раскрывает распределение результатов по сценариям, стоимость отдельных действий и время выполнения. Неясно также, насколько устойчивой будет система при существенном изменении освещения, расположения объектов или формулировок команд.
Что остаётся проверить
CLUE показывает перспективный принцип: робот может не ждать полной спецификации задачи, а уточнять её смысл через управляемое взаимодействие с миром. Но это не устраняет исходную неопределённость автоматически. Гипотеза языковой модели может быть неверной, карта — неполной, а выбранное действие — слишком дорогим или небезопасным для проверки.
Поэтому при оценке подобных систем стоит отдельно смотреть не только на итоговую успешность, но и на число попыток, расход токенов, время до решения и последствия ошибочного уточнения. Важно также сравнивать CLUE не только с оракулом, но и с более простыми базовыми методами на одинаковых задачах.
На момент публикации работа остаётся исследовательским препринтом. Полезный следующий шаг для читателей и команд, оценивающих технологию, — проверить полный текст статьи и материалы проекта: какие именно задачи входили в эксперимент, как считалась успешность и какие данные получает система на каждой итерации. Именно эти детали определят, применим ли подход за пределами демонстрационных сред.










