Запись архива

Google представила AgentHands — прототип жестикулирующего ИИ-агента для Android XR

Исследователи Google показали AgentHands — прототип, который добавляет ИИ-агентам синхронизированные жесты рук в среде дополненной реальности. Система, опубликованная на CHI 2026, использует LLM для генерации пространственно привязанных движений, которые помогают пользователю в физических задачах — от ухода за орхидеей

Агент Google AgentHands в Android XR: виртуальные руки указывают на воздушные корни орхидеи, синхронизируя жест с голосовыми инструкциями
Агент Google AgentHands в Android XR: виртуальные руки указывают на воздушные корни орхидеи, синхронизируя жест с голосовыми инструкциями
Imagen destacada del articulo fuente

Google Research представила AgentHands — исследовательский прототип для платформы Android XR, который наделяет голосовых ИИ-агентов синхронизированными жестами рук. В отличие от плоских UI-оверлеев, привычных по Project Astra или Gemini 3.1 Flash Live, новая система переводит абстрактные инструкции в пространственно точные движения, привязанные к реальным объектам в комнате пользователя. Работа опубликована на конференции CHI 2026.

Ключевые факты

Параметр Значение
Разработчик Google Research (Xun Qian, Ruofei Du)
Публикация CHI 2026
Платформа Android XR
Основная инновация LLM генерирует GestureEvents, синхронизированные с TTS по таймингу слов
Оценка Внутригрупповое исследование (N=12), сравнение с речевым агентом

Как устроен AgentHands

Исходная точка — формирующее исследование с экспертами по XR и человеко-машинному взаимодействию (HCI) в Google. Команда выделила шесть измерений «читаемости» виртуальной руки: handedness (какая рука), жест, пространственность, временная динамика, интерактивность и визуальные эффекты. На основе этой таксономии построена библиотека из трёх семантических категорий жестов — дейктические (указание), иконические (изображение формы или действия) и экспрессивные (социальные сигналы).

Рабочий процесс выглядит так. Пользователь в XR-гарнитуре «регистрирует» объекты взглядом — система строит 3D-ограничивающие рамки для каждого предмета (например, орхидеи или ноутбука). Когда пользователь задаёт вопрос, LLM генерирует текстовый ответ со встроенными GestureEvents. Каждое событие привязано к конкретным триггерным словам и кодирует параметры жеста по таксономии. Локальный парсер на гарнитуре синхронизирует анимацию рук с голосом на уровне отдельных слов.

Примеры сценариев

В демонстрации авторы показали три сценария. В сценарии ухода за орхидеей агент не просто говорит «проверьте корни» — он перемещает руку к основанию растения и обводит воздушные корни, объясняя их функцию. При настройке 3D-принтера агент показывает последовательность «поверни и нажми» на панели управления, делая интерфейс интуитивным. В режиме лайфстайл-компаньона агент использует предупреждающий жест — удерживает руку пользователя и накладывает визуальный эффект, чтобы остановить нежелательное поведение.

Результаты пользовательского исследования

Внутригрупповое исследование с 12 участниками сравнивало AgentHands с речевым агентом без жестов. Содержание речи в обеих группах было идентичным. Участники выполняли две задачи: уход за орхидеей и работа с 3D-принтером. По всем ключевым метрикам — понимание местоположения объекта, понимание действия и заметность предупреждений — AgentHands статистически значимо превзошёл речевой baseline.

Что это значит для разработчиков и пользователей

AgentHands — не коммерческий продукт, а исследовательский прототип. Однако он задаёт вектор для следующего поколения интерфейсов: от плоских подсказок на экране к пространственно осознанным агентам, которые не просто анализируют окружение, а физически взаимодействуют с ним. Для разработчиков это означает, что будущие SDK для Android XR могут включать API для генерации жестов, привязанных к LLM-выходу. Для пользователей — более естественный диалог с ассистентом, который показывает, а не только говорит.

Ограничения

Исследование проведено на малой выборке (12 человек) в контролируемых условиях. Все сценарии были заранее подготовлены исследователями, а не генерировались агентом в реальном времени. Авторы не раскрывают, какая именно LLM использовалась для генерации GestureEvents, и не приводят данных о задержках на реальном XR-устройстве. Прототип не оценивался в условиях шумной или динамически меняющейся среды.

Источник: Google Research Blog — AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR (https://research.google/blog/agenthands-generating-interactive-hand-gestures-for-spatially-grounded-agent-conversations-in-xr/)