Запись архива

Mobile ALOHA: бытовые задачи на недорогом железе

Разбираем Mobile ALOHA — работу Stanford о мобильном двуруком роботе с бюджетом $32k: как он собирает демонстрации, зачем смешивает их со статическим ALOHA и что реально показали эксперименты.

Схема Mobile ALOHA: двурукий робот на базе AgileX Tracer, оператор с поясным креплением для whole-body teleoperation и этап co-training со статическими данными ALOHA

Mobile ALOHA — работа Stanford авторов Zipeng Fu, Tony Z. Zhao и Chelsea Finn о мобильной версии ALOHA: двурукий робот на колёсной базе учится бытовым задачам через имитацию по человеческим демонстрациям. По карточке arXiv, препринт появился 4 января 2024 года; позже работа вошла в CoRL 2024, а публикация доступна в материалах PMLR 270.

Важно не путать эту работу с «универсальной робот-домработницей». В первоисточнике ставка гораздо уже и практичнее: можно ли на открытом железе с бюджетом менее $32k собрать данные для whole-body manipulation и затем поднять качество за счёт co-training со статическими датасетами ALOHA.

Коротко

  • Mobile ALOHA — это не новая «мозговая» модель, а инженерный стек: мобильная база, двурукая телеприсутствующая запись демонстраций и прямое imitation learning.
  • Ключевой ход работы — смешивать мобильные демонстрации с уже существующими статическими данными ALOHA, зануляя для них действия базы и обучая общую политику.
  • Авторы показывают, что такой co-training может резко улучшать whole-task success на части задач; абстракт работы и проектная страница формулируют эффект как «up to 90%».
  • Работа важна прежде всего как рецепт сбора данных и переноса уже имеющихся манипуляционных датасетов в мобильную робототехнику, а не как доказательство «почти решённого» домашнего робота.

Контекст: от ALOHA 2023 к Mobile ALOHA

Предыстория здесь критична. В работе Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware 2023 года команда показала ALOHA — недорогую открытую систему для точной двурукой телеманипуляции и алгоритм ACT (Action Chunking with Transformers). Но тот сетап был, по сути, настольным: руки работали в фиксированной сцене, а мобильности не было.

Mobile ALOHA расширяет именно этот разрыв. Авторы исходят из того, что полезные бытовые действия почти всегда требуют не только кистевой точности, но и координации всего тела робота: подъехать, отступить, удержать дверь, поднять тяжёлый предмет двумя руками, подвинуться к крану или к кнопке лифта. Иначе говоря, проблема не сводится к «сделать руку аккуратнее» — нужно научить систему совместно двигать базу и обе руки.

Отсюда и главный вопрос статьи: можно ли сохранить философию ALOHA — открытость, сравнительно низкую стоимость и обучение по демонстрациям — но вынести её из настольной сцены в кухню, коридор и лифт.

Метод: как устроен Mobile ALOHA

Железо

По конструкции Mobile ALOHA — это ALOHA, установленная на мобильную базу AgileX Tracer. В статье авторы описывают whole-body teleoperation так: оператор физически пристёгнут к базе поясным креплением и одновременно управляет руками через leader-манипуляторы, а движение базы возникает за счёт прямого «проталкивания» колёс. Это грубое, но практичное решение: обе руки остаются заняты управлением манипуляторами, а база всё равно движется вместе с оператором.

Авторы отдельно подчёркивают, что система остаётся автономной по питанию и вычислениям, а общий бюджет — менее $32k с onboard power and compute. Это важная часть вклада: работа пытается показать не просто «можно ли», а «можно ли на доступном для лаборатории железе».

Обучение

На уровне обучения рецепт на удивление простой. Авторы не вводят языковой planner, не строят сложную иерархию навыков и не делают ставку на reinforcement learning. Вместо этого они записывают демонстрации whole-body teleoperation, а затем обучают политику прямым supervised behavior cloning.

Ключевой трюк — co-training со статическими данными ALOHA. Мобильные эпизоды для конкретной задачи смешиваются с уже собранными ALOHA-демонстрациями из статичной двурукой манипуляции. Для статических примеров действия базы просто зануляются, чтобы формат действий совпадал. На практике это означает, что модель переиспользует уже выученные «моторные привычки» — подвод руки к объекту, захват, визуальную подстройку, координацию двух рук — и достраивает поверх них мобильную компоненту.

Ещё один важный момент: авторы не привязывают рецепт к одной архитектуре. В статье он проверяется с ACT, Diffusion Policy и VINN, хотя лучший и самый полный набор результатов показан именно для ACT.

Результаты

Сначала важное уточнение по источнику. В аннотации препринта и на проектной странице сказано, что система работает с 50 демонстрациями на задачу. Но в Table 1 CoRL-версии статьи для Cook Shrimp и High Five указано по 20 демонстраций, а для остальных задач — по 50. Ниже мы следуем именно таблице экспериментов статьи.

Числа в таблице ниже — авторская отчётность из Table 1 статьи. Второй независимой публикации с той же детализацией мы не нашли, поэтому трактовать их лучше как результаты первоисточника, а не как внешне воспроизведённый бенчмарк. По тексту статьи большинство success rate посчитаны по 20 реальным прогонам, исключение — Cook Shrimp, где было 5 прогонов.

Задача Демонстрации ACT + co-training, успех всей задачи ACT без co-training
Wipe Wine 50 95% 50%
Cook Shrimp 20 40% 20%
Rinse Pan 50 80% 0%
Use Cabinet 50 85% 85%
Call Elevator 50 95% 0%
Push Chairs 50 80% 0%
High Five 20 85% 85%

Если смотреть не только на итог whole-task success, а на подзадачи, сильнее всего co-training помогает там, где мобильность вносит ошибки в точную манипуляцию: нажатие кнопки лифта, включение крана, обобщение на новые стулья в Push Chairs. Именно отсюда и берётся формулировка «up to 90%»: в статье она относится к максимальному приросту успеха на отдельных задачах и подзадачах, а не к средней прибавке по всему набору.

На двух задачах авторы также сравнили разные алгоритмы обучения. По Table 2 статьи, на Wipe Wine whole-task success с co-training составил 95% для ACT, 65% для Diffusion Policy и 15% для VINN + Chunking; на Push Chairs — 100%, 100% и 60% соответственно. Это тоже одноисточниковые числа из самой работы, но они полезны как практический сигнал: выигрыш в Mobile ALOHA даёт не только архитектура, а именно связка «данные + co-training + action chunking».

Отдельно интересен и data-efficiency результат. В arXiv/CoRL-версии статьи авторы пишут, что на задаче Wipe Wine политика с co-training и 35 мобильными демонстрациями обгоняет политику без co-training, обученную на 50 демонстрациях: 70% против 50%.

Интерпретация

Наш комментарий

На наш взгляд, главный вклад Mobile ALOHA не в зрелищных роликах с креветкой и не в отдельных процентах таблицы. Он в том, что работа аккуратно связывает три обычно разорванных слоя embodied AI: доступное железо, удобный сбор whole-body демонстраций и переиспользование уже существующих манипуляционных данных.

Для практиков здесь особенно важен второй пункт. Авторы не доказывают, что домашний робот уже «почти готов»; они показывают более приземлённую вещь: даже если у вас нет огромного мобильного датасета, статические двурукие демонстрации всё ещё полезны как источник моторных и визуальных приоритетов. Это хороший инженерный сигнал для команд, которые уже имеют tabletop-данные и думают, можно ли перенести их в мобильную платформу без полной перезаписи пайплайна.

Ещё одно сильное место работы — отказ от лишней сложности. В статье нет большой языковой модели как центра всей системы, нет сложного world model и нет громоздкой навигационной надстройки. В этом смысле Mobile ALOHA полезна как контрпример к идее, что embodied AI обязательно начинается с самой крупной модели. Иногда узкое, но хорошо организованное поведенческое клонирование на правильных демонстрациях даёт более честный прогресс.

Ограничения и критика

  • Это single-task imitation learning, а не универсальный агент. Авторы прямо пишут, что ограничивают результаты режимом обучения отдельных задач. Робот не умеет сам исследовать среду, улучшать себя или приобретать новые знания без новых демонстраций.

  • Демо по одной задаче всё ещё нужны. Даже при co-training политика учится под конкретный навык, а не получает общую бытовую компетентность из текста, видео или большого интернета.

  • Часть оценок хрупка статистически. По статье, почти все success rate считают на 20 прогонах, но Cook Shrimp — только на 5. Для сложной контактной задачи это малый объём, так что число 40% стоит читать осторожно.

  • Геометрия робота всё ещё ограничивает быт. В разделе limitations авторы сами указывают footprint 90 × 135 см и фиксированную высоту follower-рук; из-за этого нижние шкафы, духовки и посудомоечные машины трудны для доступа.

  • Демонстрации собирали эксперты. В статье сказано, что мобильные демонстрации дают два опытных оператора. Работа не отвечает на вопрос, насколько тот же рецепт устойчив к шумным, неоднородным или частично неудачным человеческим траекториям.

  • База вносит заметную ошибку, и это не исчезает магически. В приложении авторы пишут, что open-loop replay одной и той же траектории даёт нулевой whole-task success, а в отдельном тесте ошибка конечной точки после повторов смещалась примерно на 10 см и растягивалась примерно на 20 см. Политика умеет это частично компенсировать в замкнутом контуре, но именно здесь видно, насколько мобильная манипуляция чувствительна к неточностям платформы.

Вывод

Если убрать зрелищные демо, Mobile ALOHA остаётся очень полезной работой про инфраструктуру embodied AI. Она показывает, что мобильную двурукую манипуляцию можно строить не только вокруг дорогого железа, но и вокруг грамотного сбора демонстраций и переноса уже имеющихся статических данных.

Для разработчика главный вывод простой: прежде чем тянуть в систему ещё одну «умную» модель, стоит проверить, не ограничивает ли вас способ телеприсутствия, формат действий и качество смешивания датасетов. Mobile ALOHA убедительно показывает, что именно здесь может лежать значительная часть выигрыша.

Источники

FAQ

Это уже универсальный домашний робот?

Нет. По статье Mobile ALOHA — это набор task-specific политик, обучаемых по 20–50 демонстрациям на конкретную задачу, а не общий агент, который сам планирует весь быт.

Что здесь нового по сравнению с ALOHA 2023?

Главное отличие — мобильная база и whole-body teleoperation, где база и обе руки пишутся как единое действие. Плюс авторы показывают, что статические ALOHA-данные можно использовать для co-training мобильных задач.

Почему co-training со статическими данными вообще помогает?

По логике статьи, потому что многие элементы поведения общие: подвод к объекту, захват, визуальная коррекция, координация двух рук. Мобильной политике не нужно заново выучивать всё с нуля.

Насколько «недорогой» была система?

Авторы несколько раз фиксируют бюджет как менее $32k с onboard power and compute. Для исследовательской мобильной манипуляции это действительно сравнительно низкий порог, но всё ещё лабораторный прототип, а не массовое потребительское устройство.

Читайте также