RT-2 — работа Google DeepMind, публично представленная 28 июля 2023 года, где vision-language model превращают в vision-language-action model: модель не только понимает картинку и текст, но и напрямую выдаёт действия робота. Open X-Embodiment и RT-X — следующий шаг той же линии, представленный осенью 2023 года: общий формат данных для роботических демонстраций и обучение RT-моделей на смеси данных от разных платформ.
Это важно по простой причине: RT-2 решал проблему семантики и переноса веб-знаний в управление, а Open X-Embodiment решал проблему фрагментации роботических данных по лабораториям и типам железа. Вместе эти работы показывают, что «один мозг для разных роботов» в робототехнике означает не магический универсальный агент, а общий способ представления действий, данных и обучения.
Коротко
- RT-2 обучает робота через тот же токеновый интерфейс, что и большие vision-language модели: действия кодируются как текстовые токены, а затем декодируются обратно в управляющие команды.
- В испытаниях более чем на 6000 роботических прогонов RT-2 сохранил качество на знакомых задачах и поднял успех на незнакомых сценариях до 62% против 32% у RT-1.
- Open X-Embodiment — это не одна модель, а инфраструктура: датасет и общий формат, объединяющие 22 роботических воплощения, 527 навыков, 160266 задач и более 1 млн реальных траекторий.
- На этой смеси данных модели RT-1-X и RT-2-X показали положительный перенос: RT-1-X дал в среднем 50% улучшения success rate относительно одно-доменных методов, а RT-2-X оказался в 3 раза сильнее RT-2 на оценке emergent skills.
- Фраза «один мозг» здесь уместна только с оговорками: речь идёт о переносе в пределах сходных манипуляционных задач и нормализованного action space, а не о готовом универсальном роботе.
Контекст
До RT-2 и Open X-Embodiment в роботическом обучении было две разные проблемы.
Первая — семантическая. Робот можно научить брать кружку или открывать ящик, но переносить абстрактные знания из интернета в физическое действие намного труднее. Обычные policy-модели были хороши в повторении показанных движений, но слабы в задачах вида «положи объект на цифру 3», «возьми самый маленький предмет» или «подними предмет, который вот-вот упадёт».
Вторая — датасетная. Почти каждая лаборатория собирала данные под свой манипулятор, свою камеру, свой control stack и свои задачи. Из-за этого роботические модели часто были не просто task-specific, а буквально lab-specific: меняется робот, окружение или способ задания действия — обучение приходится начинать почти заново.
RT-2 атакует первую проблему. Open X-Embodiment и RT-X — вторую. Поэтому разбирать их по отдельности полезно, но по-настоящему смысл появляется, когда смотреть на них как на связанный стек.
Метод
Что именно делает RT-2
Ключевая идея RT-2 удивительно проста: вместо того чтобы строить отдельный выходной интерфейс для low-level control, авторы представляют действия робота как ещё один тип токенов. Модель получает изображение с камеры и текстовую инструкцию, а на выходе выдаёт токенизированную строку действия. На этапе исполнения эти токены преобразуются обратно в управляющие команды робота.
Это позволяет взять уже предобученную vision-language model и не ломать её интерфейс. В RT-2 авторы совместно дообучают backbone на двух типах данных: роботических траекториях и интернет-масштабных vision-language задачах вроде visual question answering. Именно этот режим авторы называют co-fine-tuning: модель не просто доучивается на роботах, а сохраняет часть старого веб-знания во время дообучения.
В источниках описаны две основные инстанциации RT-2: на базе PaLM-E-12B и PaLI-X-55B. Для практиков здесь важен не бренд backbones, а инженерный урок: если action space удаётся втиснуть в тот же токеновый интерфейс, что и язык, мультимодальный foundation model можно превратить в policy без сложного модульного конвейера между «пониманием» и «действием».
Что именно добавляет Open X-Embodiment
Open X-Embodiment решает другую задачу: как вообще собрать данные так, чтобы одна и та же архитектура могла учиться на опыте разных лабораторий и роботов. Авторы вводят общий формат данных и общий взгляд на действия, чтобы смешивать демонстрации от разных embodiments в одном обучающем наборе.
На этой основе обучаются RT-1-X и RT-2-X. Суффикс -X здесь важнее, чем может показаться. Он означает не новую архитектуру с нуля, а обучение знакомых RT-моделей на X-embodiment смеси: то есть на данных не одного робота и не одной лаборатории, а общего корпуса.
Если говорить совсем коротко, связка выглядит так:
- RT-2 показывает, что большой vision-language backbone можно напрямую превратить в robot policy.
- Open X-Embodiment показывает, что robot policy можно учить на общем корпусе разных robots, если сначала стандартизовать данные и action representation.
- RT-2-X объединяет обе идеи: foundation-style VLA плюс cross-embodiment robot data.
Результаты
Ниже — результаты, которые лучше всего передают суть линии RT-2 → Open X-Embodiment → RT-X.
| Компонент | Что проверяли | Что сообщают источники | Источник |
|---|---|---|---|
| RT-2 | Перенос на незнакомые сценарии и emergent skills | Более 6000 роботических прогонов; на unseen scenarios успех вырос до 62% против 32% у RT-1; на emergent skill evaluations RT-2 дал более чем 3-кратное улучшение относительно предыдущих baselines. | RT-2 paper; RT-2 project page; DeepMind blog; Google blog |
| Open X-Embodiment | Масштаб и разнообразие корпуса | 22 роботических воплощения, 527 навыков, 160266 задач и более 1 млн реальных траекторий, собранных в общем формате. | Open X-Embodiment paper; Project page; DeepMind blog |
| RT-1-X | Помогает ли cross-embodiment обучение на обычных манипуляционных задачах | В партнёрских академических лабораториях RT-1-X показал в среднем 50% improvement по success rate относительно методов, обученных только на своих одно-доменных данных. | Project page; DeepMind blog |
| RT-2-X | Даёт ли опыт других robots новые навыки даже для VLA-модели | На оценке emergent skills RT-2-X оказался в 3 раза успешнее RT-2; на проектной странице и в блоге это связывают с положительным переносом из данных других платформ. | Project page; DeepMind blog |
Практически это означает следующее. RT-2 сам по себе уже улучшает семаническое обобщение: робот лучше справляется с новыми объектами, фонами и средами. Но когда тот же класс моделей учат на смеси данных от разных embodiments, появляется ещё один источник переноса — не только от интернета к роботу, но и от робота к роботу.
Особенно показателен контраст между RT-2 и RT-2-X. Первая модель переносит веб-знания в физические действия. Вторая добавляет к этому перенос моторного и визуально-сценового опыта между платформами. Именно из-за этого тема Open X-Embodiment важна не меньше, чем сам RT-2: без общей смеси данных идея VLA остаётся сильной, но слишком привязанной к исходному robot dataset.
Интерпретация
Наш комментарий
На наш взгляд, RT-2 и Open X-Embodiment закрывают два разных «бутылочных горлышка» в foundation robotics.
- RT-2 закрывает проблему интерфейса между большим мультимодальным пониманием и низкоуровневым управлением. Он показывает, что action prediction можно встроить в токеновую логику большой модели, а не выносить в отдельный стек.
- Open X-Embodiment закрывает проблему масштаба роботических данных. Даже лучшая архитектура мало даст, если весь опыт собран на одном манипуляторе в одной лаборатории.
- RT-X — это точка, где обе идеи складываются: общая модель получает и веб-семантику, и cross-embodiment роботический опыт.
Для практиков отсюда следуют три урока.
- Если вы строите VLA-систему, важен не только backbone, но и унифицированный action representation. Без него данные разных роботов плохо смешиваются.
- Если вы хотите обобщение, нельзя дообучать модель только на узком robot-only корпусе и надеяться на чудо. В RT-2 решающую роль играет то, что веб-знание не выбрасывается, а сохраняется через co-fine-tuning.
- Если вы хотите перенос между роботами, главный актив — не новый трюк в архитектуре, а общий формат данных и общий evaluation protocol.
Именно поэтому исторически важна не только сама модель RT-2, но и инфраструктурная работа Open X-Embodiment. Без второй первая осталась бы впечатляющей демонстрацией. Вместе они становятся рецептом для целого класса современных VLA-подходов.
Ограничения
Здесь особенно важно не переобещать.
- RT-2 не доказывает, что робот научился новым физическим примитивам. В самой работе авторы отдельно оговаривают, что физические навыки модели по-прежнему ограничены распределением навыков, присутствующих в robot data. Усиливается прежде всего семаническое и композиционное обобщение: когда, куда и какой уже известный навык применить.
- «Один мозг» не означает произвольную совместимость с любым железом. Перенос достигается потому, что данные приводят к общему формату, а задачи лежат в близком классе манипуляций. Это не то же самое, что один checkpoint для любого робота, любой сенсорики и любой кинематики без адаптации.
- Open X-Embodiment — это смесь неравномерных источников. Даже из проектной страницы видно, что разные embodiments представлены по-разному. Значит, часть улучшений может зависеть не только от разнообразия, но и от того, какие платформы и сцены доминируют в смеси.
- Оценки остаются довольно узкими. RT-2 в основном проверяют на tabletop manipulation и связанных с этим emergent instructions. RT-1-X и RT-2-X тоже оцениваются на конкретных лабораторных задачах. Это сильнее, чем чистая симуляция, но всё ещё далеко от открытого бытового мира.
- Вопросы безопасности, долгого горизонта и автономного сбора данных здесь только намечены. Поздние материалы DeepMind про AutoRT, SARA-RT и RT-Trajectory показывают, что сама лаборатория рассматривала RT-2 и Open X-Embodiment как фундамент, а не как завершённое решение.
Вывод
RT-2 важен не потому, что «наконец сделал универсального робота», а потому, что показал рабочий интерфейс между foundation-style мультимодальными моделями и robot control. Open X-Embodiment и RT-X важны не потому, что собрали просто большой датасет, а потому, что сделали перенос между разными robot embodiments инженерно правдоподобным.
Если свести всё к одной формуле, она будет такой: веб-знания дают роботу семантику, а cross-embodiment данные дают ему более широкий поведенческий опыт. Именно на пересечении этих двух идей и вырос современный класс vision-language-action систем.
Источники
- Anthony Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv, 2023.
- RT-2: Vision-Language-Action Models. Official project page.
- Yevgen Chebotar, Tianhe Yu. RT-2: New model translates vision and language into action. Google DeepMind Blog, 2023.
- Vincent Vanhoucke. Speaking robot: Our new AI model translates vision and language into robotic actions. The Keyword / Google Blog, 2023.
- Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv, 2023.
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models. Official project page.
- Quan Vuong, Pannag Sanketi. Scaling up learning across many different robot types. Google DeepMind Blog, 2023.
- The Google DeepMind Robotics Team. Shaping the future of advanced robotics. Google DeepMind Blog, 2024.
FAQ
RT-2 и Open X-Embodiment — это одна и та же работа?
Нет. RT-2 — это VLA-модель и способ представить robot actions как токены. Open X-Embodiment — это общий датасет и формат данных для обучения на опыте разных robots. RT-X — это модели RT-1-X и RT-2-X, обученные на этой смеси.
Правильно ли говорить, что теперь один checkpoint может управлять любым роботом?
Нет, это слишком сильная формулировка. Источники показывают перенос между разными манипуляционными платформами при общей нормализации действий и данных, но не доказывают универсальность для произвольного железа без адаптации.
Почему эти работы до сих пор важны для практиков?
Потому что они задали базовый рецепт современных VLA-систем: большой мультимодальный backbone, токенизированное представление действий, heterogeneous robot data и отдельные оценки на seen, unseen и emergent сценариях.
