Запись архива

π0 и NVIDIA GR00T: фундамент для роботов

Разбираем π0 от Physical Intelligence и NVIDIA GR00T по первоисточникам: архитектура VLA, рецепты обучения, результаты 2024–2025 и ограничения без рекламного шума.

Сравнительная схема π0 и NVIDIA GR00T: источники данных, VLM-ядро, action model, постобучение и развёртывание на роботах

В 2024–2025 годах две заметные линии в embodied AI оформились особенно чётко. Physical Intelligence показала π0 как generalist policy для манипуляции на разных роботах, а NVIDIA сначала представила Project GR00T как стек для гуманоидов, а затем вывела в публичное поле модель GR00T N1. Для практиков это важно не как новость, а как развилка: один путь делает ставку на модель и рецепт обучения, другой — на модель вместе с симуляцией, синтетическими данными и инфраструктурой.

Ниже — исторический разбор именно материалов периода 2024–2025 годов: анонса Project GR00T от 18 марта 2024 года, публикации π0 от 31 октября 2024 года и релиза GR00T N1 от 17–18 марта 2025 года. Более поздние π0.5, GR00T N1.5, N1.6 и N1.7 сознательно оставляем за рамками, чтобы не смешивать разные поколения систем.

Коротко

  • π0 и GR00T N1 принадлежат к одному семейству идей — vision-language-action моделей, — но решают задачу по-разному.
  • π0 — это прежде всего модель и recipe: VLM-основа, flow matching для непрерывных действий, cross-embodiment обучение и отдельная стадия постобучения под конкретный навык.
  • GR00T в материалах 2024–2025 — это не только модель, но и полный стек для гуманоидов: инициатива, synthetic-data blueprint, симуляция и затем открытая модель GR00T N1.
  • У GR00T N1 есть более прозрачная публичная количественная оценка на симуляционных и реальных бенчмарках; у π0 доказательства сильнее завязаны на реальные задачи авторов и figure-based comparisons, а не на единый открытый benchmark.
  • Прямой ответ на вопрос «кто лучше?» по источникам 2024–2025 дать нельзя: задачи, корпуса данных, embodiment и протоколы оценки у систем разные.

Контекст: почему вообще нужен фундамент для роботов

Обе работы стартуют с одной и той же проблемы. У языковых и vision-language моделей есть интернет-масштаб для предобучения, а у робототехники такого единого корпуса нет. Вместо него есть фрагментированные наборы траекторий, разная кинематика, разные камеры, разные action spaces и дорогой сбор реальных демонстраций.

Отсюда и общая цель: научить модель переносить знания между embodiment, задачами и сценами, а затем быстро дотачивать её под конкретного робота. В терминах источников это означает не просто imitation learning на одной установке, а попытку собрать robot foundation model.

Но на этом сходство почти заканчивается. π0 подаётся как generalist robot policy для dexterous manipulation на множестве платформ. GR00T с самого начала формулируется как ставка на гуманоидов и на полный цикл разработки: от сбора демонстраций и synthetic data до обучения, симуляции и последующего deployment.

Метод: чем отличаются π0 и NVIDIA GR00T

π0: модель-first подход

В paper по π0 авторы строят модель поверх PaliGemma и добавляют отдельный action expert, который генерирует непрерывные действия через flow matching. В paper точный размер системы указан как 3,3 млрд параметров, где базовый VLM — 3 млрд, а action expert — 300 млн; эту точную разбивку даёт сам paper, а launch post отдельно подтверждает использование 3-миллиардного VLM как основы. Важная практическая деталь: и paper, и launch post связывают этот дизайн с управлением на частоте до 50 Гц, то есть ставка здесь делается на достаточно тонкий непрерывный контроль, а не только на «семантическое понимание задачи».

По данным paper и репозитория openpi, публичные checkpoint’ы связаны с предобучением на 10k+ часов роботных данных. При этом в официальных материалах есть тонкость со счётом embodiment: launch post говорит о данных с 8 robots, а paper — о 7 robot configurations и 68 tasks. Это не обязательно противоречие: в paper часть платформ сгруппирована по схожей кинематике, но для редакционного разбора важно зафиксировать, что источники считают «роботов» и «конфигурации» по-разному.

Рецепт обучения у π0 двухстадийный. Сначала — широкое предобучение на своей dexterous смеси плюс open-source данные вроде OXE, DROID и Bridge. Затем — постобучение на более узком, но более качественном наборе данных под конкретный downstream task. В самом paper сказано, что простейшие задачи могли требовать около 5 часов task-specific данных, а самые сложные — 100+ часов; в более позднем посте про open-sourcing команда отдельно предупреждает, что перенос на чужой робот может и не сработать.

GR00T: stack-first подход

С NVIDIA GR00T важнее не спутать уровни абстракции. Project GR00T, анонсированный 18 марта 2024 года, — это инициатива и экосистема для гуманоидов. Конкретная публичная foundation model появляется позже: GR00T N1 выходит как paper от 17 марта 2025 года, а её availability в developer-канале NVIDIA объявляется 18 марта 2025 года.

Архитектурно GR00T N1 тоже относится к VLA-моделям, но оформлен иначе. Paper и technical blog описывают dual-system architecture: vision-language модуль для интерпретации сцены и инструкций плюс diffusion transformer для генерации непрерывных действий. В whitepaper точный размер публичного checkpoint’а указан как 2,2 млрд параметров с 1,34 млрд в VLM; поскольку эта точная разбивка явно дана в whitepaper, а в блоге модель фигурирует как N1 2B, надёжнее говорить, что публичная версия — это модель порядка 2 млрд параметров.

Главное отличие — data strategy. Если у π0 центр тяжести в собственном dexterous корпусе и cross-embodiment смеси, то GR00T N1 опирается на data pyramid: внизу human videos и web-scale priors, выше synthetic trajectories, наверху real robot demonstrations. Для этой схемы NVIDIA отдельно строит Isaac GR00T Blueprint: teleoperation, mimic-порождение траекторий, domain randomization и связка с Omniverse/Cosmos/Isaac Lab.

Ось сравнения π0 NVIDIA GR00T / GR00T N1
Что именно было представлено Конкретная generalist policy для манипуляции Сначала инициатива и стек, затем конкретная open foundation model N1
Первая ключевая дата в рассматриваемом скоупе 31 октября 2024 года 18 марта 2024 года для Project GR00T; 17–18 марта 2025 года для N1
Базовая архитектура VLM на базе PaliGemma + отдельный action expert с flow matching VLM + diffusion transformer в dual-system дизайне
Фокус embodiment Манипуляторы, бимануальные системы, mobile manipulators Явный акцент на гуманоидов, но с cross-embodiment переносом
Ключ к масштабированию Большая dexterous смесь и последующее task-specific post-training Data pyramid: human video, synthetic data и real robot trajectories
Публичность в 2025 году Код и веса через openpi, но с пометкой experimental Открытые веса, датасеты и скрипты вокруг N1 и Isaac GR00T workflows

Результаты: что показали источники

Для π0 публичная доказательная база в 2024–2025 выглядит сильной, но не идеально стандартизованной. В paper авторы пишут, что даже compute-parity версия модели обходит OpenVLA и Octo на их out-of-box задачах, а в задачах после fine-tuning π0 в целом превосходит OpenVLA, Octo, ACT и Diffusion Policy в собственных real-world настройках. Это важный сигнал для практиков, но не полноценный общий head-to-head benchmark: основной массив доказательств у π0 — реальные задачи авторов, figure-based comparisons и task-specific evaluation, а не единая открытая таблица на одном публичном наборе.

У GR00T N1 количественная картина прозрачнее. И paper, и technical blog публикуют одинаковые таблицы для симуляционных и реальных задач на GR-1.

Метрика Baseline GR00T N1 Что это означает
Simulation average across RoboCasa, DexMG, GR-1 (100 demos/task) BC Transformer: 26,4%; Diffusion Policy: 33,4% 45,0% N1 выигрывает у обоих baseline на среднем по трём симуляционным наборам
Real-world average on GR-1, 10% data Diffusion Policy: 10,2% 42,6% Авторы показывают сильный выигрыш в low-data режиме
Real-world average on GR-1, full data Diffusion Policy: 46,4% 76,8% N1 сохраняет преимущество и при полном наборе телеперационных данных
Synthetic + real data versus real-only Real-only baseline По данным NVIDIA, +40% к performance Синтетика у NVIDIA выступает не украшением, а частью training recipe

По синтетическим данным у NVIDIA тоже есть важная практическая деталь. В разных официальных материалах фигурируют две близкие формулировки: technical blog про N1 пишет о over 750K synthetic trajectories за 11 часов, а отдельный post про pipeline — о 780K trajectories за те же 11 часов. Оба источника сходятся в другом: это эквивалент 6,5K часов демонстраций и, по сообщению NVIDIA, в сочетании с real data дало 40% прироста относительно real-only обучения.

Интерпретация

Наш комментарий

Если убрать маркетинговую упаковку, π0 и GR00T показывают две разные гипотезы о том, где лежит основной bottleneck робототехники. У π0 bottleneck — в хорошей VLA-архитектуре и в правильно собранном pretrain/post-train recipe для dexterous manipulation. У GR00T bottleneck шире: без инфраструктуры для synthetic data, teleoperation и симуляции foundation model для гуманоидов будет слишком дорогой и медленной в развитии.

На практике это значит следующее. Если вы исследуете policy learning, перенос между robot embodiments и связь VLM с непрерывным управлением, линия π0 выглядит как более «модельный» референс. Если вы строите humanoid stack и вас интересуют data pipelines, post-training, evaluation и deployment как единый производственный цикл, линия GR00T полезнее как системный шаблон.

Именно поэтому прямое сравнение в духе «π0 победил GR00T» по источникам 2024–2025 некорректно. Это не две версии одной и той же системы на одном и том же benchmark, а две разные инженерные ставки на то, как вообще собирать foundation layer для роботов.

Ограничения и критика

  • Нет общего benchmark’а. У π0 и GR00T N1 разные embodiment, разные задачи и разные evaluation protocols. Любой жёсткий рейтинг между ними был бы уже нашей фантазией, а не выводом из источников.
  • У π0 мало единой табличной публичной оценки. Paper убедителен как исследовательский рассказ о recipe и real-world capabilities, но слабее как универсальная benchmark card для внешнего сравнения.
  • Официальные материалы π0 расходятся в подсчёте embodiment. Launch post говорит о 8 robots, а paper — о 7 configurations и 68 tasks. Это не критический дефект, но для аккуратного цитирования важно.
  • Сами авторы openpi предупреждают о риске переноса. Репозиторий прямо помечает релиз как experimental и говорит, что модель может не сработать на вашей платформе без серьёзной адаптации.
  • Сильные числа GR00T N1 завязаны на собственный стек NVIDIA. Это не обнуляет результат, но означает, что часть преимущества может приходить не только из архитектуры, а из целого пакета данных, симуляции и tooling.
  • Синтетические данные у GR00T пока больше подтверждены самой NVIDIA, чем независимыми репликациями. Даже в самом paper авторы отдельно признают, что генерация физически правдоподобных и достаточно разнообразных synthetic datasets остаётся открытой проблемой.
  • Ни одна из систем не доказывает «универсального домашнего робота». Источники показывают перенос, data efficiency и прогресс в dexterous manipulation, но не закрывают вопрос о надёжной автономии в полностью открытом мире.

Вывод

π0 и NVIDIA GR00T важны не потому, что уже решили робототехнику, а потому что зафиксировали два рабочих шаблона для robot foundation models. Первый шаблон — это сильная VLA-модель плюс аккуратный pretrain/post-train recipe; второй — foundation model как часть более широкого стека данных, симуляции и deployment. Для практиков главный урок один: в embodied AI архитектура больше неотделима от data pipeline и от того, как именно вы организуете перенос между роботами.

Источники

FAQ

Это прямые конкуренты?

Не совсем. π0 в рассматриваемом скоупе — это конкретная модельная линия, а GR00T — сначала инициатива и стек, а затем модель N1. Их можно сравнивать по подходу к VLA и данным, но не как два checkpoint’а на одном и том же benchmark.

Что из этого ближе к open-source практике?

Обе линии в 2025 году сделали шаг к открытости, но с разной философией. openpi прямо даёт код и веса и одновременно предупреждает, что перенос на чужой робот не гарантирован. NVIDIA делает ставку на открытые веса N1 и tooling вокруг Isaac/GR00T, но сильнее завязывает workflow на собственную экосистему.

Почему synthetic data здесь так важны?

Потому что реальная телеперация дорога, медленна и плохо масштабируется. В логике GR00T synthetic trajectories нужны, чтобы быстро нарастить coverage навыков и сцен; в логике всей области это способ частично обойти дефицит embodied data.

Какой практический вывод для ML-инженера?

Смотреть нужно не только на architecture diagram. Для роботов качество и состав предобучения, способ унифицировать state/action между embodiments и стоимость post-training часто важнее, чем формальный размер модели.

Читайте также