В 2024–2025 годах две заметные линии в embodied AI оформились особенно чётко. Physical Intelligence показала π0 как generalist policy для манипуляции на разных роботах, а NVIDIA сначала представила Project GR00T как стек для гуманоидов, а затем вывела в публичное поле модель GR00T N1. Для практиков это важно не как новость, а как развилка: один путь делает ставку на модель и рецепт обучения, другой — на модель вместе с симуляцией, синтетическими данными и инфраструктурой.
Ниже — исторический разбор именно материалов периода 2024–2025 годов: анонса Project GR00T от 18 марта 2024 года, публикации π0 от 31 октября 2024 года и релиза GR00T N1 от 17–18 марта 2025 года. Более поздние π0.5, GR00T N1.5, N1.6 и N1.7 сознательно оставляем за рамками, чтобы не смешивать разные поколения систем.
Коротко
- π0 и GR00T N1 принадлежат к одному семейству идей — vision-language-action моделей, — но решают задачу по-разному.
- π0 — это прежде всего модель и recipe: VLM-основа, flow matching для непрерывных действий, cross-embodiment обучение и отдельная стадия постобучения под конкретный навык.
- GR00T в материалах 2024–2025 — это не только модель, но и полный стек для гуманоидов: инициатива, synthetic-data blueprint, симуляция и затем открытая модель GR00T N1.
- У GR00T N1 есть более прозрачная публичная количественная оценка на симуляционных и реальных бенчмарках; у π0 доказательства сильнее завязаны на реальные задачи авторов и figure-based comparisons, а не на единый открытый benchmark.
- Прямой ответ на вопрос «кто лучше?» по источникам 2024–2025 дать нельзя: задачи, корпуса данных, embodiment и протоколы оценки у систем разные.
Контекст: почему вообще нужен фундамент для роботов
Обе работы стартуют с одной и той же проблемы. У языковых и vision-language моделей есть интернет-масштаб для предобучения, а у робототехники такого единого корпуса нет. Вместо него есть фрагментированные наборы траекторий, разная кинематика, разные камеры, разные action spaces и дорогой сбор реальных демонстраций.
Отсюда и общая цель: научить модель переносить знания между embodiment, задачами и сценами, а затем быстро дотачивать её под конкретного робота. В терминах источников это означает не просто imitation learning на одной установке, а попытку собрать robot foundation model.
Но на этом сходство почти заканчивается. π0 подаётся как generalist robot policy для dexterous manipulation на множестве платформ. GR00T с самого начала формулируется как ставка на гуманоидов и на полный цикл разработки: от сбора демонстраций и synthetic data до обучения, симуляции и последующего deployment.
Метод: чем отличаются π0 и NVIDIA GR00T
π0: модель-first подход
В paper по π0 авторы строят модель поверх PaliGemma и добавляют отдельный action expert, который генерирует непрерывные действия через flow matching. В paper точный размер системы указан как 3,3 млрд параметров, где базовый VLM — 3 млрд, а action expert — 300 млн; эту точную разбивку даёт сам paper, а launch post отдельно подтверждает использование 3-миллиардного VLM как основы. Важная практическая деталь: и paper, и launch post связывают этот дизайн с управлением на частоте до 50 Гц, то есть ставка здесь делается на достаточно тонкий непрерывный контроль, а не только на «семантическое понимание задачи».
По данным paper и репозитория openpi, публичные checkpoint’ы связаны с предобучением на 10k+ часов роботных данных. При этом в официальных материалах есть тонкость со счётом embodiment: launch post говорит о данных с 8 robots, а paper — о 7 robot configurations и 68 tasks. Это не обязательно противоречие: в paper часть платформ сгруппирована по схожей кинематике, но для редакционного разбора важно зафиксировать, что источники считают «роботов» и «конфигурации» по-разному.
Рецепт обучения у π0 двухстадийный. Сначала — широкое предобучение на своей dexterous смеси плюс open-source данные вроде OXE, DROID и Bridge. Затем — постобучение на более узком, но более качественном наборе данных под конкретный downstream task. В самом paper сказано, что простейшие задачи могли требовать около 5 часов task-specific данных, а самые сложные — 100+ часов; в более позднем посте про open-sourcing команда отдельно предупреждает, что перенос на чужой робот может и не сработать.
GR00T: stack-first подход
С NVIDIA GR00T важнее не спутать уровни абстракции. Project GR00T, анонсированный 18 марта 2024 года, — это инициатива и экосистема для гуманоидов. Конкретная публичная foundation model появляется позже: GR00T N1 выходит как paper от 17 марта 2025 года, а её availability в developer-канале NVIDIA объявляется 18 марта 2025 года.
Архитектурно GR00T N1 тоже относится к VLA-моделям, но оформлен иначе. Paper и technical blog описывают dual-system architecture: vision-language модуль для интерпретации сцены и инструкций плюс diffusion transformer для генерации непрерывных действий. В whitepaper точный размер публичного checkpoint’а указан как 2,2 млрд параметров с 1,34 млрд в VLM; поскольку эта точная разбивка явно дана в whitepaper, а в блоге модель фигурирует как N1 2B, надёжнее говорить, что публичная версия — это модель порядка 2 млрд параметров.
Главное отличие — data strategy. Если у π0 центр тяжести в собственном dexterous корпусе и cross-embodiment смеси, то GR00T N1 опирается на data pyramid: внизу human videos и web-scale priors, выше synthetic trajectories, наверху real robot demonstrations. Для этой схемы NVIDIA отдельно строит Isaac GR00T Blueprint: teleoperation, mimic-порождение траекторий, domain randomization и связка с Omniverse/Cosmos/Isaac Lab.
| Ось сравнения | π0 | NVIDIA GR00T / GR00T N1 |
|---|---|---|
| Что именно было представлено | Конкретная generalist policy для манипуляции | Сначала инициатива и стек, затем конкретная open foundation model N1 |
| Первая ключевая дата в рассматриваемом скоупе | 31 октября 2024 года | 18 марта 2024 года для Project GR00T; 17–18 марта 2025 года для N1 |
| Базовая архитектура | VLM на базе PaliGemma + отдельный action expert с flow matching | VLM + diffusion transformer в dual-system дизайне |
| Фокус embodiment | Манипуляторы, бимануальные системы, mobile manipulators | Явный акцент на гуманоидов, но с cross-embodiment переносом |
| Ключ к масштабированию | Большая dexterous смесь и последующее task-specific post-training | Data pyramid: human video, synthetic data и real robot trajectories |
| Публичность в 2025 году | Код и веса через openpi, но с пометкой experimental | Открытые веса, датасеты и скрипты вокруг N1 и Isaac GR00T workflows |
Результаты: что показали источники
Для π0 публичная доказательная база в 2024–2025 выглядит сильной, но не идеально стандартизованной. В paper авторы пишут, что даже compute-parity версия модели обходит OpenVLA и Octo на их out-of-box задачах, а в задачах после fine-tuning π0 в целом превосходит OpenVLA, Octo, ACT и Diffusion Policy в собственных real-world настройках. Это важный сигнал для практиков, но не полноценный общий head-to-head benchmark: основной массив доказательств у π0 — реальные задачи авторов, figure-based comparisons и task-specific evaluation, а не единая открытая таблица на одном публичном наборе.
У GR00T N1 количественная картина прозрачнее. И paper, и technical blog публикуют одинаковые таблицы для симуляционных и реальных задач на GR-1.
| Метрика | Baseline | GR00T N1 | Что это означает |
|---|---|---|---|
| Simulation average across RoboCasa, DexMG, GR-1 (100 demos/task) | BC Transformer: 26,4%; Diffusion Policy: 33,4% | 45,0% | N1 выигрывает у обоих baseline на среднем по трём симуляционным наборам |
| Real-world average on GR-1, 10% data | Diffusion Policy: 10,2% | 42,6% | Авторы показывают сильный выигрыш в low-data режиме |
| Real-world average on GR-1, full data | Diffusion Policy: 46,4% | 76,8% | N1 сохраняет преимущество и при полном наборе телеперационных данных |
| Synthetic + real data versus real-only | Real-only baseline | По данным NVIDIA, +40% к performance | Синтетика у NVIDIA выступает не украшением, а частью training recipe |
По синтетическим данным у NVIDIA тоже есть важная практическая деталь. В разных официальных материалах фигурируют две близкие формулировки: technical blog про N1 пишет о over 750K synthetic trajectories за 11 часов, а отдельный post про pipeline — о 780K trajectories за те же 11 часов. Оба источника сходятся в другом: это эквивалент 6,5K часов демонстраций и, по сообщению NVIDIA, в сочетании с real data дало 40% прироста относительно real-only обучения.
Интерпретация
Наш комментарий
Если убрать маркетинговую упаковку, π0 и GR00T показывают две разные гипотезы о том, где лежит основной bottleneck робототехники. У π0 bottleneck — в хорошей VLA-архитектуре и в правильно собранном pretrain/post-train recipe для dexterous manipulation. У GR00T bottleneck шире: без инфраструктуры для synthetic data, teleoperation и симуляции foundation model для гуманоидов будет слишком дорогой и медленной в развитии.
На практике это значит следующее. Если вы исследуете policy learning, перенос между robot embodiments и связь VLM с непрерывным управлением, линия π0 выглядит как более «модельный» референс. Если вы строите humanoid stack и вас интересуют data pipelines, post-training, evaluation и deployment как единый производственный цикл, линия GR00T полезнее как системный шаблон.
Именно поэтому прямое сравнение в духе «π0 победил GR00T» по источникам 2024–2025 некорректно. Это не две версии одной и той же системы на одном и том же benchmark, а две разные инженерные ставки на то, как вообще собирать foundation layer для роботов.
Ограничения и критика
- Нет общего benchmark’а. У π0 и GR00T N1 разные embodiment, разные задачи и разные evaluation protocols. Любой жёсткий рейтинг между ними был бы уже нашей фантазией, а не выводом из источников.
- У π0 мало единой табличной публичной оценки. Paper убедителен как исследовательский рассказ о recipe и real-world capabilities, но слабее как универсальная benchmark card для внешнего сравнения.
- Официальные материалы π0 расходятся в подсчёте embodiment. Launch post говорит о 8 robots, а paper — о 7 configurations и 68 tasks. Это не критический дефект, но для аккуратного цитирования важно.
- Сами авторы openpi предупреждают о риске переноса. Репозиторий прямо помечает релиз как experimental и говорит, что модель может не сработать на вашей платформе без серьёзной адаптации.
- Сильные числа GR00T N1 завязаны на собственный стек NVIDIA. Это не обнуляет результат, но означает, что часть преимущества может приходить не только из архитектуры, а из целого пакета данных, симуляции и tooling.
- Синтетические данные у GR00T пока больше подтверждены самой NVIDIA, чем независимыми репликациями. Даже в самом paper авторы отдельно признают, что генерация физически правдоподобных и достаточно разнообразных synthetic datasets остаётся открытой проблемой.
- Ни одна из систем не доказывает «универсального домашнего робота». Источники показывают перенос, data efficiency и прогресс в dexterous manipulation, но не закрывают вопрос о надёжной автономии в полностью открытом мире.
Вывод
π0 и NVIDIA GR00T важны не потому, что уже решили робототехнику, а потому что зафиксировали два рабочих шаблона для robot foundation models. Первый шаблон — это сильная VLA-модель плюс аккуратный pretrain/post-train recipe; второй — foundation model как часть более широкого стека данных, симуляции и deployment. Для практиков главный урок один: в embodied AI архитектура больше неотделима от data pipeline и от того, как именно вы организуете перенос между роботами.
Источники
- π0: A Vision-Language-Action Flow Model for General Robot Control
- π0: Our First Generalist Policy
- Open Sourcing π0
- Physical-Intelligence/openpi
- NVIDIA Announces Project GR00T Foundation Model for Humanoid Robots and Major Isaac Robotics Platform Update
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Accelerate Generalist Humanoid Robot Development with NVIDIA Isaac GR00T N1
- Building a Synthetic Motion Generation Pipeline for Humanoid Robot Learning
- NVIDIA Announces Isaac GR00T Blueprint to Accelerate Humanoid Robotics Development
FAQ
Это прямые конкуренты?
Не совсем. π0 в рассматриваемом скоупе — это конкретная модельная линия, а GR00T — сначала инициатива и стек, а затем модель N1. Их можно сравнивать по подходу к VLA и данным, но не как два checkpoint’а на одном и том же benchmark.
Что из этого ближе к open-source практике?
Обе линии в 2025 году сделали шаг к открытости, но с разной философией. openpi прямо даёт код и веса и одновременно предупреждает, что перенос на чужой робот не гарантирован. NVIDIA делает ставку на открытые веса N1 и tooling вокруг Isaac/GR00T, но сильнее завязывает workflow на собственную экосистему.
Почему synthetic data здесь так важны?
Потому что реальная телеперация дорога, медленна и плохо масштабируется. В логике GR00T synthetic trajectories нужны, чтобы быстро нарастить coverage навыков и сцен; в логике всей области это способ частично обойти дефицит embodied data.
Какой практический вывод для ML-инженера?
Смотреть нужно не только на architecture diagram. Для роботов качество и состав предобучения, способ унифицировать state/action между embodiments и стоимость post-training часто важнее, чем формальный размер модели.
