Morphometric Imitation переносит движения человеческой руки на роботов через симуляцию

Авторы Morphometric Imitation предложили трёхэтапный метод обучения роботизированных кистей по человеческим демонстрациям. В препринте заявлена успешность 89,3% в 300 реальных испытаниях без дообучения на физическом роботе.

Перенос взаимодействия человеческой руки с объектом на роботизированную кисть в системе Morphometric Imitation
Перенос взаимодействия человеческой руки с объектом на роботизированную кисть в системе Morphometric Imitation
2012 — studying in Howard-Tilton Library New Orleans.jpg | by Tulane Public Relations | wikimedia_commons | CC BY 2.0

Авторы препринта Morphometric Imitation представили систему, которая преобразует записанные взаимодействия человеческой руки с предметами в визуально-моторные политики для роботизированных кистей. Метод объединяет кинематическую оптимизацию, обучение с подкреплением в симуляции и последующую дистилляцию поведения в модель, управляющую роботом по визуальным данным.

В метаданных препринта на arXiv указана дата публикации 25 сентября 2026 года. Работа относится к исследованиям по обучению роботов на человеческих демонстрациях: вместо ручного программирования каждой операции система пытается извлечь движение и контакты из наблюдаемого взаимодействия человека с объектом.

Главный заявленный результат — успешность 89,3% в 300 испытаниях на 30 физических объектах. Авторы характеризуют эксперимент как zero-shot sim-to-real: политика была обучена в симуляции и затем перенесена на реальное оборудование без дополнительного обучения на физических испытаниях. Эти цифры пока следует рассматривать как результаты авторской оценки, поскольку речь идёт о препринте, а независимое воспроизведение в доступных материалах не представлено.

Почему движения человека нельзя просто скопировать

Даже качественно восстановленная траектория человеческой кисти не подходит роботу напрямую. У человеческой и роботизированной руки отличаются длина и количество пальцев, расположение суставов, диапазоны движения и доступные точки контакта. Попытка буквально повторить позу может привести к тому, что робот не коснётся объекта в нужном месте или сформирует неустойчивый захват.

Есть и вторая проблема: кинематически допустимая последовательность поз ещё не гарантирует выполнимого движения. В реальной системе действуют ограничения приводов, инерция, трение и столкновения. Поэтому движение, визуально похожее на человеческое, может оказаться слишком быстрым, нестабильным или физически недостижимым для конкретной кисти.

Третий разрыв возникает между симуляцией и физическим роботом. Политика, обученная в виртуальной среде, сталкивается в реальности с шумом камер, неточностями оценки положения объекта и отличиями контактной динамики. Morphometric Imitation разделяет эти проблемы на три последовательных этапа, а не пытается решить их одной моделью.

Три этапа Morphometric Imitation

На первом этапе применяется морфометрическая оптимизация, обозначенная авторами как MMO. Она переносит движение человеческой руки на другую морфологию, стараясь сохранить структуру продемонстрированных контактов. Критерием становится не только сходство поз: системе требуется учитывать, какие части руки касались объекта в исходной демонстрации.

Авторы сообщают, что MMO протестировали на трёх роботизированных кистях — Allegro Hand, LEAP Hand и Inspire Hand — и десяти взаимодействиях человека с объектами. По данным препринта, контактная метрика F1 для каждой кисти была как минимум на 8 процентных пунктов выше результата сильнейшего из пяти использованных методов сравнения. Из доступного резюме нельзя определить, насколько одинаковыми были условия настройки всех бейзлайнов; это требует проверки по полной PDF-версии работы.

На втором этапе к кинематической траектории добавляется residual RL — остаточное обучение с подкреплением. Алгоритм не создаёт движение с нуля, а корректирует исходный референс, используя сведения о положении объекта и контактах из человеческой демонстрации. Цель этого этапа — получить движение, которое робот способен выполнить с учётом динамики.

Авторы заявляют, что такой подход повышал успешность последующего динамического переноса на величину до 35 процентных пунктов. Формулировка «до» существенна: она указывает на максимальное улучшение в отдельных условиях, а не на единый прирост для всех кистей и задач. Проведённые авторами абляции также показывают, что данные о позе объекта и контактах дают взаимодополняющий эффект.

На третьем этапе полученные в симуляции демонстрации используются для обучения визуально-моторной политики. Именно эта модель должна получать визуальные наблюдения и выдавать управляющие команды без доступа к полной информации симулятора.

Что означает результат 89,3%

Согласно аннотации, обученные политики проверили в 300 реальных испытаниях с 30 объектами и получили совокупную успешность 89,3%. Это наиболее практическая часть работы: она показывает заявленный переход от восстановленного человеческого движения к управлению физической роботизированной кистью.

При этом zero-shot в данном контексте следует понимать прежде всего как перенос из симуляции на реального робота без дополнительного дообучения в физической среде. Эта формулировка сама по себе не означает, что каждый предмет был полностью неизвестен системе на всех стадиях подготовки данных. Чтобы оценить обобщение, необходимо отдельно проверить разделение объектов между обучением и тестированием, способы визуальной рандомизации и доступность моделей объектов в симуляции.

Показатель 89,3% также не раскрывает распределение результатов между десятью видами взаимодействий, тремя конструкциями кистей и отдельными объектами. Средняя успешность может скрывать заметную разницу между простыми захватами и задачами, требующими точной последовательности контактов. Для разработчиков важны результаты по каждой задаче, критерий засчитывания успешной попытки и продолжительность одного эпизода.

Чем метод интересен разработчикам робототехнического ИИ

Morphometric Imitation предлагает использовать человеческие взаимодействия как источник структурированных демонстраций, сохраняя информацию о контактах, а не только траектории суставов. Это потенциально уменьшает объём ручной подготовки движений для каждой новой роботизированной кисти.

Разделение на кинематический перенос, динамическое уточнение и обучение визуальной политики также позволяет диагностировать ошибки по стадиям. Если робот неверно располагает пальцы, проблема может находиться в морфометрической оптимизации. Если правильная поза не приводит к устойчивому действию — в динамическом переносе. Если поведение разрушается только на физическом оборудовании, проверять нужно визуальное восприятие и разрыв между симуляцией и реальностью.

Для команд, работающих с imitation learning, существенным является и выбор входных данных. Метод предполагает, что исходное взаимодействие руки с объектом уже реконструировано достаточно точно. Ошибки в геометрии, положении объекта или точках контакта могут перейти в последующие этапы. Аннотация не сообщает, насколько устойчив весь процесс к таким ошибкам и сколько ручной обработки требуется для одной демонстрации.

Что проверить перед практическим применением

На странице проекта Morphometric Imitation разработчикам стоит проверить доступность кода, конфигураций симулятора, обученных весов и исходных демонстраций. Наличие только видеопримеров было бы недостаточно для воспроизведения заявленных результатов на другой аппаратной платформе.

Отдельного внимания требуют вычислительная стоимость residual RL, число симуляционных эпизодов и время подготовки политики для нового типа кисти. В аннотации эти параметры не приведены, поэтому по опубликованной цифре успешности нельзя оценить стоимость внедрения.

Перед сравнением со своим пайплайном также стоит сверить четыре детали: как рассчитывается контактный F1, какие пять бейзлайнов использованы, что именно считается успешным физическим испытанием и тестировались ли политики при изменении освещения, положения камеры и свойств объектов. Пока эти условия не изучены по полной работе или не подтверждены независимым запуском, результат 89,3% нельзя автоматически переносить на другие роботы и производственные сценарии.

Источники