CoFiT: авторы сообщают о снижении времени нарушений ограничений робота на 83%

Авторы препринта arXiv сообщают, что CoFiT снизил время нарушений ограничений на 83% в испытаниях TWIST2 на Unitree G1. Все испытания с методом прошли без вмешательства оператора; в 50% базовых испытаний потребовалась остановка.

CoFiT: авторы сообщают о снижении времени нарушений ограничений робота на 83%. Тематическая карточка Comrad404.

Авторы препринта arXiv сообщают, что на роботе Unitree G1 метод CoFiT снизил время нарушений ограничений безопасности на 83% в испытаниях с TWIST2. Во всех испытаниях с CoFiT вмешательство оператора не потребовалось; в базовых испытаниях оператору пришлось остановить робота в 50% случаев. Это результаты одного препринта, а не независимая оценка метода.

В описанной авторами схеме робот получает опорное задание — например, от планировщика, телеоператора или генератора движений, — а политика, обученная с подкреплением, отслеживает его. Фильтр безопасности может корректировать команды, если они грозят нарушить заданные ограничения. Авторы препринта arXiv:2610.02341 пишут, что при независимой работе политики и фильтра коррекции меняют выполняемые действия и распределение состояний, в которых оказывается робот.

CoFiT (Constrained Filter-aware Tuning) — предложенный авторами метод дообучения предварительно обученной политики с учётом фильтра безопасности. По данным препринта, в сценах с ограничениями время нарушений относительно обучения только с фильтром сократилось на 91% в TWIST2 и на 21% в SONIC; авторам также потребовались меньшие коррекции фильтра.

Для аппаратных испытаний авторы сообщают о снижении времени нарушений на 83% в TWIST2 на Unitree G1. В препринте также сказано, что все испытания CoFiT завершились без вмешательства оператора, тогда как в 50% базовых испытаний потребовалась остановка оператором. Работа размещена на arXiv как препринт и не представлена здесь как независимо проверенный результат.