Авторы препринта arXiv сообщают, что на роботе Unitree G1 метод CoFiT снизил время нарушений ограничений безопасности на 83% в испытаниях с TWIST2. Во всех испытаниях с CoFiT вмешательство оператора не потребовалось; в базовых испытаниях оператору пришлось остановить робота в 50% случаев. Это результаты одного препринта, а не независимая оценка метода.
В описанной авторами схеме робот получает опорное задание — например, от планировщика, телеоператора или генератора движений, — а политика, обученная с подкреплением, отслеживает его. Фильтр безопасности может корректировать команды, если они грозят нарушить заданные ограничения. Авторы препринта arXiv:2610.02341 пишут, что при независимой работе политики и фильтра коррекции меняют выполняемые действия и распределение состояний, в которых оказывается робот.
CoFiT (Constrained Filter-aware Tuning) — предложенный авторами метод дообучения предварительно обученной политики с учётом фильтра безопасности. По данным препринта, в сценах с ограничениями время нарушений относительно обучения только с фильтром сократилось на 91% в TWIST2 и на 21% в SONIC; авторам также потребовались меньшие коррекции фильтра.
Для аппаратных испытаний авторы сообщают о снижении времени нарушений на 83% в TWIST2 на Unitree G1. В препринте также сказано, что все испытания CoFiT завершились без вмешательства оператора, тогда как в 50% базовых испытаний потребовалась остановка оператором. Работа размещена на arXiv как препринт и не представлена здесь как независимо проверенный результат.






