
Главный вывод: команда Hugging Face доказала, что видеокодеки — не просто способ хранения роликов для YouTube, а эффективный инженерный инструмент для робототехники. Их формат LeRobotDataset в среднем занимает 14% от объёма оригинальных PNG-датасетов, а в лучшем случае — 0,2%. При этом время декодирования одного кадра из видео сопоставимо с загрузкой PNG, а качество восстановленных изображений, по заявлению авторов, достаточно для полноценного обучения политик управления роботами.
Проблема, которую решает команда Remi Cadene и его коллег, стара как сама робототехника: данных для обучения моделей катастрофически не хватает. В отличие от NLP и компьютерного зрения, где интернет предоставил гигантские корпуса текстов и изображений, у роботов такого источника нет. Даже амбициозные проекты вроде Open X-Embodiment не дотягивают до масштабов LLM. Но, как выяснилось, проблема не только в количестве данных, но и в их формате.
До недавнего времени стандартом де-факто для хранения визуальной модальности (кадров с камер робота) был PNG. Каждый кадр — отдельный файл. Это надёжно, но чудовищно расточительно: соседние кадры в записи движения манипулятора почти идентичны, и PNG хранит эту избыточность безжалостно. Академические группы выпускали датасеты в HDF5, Zarr, Pickle или TAR — каждый раз изобретая велосипед. Видеоформаты отвергались из-за опасений по поводу скорости загрузки: считалось, что декодирование видео в реальном времени для обучения нейросетей будет на порядки медленнее, чем чтение PNG.
Hugging Face решил проверить это допущение на практике и построил бенчмарк. Результаты оказались неочевидными.
Два кита сжатия: пространство и время
Современные видеокодеки (H.264, H.265, AV1) используют два принципа. Первый — пространственное сжатие: внутри одного кадра кодировщик ищет однородные области (например, фон стола или стену) и описывает их компактно, как в JPEG. Второй — временное сжатие: вместо хранения каждого кадра целиком кодек вычисляет разницу между кадрами и сохраняет только изменения. Для этого в потоке размещаются опорные кадры (I-frames, или keyframes), от которых отсчитываются все последующие.
Именно второй механизм даёт основной выигрыш в робототехнических датасетах. Когда робот медленно перемещает схват, большая часть сцены остаётся неизменной. Временное сжатие превращает последовательность из сотен почти одинаковых PNG в компактный видеопоток с редкими опорными кадрами и небольшими дельтами между ними.
Авторы бенчмарка оценивали четыре критерия: коэффициент сжатия (размер видео к размеру исходных кадров), время загрузки одного кадра, качество восстановленного изображения (PSNR, SSIM, MSE) и совместимость с плеерами и браузерами. Последнее было принципиально важно: команда хотела, чтобы датасеты можно было не только скачивать, но и просматривать онлайн через Hugging Face Spaces без установки специального софта.
Бенчмарк: что показали тесты
В собственных тестах Hugging Face (опубликованы в блоге 27 августа 2024 года) сравнивались разные настройки кодирования. Ключевые результаты:
- Средний коэффициент сжатия: 14% от исходного размера. В лучшем случае (вероятно, для статичных сцен с медленным движением) — 0,2%. То есть датасет объёмом 20 ГБ превращается в 1 ГБ при сжатии 1:20, что является консервативной оценкой.
- Время декодирования одного кадра из видео оказалось сопоставимо с загрузкой PNG — в некоторых случаях даже быстрее, хотя авторы честно отмечают, что это сильно зависит от разрешения и используемого кодера.
- Качество: метрики PSNR и SSIM оставались на уровне, достаточном для обучения политик. Конкретные пороговые значения в блоге не приводятся, но утверждается, что degradation в performance политик не наблюдалось.
Важный технический нюанс: стандартные настройки кодеков, оптимизированные для медиапотребления (например, большой размер GOP — группы кадров между опорными кадрами), неоптимальны для машинного обучения. Слишком редкие I-frames означают, что для доступа к произвольному кадру придётся декодировать всю цепочку от последнего ключевого кадра, что убивает скорость произвольного доступа. Hugging Face пришлось подбирать параметры под свой сценарий использования.
Практические последствия: от хранения к распространению
Снижение размера датасетов в 7-14 раз (в среднем) — это не просто экономия места на дисках. Это означает, что исследовательские группы могут выкладывать на Hugging Face Hub датасеты, которые раньше были слишком велики для хостинга. Нативная интеграция с Hub позволяет скачивать и визуализировать данные прямо в браузере через Spaces — примеры с koch_tutorial и koch_bimanual_folding уже доступны для просмотра.
Для сообщества это снижает порог входа: чтобы воспроизвести эксперимент, больше не нужно скачивать 100 ГБ PNG. Достаточно 7-14 ГБ видео. При этом для обучения политики фреймворк LeRobot на лету декодирует нужные кадры, и, по заявлению авторов, накладные расходы на декодирование не становятся узким местом — GPU всё равно упирается в вычисления, а не в I/O.
Ограничения и подводные камни
Не всё так радужно. Во-первых, сжатие с потерями — это всегда компромисс. Хотя авторы утверждают, что качество достаточно для обучения, это верно только для текущего поколения моделей. Если в будущем политики станут более чувствительными к высокочастотным деталям (текстуры, мелкие объекты), артефакты кодирования могут стать проблемой. Бенчмарк не показывает, при каком уровне сжатия начинается деградация политики — это было бы полезно знать.
Во-вторых, скорость декодирования сильно зависит от аппаратного ускорения. На серверах без GPU или без поддержки аппаратного декодирования H.264/H.265 загрузка может стать медленнее PNG. Hugging Face тестировал на своём оборудовании, но в полевых условиях (например, на Raspberry Pi в лаборатории) результаты могут отличаться.
В-третьих, не все датасеты одинаково хорошо сжимаются. Сцены с быстрым движением, частой сменой ракурса или динамическим фоном дадут меньший выигрыш. Авторы не приводят разбивку по типам сцен, но логично предположить, что для датасетов с активным перемещением робота сжатие будет менее эффективным.
В-четвёртых, совместимость. Хотя H.264 поддерживается практически везде, более современные кодеки (H.265, AV1) могут не воспроизводиться в старых браузерах или плеерах. Hugging Face выбрал компромисс, но не уточняет, какой именно кодек используется по умолчанию.
Независимый взгляд: что говорят исследования
Отдельного внимания заслуживает контекст. Обзор arXiv от февраля 2024 года (A Review of Video-based Learning Approaches for Robot Manipulation) подтверждает, что проблема дефицита качественных данных — центральная для робототехники. Авторы обзора отмечают, что даже современные методы few-shot и multi-task learning требуют значительных объёмов данных для обобщения. Видеообучение рассматривается как перспективный путь, но именно проблема хранения и формата оставалась нерешённой.
NVIDIA, один из ключевых игроков в Physical AI, пошёл другим путём. Их платформа Cosmos3, анонсированная в 2026 году, использует Mixture-of-Transformers для генерации синтетических видеоданных — целый датасет PhysicalAI-WorldModel-Synthetic-Embodied-Robot-Scenes содержит 373 703 MP4-клипа, сгенерированных на основе Isaac Sim. Но это не отменяет проблемы хранения реальных записей: синтетические данные хороши для претренировки, но финальная донастройка всё равно требует реальных.
Почему это не сделали раньше
Основная причина — инерция. Академические группы десятилетиями использовали покадровые форматы, и переход на видео требовал переписывания пайплайнов загрузки данных. Кроме того, существовало негласное убеждение, что видео — это «грязно»: сжатие с потерями, зависимость от кодеков, сложность произвольного доступа. Hugging Face показал, что при правильной настройке эти проблемы решаемы.
Второй фактор — отсутствие удобных инструментов. LeRobot не просто предлагает новый формат, но и предоставляет API для его использования, интеграцию с PyTorch DataLoader и визуализацию. Без этого инженерного слоя идея осталась бы на уровне proof-of-concept.
Вердикт: когда ждать массового внедрения
Формат LeRobotDataset уже используется в нескольких датасетах на Hugging Face Hub. Для новых проектов это очевидный выбор: экономия места и трафика, удобство распространения, приемлемая скорость загрузки. Однако для архивных датасетов, выпущенных в PNG, конвертация может быть неоправданной — если они уже скачаны и используются.
Главный риск — зависимость от конкретных кодеков и их версий. Если через 5 лет H.264 перестанет быть стандартом де-факто (например, из-за патентных ограничений или перехода на нейросетевые кодеки), датасеты в этом формате потребуют перекодировки. Но та же проблема существует и для PNG — он тоже не вечен.
В конечном счёте, работа Hugging Face — это не технологический прорыв, а грамотная инженерная оптимизация. Они взяли давно известную технику (видеосжатие) и адаптировали её под специфику машинного обучения, измерив все компромиссы. Для индустрии это означает, что отговорка «у нас слишком большие датасеты» больше не работает. Теперь есть инструмент, который делает их маленькими — без потери качества обучения.