
Команда LeRobot из Hugging Face совместно со стартапом Yaak анонсировали Learning to Drive (L2D) — открытый мультимодальный датасет для обучения систем автономного вождения, который, по заявлению авторов, является крупнейшим в своём классе. Общий объём данных превышает 1 петабайт, а ключевое отличие L2D от предшественников — включение как эталонных траекторий, выполненных инструкторами автошкол, так и субоптимальных манёвров учеников, что приближает условия обучения к реальному вождению.
Исходный анонс опубликован в официальном блоге Hugging Face 11 марта 2025 года. Разработчики подчёркивают, что проект следует логике развития открытых языковых моделей, которые получили ускорение благодаря крупным корпусам текстов, и намерены применить тот же подход к робототехнике и автомобильному ИИ.
Что изменилось
Сбор данных: 60 электромобилей, 30 городов, три года
L2D собирался с 2022 по 2025 год с использованием идентичных сенсорных комплектов, установленных на 60 электромобилях KIA E-niro, которые эксплуатировались автошколами в 30 городах Германии. Каждый автомобиль оснащён шестью RGB-камерами, обеспечивающими круговой обзор на 360 градусов, GPS-приёмником, инерциальным измерительным модулем (IMU) и интерфейсом для считывания данных с CAN-шины — скорости, положения педалей газа и тормоза, угла поворота руля, сигналов поворота и включённой передачи.
Все модальности синхронизированы по временным меткам Unix с привязкой к передней левой камере. Частота дискретизации после интерполяции — 10 Гц. В набор данных включены эпизоды с разнообразными условиями окружающей среды, сбоями сенсоров, дорожными работами и неработающими светофорами, что, по замыслу авторов, должно помочь моделям обобщать на редкие, но критически важные сценарии.
Кого это касается
Два типа политик: эксперты и ученики
Главная особенность L2D — разделение записанных траекторий на две группы: экспертные политики (выполненные инструкторами автошкол) и ученические политики (выполненные обучающимися водителями). Экспертные траектории считаются эталонными — в них отсутствуют ошибки вождения. Ученические, напротив, содержат известные субоптимальности, такие как резкие движения рулём, неточное удержание полосы или неправильная оценка дистанции.
Оба типа политик сопровождаются текстовыми инструкциями на естественном языке, описывающими задачу. Например: «Когда у вас есть преимущество, проезжайте перекрёсток с круговым движением и выезжайте на третьем съезде, осторожно пересекая пешеходный переход». В будущих версиях датасета (R3+) разработчики планируют добавлять текстовые объяснения причин субоптимальности для ученических эпизодов.
Что проверить
Все сценарии соответствуют официальному каталогу заданий на получение водительских прав в Германии (EU-версия): обгоны, круговые движения, переезды через железнодорожные пути и другие обязательные манёвры.
Поиск по датасету с помощью LLM
Для навигации по петабайтному массиву данных команда Yaak разработала поисковую систему на основе LLM. Сырые GPS-треки сопоставляются с дорожной сетью OpenStreetMap через Open Source Routing Machine (OSRM), после чего полученные маршруты обогащаются тегами OSM — типами дорог, ограничениями, манёврами. LLM на основе этой информации генерирует текстовое описание каждого эпизода.
Пользователь может искать эпизоды по произвольным текстовым запросам, например: «светлое время суток, подъехать к светофору и затем выполнить левый поворот через несколько полос». Система возвращает соответствующие эпизоды с временными метками. Разработчики сравнивают этот подход с контролем версий: сообществу предлагается искать и находить новые эпизоды, ставить их в очередь на проверку и встраивать в будущие релизы (R5+).
Место L2D среди открытых датасетов
По заявлению авторов, L2D превосходит все существующие открытые датасеты для автономного вождения по совокупному объёму данных, количеству часов вождения и числу эпизодов. Сравнительная таблица в блоге Hugging Face показывает, что предшественники — nuScenes, Waymo Open Dataset, Argoverse 2 и другие — уступают L2D по объёму на порядок, особенно если исключить лидарные и радарные модальности.
L2D распространяется в формате LeRobot v3.0, что означает совместимость с одноимённой библиотекой для обучения роботов, поддерживающей state-of-the-art алгоритмы поведенческого клонирования, reinforcement learning и flow matching. Это позволяет использовать датасет не только для исследований в области автономного вождения, но и как бенчмарк для общих методов робототехнического обучения.
Практическое значение для разработчиков
Для инженеров, работающих с end-to-end моделями вождения, L2D закрывает давний пробел: до сих пор крупные мультимодальные датасеты были либо проприетарными, либо ограниченными по охвату и объёму. Наличие размеченных субоптимальных траекторий открывает возможность для обучения моделей, которые не только копируют экспертные действия, но и учатся исправлять ошибки — аналогично тому, как в NLP модели учатся на парах «правильный-неправильный» текст.
Кроме того, возможность поиска эпизодов по текстовому описанию снижает порог входа для исследователей, не имеющих доступа к дорогостоящим симуляторам или собственным автопаркам. Достаточно сформулировать запрос на естественном языке, чтобы получить подборку релевантных сценариев для обучения или тестирования.
Ограничения и неопределённости
На момент публикации датасет доступен в версии R2+, которая включает базовый набор эпизодов. Версия с разметкой причин субоптимальности для ученических политик (R3+) и возможность краудсорсинга новых эпизодов (R5+) анонсированы, но точные сроки их выхода не указаны.
Также стоит учитывать, что все данные собраны в Германии по стандартам EU, что накладывает ограничения на географическую обобщаемость обученных моделей. Разметка с помощью LLM и OSM, хотя и автоматизирована, может содержать ошибки в сложных сценариях — разработчики не приводят метрик точности этой разметки.
Наконец, датасет распространяется под лицензией, которая не указана в блоге явно; для коммерческого использования потребуется уточнять условия у Yaak и Hugging Face.
Что дальше
Сообщество LeRobot уже интегрировало L2D в свой конвейер обучения. Разработчики могут загрузить датасет через Hugging Face Datasets и запустить тренировку модели на стандартных скриптах LeRobot. Для желающих проверить качество данных на собственном бенчмарке доступен инструмент визуализации Nutron, поддерживающий синхронизированный просмотр всех шести камер, GPS-трека и текстовой инструкции.
Yaak и Hugging Face приглашают сообщество к поиску новых эпизодов в сырых данных — процесс, напоминающий ревью кода в открытых проектах. Если этот подход сработает, L2D может стать не просто датасетом, а живым репозиторием сценариев вождения, который будет расти за счёт вклада участников.
