
Исследователи представили Smol-VL-BLV — компактную визуально-языковую модель, адаптированную для помощи незрячим и слабовидящим пользователям. По утверждению авторов, модель способна включать в описание сцены направления, приблизительные расстояния и потенциальные препятствия, оставаясь достаточно небольшой для локального запуска на Android-смартфоне.
Работа опубликована 26 сентября 2026 года в виде препринта на arXiv. Это означает, что заявленные результаты пока следует рассматривать как данные самих разработчиков: независимой проверки и рецензирования в научном журнале у исследования нет.
Основной инженерный результат — сочетание модели на 500 млн параметров со специализированным постобучением. После квантования Smol-VL-BLV занимает около 450 МБ, работает без подключения к сети и, как сообщают авторы, запускается на Android-устройстве среднего класса. Точное время генерации в аннотации не раскрыто: задержка зависит от аппаратной конфигурации телефона.
Малую VLM обучили говорить о положении объектов и рисках
Обычное описание изображения может перечислить людей, предметы и общую обстановку, но этого недостаточно для навигационной помощи. Пользователю важны формулировки вроде «ступенька впереди», «дверь справа» или «препятствие примерно в двух метрах». Авторы Smol-VL-BLV исходят из того, что компактные VLM часто упускают именно такие детали.
Для адаптации модели использовали два механизма. На первом этапе применялась дистилляция: более крупная модель-учитель создавала развёрнутые описания, на которых обучалась компактная модель-ученик. Авторы ориентировались на требования к аудиодескрипции, но подробности состава данных и контроля качества нужно оценивать по полному тексту работы, а не только по аннотации.
Второй этап основан на Group Relative Policy Optimization, или GRPO. Это метод постобучения с наградой, которая в данном случае учитывала три свойства ответа:
- наличие понятных указаний направления;
- оценку расстояния до объектов;
- обнаружение потенциально опасных элементов сцены.
Таким образом, модель оптимизировали не просто для подробных подписей к изображениям, а для описаний, полезных в контексте нарушений зрения. Из опубликованного резюме, однако, нельзя установить, насколько точно модель оценивает расстояния в физическом мире и использовались ли для этого данные камеры о глубине.
После GRPO потребовалось восстановить общее качество описаний
Многоступенчатая настройка специализированной модели создаёт риск катастрофического забывания: улучшая узкий навык, система может потерять часть общих возможностей. Например, она начинает чаще упоминать направления и препятствия, но хуже распознаёт текст или описывает сложные сцены.
Авторы Smol-VL-BLV сообщают, что столкнулись с этой проблемой после этапа GRPO. Поэтому в процесс добавили короткую финальную донастройку, предназначенную для восстановления общего качества описаний при сохранении пространственной привязки.
Согласно препринту, лучшая версия показала следующие относительные изменения по сравнению с исходной моделью:
| Метрика | Заявленный относительный прирост |
|---|---|
| Spatial score | 19,3% |
| Social score | 14,8% |
| OCR-Bench | 101,5% |
| TextVQA accuracy | 44,2% |
Эти проценты нельзя читать как абсолютную точность. Прирост OCR-Bench на 101,5% означает увеличение результата относительно выбранной базовой версии, а не достижение точности выше 100%. В доступной аннотации также не приведены исходные и итоговые баллы, поэтому по ней невозможно оценить фактический разрыв или сравнить модель с крупными коммерческими VLM.
Рост результатов OCR-Bench и TextVQA показывает, что постобучение, по данным авторов, не свелось к добавлению пространственных шаблонов. Модель также стала лучше справляться с изображённым текстом и визуальными вопросами. Для пользователей с нарушениями зрения это потенциально полезно при чтении указателей, упаковок, меню и надписей, хотя отдельные сценарии требуют проверки на реальных устройствах и изображениях.
Около 450 МБ и работа без облачного сервера
Для мобильного развёртывания исследователи применили смешанную точность вычислений. После квантования размер модели составил приблизительно 450 МБ. По заявлению команды, она целиком выполняется на Android-смартфоне среднего класса, не отправляя изображения на удалённый сервер.
Локальная обработка даёт два практических преимущества. Приложение может работать при нестабильном соединении, а фотографии окружения не обязательно передавать облачному провайдеру. При этом сам по себе локальный запуск не гарантирует конфиденциальность: она также зависит от разрешений приложения, журналирования, аналитики и способа хранения изображений.
Разработчики не приводят в аннотации универсальное значение задержки. Формулировка ограничивается тем, что скорость зависит от возможностей устройства. Поэтому цифру около 450 МБ нельзя автоматически считать подтверждением комфортной работы на любом телефоне. Производительность будут определять процессор, объём оперативной памяти, доступный ускоритель, нагрев и реализация среды выполнения.
Для разработчиков это важное ограничение при оценке проекта. До интеграции стоит проверить не только размер файла, но и время первого запуска, скорость генерации, пиковое потребление памяти, энергозатраты и устойчивость модели при длительной работе с камерой.
Бенчмарки пока не доказывают безопасность навигации
Smol-VL-BLV позиционируется как модель для незрячих и слабовидящих пользователей, однако результаты на VQA, OCR и специализированных оценках нельзя напрямую приравнивать к безопасной навигации. Ошибка при чтении подписи и ошибка при определении ступеньки или движущегося объекта имеют разную цену.
В аннотации нет сведений о полевом исследовании с участием целевой аудитории, количестве протестированных Android-устройств или частоте опасных пропусков. Также не указано, как система ведёт себя в темноте, при размытии кадра, сложном освещении, плотном движении и частичном перекрытии объектов.
До появления таких данных модель разумнее рассматривать как исследовательский прототип визуального ассистента, а не как замену трости, собаке-проводнику или специализированным навигационным средствам. Пространственно уверенная формулировка модели сама по себе не подтверждает точность оценки.
Отдельного внимания требует метрическое расстояние. Разработчикам следует проверить, действительно ли ответы меняются согласованно при изменении дистанции до объекта, или модель воспроизводит правдоподобные числовые формулировки на основе визуальных признаков. Для такого теста нужны сцены с заранее измеренными расстояниями и разные камеры.
Код и данные открыты, но заявления ещё предстоит воспроизвести
Авторы сообщили о публикации модели, набора данных и кода на официальной странице Smol-VL-BLV. Перед коммерческим или исследовательским использованием необходимо отдельно проверить фактически доступные файлы, условия лицензий для модели и данных, формат мобильной сборки и инструкции по воспроизведению результатов.
Страница проекта, карточка arXiv и PDF относятся к одной исследовательской работе, поэтому это не три независимых подтверждения результатов. Сторонних сравнительных испытаний в предоставленных материалах нет.
Наиболее показательной проверкой станет запуск опубликованной сборки на нескольких Android-смартфонах с замером задержки и памяти, а также тестирование заранее размеченных сцен с препятствиями, направлениями, расстояниями и текстом. До такой проверки подтверждёнными можно считать публикацию препринта и заявленные характеристики прототипа, но не его надёжность как навигационного средства.



