
Команда Hugging Face представила NeoMME — семейство мультимодальных энкодеров, которое отказывается от привычной архитектуры с отдельным vision tower и каузальной языковой моделью. Вместо этого единый двунаправленный Transformer (bidirectional encoder) обрабатывает как текстовые токены, так и сырые патчи изображений, а обучение ведётся с нуля на задаче masked discrete-diffusion. Модели выпущены в двух размерах — 260M и 800M параметров — и доступны под лицензией Apache 2.0.
Архитектура: без vision tower и каузального декодера
NeoMME (произносится «ни-о-ми») принципиально отличается от большинства современных визуально-языковых моделей (VLM), которые используют предобученный vision encoder, проектор для отображения визуальных признаков в пространство языковой модели и каузальный декодер для генерации. Как отмечают авторы, такой подход избыточен для задач, не требующих авторегрессивной генерации текста, — поиска, классификации и разметки токенов.
В NeoMME изображения и текст проходят через один и тот же вычислительный контур. Это упрощает предобучение, дообучение, параллелизацию и инференс. При этом модель не основана на какой-либо предобученной vision tower, текстовом энкодере или декодере.
Предобучение: masked discrete-diffusion и смешанные данные
Обучение велось с нуля на задаче восстановления замаскированных текстовых токенов. Для текстовых примеров уровень маскирования выбирался равномерно от 0 до 1, для мультимодальных — от 0.3 до 1. Патчи изображений при этом всегда оставались видимыми. Такой подход, по замыслу авторов, вынуждает модель при высоком уровне маскирования опираться на визуальный контекст, а не на окружающий текст.
Предобучение смешивало многоязычный текст, код, математику, естественные изображения и документы. Каждая модель обработала около 524 млрд упакованных входных токенов, включая 290 млрд токенов из текстовых примеров. Для повышения эффективности обучения при относительно небольшом текстовом бюджете (против 2 трлн токенов у ModernBERT) использовался оптимизатор NorMuon.
Поиск документов: NeoMME-Retriever и ViDoRe v3
Для оценки качества энкодера в прикладной задаче команда дообучила NeoMME на поиск документов по методологии page-image, введённой ColPali. Модель ранжирует скриншоты страниц, обходя этапы OCR и извлечения текста из PDF, что позволяет сохранять разметку, таблицы, шрифты и другие визуальные подсказки.
NeoMME-Retriever добавляет к основе NeoMME две головы: одна выдаёт плотные эмбеддинги (dense), другая — эмбеддинги с поздним взаимодействием (late-interaction). Оба представления возвращаются за один прямой проход.
Ключевые факты
| Параметр | NeoMME-Retriever-260M | NeoMME-Retriever-800M |
|---|---|---|
| nDCG@10 на ViDoRe v3 | 523 | 556 |
| Параметры | 260M | 800M |
| Сравнение | В 0.002 от ColQwen2.5 при 14× меньшем числе параметров | В 0.009 от Vultron Retriever Flash (0.8B) |
| Пропускная способность | ~51 страница/с на L40S (2048×2048) | — |
| Лицензия | Apache 2.0 | Apache 2.0 |
NeoMME-Retriever-260M лежит на Парето-границе ViDoRe v3 по nDCG@10 и размеру модели, обходя ColModernVBERT и вдвое более крупный ColSmol-500M. NeoMME-Retriever-800M превосходит ColPali v1.3 при в 3.6 раза меньшем числе параметров.
Сжатие индекса: 255× при сохранении 95% точности
Late-interaction эмбеддинги по своей природе объёмны: для страницы 2048×2048 пикселей NeoMME-Retriever генерирует около 4200 векторов, что в float32 составляет примерно 2.1 МБ. Для снижения хранилища команда применила два метода:
— иерархическую пулинговую агрегацию токенов (hierarchical token pooling);
— асимметричное квантование (asymmetric quantization).
В комбинации с pooling factor 10 и int8 для запросов и документов размер индекса снизился с 1.5 МБ до 6 кБ на страницу — сжатие в 255 раз. При этом точность (nDCG@10) сохранилась на уровне более 95% от базовой.
Практическое значение
NeoMME предлагает альтернативный путь для построения мультимодальных энкодеров, не привязанный к доминирующей VLM-архитектуре. Для разработчиков, занимающихся поиском по документам, RAG-системами или задачами классификации, модель может стать более эффективным решением с точки зрения как параметров, так и памяти. Возможность получать и dense, и late-interaction эмбеддинги за один проход упрощает гибридные пайплайны: быстрый ANN-поиск по плотным векторам с последующим реранкингом через позднее взаимодействие.
Доступность и лицензия
Все чекпоинты NeoMME (260M и 800M) опубликованы под лицензией Apache 2.0 и доступны через Hugging Face Transformers. Это позволяет использовать модель в коммерческих проектах без дополнительных ограничений.
