Запись архива

Hugging Face представил NeoMME — мультимодальный энкодер без раздельного vision tower и каузальной языковой модели

NeoMME от Hugging Face — семейство мультимодальных энкодеров (260M и 800M параметров) без раздельного vision tower и каузальной языковой модели. Единый Transformer обрабатывает и текст, и сырые патчи изображений. Модель обучена с нуля на masked discrete-diffusion objective. В задаче поиска документов NeoMME-Retriever-2

Схема архитектуры мультимодального энкодера NeoMME от Hugging Face
Схема архитектуры мультимодального энкодера NeoMME от Hugging Face
Изображение из исходного материала

Команда Hugging Face представила NeoMME — семейство мультимодальных энкодеров, которое отказывается от привычной архитектуры с отдельным vision tower и каузальной языковой моделью. Вместо этого единый двунаправленный Transformer (bidirectional encoder) обрабатывает как текстовые токены, так и сырые патчи изображений, а обучение ведётся с нуля на задаче masked discrete-diffusion. Модели выпущены в двух размерах — 260M и 800M параметров — и доступны под лицензией Apache 2.0.

Архитектура: без vision tower и каузального декодера

NeoMME (произносится «ни-о-ми») принципиально отличается от большинства современных визуально-языковых моделей (VLM), которые используют предобученный vision encoder, проектор для отображения визуальных признаков в пространство языковой модели и каузальный декодер для генерации. Как отмечают авторы, такой подход избыточен для задач, не требующих авторегрессивной генерации текста, — поиска, классификации и разметки токенов.

В NeoMME изображения и текст проходят через один и тот же вычислительный контур. Это упрощает предобучение, дообучение, параллелизацию и инференс. При этом модель не основана на какой-либо предобученной vision tower, текстовом энкодере или декодере.

Предобучение: masked discrete-diffusion и смешанные данные

Обучение велось с нуля на задаче восстановления замаскированных текстовых токенов. Для текстовых примеров уровень маскирования выбирался равномерно от 0 до 1, для мультимодальных — от 0.3 до 1. Патчи изображений при этом всегда оставались видимыми. Такой подход, по замыслу авторов, вынуждает модель при высоком уровне маскирования опираться на визуальный контекст, а не на окружающий текст.

Предобучение смешивало многоязычный текст, код, математику, естественные изображения и документы. Каждая модель обработала около 524 млрд упакованных входных токенов, включая 290 млрд токенов из текстовых примеров. Для повышения эффективности обучения при относительно небольшом текстовом бюджете (против 2 трлн токенов у ModernBERT) использовался оптимизатор NorMuon.

Поиск документов: NeoMME-Retriever и ViDoRe v3

Для оценки качества энкодера в прикладной задаче команда дообучила NeoMME на поиск документов по методологии page-image, введённой ColPali. Модель ранжирует скриншоты страниц, обходя этапы OCR и извлечения текста из PDF, что позволяет сохранять разметку, таблицы, шрифты и другие визуальные подсказки.

NeoMME-Retriever добавляет к основе NeoMME две головы: одна выдаёт плотные эмбеддинги (dense), другая — эмбеддинги с поздним взаимодействием (late-interaction). Оба представления возвращаются за один прямой проход.

Ключевые факты

Параметр NeoMME-Retriever-260M NeoMME-Retriever-800M
nDCG@10 на ViDoRe v3 523 556
Параметры 260M 800M
Сравнение В 0.002 от ColQwen2.5 при 14× меньшем числе параметров В 0.009 от Vultron Retriever Flash (0.8B)
Пропускная способность ~51 страница/с на L40S (2048×2048)
Лицензия Apache 2.0 Apache 2.0

NeoMME-Retriever-260M лежит на Парето-границе ViDoRe v3 по nDCG@10 и размеру модели, обходя ColModernVBERT и вдвое более крупный ColSmol-500M. NeoMME-Retriever-800M превосходит ColPali v1.3 при в 3.6 раза меньшем числе параметров.

Сжатие индекса: 255× при сохранении 95% точности

Late-interaction эмбеддинги по своей природе объёмны: для страницы 2048×2048 пикселей NeoMME-Retriever генерирует около 4200 векторов, что в float32 составляет примерно 2.1 МБ. Для снижения хранилища команда применила два метода:

— иерархическую пулинговую агрегацию токенов (hierarchical token pooling);
— асимметричное квантование (asymmetric quantization).

В комбинации с pooling factor 10 и int8 для запросов и документов размер индекса снизился с 1.5 МБ до 6 кБ на страницу — сжатие в 255 раз. При этом точность (nDCG@10) сохранилась на уровне более 95% от базовой.

Практическое значение

NeoMME предлагает альтернативный путь для построения мультимодальных энкодеров, не привязанный к доминирующей VLM-архитектуре. Для разработчиков, занимающихся поиском по документам, RAG-системами или задачами классификации, модель может стать более эффективным решением с точки зрения как параметров, так и памяти. Возможность получать и dense, и late-interaction эмбеддинги за один проход упрощает гибридные пайплайны: быстрый ANN-поиск по плотным векторам с последующим реранкингом через позднее взаимодействие.

Доступность и лицензия

Все чекпоинты NeoMME (260M и 800M) опубликованы под лицензией Apache 2.0 и доступны через Hugging Face Transformers. Это позволяет использовать модель в коммерческих проектах без дополнительных ограничений.

Источник: Hugging Face Blog — NeoMME: an efficient Multimodal-native and Multilingual Encoder