Запись архива

Открытые VLM в 2024 году: как различаются Qwen2-VL, InternVL, Molmo и Pixtral

Сравниваем четыре открытые VLM-семьи 2024 года — Qwen2-VL, InternVL, Molmo и Pixtral: архитектуру, OCR и видео, открытость данных и ограничения официальных бенчмарков.

Сравнительная схема четырёх открытых VLM 2024 года: Qwen2-VL, InternVL, Molmo и Pixtral по архитектуре, данным и типовым задачам

В 2024 году открытые vision-language models (VLM) перестали быть только демонстрациями «LLM + картинка». Qwen2-VL, InternVL, Molmo и Pixtral вышли с разными ставками: универсальность и видео, OCR и документы, открытые данные и человеко-ориентированная оценка, баланс текста и зрения. Этот обзор сознательно ограничен историческим срезом 2024 года: мы не подменяем его более поздними релизами 2025–2026, а разбираем, что именно тогда изменилось в открытом сегменте.

Под «открытыми VLM» здесь важно понимать не одинаковую степень открытости, а опубликованные веса, документацию и первичные технические материалы. У этих четырёх семейств разный ответ на вопрос, что именно должно быть открыто: только веса, веса и код, или ещё и данные с оценочным пайплайном.

Коротко

  • Qwen2-VL сделал ставку на универсальность: динамическое разрешение, единый режим для изображений и видео, сильный OCR и мультиязычность.
  • InternVL в 2024 году развивался как линейка для документов, диаграмм и high-resolution OCR, причём авторы открыто показывали, что цифры зависят от eval-стека.
  • Molmo отличился не только качеством, но и тем, что вынес в центр открытые данные PixMo, pointing/grounding и собственную человеческую оценку.
  • Pixtral показал другой путь: компактный по современным меркам 12B-класс, собственный vision encoder, длинный текстовый контекст и сильные текстовые метрики без явной жертвы мультимодальности.
  • Сводить эти семейства к одному «победителю» некорректно: официальные таблицы собраны разными пайплайнами, с разными задачами и иногда с разной философией сравнения.

Контекст

До 2024 года открытый рынок VLM в основном жил логикой LLaVA-подобных систем: берём сильный vision encoder, пришиваем его к LLM, затем улучшаем инструкционными данными. В 2024-м появились более оформленные семейства, где различия шли уже не только по качеству, но и по инженерной философии.

Qwen2-VL в официальном блоге от 29 августа 2024 года и в техническом отчёте от 18 сентября 2024 года описан как универсальный мультимодальный апгрейд семейства Qwen с динамической обработкой изображений и видео. InternVL в 2024-м фактически надо читать как две волны: InternVL 1.5 из отчёта от 25 апреля 2024 года и InternVL2, опубликованный 4 июля 2024 года. Molmo вышел 25 сентября 2024 года и сразу был подан не просто как open-weights-модель, а как попытка построить сильный VLM без дистилляции из закрытых VLM. Pixtral 12B Mistral вывела в релиз 11 сентября 2024 года, а отдельный paper опубликовала 9 октября 2024 года.

Уже из этих дат видно, что мы сравниваем не один момент времени, а последовательность релизов внутри одного года. Это важно: «лучше» и «хуже» в апреле, июле и сентябре 2024 года означало разное.

Метод: как сравнивать эти VLM

Вместо единого рейтинга здесь полезнее смотреть на четыре оси:

  1. Архитектурный приоритет: где именно авторы искали выигрыш — в encoder/connector, в high-resolution обработке, в длинном контексте или в данных.
  2. Реальная открытость: открыты ли только веса или ещё training/eval-код и датасеты.
  3. Рабочий профиль: изображения, документы, OCR, видео, pointing/grounding, text-first сценарии.
  4. Качество по официальным источникам: но только с оговоркой, что разные семьи считают его по-разному.

Последняя ось особенно скользкая. InternVL2 прямо пишет, что часть результатов считалась в собственном репозитории, а часть — через VLMEvalKit, и даже для MMMU публикует две колонки. Mistral в карточке Pixtral отдельно подчёркивает, что модели переоценивались единым пайплайном. Ai2 для Molmo, наоборот, публикует не одну привычную таблицу по отдельным бенчмаркам, а собственную среднюю оценку по 11 академическим задачам плюс human preference Elo. То есть официальные цифры полезны как сигнал, но не как нейтральный мировой табель.

Семейство Ключевой релиз 2024 Главный технический тезис Что открыто по официальным материалам Практический профиль
Qwen2-VL 29 августа 2024 — блог; 18 сентября 2024 — technical report Naive Dynamic Resolution, M-RoPE, единый стек для image/video Веса, код, model cards; акцент на open weights Универсальный VLM, OCR, мультиязычность, видео
InternVL 1.5 / 2.0 25 апреля 2024 — InternVL 1.5; 4 июля 2024 — InternVL2 Сильный vision encoder, dynamic high-resolution tiling, масштабирование по размерам моделей Веса, код, документация; открытая линейка размеров Документы, диаграммы, OCR, multi-image, часть video-сценариев
Molmo 25 сентября 2024 Data-first подход: PixMo, pointing/grounding, открытая оценка и человеческое ранжирование Веса, код, данные PixMo, eval-артефакты; заявка на более полную воспроизводимость Open-ended image QA, pointing, grounded interaction
Pixtral 12B 11 сентября 2024 — модель; 9 октября 2024 — paper Нативная мультимодальность, свой vision encoder, natural resolution, сильный текстовый backbone Веса, model card, paper, открытый MM-MT-Bench Изображения и документы, text-first продакшн-сценарии, long-context чат

Результаты

Qwen2-VL: универсальный open-weights generalist

По официальным материалам Qwen2-VL строится вокруг двух идей: Naive Dynamic Resolution, где изображение превращается в переменное число visual tokens, и M-RoPE, которое соединяет 1D-текстовые, 2D-визуальные и 3D-видео-позиции. В блоге Qwen отдельно подчёркивает поддержку видео длиннее 20 минут и улучшение мультиязычного понимания текста внутри изображений.

Практически это выглядит как попытка сделать не «OCR-модель» и не «video-модель», а один общий VLM. В официальной карточке Qwen2-VL-7B-Instruct опубликованы сильные для 7B-класса результаты на DocVQA, OCRBench и Video-MME; при этом в других официальных карточках Qwen рядом встречаются немного отличающиеся цифры из-за другого eval-сетапа. Поэтому для Qwen2-VL важно не только значение метрики, но и то, какой именно официальный артефакт вы читаете.

На уровне позиционирования Qwen2-VL выглядит как самая «продуктовая» из четырёх семей: один стек, много модальностей, понятный переход от image QA к video QA и agent-подобным сценариям.

InternVL: ставка на high-resolution, OCR и широкую линейку размеров

InternVL 1.5 в отчёте от 25 апреля 2024 года делал акцент на три вещи: InternViT-6B как сильный vision encoder, dynamic high-resolution с тайлингом от 1 до 40 фрагментов размера 448×448 и специально собранный качественный двуязычный датасет для OCR и китайских сцен. Уже это хорошо объясняет, почему InternVL в 2024 году так часто всплывал в задачах документов, графиков и диаграмм.

InternVL2 от 4 июля 2024 года расширил эту идею до полноценной линейки от 1B до 76B-класса и добавил тезис о progressive scaling: модель, данные и alignment растут согласованно. Официальная страница InternVL2 публикует для InternVL2-Pro 62.0 на MMMU и 66.3 на MathVista, а также сильные значения на DocVQA и OCRBench; GitHub-репозиторий отдельно повторяет по крайней мере ключевой тезис про 62.0 на MMMU. Но ещё важнее другое: InternVL сам предупреждает, что для части задач использует разные evaluation toolkits. Это редкий и полезный уровень честности.

Если Qwen2-VL — универсальный generalist, то InternVL в 2024 году был ближе к профилю «рабочая лошадка для document-heavy сценариев». Особенно там, где важны OCR, чарты, таблицы и high-resolution input.

Molmo: главный ход — не только модель, а данные и оценка

У Molmo самая заметная особенность 2024 года — фокус не на очередном коннекторе между CLIP и LLM, а на PixMo: собственных датасетах для детальных caption’ов, свободных image Q&A и 2D pointing. В блоге Ai2 прямо пишет, что большая часть pipeline после исходных vision encoder и LLM — веса, код, данные и evaluation — открыта и не зависит от дистилляции из внешних VLM.

Архитектурно Molmo при этом относительно консервативен: multiscale/multicrop preprocessor, ViT image encoder, MLP connector, decoder-only LLM. Новизна здесь больше в данных и в том, какие навыки эти данные покупают: open-ended описание, grounded pointing, чтение сложных визуальных сцен.

Точные числа у Molmo лучше читать с осторожностью и вместе с оговоркой источника. В официальной карточке Molmo-72B-0924 и в повторяющей ту же таблицу карточке Molmo-7B-D-0924 опубликованы 81.2 средней оценки по 11 академическим бенчмаркам и 1077 human preference Elo для Molmo 72B. Это сильный результат внутри собственной системы оценки Ai2, но не универсальная единица измерения рынка. Тем не менее именно Molmo сделал самый ясный шаг в сторону воспроизводимой открытой мультимодальности, а не просто открытых весов.

Pixtral: мультимодальность без отказа от сильного текста

Pixtral 12B Mistral описывает как нативно мультимодальную модель на 12B параметров плюс vision encoder на 400M параметров. Официальные материалы делают акцент на обработке изображений в естественном разрешении и соотношении сторон, возможности работать с несколькими изображениями и длинном текстовом контексте в 128k.

Главная идея Pixtral — не быть «узкой зрительной моделью», которая проигрывает обычным текстовым LLM на чистом тексте. В официальной карточке модели опубликованы сильные результаты не только на мультимодальных задачах, но и на text-only наборах вроде MMLU, MATH и HumanEval. Для команд это важный сигнал: Pixtral можно рассматривать как единый backbone для чат-сценариев, где изображения — частый, но не единственный тип входа.

Точные мультимодальные цифры ниже — из официальной карточки модели Mistral; paper подтверждает направление сравнений, но не дублирует всю таблицу в доступном нам текстовом виде. Это означает, что сами значения полезны как ориентир, но не как независимая верификация.

Семейство Репрезентативная 2024-модель Официально опубликованные метрики Как это читать
Qwen2-VL Qwen2-VL-7B-Instruct DocVQA test 94.5; OCRBench 845; Video-MME 63.3/69.0 Цифры из официальной карточки Qwen; в других официальных артефактах есть близкие, но не идентичные значения из-за разных eval-настроек
InternVL InternVL2-Pro MMMU 62.0; MathVista 66.3; OCRBench 837 Официальная страница InternVL2; авторы сами предупреждают о зависимости результатов от toolkit
Molmo Molmo 72B Average on 11 academic benchmarks 81.2; Human preference Elo 1077 Официальная таблица Ai2; это агрегат по собственной методике, а не единый внешний лидерборд
Pixtral Pixtral-12B-2409 MMMU 52.5; MathVista 58.0; ChartQA 81.8; DocVQA 90.7 Официальная карточка Mistral; paper подтверждает общую картину, но не повторяет все цифры в том же формате

Интерпретация

Наш комментарий

Если отбросить гонку за одним рейтингом, то в 2024 году эти четыре семьи разошлись по ролям.

  • Qwen2-VL — лучший кандидат на роль универсального open-weights VLM, если вам нужно одним стеком закрывать изображения, OCR, мультиязычность и часть видео-задач.
  • InternVL — практичный выбор для document-heavy сценариев, где цена high-resolution обработки и качество OCR важнее красивой универсальности.
  • Molmo — наиболее интересен исследователям и командам, которым важна не только модель, но и вопрос откуда взялось качество: данные, pointing, eval, воспроизводимость.
  • Pixtral — удобный компромисс для тех, кто не хочет держать отдельно «обычную LLM» и отдельно мультимодальную модель.

Самое важное различие между ними — это не только архитектура, а определение слова «открытый». У Qwen2-VL и Pixtral открытость в первую очередь про веса и удобство использования. У InternVL — про открытую линейку, код и систематическую инженерную работу с OCR/high-res. У Molmo — про попытку открыть ещё и происхождение мультимодальных способностей через данные и eval-пайплайн.

Ограничения

Первое ограничение этого обзора — неполная сопоставимость источников. Qwen, InternVL, Molmo и Pixtral публикуют результаты в разном формате: от пер-бенчмарк таблиц до агрегированных средних и human Elo.

Второе — разные evaluation stacks. InternVL сам показывает, что MMMU может иметь две официальные колонки в зависимости от кода оценки. Ai2 для Molmo прямо пишет, что для фиксированной модели результат на одном и том же бенчмарке может плавать заметно в зависимости от prompt’ов и препроцессинга.

Третье — разная степень открытости. Называть все четыре семейства одинаково «open-source VLM» слишком грубо. Molmo в 2024 году заметно сильнее остальных давил на открытые данные и оценки; у остальных акцент чаще был на весах, коде и документации.

Четвёртое — исторические рамки. После 2024 года рынок быстро изменился, и некоторые из тогдашних компромиссов уже не выглядят окончательными. Но цель статьи не в том, чтобы обновить рейтинг на август 2026 года, а в том, чтобы честно зафиксировать, что именно внесли эти релизы в 2024-м.

Заключение

Открытые VLM 2024 года не сошлись к одной формуле. Qwen2-VL продвигал универсальность и видео, InternVL — OCR и high-resolution документы, Molmo — открытые данные и grounded interaction, Pixtral — сильный текстовый backbone с нативной мультимодальностью.

Если вам нужен не лозунг, а практический выбор, смотрите не на общий «SOTA», а на профиль задачи и на то, насколько для вас важны не только веса, но и прозрачность данных, оценки и воспроизводимости.

Источники

FAQ

Что из этого лучше для OCR и документов?

По официальным материалам 2024 года сильнее всего на OCR, диаграммы и документы были ориентированы InternVL и Qwen2-VL. InternVL системно продвигал high-resolution tiling и document-heavy наборы, а Qwen2-VL показывал сильные DocVQA и OCRBench в своих карточках моделей.

Какая семья была наиболее открытой именно по данным?

Если понимать открытость не только как open weights, а как данные и eval, то наиболее явный акцент на этом делал Molmo. Ai2 отдельно вынесла PixMo, открытый evaluation pipeline и отказ от дистилляции из внешних VLM в центр релиза.

Можно ли по этим таблицам выбрать абсолютного победителя?

Скорее нет. Официальные цифры полезны как ориентир, но они собраны разными пайплайнами, на разных срезах и иногда с разной философией оценки. Для практики надёжнее повторить проверку на собственных документах, интерфейсах и видео.

Читайте также