В 2024 году открытые vision-language models (VLM) перестали быть только демонстрациями «LLM + картинка». Qwen2-VL, InternVL, Molmo и Pixtral вышли с разными ставками: универсальность и видео, OCR и документы, открытые данные и человеко-ориентированная оценка, баланс текста и зрения. Этот обзор сознательно ограничен историческим срезом 2024 года: мы не подменяем его более поздними релизами 2025–2026, а разбираем, что именно тогда изменилось в открытом сегменте.
Под «открытыми VLM» здесь важно понимать не одинаковую степень открытости, а опубликованные веса, документацию и первичные технические материалы. У этих четырёх семейств разный ответ на вопрос, что именно должно быть открыто: только веса, веса и код, или ещё и данные с оценочным пайплайном.
Коротко
- Qwen2-VL сделал ставку на универсальность: динамическое разрешение, единый режим для изображений и видео, сильный OCR и мультиязычность.
- InternVL в 2024 году развивался как линейка для документов, диаграмм и high-resolution OCR, причём авторы открыто показывали, что цифры зависят от eval-стека.
- Molmo отличился не только качеством, но и тем, что вынес в центр открытые данные PixMo, pointing/grounding и собственную человеческую оценку.
- Pixtral показал другой путь: компактный по современным меркам 12B-класс, собственный vision encoder, длинный текстовый контекст и сильные текстовые метрики без явной жертвы мультимодальности.
- Сводить эти семейства к одному «победителю» некорректно: официальные таблицы собраны разными пайплайнами, с разными задачами и иногда с разной философией сравнения.
Контекст
До 2024 года открытый рынок VLM в основном жил логикой LLaVA-подобных систем: берём сильный vision encoder, пришиваем его к LLM, затем улучшаем инструкционными данными. В 2024-м появились более оформленные семейства, где различия шли уже не только по качеству, но и по инженерной философии.
Qwen2-VL в официальном блоге от 29 августа 2024 года и в техническом отчёте от 18 сентября 2024 года описан как универсальный мультимодальный апгрейд семейства Qwen с динамической обработкой изображений и видео. InternVL в 2024-м фактически надо читать как две волны: InternVL 1.5 из отчёта от 25 апреля 2024 года и InternVL2, опубликованный 4 июля 2024 года. Molmo вышел 25 сентября 2024 года и сразу был подан не просто как open-weights-модель, а как попытка построить сильный VLM без дистилляции из закрытых VLM. Pixtral 12B Mistral вывела в релиз 11 сентября 2024 года, а отдельный paper опубликовала 9 октября 2024 года.
Уже из этих дат видно, что мы сравниваем не один момент времени, а последовательность релизов внутри одного года. Это важно: «лучше» и «хуже» в апреле, июле и сентябре 2024 года означало разное.
Метод: как сравнивать эти VLM
Вместо единого рейтинга здесь полезнее смотреть на четыре оси:
- Архитектурный приоритет: где именно авторы искали выигрыш — в encoder/connector, в high-resolution обработке, в длинном контексте или в данных.
- Реальная открытость: открыты ли только веса или ещё training/eval-код и датасеты.
- Рабочий профиль: изображения, документы, OCR, видео, pointing/grounding, text-first сценарии.
- Качество по официальным источникам: но только с оговоркой, что разные семьи считают его по-разному.
Последняя ось особенно скользкая. InternVL2 прямо пишет, что часть результатов считалась в собственном репозитории, а часть — через VLMEvalKit, и даже для MMMU публикует две колонки. Mistral в карточке Pixtral отдельно подчёркивает, что модели переоценивались единым пайплайном. Ai2 для Molmo, наоборот, публикует не одну привычную таблицу по отдельным бенчмаркам, а собственную среднюю оценку по 11 академическим задачам плюс human preference Elo. То есть официальные цифры полезны как сигнал, но не как нейтральный мировой табель.
| Семейство | Ключевой релиз 2024 | Главный технический тезис | Что открыто по официальным материалам | Практический профиль |
|---|---|---|---|---|
| Qwen2-VL | 29 августа 2024 — блог; 18 сентября 2024 — technical report | Naive Dynamic Resolution, M-RoPE, единый стек для image/video | Веса, код, model cards; акцент на open weights | Универсальный VLM, OCR, мультиязычность, видео |
| InternVL 1.5 / 2.0 | 25 апреля 2024 — InternVL 1.5; 4 июля 2024 — InternVL2 | Сильный vision encoder, dynamic high-resolution tiling, масштабирование по размерам моделей | Веса, код, документация; открытая линейка размеров | Документы, диаграммы, OCR, multi-image, часть video-сценариев |
| Molmo | 25 сентября 2024 | Data-first подход: PixMo, pointing/grounding, открытая оценка и человеческое ранжирование | Веса, код, данные PixMo, eval-артефакты; заявка на более полную воспроизводимость | Open-ended image QA, pointing, grounded interaction |
| Pixtral 12B | 11 сентября 2024 — модель; 9 октября 2024 — paper | Нативная мультимодальность, свой vision encoder, natural resolution, сильный текстовый backbone | Веса, model card, paper, открытый MM-MT-Bench | Изображения и документы, text-first продакшн-сценарии, long-context чат |
Результаты
Qwen2-VL: универсальный open-weights generalist
По официальным материалам Qwen2-VL строится вокруг двух идей: Naive Dynamic Resolution, где изображение превращается в переменное число visual tokens, и M-RoPE, которое соединяет 1D-текстовые, 2D-визуальные и 3D-видео-позиции. В блоге Qwen отдельно подчёркивает поддержку видео длиннее 20 минут и улучшение мультиязычного понимания текста внутри изображений.
Практически это выглядит как попытка сделать не «OCR-модель» и не «video-модель», а один общий VLM. В официальной карточке Qwen2-VL-7B-Instruct опубликованы сильные для 7B-класса результаты на DocVQA, OCRBench и Video-MME; при этом в других официальных карточках Qwen рядом встречаются немного отличающиеся цифры из-за другого eval-сетапа. Поэтому для Qwen2-VL важно не только значение метрики, но и то, какой именно официальный артефакт вы читаете.
На уровне позиционирования Qwen2-VL выглядит как самая «продуктовая» из четырёх семей: один стек, много модальностей, понятный переход от image QA к video QA и agent-подобным сценариям.
InternVL: ставка на high-resolution, OCR и широкую линейку размеров
InternVL 1.5 в отчёте от 25 апреля 2024 года делал акцент на три вещи: InternViT-6B как сильный vision encoder, dynamic high-resolution с тайлингом от 1 до 40 фрагментов размера 448×448 и специально собранный качественный двуязычный датасет для OCR и китайских сцен. Уже это хорошо объясняет, почему InternVL в 2024 году так часто всплывал в задачах документов, графиков и диаграмм.
InternVL2 от 4 июля 2024 года расширил эту идею до полноценной линейки от 1B до 76B-класса и добавил тезис о progressive scaling: модель, данные и alignment растут согласованно. Официальная страница InternVL2 публикует для InternVL2-Pro 62.0 на MMMU и 66.3 на MathVista, а также сильные значения на DocVQA и OCRBench; GitHub-репозиторий отдельно повторяет по крайней мере ключевой тезис про 62.0 на MMMU. Но ещё важнее другое: InternVL сам предупреждает, что для части задач использует разные evaluation toolkits. Это редкий и полезный уровень честности.
Если Qwen2-VL — универсальный generalist, то InternVL в 2024 году был ближе к профилю «рабочая лошадка для document-heavy сценариев». Особенно там, где важны OCR, чарты, таблицы и high-resolution input.
Molmo: главный ход — не только модель, а данные и оценка
У Molmo самая заметная особенность 2024 года — фокус не на очередном коннекторе между CLIP и LLM, а на PixMo: собственных датасетах для детальных caption’ов, свободных image Q&A и 2D pointing. В блоге Ai2 прямо пишет, что большая часть pipeline после исходных vision encoder и LLM — веса, код, данные и evaluation — открыта и не зависит от дистилляции из внешних VLM.
Архитектурно Molmo при этом относительно консервативен: multiscale/multicrop preprocessor, ViT image encoder, MLP connector, decoder-only LLM. Новизна здесь больше в данных и в том, какие навыки эти данные покупают: open-ended описание, grounded pointing, чтение сложных визуальных сцен.
Точные числа у Molmo лучше читать с осторожностью и вместе с оговоркой источника. В официальной карточке Molmo-72B-0924 и в повторяющей ту же таблицу карточке Molmo-7B-D-0924 опубликованы 81.2 средней оценки по 11 академическим бенчмаркам и 1077 human preference Elo для Molmo 72B. Это сильный результат внутри собственной системы оценки Ai2, но не универсальная единица измерения рынка. Тем не менее именно Molmo сделал самый ясный шаг в сторону воспроизводимой открытой мультимодальности, а не просто открытых весов.
Pixtral: мультимодальность без отказа от сильного текста
Pixtral 12B Mistral описывает как нативно мультимодальную модель на 12B параметров плюс vision encoder на 400M параметров. Официальные материалы делают акцент на обработке изображений в естественном разрешении и соотношении сторон, возможности работать с несколькими изображениями и длинном текстовом контексте в 128k.
Главная идея Pixtral — не быть «узкой зрительной моделью», которая проигрывает обычным текстовым LLM на чистом тексте. В официальной карточке модели опубликованы сильные результаты не только на мультимодальных задачах, но и на text-only наборах вроде MMLU, MATH и HumanEval. Для команд это важный сигнал: Pixtral можно рассматривать как единый backbone для чат-сценариев, где изображения — частый, но не единственный тип входа.
Точные мультимодальные цифры ниже — из официальной карточки модели Mistral; paper подтверждает направление сравнений, но не дублирует всю таблицу в доступном нам текстовом виде. Это означает, что сами значения полезны как ориентир, но не как независимая верификация.
| Семейство | Репрезентативная 2024-модель | Официально опубликованные метрики | Как это читать |
|---|---|---|---|
| Qwen2-VL | Qwen2-VL-7B-Instruct | DocVQA test 94.5; OCRBench 845; Video-MME 63.3/69.0 | Цифры из официальной карточки Qwen; в других официальных артефактах есть близкие, но не идентичные значения из-за разных eval-настроек |
| InternVL | InternVL2-Pro | MMMU 62.0; MathVista 66.3; OCRBench 837 | Официальная страница InternVL2; авторы сами предупреждают о зависимости результатов от toolkit |
| Molmo | Molmo 72B | Average on 11 academic benchmarks 81.2; Human preference Elo 1077 | Официальная таблица Ai2; это агрегат по собственной методике, а не единый внешний лидерборд |
| Pixtral | Pixtral-12B-2409 | MMMU 52.5; MathVista 58.0; ChartQA 81.8; DocVQA 90.7 | Официальная карточка Mistral; paper подтверждает общую картину, но не повторяет все цифры в том же формате |
Интерпретация
Наш комментарий
Если отбросить гонку за одним рейтингом, то в 2024 году эти четыре семьи разошлись по ролям.
- Qwen2-VL — лучший кандидат на роль универсального open-weights VLM, если вам нужно одним стеком закрывать изображения, OCR, мультиязычность и часть видео-задач.
- InternVL — практичный выбор для document-heavy сценариев, где цена high-resolution обработки и качество OCR важнее красивой универсальности.
- Molmo — наиболее интересен исследователям и командам, которым важна не только модель, но и вопрос откуда взялось качество: данные, pointing, eval, воспроизводимость.
- Pixtral — удобный компромисс для тех, кто не хочет держать отдельно «обычную LLM» и отдельно мультимодальную модель.
Самое важное различие между ними — это не только архитектура, а определение слова «открытый». У Qwen2-VL и Pixtral открытость в первую очередь про веса и удобство использования. У InternVL — про открытую линейку, код и систематическую инженерную работу с OCR/high-res. У Molmo — про попытку открыть ещё и происхождение мультимодальных способностей через данные и eval-пайплайн.
Ограничения
Первое ограничение этого обзора — неполная сопоставимость источников. Qwen, InternVL, Molmo и Pixtral публикуют результаты в разном формате: от пер-бенчмарк таблиц до агрегированных средних и human Elo.
Второе — разные evaluation stacks. InternVL сам показывает, что MMMU может иметь две официальные колонки в зависимости от кода оценки. Ai2 для Molmo прямо пишет, что для фиксированной модели результат на одном и том же бенчмарке может плавать заметно в зависимости от prompt’ов и препроцессинга.
Третье — разная степень открытости. Называть все четыре семейства одинаково «open-source VLM» слишком грубо. Molmo в 2024 году заметно сильнее остальных давил на открытые данные и оценки; у остальных акцент чаще был на весах, коде и документации.
Четвёртое — исторические рамки. После 2024 года рынок быстро изменился, и некоторые из тогдашних компромиссов уже не выглядят окончательными. Но цель статьи не в том, чтобы обновить рейтинг на август 2026 года, а в том, чтобы честно зафиксировать, что именно внесли эти релизы в 2024-м.
Заключение
Открытые VLM 2024 года не сошлись к одной формуле. Qwen2-VL продвигал универсальность и видео, InternVL — OCR и high-resolution документы, Molmo — открытые данные и grounded interaction, Pixtral — сильный текстовый backbone с нативной мультимодальностью.
Если вам нужен не лозунг, а практический выбор, смотрите не на общий «SOTA», а на профиль задачи и на то, насколько для вас важны не только веса, но и прозрачность данных, оценки и воспроизводимости.
Источники
- Qwen2-VL: To See the World More Clearly | Qwen
- Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution
- Qwen/Qwen2-VL-7B-Instruct README
- Qwen/Qwen2-VL-72B-Instruct README
- InternVL2: Better than the Best—Expanding Performance Boundaries of Open-Source Multimodal Models with the Progressive Scaling Strategy
- How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
- OpenGVLab/InternVL GitHub Repository
- Molmo | Ai2
- Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
- allenai/Molmo-72B-0924 Model Card
- allenai/Molmo-7B-D-0924 Model Card
- Model Card for Pixtral-12B-2409
- Pixtral 12B | Mistral Docs
- Pixtral 12B
FAQ
Что из этого лучше для OCR и документов?
По официальным материалам 2024 года сильнее всего на OCR, диаграммы и документы были ориентированы InternVL и Qwen2-VL. InternVL системно продвигал high-resolution tiling и document-heavy наборы, а Qwen2-VL показывал сильные DocVQA и OCRBench в своих карточках моделей.
Какая семья была наиболее открытой именно по данным?
Если понимать открытость не только как open weights, а как данные и eval, то наиболее явный акцент на этом делал Molmo. Ai2 отдельно вынесла PixMo, открытый evaluation pipeline и отказ от дистилляции из внешних VLM в центр релиза.
Можно ли по этим таблицам выбрать абсолютного победителя?
Скорее нет. Официальные цифры полезны как ориентир, но они собраны разными пайплайнами, на разных срезах и иногда с разной философией оценки. Для практики надёжнее повторить проверку на собственных документах, интерфейсах и видео.
