
Команда Datalab представила Marker 2 — полную переработку открытого пайплайна конвертации документов. Инструмент преобразует PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB в Markdown, JSON, HTML или чанки. Главное достижение — результат на стороннем бенчмарке olmOCR-bench от Allen AI: сбалансированный режим Marker 2 набирает 76.0 % точности при пропускной способности 2.9 страниц в секунду на одном GPU B200. Это более чем в 5 раз быстрее пайплайнового бэкенда MinerU (0.54 стр/с) при более высоком качестве (72.7 %).
Архитектура и режимы работы
Marker 2 собран из трёх компонентов, которые Datalab выпускала по отдельности в предыдущие месяцы: Surya OCR 2, модель быстрой разметки страниц на 20 млн параметров и переписанный pdftext, который стал в 3 раза быстрее предыдущей версии. Вместо единого конвейера теперь доступны три режима, которые выбираются автоматически в зависимости от устройства: на GPU — сбалансированный, на CPU или MPS — быстрый. Пользователь может принудительно задать режим через флаг –mode.
Полная поддержка CPU — второе структурное изменение. Режим fast –disable_ocr не требует GPU и не запускает инференс-сервер: лёгкая модель разметки (20M параметров) всё равно распознаёт колонки, таблицы и заголовки на процессоре. Третье изменение — архитектурное: множество тонких CPU-воркеров разделяют один экземпляр Surya-сервера, а родительский процесс управляет параллелизмом VLM-запросов. Благодаря этому пропускная способность растёт с ёмкостью сервера, а не с VRAM на процесс. Datalab сообщает, что в сбалансированном режиме достигается ~2.9 стр/с против ~0.3 стр/с при однопоточной обработке на том же оборудовании.
Результаты бенчмарка
Оценка проводилась на olmOCR-bench — наборе из 1403 PDF-файлов с примерно 8400 юнит-тестами (проход/непроход), охватывающими математическую вёрстку, структуру таблиц, порядок чтения, колонтитулы и старые сканы. Итоговый балл — макро-усреднение по 8 категориям.
Ключевые факты
| Инструмент | Режим | Точность (общая) | Точность (born-digital) | Пропускная способность |
|---|---|---|---|---|
| Marker 2 (balanced) | GPU | 0 % | 5 % | 9 стр/с |
| MinerU (pipeline) | GPU | 7 % | 3 % | 54 стр/с |
| Docling (default) | GPU | 3 % | 0 % | 1 стр/с |
| LiteParse (CPU, без OCR) | CPU | 4 % | — | 1721 стр/с |
Datalab подчёркивает, что цифры получены на их собственных прогонах, но все конфигурации воспроизводимы через открытый харнес в репозитории Marker, который включает скрипты для конкурентов.
Сравнение с конкурентами
MinerU — самый близкий архитектурный аналог: оба инструмента сначала читают текстовый слой PDF и выборочно применяют OCR. На born-digital документах Marker 2 и MinerU практически равны (83.5 против 83.3), но Marker 2 выигрывает по скорости в 5.4 раза. Быстрый режим Marker 2 (7.4 стр/с) опережает MinerU в 13.7 раз, но проигрывает 6.1 балла точности. Datalab отмечает, что MinerU также предлагает VLM-бэкенд (полностраничный VLM), который не входит в данное сравнение и может давать более высокие результаты — командам следует оценивать его отдельно.
Docling проигрывает по всем показателям: 50.3 % против 76.0 % при меньшей скорости (2.1 стр/с). Его сильная сторона — другая: модель управления (MIT-лицензия, проект в LF AI & Data Foundation, происходит из IBM Research) и расширенный список входных форматов, включая аудио и email.
LiteParse от LlamaIndex — лёгкий Rust-парсер, не предназначенный для точного восстановления структуры. На CPU он даёт 20.4 % точности, но при отключённом OCR показывает 1721 стр/с — примерно в 73 раза быстрее Marker 2 на CPU. Однако Marker 2 даже без OCR (fast –disable-ocr) набирает 43.6 % благодаря модели разметки, тогда как LiteParse не имеет такой модели и «ломается» на нелинейных макетах.
Когда выбирать Marker 2
Marker 2 рассчитан на сценарии, где нужен баланс между точностью и скоростью, особенно на GPU. Для born-digital документов его сбалансированный режим почти не уступает VLM-решениям (Gemini Flash 3.5 через API набирает 76.4 %, Marker 2 — 76.0 %), но при этом не требует отдельных API-запросов на каждую страницу. Для сканов, математических статей и максимальной точности Datalab указывает, что VLM-уровень (их собственный Chandra 2, 85.8 %) остаётся предпочтительным.
Важно: выбор режима меняет профиль ошибок. Математические формулы в быстром режиме берутся из текстового слоя PDF, поэтому arXiv-математика падает с 83.9 до 23.4, а в режиме –disable_ocr — до 0.0. Старые сканы остаются самым слабым местом во всех режимах (максимум 43.2).
Ограничения и оговорки
Все опубликованные результаты получены Datalab на собственном оборудовании (один B200) и на одном бенчмарке. Реальная производительность на вашем корпусе документов может отличаться. Командам рекомендуется запустить открытый харнес из репозитория Marker на своих данных, чтобы получить релевантное сравнение.
Marker 2 также содержит breaking changes: требуется Python 3.10+, система сборки переведена с Poetry на uv, удалены конвертер для структурированного извлечения и экстракторы — теперь Datalab предлагает вместо них API или workflow с –use_llm.
Источник: MarkTechPost — Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput (https://www.marktechpost.com/2026/07/24/datalabs-marker-2-vs-mineru-docling-and-liteparse-76-0-on-olmocr-bench-at-5x-minerus-throughput/)