
Команда Datalab представила Marker 2 — полную переработку своего open-source пайплайна для конвертации PDF, изображений, DOCX, PPTX, XLSX, HTML и EPUB в Markdown, JSON, HTML или чанки. Вместо одного универсального режима теперь доступны три: balanced (сбалансированный по точности и скорости), fast (без VLM-OCR) и CPU-only. Главные цифры: balanced-режим набирает 76,0% на бенчмарке olmOCR-bench и выдаёт 2,9 страницы в секунду на одном GPU B200 — это в 5,4 раза быстрее MinerU (0,54 стр/сек) и при этом точнее (72,7% у MinerU). Docling на том же стенде показывает 50,3% при 2,1 стр/сек. LiteParse, напротив, жертвует точностью ради скорости: без OCR он выдаёт 1721 стр/сек на CPU, но набирает лишь 22,4%.
Ключевые факты
| Параметр | Marker 2 (balanced) | MinerU (pipeline) | Docling | LiteParse (CPU, без OCR) |
|---|---|---|---|---|
| Точность (olmOCR-bench, общая) | 76,0% | 72,7% | 50,3% | 22,4% |
| Точность (born-digital PDF) | 83,5% | 83,3% | 64,0% | — |
| Скорость (стр/сек) | 2,9 (B200) | 0,54 (B200) | 2,1 (B200) | 1721 (CPU) |
| Условия | GPU, Surya OCR 2 + layout model | pipeline backend | default pipeline | Rust, без VLM |
Что изменилось в Marker 2
Ключевое архитектурное решение — разделение пайплайна на три компонента, которые Datalab выпускал по отдельности в последние месяцы: Surya OCR 2 (модель распознавания), быстрая layout-модель на 20 млн параметров, и переписанный pdftext, который стал в 3 раза быстрее предыдущей версии. Вместо монолитного процесса теперь используется несколько лёгких CPU-воркеров, которые делят один инференс-сервер Surya. Родительский процесс управляет конкурентностью VLM-вызовов, поэтому пропускная способность растёт с ёмкостью сервера, а не упирается в VRAM на процесс. В результате balanced-режим выдерживает ~2,9 стр/сек против ~0,3 стр/сек при последовательной обработке на том же железе.
Второе важное изменение — полноценная поддержка CPU. Режим fast с флагом –disable_ocr не требует GPU и инференс-сервера, но layout-модель на 20 млн параметров всё равно распознаёт колонки, таблицы и заголовки на процессоре. Это позволяет Marker 2 на CPU набирать 43,6% против 22,4% у LiteParse и 20,4% у LiteParse без OCR.
Третье — смена инфраструктуры сборки: теперь требуется Python 3.10+, пакетный менеджер uv вместо Poetry, хотя pip install marker-pdf остаётся без изменений. Удалён конвертер structured-extraction — Datalab рекомендует вместо него использовать хостируемый API или флаг –use_llm.
Бенчмарк и методология
Все результаты получены на olmOCR-bench — наборе из 1403 PDF-файлов с примерно 8400 тестами pass/fail от Allen AI (Ai2). Бенчмарк покрывает восемь категорий: отображение математических формул, структура таблиц, порядок чтения, заголовки и футеры, старые сканы. Итоговая оценка — макро-усреднение по категориям. Datalab подчёркивает, что все цифры воспроизводимы: в репозитории Marker есть скрипты для запуска конкурентов (MinerU, Docling, LiteParse) на том же железе. Важно: тесты проводились на одном хосте с B200, а результаты на собственном корпусе документов могут отличаться.
Сравнение с конкурентами: кому что подходит
MinerU — ближайший архитектурный аналог: оба используют текстовый слой PDF и выборочный OCR. Marker balanced выигрывает по общей точности (76,0 vs 72,7) и с большим отрывом по скорости (2,9 vs 0,54 стр/сек). На born-digital PDF они практически равны (83,5 vs 83,3). Однако у MinerU есть VLM-бекенд, который по заявлению Datalab даёт более высокую точность — этот режим не участвовал в сравнении. Командам, у которых много born-digital документов, стоит тестировать оба инструмента на своём корпусе.
Docling — самый широкий по охвату форматов (включает аудио и email), но заметно уступает по точности (50,3% против 76,0%) и скорости (2,1 против 2,9 стр/сек). Его сильная сторона — лицензия MIT, происхождение от IBM Research и управление под эгидой LF AI & Data Foundation. Если приоритет — governance и поддержка редких форматов, Docling остаётся вариантом, но для точной конвертации научных PDF или финансовых документов он проигрывает.
LiteParse — экстремально быстрый парсер на Rust, но без модели разметки. Он не обрабатывает нелинейную структуру, поэтому на таблицах, многоколоночных страницах и математике падает. Marker 2 в CPU-режиме более чем вдвое точнее (43,6% против 22,4%) при скорости, достаточной для batch-обработки. Для сценариев, где важна только скорость и документы простые (одноколоночный текст без таблиц), LiteParse может быть оправдан.
Ограничения и нюансы
Marker 2 — это пайплайн, а не VLM. Для максимальной точности (сканы, математика, сложная вёрстка) Datalab рекомендует свою хостируемую модель Chandra 2 (85,8% на olmOCR-bench) или Gemini Flash 3.5 (76,4%). Однако balanced-режим Marker 2 отстаёт от Gemini Flash всего на 0,4 процентных пункта (76,0 vs 76,4) и даже опережает его на born-digital документах (83,5 vs 79,1) — без затрат на API-запросы.
Слабое место fast-режима — математика: точность падает с 83,9% до 23,4%, а при –disable_ocr — до 0,0% по дизайну. Для arXiv-статей этот режим не подходит. Старые сканы — проблемная категория для всех пайплайнов: лучший результат — 43,2% в balanced-режиме.
