Запись архива

Marker 2 от Datalab: 76.0 % на olmOCR-bench при 5-кратном превосходстве в скорости над MinerU

Datalab выпустил Marker 2 — полностью переписанный пайплайн для конвертации PDF, изображений и офисных форматов в Markdown. На бенчмарке olmOCR-bench от Ai2 сбалансированный режим показывает 76.0 % точности при 2.9 страницах в секунду на одном B200 — более чем в 5 раз быстрее MinerU и с лучшим качеством, чем Docling. Р

Сравнительная таблица Marker 2, MinerU, Docling и LiteParse по точности и скорости на olmOCR-bench
Сравнительная таблица Marker 2, MinerU, Docling и LiteParse по точности и скорости на olmOCR-bench
Bundesarchiv Bild 183-15634-0004, Bergarbeiter mit Picklhammer.jpg | by Klein | wikimedia_commons | CC BY-SA 3.0 de

Команда Datalab представила Marker 2 — полную переработку открытого пайплайна конвертации документов. Инструмент преобразует PDF, изображения, PPTX, DOCX, XLSX, HTML и EPUB в Markdown, JSON, HTML или чанки. Главное достижение — результат на стороннем бенчмарке olmOCR-bench от Allen AI: сбалансированный режим Marker 2 набирает 76.0 % точности при пропускной способности 2.9 страниц в секунду на одном GPU B200. Это более чем в 5 раз быстрее пайплайнового бэкенда MinerU (0.54 стр/с) при более высоком качестве (72.7 %).

Архитектура и режимы работы

Marker 2 собран из трёх компонентов, которые Datalab выпускала по отдельности в предыдущие месяцы: Surya OCR 2, модель быстрой разметки страниц на 20 млн параметров и переписанный pdftext, который стал в 3 раза быстрее предыдущей версии. Вместо единого конвейера теперь доступны три режима, которые выбираются автоматически в зависимости от устройства: на GPU — сбалансированный, на CPU или MPS — быстрый. Пользователь может принудительно задать режим через флаг –mode.

Полная поддержка CPU — второе структурное изменение. Режим fast –disable_ocr не требует GPU и не запускает инференс-сервер: лёгкая модель разметки (20M параметров) всё равно распознаёт колонки, таблицы и заголовки на процессоре. Третье изменение — архитектурное: множество тонких CPU-воркеров разделяют один экземпляр Surya-сервера, а родительский процесс управляет параллелизмом VLM-запросов. Благодаря этому пропускная способность растёт с ёмкостью сервера, а не с VRAM на процесс. Datalab сообщает, что в сбалансированном режиме достигается ~2.9 стр/с против ~0.3 стр/с при однопоточной обработке на том же оборудовании.

Результаты бенчмарка

Оценка проводилась на olmOCR-bench — наборе из 1403 PDF-файлов с примерно 8400 юнит-тестами (проход/непроход), охватывающими математическую вёрстку, структуру таблиц, порядок чтения, колонтитулы и старые сканы. Итоговый балл — макро-усреднение по 8 категориям.

Ключевые факты

Инструмент Режим Точность (общая) Точность (born-digital) Пропускная способность
Marker 2 (balanced) GPU 0 % 5 % 9 стр/с
MinerU (pipeline) GPU 7 % 3 % 54 стр/с
Docling (default) GPU 3 % 0 % 1 стр/с
LiteParse (CPU, без OCR) CPU 4 % 1721 стр/с

Datalab подчёркивает, что цифры получены на их собственных прогонах, но все конфигурации воспроизводимы через открытый харнес в репозитории Marker, который включает скрипты для конкурентов.

Сравнение с конкурентами

MinerU — самый близкий архитектурный аналог: оба инструмента сначала читают текстовый слой PDF и выборочно применяют OCR. На born-digital документах Marker 2 и MinerU практически равны (83.5 против 83.3), но Marker 2 выигрывает по скорости в 5.4 раза. Быстрый режим Marker 2 (7.4 стр/с) опережает MinerU в 13.7 раз, но проигрывает 6.1 балла точности. Datalab отмечает, что MinerU также предлагает VLM-бэкенд (полностраничный VLM), который не входит в данное сравнение и может давать более высокие результаты — командам следует оценивать его отдельно.

Docling проигрывает по всем показателям: 50.3 % против 76.0 % при меньшей скорости (2.1 стр/с). Его сильная сторона — другая: модель управления (MIT-лицензия, проект в LF AI & Data Foundation, происходит из IBM Research) и расширенный список входных форматов, включая аудио и email.

LiteParse от LlamaIndex — лёгкий Rust-парсер, не предназначенный для точного восстановления структуры. На CPU он даёт 20.4 % точности, но при отключённом OCR показывает 1721 стр/с — примерно в 73 раза быстрее Marker 2 на CPU. Однако Marker 2 даже без OCR (fast –disable-ocr) набирает 43.6 % благодаря модели разметки, тогда как LiteParse не имеет такой модели и «ломается» на нелинейных макетах.

Когда выбирать Marker 2

Marker 2 рассчитан на сценарии, где нужен баланс между точностью и скоростью, особенно на GPU. Для born-digital документов его сбалансированный режим почти не уступает VLM-решениям (Gemini Flash 3.5 через API набирает 76.4 %, Marker 2 — 76.0 %), но при этом не требует отдельных API-запросов на каждую страницу. Для сканов, математических статей и максимальной точности Datalab указывает, что VLM-уровень (их собственный Chandra 2, 85.8 %) остаётся предпочтительным.

Важно: выбор режима меняет профиль ошибок. Математические формулы в быстром режиме берутся из текстового слоя PDF, поэтому arXiv-математика падает с 83.9 до 23.4, а в режиме –disable_ocr — до 0.0. Старые сканы остаются самым слабым местом во всех режимах (максимум 43.2).

Ограничения и оговорки

Все опубликованные результаты получены Datalab на собственном оборудовании (один B200) и на одном бенчмарке. Реальная производительность на вашем корпусе документов может отличаться. Командам рекомендуется запустить открытый харнес из репозитория Marker на своих данных, чтобы получить релевантное сравнение.

Marker 2 также содержит breaking changes: требуется Python 3.10+, система сборки переведена с Poetry на uv, удалены конвертер для структурированного извлечения и экстракторы — теперь Datalab предлагает вместо них API или workflow с –use_llm.

Источник: MarkTechPost — Datalab’s Marker 2 vs MinerU, Docling and LiteParse: 76.0 on olmOCR-bench at 5× MinerU’s Throughput (https://www.marktechpost.com/2026/07/24/datalabs-marker-2-vs-mineru-docling-and-liteparse-76-0-on-olmocr-bench-at-5x-minerus-throughput/)