Запись архива

Marker 2 от Datalab: обновлённый open-source пайплайн для документов обходит MinerU, Docling и LiteParse по скорости и точности

Datalab выпустил Marker 2 — полный рефакторинг пайплайна конвертации PDF, изображений и документов. На бенчмарке olmOCR-bench balanced-режим показал 76,0% точности при 2,9 страницах в секунду на одном B200, что в 5,4 раза быстрее MinerU и значительно точнее Docling. Разбираем, как изменился инструмент и что это значит

График сравнения производительности Marker 2, MinerU, Docling и LiteParse на бенчмарке olmOCR-bench: точность в процентах по оси Y, скорость в страницах в секунду по оси X
График сравнения производительности Marker 2, MinerU, Docling и LiteParse на бенчмарке olmOCR-bench: точность в процентах по оси Y, скорость в страницах в секунду по оси X
189es – British Airways Boeing 737-436, G-DOCL@LHR,02.10.2002 – Flickr – Aero Icarus.jpg | by Aero Icarus from Zürich, Switzerland | wikimedia_commons | CC BY-SA 2.0

Команда Datalab представила Marker 2 — полную переработку своего open-source пайплайна для конвертации PDF, изображений, DOCX, PPTX, XLSX, HTML и EPUB в Markdown, JSON, HTML или чанки. Вместо одного универсального режима теперь доступны три: balanced (сбалансированный по точности и скорости), fast (без VLM-OCR) и CPU-only. Главные цифры: balanced-режим набирает 76,0% на бенчмарке olmOCR-bench и выдаёт 2,9 страницы в секунду на одном GPU B200 — это в 5,4 раза быстрее MinerU (0,54 стр/сек) и при этом точнее (72,7% у MinerU). Docling на том же стенде показывает 50,3% при 2,1 стр/сек. LiteParse, напротив, жертвует точностью ради скорости: без OCR он выдаёт 1721 стр/сек на CPU, но набирает лишь 22,4%.

Ключевые факты

Параметр Marker 2 (balanced) MinerU (pipeline) Docling LiteParse (CPU, без OCR)
Точность (olmOCR-bench, общая) 76,0% 72,7% 50,3% 22,4%
Точность (born-digital PDF) 83,5% 83,3% 64,0%
Скорость (стр/сек) 2,9 (B200) 0,54 (B200) 2,1 (B200) 1721 (CPU)
Условия GPU, Surya OCR 2 + layout model pipeline backend default pipeline Rust, без VLM

Что изменилось в Marker 2

Ключевое архитектурное решение — разделение пайплайна на три компонента, которые Datalab выпускал по отдельности в последние месяцы: Surya OCR 2 (модель распознавания), быстрая layout-модель на 20 млн параметров, и переписанный pdftext, который стал в 3 раза быстрее предыдущей версии. Вместо монолитного процесса теперь используется несколько лёгких CPU-воркеров, которые делят один инференс-сервер Surya. Родительский процесс управляет конкурентностью VLM-вызовов, поэтому пропускная способность растёт с ёмкостью сервера, а не упирается в VRAM на процесс. В результате balanced-режим выдерживает ~2,9 стр/сек против ~0,3 стр/сек при последовательной обработке на том же железе.

Второе важное изменение — полноценная поддержка CPU. Режим fast с флагом –disable_ocr не требует GPU и инференс-сервера, но layout-модель на 20 млн параметров всё равно распознаёт колонки, таблицы и заголовки на процессоре. Это позволяет Marker 2 на CPU набирать 43,6% против 22,4% у LiteParse и 20,4% у LiteParse без OCR.

Третье — смена инфраструктуры сборки: теперь требуется Python 3.10+, пакетный менеджер uv вместо Poetry, хотя pip install marker-pdf остаётся без изменений. Удалён конвертер structured-extraction — Datalab рекомендует вместо него использовать хостируемый API или флаг –use_llm.

Бенчмарк и методология

Все результаты получены на olmOCR-bench — наборе из 1403 PDF-файлов с примерно 8400 тестами pass/fail от Allen AI (Ai2). Бенчмарк покрывает восемь категорий: отображение математических формул, структура таблиц, порядок чтения, заголовки и футеры, старые сканы. Итоговая оценка — макро-усреднение по категориям. Datalab подчёркивает, что все цифры воспроизводимы: в репозитории Marker есть скрипты для запуска конкурентов (MinerU, Docling, LiteParse) на том же железе. Важно: тесты проводились на одном хосте с B200, а результаты на собственном корпусе документов могут отличаться.

Сравнение с конкурентами: кому что подходит

MinerU — ближайший архитектурный аналог: оба используют текстовый слой PDF и выборочный OCR. Marker balanced выигрывает по общей точности (76,0 vs 72,7) и с большим отрывом по скорости (2,9 vs 0,54 стр/сек). На born-digital PDF они практически равны (83,5 vs 83,3). Однако у MinerU есть VLM-бекенд, который по заявлению Datalab даёт более высокую точность — этот режим не участвовал в сравнении. Командам, у которых много born-digital документов, стоит тестировать оба инструмента на своём корпусе.

Docling — самый широкий по охвату форматов (включает аудио и email), но заметно уступает по точности (50,3% против 76,0%) и скорости (2,1 против 2,9 стр/сек). Его сильная сторона — лицензия MIT, происхождение от IBM Research и управление под эгидой LF AI & Data Foundation. Если приоритет — governance и поддержка редких форматов, Docling остаётся вариантом, но для точной конвертации научных PDF или финансовых документов он проигрывает.

LiteParse — экстремально быстрый парсер на Rust, но без модели разметки. Он не обрабатывает нелинейную структуру, поэтому на таблицах, многоколоночных страницах и математике падает. Marker 2 в CPU-режиме более чем вдвое точнее (43,6% против 22,4%) при скорости, достаточной для batch-обработки. Для сценариев, где важна только скорость и документы простые (одноколоночный текст без таблиц), LiteParse может быть оправдан.

Ограничения и нюансы

Marker 2 — это пайплайн, а не VLM. Для максимальной точности (сканы, математика, сложная вёрстка) Datalab рекомендует свою хостируемую модель Chandra 2 (85,8% на olmOCR-bench) или Gemini Flash 3.5 (76,4%). Однако balanced-режим Marker 2 отстаёт от Gemini Flash всего на 0,4 процентных пункта (76,0 vs 76,4) и даже опережает его на born-digital документах (83,5 vs 79,1) — без затрат на API-запросы.

Слабое место fast-режима — математика: точность падает с 83,9% до 23,4%, а при –disable_ocr — до 0,0% по дизайну. Для arXiv-статей этот режим не подходит. Старые сканы — проблемная категория для всех пайплайнов: лучший результат — 43,2% в balanced-режиме.

Источник: MarkTechPost — Datalab Marker v2 vs MinerU, Docling, and Liteparse: Benchmark Breakdown