Запись архива

Cohere выпустила Parse 5 — компактную VLM для разметки PDF и слайдов в Markdown

Parse 5 — 2,3B-параметрическая модель от Cohere, которая преобразует PDF, презентации и изображения в Markdown с HTML-таблицами, координатами рамок и описаниями. API стоит $1,5 за 1000 страниц, а ParseBench — 79,2 балла, но с оговорками.

Интерфейс Cohere Parse 5 с разметкой документа и выводом Markdown
Интерфейс Cohere Parse 5 с разметкой документа и выводом Markdown
Редакционная тематическая обложка COMRAD404

Cohere представила Parse 5 (parse-v5.0) — модель для разметки документов, предназначенную для корпоративного извлечения данных. Это vision language model на 2,3 миллиарда параметров, построенная на архитектуре North-Micro-Vision-Instruct от Cohere Labs. Модель принимает страницу PDF, PPT или JPEG в виде data URI с base64-кодировкой и возвращает Markdown, включающий текст в порядке чтения, таблицы в HTML, списки, пары ключ-значение из форм, описания изображений и координаты ограничивающих рамок. Отдельного этапа OCR не предусмотрено.

Parse 5 доступна через Parse API Cohere, Microsoft Foundry, AWS SageMaker и одноарендный Model Vault. Ожидания или исследовательской лицензии нет — модель сразу запущена в продакшн.

Ключевые факты

Параметр Значение
Параметры 2,3B
Контекстное окно 8192 токена
Размер модели ~4,6 ГБ
Цена API $1,50 за 1000 страниц
Model Vault (Medium) $4/ч или $2500/мес
Model Vault (XL) $7/ч или $4300/мес
ParseBench (три измерения) 79,2

Как работает Parse 5

Parse 5 не использует отдельный OCR-движок. Модель за один проход восстанавливает текст и порядок чтения, таблицы, списки, формы, изображения с подписями и координаты границ страниц и визуальных элементов. Поддерживаются девять языков: арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский и испанский. Для других языков модель работает в режиме zero-shot с меньшей точностью.

Практическое значение имеют два режима вывода. По умолчанию модель возвращает строку Markdown на страницу. При установке output_format=”blocks” возвращаются типизированные блоки: табличный блок содержит HTML-код таблицы, её ограничивающую рамку и описание. Второй режим обеспечивает трассируемость на уровне цитирования — возможность указать, из какой части документа взята конкретная строка.

ParseBench: что показывает цифра 79,2

Cohere приводит показатель ParseBench 79,2, который ставит Parse 5 выше Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) и Databricks AI Parse (72,4). ParseBench — бенчмарк LlamaIndex на ~2078 корпоративных страницах, проверенных вручную. Он оценивает пять измерений: таблицы, диаграммы, точность содержания, семантическую разметку и визуальную привязку.

Цифра 79,2 — среднее по трём измерениям: таблицы, точность содержания и семантическая разметка. Два измерения — диаграммы и визуальная привязка — исключены. Это стандартная практика: Azure при тех же трёх измерениях показывает 74,3, что совпадает с данными Cohere. На полном лидерборде ParseBench те же модели набирают значительно меньше: Mistral OCR 4 — 60,68, Databricks AI Parse — 60,68, Azure Document Intelligence — 59,64. Лидирует LlamaParse Agentic с 84,88. Parse 5 на этом лидерборде пока не представлен.

Таким образом, 79,2 — это заявленный поставщиком показатель на подмножестве бенчмарка, а не результат независимого тестирования. Cohere позиционирует модель по соотношению цены и производительности, а не по пиковой точности.

Цены и экономика развёртывания

Parse API стоит $1,50 за 1000 страниц. Для Model Vault: Medium — $4/ч или $2500/мес, XL — $7/ч или $4300/мес. Точка безубыточности: при $0,0015 за страницу один инстанс Medium окупается при ~1,67 млн страниц в месяц, XL — при ~2,87 млн. Ниже этого порога выгоднее использовать метризованный API. Выше — выделенная инфраструктура становится дешевле, не говоря о требованиях к местонахождению данных, которые обычно и являются основной причиной перехода на Model Vault.

Что это значит для выбора инструмента

Для разработчиков и инженеров, работающих с корпоративными документами, Parse 5 предлагает компактную модель (2,3B, ~4,6 ГБ), которую можно развернуть как через API, так и на выделенных инстансах. Отсутствие отдельного OCR и прямой вывод в Markdown упрощают интеграцию в пайплайны обработки документов. Режим типизированных блоков даёт возможность построения систем с проверяемыми источниками данных.

Однако при оценке качества стоит учитывать, что заявленные 79,2 балла ParseBench относятся к трём из пяти измерений. Для задач, где критичны диаграммы или визуальная привязка, потребуется самостоятельное тестирование на собственных документах.

Источник: MarkTechPost — Cohere Releases Parse 5 (parse-v5.0): A 2.3B Vision Language Model That Turns Enterprise Documents Into Markdown