Запись архива

LLM под микроскопом: как OCR-шум убивает точность извлечения данных из документов

Новый бенчмарк наглядно демонстрирует, что даже лучшие open-source LLM (Gemma, Qwen2.5, DeepSeek) резко теряют качество при работе с реальным OCR. Исследователи выявили типовые ошибки: галлюцинации, числовые искажения и разрыв пар «ключ-значение».

Сравнение точности LLM при извлечении ключ-значение из документов с разным качеством OCR
Сравнение точности LLM при извлечении ключ-значение из документов с разным качеством OCR
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Что произошло

На arxiv опубликована работа «From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings». Исследователи провели масштабное тестирование open-source LLM на задаче извлечения пар «ключ-значение» (KVP) из документов — как с идеальным текстом, так и с типичным OCR-шумом.

В выборку вошли Gemma, Mistral, Qwen2.5, LLaMA 3 и DeepSeek. Для оценки использовались три бенчмарка: FUNSD, CORD и SROIE. В качестве OCR-движков применялись PaddleOCR, EasyOCR и Tesseract. Контрольные замеры проводились на «золотых» текстовых аннотациях (Gold-text) и на реальном выводе OCR.

Ключевые результаты

При работе с качественным текстом современные LLM демонстрируют высокую семантическую точность, в ряде случаев сопоставимую со специализированными layout-aware системами. Однако при внесении OCR-шума производительность падает драматически, причём разрыв между моделями существенно сокращается.

Авторы выделяют два главных фактора успеха: способность модели к семантическому рассуждению над текстом и сохранение текстовой точности при OCR-ошибках. Увеличение размера модели помогает на чистых данных, но на зашумлённых входных данных прирост нивелируется — доминирующим фактором становится качество распознавания.

Типовые сценарии отказов

Исследователи систематизировали повторяющиеся ошибки:
— Разрыв пар «ключ-значение»: модель теряет связь между меткой и значением при смещении или замене символов.
— Галлюцинации: модель «додумывает» отсутствующие в документе поля.
— Числовые искажения: замена цифр (например, 0 на 8 или 1 на 7) из-за нечёткого OCR.
— Пропуск полей при сильном зашумлении отдельных строк.

Практические выводы

Работа наглядно демонстрирует разрыв между лабораторными условиями и реальным внедрением. Если в датасетах с «золотым» текстом LLM показывают впечатляющие результаты, то в production-сценариях с живым OCR качество падает до неприемлемого уровня.

Авторы подчёркивают: для построения надёжных пайплайнов извлечения данных необходимо совместно улучшать качество OCR, структурное понимание документа и семантические способности LLM. Просто «скормить» вывод OCR большой модели — недостаточно.

Источники

— Оригинальная статья на arXiv: https://arxiv.org/abs/2609.17538
— Используемые бенчмарки: FUNSD, CORD, SROIE