
Что произошло
На arxiv опубликована работа «From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings». Исследователи провели масштабное тестирование open-source LLM на задаче извлечения пар «ключ-значение» (KVP) из документов — как с идеальным текстом, так и с типичным OCR-шумом.
В выборку вошли Gemma, Mistral, Qwen2.5, LLaMA 3 и DeepSeek. Для оценки использовались три бенчмарка: FUNSD, CORD и SROIE. В качестве OCR-движков применялись PaddleOCR, EasyOCR и Tesseract. Контрольные замеры проводились на «золотых» текстовых аннотациях (Gold-text) и на реальном выводе OCR.
Ключевые результаты
При работе с качественным текстом современные LLM демонстрируют высокую семантическую точность, в ряде случаев сопоставимую со специализированными layout-aware системами. Однако при внесении OCR-шума производительность падает драматически, причём разрыв между моделями существенно сокращается.
Авторы выделяют два главных фактора успеха: способность модели к семантическому рассуждению над текстом и сохранение текстовой точности при OCR-ошибках. Увеличение размера модели помогает на чистых данных, но на зашумлённых входных данных прирост нивелируется — доминирующим фактором становится качество распознавания.
Типовые сценарии отказов
Исследователи систематизировали повторяющиеся ошибки:
— Разрыв пар «ключ-значение»: модель теряет связь между меткой и значением при смещении или замене символов.
— Галлюцинации: модель «додумывает» отсутствующие в документе поля.
— Числовые искажения: замена цифр (например, 0 на 8 или 1 на 7) из-за нечёткого OCR.
— Пропуск полей при сильном зашумлении отдельных строк.
Практические выводы
Работа наглядно демонстрирует разрыв между лабораторными условиями и реальным внедрением. Если в датасетах с «золотым» текстом LLM показывают впечатляющие результаты, то в production-сценариях с живым OCR качество падает до неприемлемого уровня.
Авторы подчёркивают: для построения надёжных пайплайнов извлечения данных необходимо совместно улучшать качество OCR, структурное понимание документа и семантические способности LLM. Просто «скормить» вывод OCR большой модели — недостаточно.
Источники
— Оригинальная статья на arXiv: https://arxiv.org/abs/2609.17538
— Используемые бенчмарки: FUNSD, CORD, SROIE
