Запись архива

Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо, но восстановление исходного порядка страниц остаётся открытой проблемой.

Khondo benchmark — document packet splitting task
Khondo benchmark — document packet splitting task
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На arXiv вышла статья Khondo — первый бенчмарк для разделения многостраничных PDF-пакетов (document packet splitting) на составляющие документы. Бенчмарк построен на реальных правительственных формах Бангладеш, двуязычных (бенгали + английский) и представленных в виде изображений страниц, а не OCR-текста. Всего 5 схем конкатенации — от последовательной до полностью перемешанной, 14 административных доменов, эталонные границы документов, типы и порядок страниц.

Почему это обсуждают

Задача тривиальна для человека, но для MLLM оказалась нетривиальной. В zero-shot режиме модели неплохо кластеризуют страницы по исходным документам, но почти полностью теряют способность восстановить порядок страниц, если пакет был перемешан. Это указывает на фундаментальное ограничение современных vision-language моделей: они видят страницы как набор фрагментов, но не улавливают последовательность.

Что подтверждено

Эксперименты авторов чётко показывают: явные инструкции про порядок страниц необходимы, но недостаточны. Английские пакеты упорядочиваются надёжнее бенгальских — язык выступает вторичным, но стабильным фактором. Основная трудность — именно реконструкция порядка, а не кластеризация. Датасет и код открыты на Hugging Face, что позволяет проверить результаты и воспроизвести эксперименты.

Что остаётся неясным

Khondo — это только первый шаг. Пока неясно, как поведут себя модели после fine-tuning на этом датасете, и насколько задача решаема для других низкоресурсных языков и более сложных схем перемешивания. Также открыт вопрос: поможет ли добавление сигналов из OCR (номера страниц, водяные знаки) или только визуальный подход сможет достичь человеческого уровня.

Punkt Detail
Платформа arXiv cs.CL
Название Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms
Дата публикации 27 июля 2026
Ключевая находка MLLM хорошо кластеризуют страницы, плохо восстанавливают порядок
Фактор языка Английский упорядочивается надёжнее бенгальского
Открытость Полный датасет и код на Hugging Face
Задача Vision-based document splitting для низкоресурсных языков

Источник: оригинальная статья на arXiv https://arxiv.org/abs/2607.21780. Верификация: датасет и код доступны на Hugging Face https://huggingface.co/datasets/Mausul/khondo.