
Что произошло
На arXiv вышла статья Khondo — первый бенчмарк для разделения многостраничных PDF-пакетов (document packet splitting) на составляющие документы. Бенчмарк построен на реальных правительственных формах Бангладеш, двуязычных (бенгали + английский) и представленных в виде изображений страниц, а не OCR-текста. Всего 5 схем конкатенации — от последовательной до полностью перемешанной, 14 административных доменов, эталонные границы документов, типы и порядок страниц.
Почему это обсуждают
Задача тривиальна для человека, но для MLLM оказалась нетривиальной. В zero-shot режиме модели неплохо кластеризуют страницы по исходным документам, но почти полностью теряют способность восстановить порядок страниц, если пакет был перемешан. Это указывает на фундаментальное ограничение современных vision-language моделей: они видят страницы как набор фрагментов, но не улавливают последовательность.
Что подтверждено
Эксперименты авторов чётко показывают: явные инструкции про порядок страниц необходимы, но недостаточны. Английские пакеты упорядочиваются надёжнее бенгальских — язык выступает вторичным, но стабильным фактором. Основная трудность — именно реконструкция порядка, а не кластеризация. Датасет и код открыты на Hugging Face, что позволяет проверить результаты и воспроизвести эксперименты.
Что остаётся неясным
Khondo — это только первый шаг. Пока неясно, как поведут себя модели после fine-tuning на этом датасете, и насколько задача решаема для других низкоресурсных языков и более сложных схем перемешивания. Также открыт вопрос: поможет ли добавление сигналов из OCR (номера страниц, водяные знаки) или только визуальный подход сможет достичь человеческого уровня.
| Punkt | Detail |
|---|---|
| Платформа | arXiv cs.CL |
| Название | Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms |
| Дата публикации | 27 июля 2026 |
| Ключевая находка | MLLM хорошо кластеризуют страницы, плохо восстанавливают порядок |
| Фактор языка | Английский упорядочивается надёжнее бенгальского |
| Открытость | Полный датасет и код на Hugging Face |
| Задача | Vision-based document splitting для низкоресурсных языков |
Источник: оригинальная статья на arXiv https://arxiv.org/abs/2607.21780. Верификация: датасет и код доступны на Hugging Face https://huggingface.co/datasets/Mausul/khondo.