Запись архива

Визуальный RAG: разбор туториала по pixel-native индексированию документов

MarkTechPost опубликовал практический разбор pixel-native RAG: рендеринг страниц в изображения, тайлинг, мультимодальные эмбеддинги SigLIP и Qwen3-VL, гибридный поиск FAISS + BM25 и сервис на FastAPI.

Схема пайплайна pixel-native RAG: документы, тайлы, мультимодальные эмбеддинги, FAISS и гибридный поиск
Схема пайплайна pixel-native RAG: документы, тайлы, мультимодальные эмбеддинги, FAISS и гибридный поиск
Divers – Illustrated London News Feb 6 1873-2.PNG | by Unknown artistUnknown artist | wikimedia_commons | Public domain

MarkTechPost 4 августа опубликовал подробное руководство Pixel-Native RAG: A Practical Guide to Visual Document Indexing. В материале показан сквозной пайплайн поиска по документам, который обходится без классического текстового парсинга: веб-страницы и PDF рендерятся в изображения, режутся на перекрывающиеся тайлы, превращаются в мультимодальные эмбеддинги и попадают в индекс FAISS. Задача — сохранить вёрстку, таблицы и визуальные элементы, которые теряются при извлечении текста и фиксированном чанкинге. Для читателей Comrad404 это готовый референс для сборки RAG над смешанным корпусом: сканы, слайды, веб-страницы и «сырые» PDF.

Ключевые факты

Параметр Значение
Публикация MarkTechPost, 4 августа 2026, туториал с кодом
Подход Визуальный: рендеринг страниц, тайлинг, мультимодальные эмбеддинги
Компоненты SigLIP/CLIP/Qwen3-VL, FAISS, OCR-BM25, RRF, FastAPI
Метрики Recall@k и MRR на тестовых запросах

От рендеринга к тайлам

Пайплайн стартует с рендеринга: для веб-страниц используется Playwright Chromium, для PDF — PyMuPDF. Страницы рисуются в масштабе 1.0, затем нарезаются на тайлы размером 1024×1024 пикселя с перекрытием 128 пикселей. Есть ограничения: максимальная высота страницы 24 000 пикселей и не более 12 тайлов на документ. Почти пустые фрагменты отфильтровываются по порогу стандартного отклонения 6.0, похожие тайлы убираются по хеммингову расстоянию 4. Такой подход справляется с многоколоночной вёрсткой, колонтитулами и блоками, где текстовая экстракция ломает порядок чтения.

В примере индексируются пять страниц Wikipedia — о RAG, векторных базах, архитектуре трансформера, фотосинтезе и Дели — плюс синтетический PDF. Этого достаточно, чтобы проверить поиск на разных типах визуального контента, включая схемы и страницы с формулами.

Эмбеддинги, FAISS и гибридный поиск

Базовый эмбеддинг-бэкенд — google/siglip-base-patch16-224, в конфигурации также доступны CLIP и опциональный Qwen/Qwen3-VL-Embedding-2B. Векторы складываются в индекс FAISS с IVF: порог 2000 векторов, поиск nprobe 16. Система достаёт 20 лучших тайлов и агрегирует их до уровня документа, возвращая пять релевантных результатов.

Ключевая особенность — гибридный поиск. Tesseract извлекает текст из тайлов, строится BM25, и разреженные оценки объединяются с плотными через reciprocal rank fusion (k=60, веса 1.0). Это закрывает типичную слабость чистых эмбеддингов: точное совпадение по номерам, идентификаторам и редким терминам.

Оценка и ответы от VLM

Качество поиска проверяется метриками Recall@k и MRR на запросах, привязанных к индексированным документам: фотосинтез, распознавание сканов, векторные базы, self-attention, RAG и Дели. В туториале также предусмотрено обучение лёгкого остаточного адаптера с контрастивным обучением — способ подстроить эмбеддинги под конкретный корпус без переобучения всей модели.

Для генерации ответов есть опциональный шаг: самые сильные тайлы передаются в Qwen/Qwen2.5-VL-3B-Instruct, чтобы модель отвечала с опорой на визуальные фрагменты документа. Поисковая часть оборачивается в веб-сервис на FastAPI, который слушает порт 8000.

Что стоит учесть перед внедрением

Туториал явно ориентирован на ноутбуки: при первом запуске он ставит зависимости, скачивает Playwright Chromium и системный пакет tesseract-ocr, а для Colab использует отдельный асинхронный раннер — из-за конфликта с уже запущенным event loop. Это удобно для прототипа, но не для продакшена: рендеринг и тайлинг добавляют заметные расходы CPU, диска и памяти.

Опциональные модели Qwen3-VL-Embedding-2B и Qwen2.5-VL-3B-Instruct на практике требуют GPU с достаточным объёмом видеопамяти. Б