Запись архива

R²Adapter: адаптер для гибридного RAG без лишних затрат

На arXiv появилась статья, в которой описывается R²Adapter — легковесный адаптер, динамически распределяющий запросы между vanilla RAG и graph-based RAG. Результат: до 59% меньше обращений к графовому поиску без потери точности.

Схема работы адаптера R²Adapter: запрос поступает в модуль маршрутизации, часть уходит в vanilla RAG, часть — в graph-based RAG с последующим перезаписыванием uncertain запросов
Схема работы адаптера R²Adapter: запрос поступает в модуль маршрутизации, часть уходит в vanilla RAG, часть — в graph-based RAG с последующим перезаписыванием uncertain запросов
Estimated training cost of some AI models – 2024 AI index.jpg | by Stanford Institute for Human-Centered Artificial Intelligence (permission obtained by email from the AI index research m | wikimedia_commons | CC BY-SA 4.0

На arXiv опубликована статья, представляющая R²Adapter — лёгкий подключаемый модуль для гибридных систем Retrieval-Augmented Generation (RAG). Работа выполнена группой исследователей, которые заметили, что пользовательские запросы сильно различаются по сложности: простые вопросы эффективно обрабатываются vanilla RAG, а многошаговые и реляционные — graph-based RAG, но последний заметно дороже по вычислительным ресурсам и задержкам.

Проблема: фиксированная стратегия неоптимальна

Существующие гибридные подходы полагаются на эвристики или LLM для маршрутизации, что создаёт дополнительную нагрузку и привязывает систему к конкретной модели. Авторы R²Adapter предлагают альтернативу — динамическое распределение запросов без участия LLM на этапе принятия решения.

Как работает R²Adapter

Адаптер состоит из двух компонентов: модуля маршрутизации (Routing) и модуля перезаписи (Rewriting). Модуль маршрутизации оценивает, какой запрос действительно выиграет от графового поиска — остальные отправляются сразу в vanilla RAG. Для запросов, направленных в graph-based RAG, но с неопределённой семантикой, модуль перезаписи преобразует их так, чтобы лучше раскрыть многошаговую структуру. Это делается без дополнительного обучения — адаптер является модель-агностическим и может быть встроен в любую пайплайн.

Экспериментальные результаты

На трёх бенчмарках многошагового Question Answering (мульти-хоп QA) R²Adapter показал снижение использования graph-based RAG на 59% при сохранении сопоставимой точности ответов. Это означает, что система затрачивает меньше ресурсов на графовый поиск, не жертвуя качеством. Важно: авторы подчёркивают, что результативность зависит от качества базовых vanilla и graph-based RAG, а также от разнообразия запросов в датасете.

Практические ограничения

Хотя R²Adapter снижает нагрузку, он не является серебряной пулей. Во-первых, модуль перезаписи может вносить задержку для uncertain запросов. Во-вторых, эффективность маршрутизации зависит от репрезентативности обучающих данных — для незнакомых типов запросов возможны ошибки. Кроме того, эксперименты проводились на трёх бенчмарках, что не гарантирует полного переноса на другие domains. Наконец, код пока не опубликован, что усложняет воспроизведение.

Значение для разработчиков

R²Adapter предлагает компромисс: использовать мощь графового RAG только там, где это действительно нужно, снижая затраты на инфраструктуру. Для продакшен-систем с разными пользовательскими запросами это может быть полезным инструментом, особенно если появятся открытые реализации.

Источники

Оригинальная статья: arXiv:2609.02894 (https://arxiv.org/abs/2609.02894)
Страница arXiv Labs: https://arxiv.org