Запись архива

Исследователи представили Iris-mini и Iris-pro — открытых поисковых агентов нового поколения

Команда исследователей опубликовала архитектуру и рецепт обучения поисковых агентов Iris-mini (35B-A3B) и Iris-pro (397B-A17B). Модели демонстрируют рекордные результаты в бенчмарках BrowseComp, DeepSearchQA и HLE, обходя многих конкурентов без использования суб-агентов и верификации на этапе тестирования.

Схема работы поискового агента Iris: от веб-корпуса к multi-hop вопросам и обучению с подкреплением
Схема работы поискового агента Iris: от веб-корпуса к multi-hop вопросам и обучению с подкреплением
2012 — studying in Howard-Tilton Library New Orleans.jpg | by Tulane Public Relations | wikimedia_commons | CC BY 2.0

В сентябре 2026 года на arXiv опубликован препринт, описывающий Iris-mini и Iris-pro — две поисковые модели размером 35B-A3B и 397B-A17B соответственно. Работа представляет не только веса моделей, но и полный рецепт построения данных и обучения.

Как устроено обучение

Исследователи применили оригинальный метод конструирования задач: из гиперссылочной структуры веб-корпуса строятся multi-hop цепочки по графу сущностей. Каждый не-ответный элемент переписывается в описательную ссылку, чтобы исключить возможность строкового совпадения. В обучающую выборку попадают только те вопросы, которые референсная модель не может решить без подсказок, но успешно решает при наличии подтверждающих свидетельств.

Далее эти вопросы превращаются в траектории, фильтруются на уровне траектории и отдельного шага, после чего применяется supervised fine-tuning (SFT). Затем политика оптимизируется через reinforcement learning (RL) с live-поиском. На этапе RL вознаграждение и суммаризатор наблюдений работают внутри тренировочного кластера, а слишком длинные развёртки прерываются на уровне запроса и возобновляются с зафиксированного префикса на следующем шаге.

Ключевая инновация: SFT-RL climbing

Процедура чередует SFT и RL: самые сложные решённые и наиболее эффективные развёртки каждого раунда RL возвращаются в следующий supervised-проход. Это позволяет модели постепенно наращивать сложность решаемых задач, не теряя ранее приобретённых навыков.

Результаты и контекстное управление

Авторы подчёркивают, что управление контекстом на этапе инференса даёт больший прирост в бенчмарках, чем большинство заявленных архитектурных различий. Поэтому все тесты проводятся как с ним, так и без него, при фиксированном наборе инструментов, лимите контекста и judge-модели.

С включённым управлением контекстом на BrowseComp, BrowseComp-ZH, DeepSearchQA и HLE модели показывают:
— Iris-mini: 82.2, 84.8, 86.9, 52.3
— Iris-pro: 88.6, 85.1, 92.9, 56.4

Это лучшие результаты среди открытых поисковых агентов в своих диапазонах параметров. Важно: результаты получены на едином ReAct-агенте, без суб-агентов и без верификации на тестовом этапе.

Практические ограничения

Хотя результаты впечатляют, стоит учитывать несколько моментов. Во-первых, обучение требует значительных вычислительных ресурсов — модель 397B параметров (с 17B активных) доступна не каждому. Во-вторых, эффективность сильно зависит от качества live-поиска и суммаризатора. В-третьих, бенчмарки типа HLE (52.3 и 56.4) остаются сложными даже для самых мощных моделей.

Когда ждать релиз

Авторы планируют выпустить веса моделей вместе с полным рецептом построения данных, обучения и оценки. Дата релиза пока не объявлена, но работа уже доступна в виде препринта на arXiv.

Источники
— Препринт на arXiv: https://arxiv.org/abs/2609.04304
— Страница arXiv Labs: https://arxiv.org/