
В сентябре 2026 года на arXiv опубликован препринт, описывающий Iris-mini и Iris-pro — две поисковые модели размером 35B-A3B и 397B-A17B соответственно. Работа представляет не только веса моделей, но и полный рецепт построения данных и обучения.
Как устроено обучение
Исследователи применили оригинальный метод конструирования задач: из гиперссылочной структуры веб-корпуса строятся multi-hop цепочки по графу сущностей. Каждый не-ответный элемент переписывается в описательную ссылку, чтобы исключить возможность строкового совпадения. В обучающую выборку попадают только те вопросы, которые референсная модель не может решить без подсказок, но успешно решает при наличии подтверждающих свидетельств.
Далее эти вопросы превращаются в траектории, фильтруются на уровне траектории и отдельного шага, после чего применяется supervised fine-tuning (SFT). Затем политика оптимизируется через reinforcement learning (RL) с live-поиском. На этапе RL вознаграждение и суммаризатор наблюдений работают внутри тренировочного кластера, а слишком длинные развёртки прерываются на уровне запроса и возобновляются с зафиксированного префикса на следующем шаге.
Ключевая инновация: SFT-RL climbing
Процедура чередует SFT и RL: самые сложные решённые и наиболее эффективные развёртки каждого раунда RL возвращаются в следующий supervised-проход. Это позволяет модели постепенно наращивать сложность решаемых задач, не теряя ранее приобретённых навыков.
Результаты и контекстное управление
Авторы подчёркивают, что управление контекстом на этапе инференса даёт больший прирост в бенчмарках, чем большинство заявленных архитектурных различий. Поэтому все тесты проводятся как с ним, так и без него, при фиксированном наборе инструментов, лимите контекста и judge-модели.
С включённым управлением контекстом на BrowseComp, BrowseComp-ZH, DeepSearchQA и HLE модели показывают:
— Iris-mini: 82.2, 84.8, 86.9, 52.3
— Iris-pro: 88.6, 85.1, 92.9, 56.4
Это лучшие результаты среди открытых поисковых агентов в своих диапазонах параметров. Важно: результаты получены на едином ReAct-агенте, без суб-агентов и без верификации на тестовом этапе.
Практические ограничения
Хотя результаты впечатляют, стоит учитывать несколько моментов. Во-первых, обучение требует значительных вычислительных ресурсов — модель 397B параметров (с 17B активных) доступна не каждому. Во-вторых, эффективность сильно зависит от качества live-поиска и суммаризатора. В-третьих, бенчмарки типа HLE (52.3 и 56.4) остаются сложными даже для самых мощных моделей.
Когда ждать релиз
Авторы планируют выпустить веса моделей вместе с полным рецептом построения данных, обучения и оценки. Дата релиза пока не объявлена, но работа уже доступна в виде препринта на arXiv.
Источники
— Препринт на arXiv: https://arxiv.org/abs/2609.04304
— Страница arXiv Labs: https://arxiv.org/
