
Проблема: коллапс масштабирования при имитационном обучении
Стандартный подход к улучшению рассуждений у больших языковых моделей (LLM) — дообучение на наборах правильных решений (имитационное обучение). Однако исследователи обнаружили фундаментальное ограничение: когда набор задач ограничен, увеличение количества правильных примеров перестаёт давать прирост качества. Этот эффект назван Scaling Collapse — «коллапс масштабирования». При этом на этапе инференса модель не может гарантировать корректность каждого промежуточного шага, а допущенная ошибка, накапливаясь, ведёт к неверному итогу.
Решение: обучение на собственных ошибках
Авторы работы «Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes» (arXiv:2609.19156) предлагают кардинально иной подход. Вместо того чтобы учить модель только на идеальных траекториях, они используют её же неудачные попытки решения. Суть метода:
Из неудачной траектории извлекается начальный сегмент (первые шаги рассуждения).
Этот сегмент, содержащий ошибки, конкатенируется с исходным промптом.
3. Модели предлагается продолжить рассуждение, но уже с учётом допущенной ранее ошибки.
Такой приём учит модель не просто повторять заученные паттерны, а выявлять и корректировать собственные неверные шаги в процессе рассуждения. Ключевое преимущество — метод полностью самоконтролируемый: не требуется внешних критиков, моделей вознаграждения или разметки.
Результаты: прорыв на бенчмарках и появление саморефлексии
Эксперименты на DeepSeek-R1-Distill-Qwen-7B показали значительное улучшение:
| Бенчмарк | Без метода | С Reflective Recovery |
|---|---|---|
| AIME 2025 | 0% | 5% |
| Minerva | 6% | 8% |
Более важно, что анализ поведения моделей выявил появление эмерджентного поведения — модель начала демонстрировать саморефлексию, которой не наблюдалось при стандартном обучении. Это переход от «запоминания ответов» к «процессуальному рефлексивному рассуждению».
Практическая значимость и ограничения
Метод Reflective Recovery решает фундаментальную проблему — разрыв между идеальными условиями обучения и реальными условиями инференса, где ошибки неизбежны. Однако стоит отметить:
- Эффективность метода зависит от качества генерации неудачных траекторий (они должны содержать релевантные ошибки, а не шум).
- На данный момент метод проверен на моделях семейства DeepSeek-R1-Distill; переносимость на другие архитектуры требует дополнительных экспериментов.
- Авторы не раскрывают, как метод ведёт себя на задачах, требующих длинных цепочек рассуждений (более 100 шагов).
Выводы
Reflective Recovery предлагает элегантный способ превратить недостаток (неизбежность ошибок) в обучающий сигнал. Это не просто очередной приём дообучения, а смена парадигмы: от результато-ориентированного запоминания к процессуально-ориентированной рефлексии. Для разработчиков, работающих с агентами и системами рассуждений, это потенциальный инструмент для создания более устойчивых и самокорректирующихся моделей.
Источники
— Оригинальная статья: arXiv:2609.19156 (https://arxiv.org/abs/2609.19156)
— arXivLabs — платформа для совместной разработки (https://arxiv.org)
