Запись архива

Reflective Recovery: как научить LLM исправлять собственные ошибки без внешних оценщиков

Исследователи представили Reflective Recovery — метод самообучения LLM на собственных неудачных попытках решения задач. Подход ломает «коллапс масштабирования» и позволяет моделям развивать саморефлексию без внешних критиков.

Схема Reflective Recovery: ошибочный путь, обнаружение ошибки, корректировка и успешное решение.
Схема Reflective Recovery: ошибочный путь, обнаружение ошибки, корректировка и успешное решение.
Student Studying in ACES Library (11056363313).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

Проблема: коллапс масштабирования при имитационном обучении

Стандартный подход к улучшению рассуждений у больших языковых моделей (LLM) — дообучение на наборах правильных решений (имитационное обучение). Однако исследователи обнаружили фундаментальное ограничение: когда набор задач ограничен, увеличение количества правильных примеров перестаёт давать прирост качества. Этот эффект назван Scaling Collapse — «коллапс масштабирования». При этом на этапе инференса модель не может гарантировать корректность каждого промежуточного шага, а допущенная ошибка, накапливаясь, ведёт к неверному итогу.

Решение: обучение на собственных ошибках

Авторы работы «Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes» (arXiv:2609.19156) предлагают кардинально иной подход. Вместо того чтобы учить модель только на идеальных траекториях, они используют её же неудачные попытки решения. Суть метода:

Из неудачной траектории извлекается начальный сегмент (первые шаги рассуждения).

Этот сегмент, содержащий ошибки, конкатенируется с исходным промптом.
3. Модели предлагается продолжить рассуждение, но уже с учётом допущенной ранее ошибки.

Такой приём учит модель не просто повторять заученные паттерны, а выявлять и корректировать собственные неверные шаги в процессе рассуждения. Ключевое преимущество — метод полностью самоконтролируемый: не требуется внешних критиков, моделей вознаграждения или разметки.

Результаты: прорыв на бенчмарках и появление саморефлексии

Эксперименты на DeepSeek-R1-Distill-Qwen-7B показали значительное улучшение:

Бенчмарк Без метода С Reflective Recovery
AIME 2025 0% 5%
Minerva 6% 8%

Более важно, что анализ поведения моделей выявил появление эмерджентного поведения — модель начала демонстрировать саморефлексию, которой не наблюдалось при стандартном обучении. Это переход от «запоминания ответов» к «процессуальному рефлексивному рассуждению».

Практическая значимость и ограничения

Метод Reflective Recovery решает фундаментальную проблему — разрыв между идеальными условиями обучения и реальными условиями инференса, где ошибки неизбежны. Однако стоит отметить:

  • Эффективность метода зависит от качества генерации неудачных траекторий (они должны содержать релевантные ошибки, а не шум).
  • На данный момент метод проверен на моделях семейства DeepSeek-R1-Distill; переносимость на другие архитектуры требует дополнительных экспериментов.
  • Авторы не раскрывают, как метод ведёт себя на задачах, требующих длинных цепочек рассуждений (более 100 шагов).

Выводы

Reflective Recovery предлагает элегантный способ превратить недостаток (неизбежность ошибок) в обучающий сигнал. Это не просто очередной приём дообучения, а смена парадигмы: от результато-ориентированного запоминания к процессуально-ориентированной рефлексии. Для разработчиков, работающих с агентами и системами рассуждений, это потенциальный инструмент для создания более устойчивых и самокорректирующихся моделей.

Источники

— Оригинальная статья: arXiv:2609.19156 (https://arxiv.org/abs/2609.19156)
— arXivLabs — платформа для совместной разработки (https://arxiv.org)