
Что случилось?
На arXiv опубликована статья arXiv:2607.26253, в которой авторы предлагают метод SARA (Sequential Adaptive Rollout Allocation) для повышения вычислительной эффективности Reinforcement Learning with Verifiable Rewards (RLVR). Проблема: при генерации роллаутов для многих промптов получаются насыщенные группы (все ответы правильные или все неправильные) — они дают нулевую дисперсию награды и не приносят градиентного сигнала. Ранее использовались либо динамическая выборка с перебором (DPS, тратит много роллаутов), либо предсказание сложности до сэмплирования (ненадёжно при смене политики). SARA решает задачу как последовательное выделение бюджета с оптимальной остановкой.
Почему это важно?
Эффективность RLVR упирается в стоимость роллаутов, особенно при обучении на одном GPU. SARA позволяет не тратить полный бюджет на уже решившиеся промпты. Метод использует Beta-апостериор для оценки вероятности успеха, закрытый предиктор эффективности группы и двухпороговое правило типа SPRT. Насыщенные группы отбрасываются после короткого зондирования, а освободившийся бюджет направляется на новые промпты. Дополнительных вычислительных затрат на предсказание не требуется.
Что подтверждено?
В работе приведены теоретические доказательства надёжности отбрасывания, ожидаемой экономии роллаутов, доминирования по yield при фиксированном бюджете и связи yield с нормой градиента GRPO. Эксперименты на математических рассуждениях и планировании с моделями 1.5B и 3B на одном GPU показали: SARA дотягивает до точности DPS (оба ниже DS oracle), но тратит на 22% меньше роллаутов. Композиция SARA + DPS даёт наилучшую точность (чуть выше DS) при 67% сокращении роллаутов — то есть почти равномерная стоимость.
| Пункт | Detail |
|---|---|
| Платформа | arXiv cs.LG |
| Дата публикации | 30 июля 2026 |
| Базовые модели | 5B, 3B |
| Экономия роллаутов vs DPS | 22% |
| Экономия (SARA + DPS) | 67% |
| Теоретические гарантии | abandoned reliability, yield dominance, связь с GRPO |
На что обратить внимание?
Метод проверен на моделях до 3B; масштабирование на 7B+ и влияние на качество финальной политики в долгой перспективе пока не раскрыты. Исходный код не опубликован, но авторы обещают открыть репозиторий. Стоит следить за появлением реализации и тестами на других бенчмарках (например, математических рассуждениях или задачах с верифицируемыми наградами).
Источник: https://arxiv.org/abs/2607.26253
Верификация: https://arxiv.org/