Запись архива

SARA: последовательное адаптивное выделение бюджетов для RLVR

Исследователи предложили метод SARA, который сокращает расход роллаутов в RLVR за счёт раннего определения насыщенных групп и перераспределения бюджета. На моделях 1.5B и 3B метод показал экономию до 67% роллаутов при сохранении точности.

Схема метода SARA: последовательное выделение бюджетов на роллауты в RLVR
Схема метода SARA: последовательное выделение бюджетов на роллауты в RLVR
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что случилось?

На arXiv опубликована статья arXiv:2607.26253, в которой авторы предлагают метод SARA (Sequential Adaptive Rollout Allocation) для повышения вычислительной эффективности Reinforcement Learning with Verifiable Rewards (RLVR). Проблема: при генерации роллаутов для многих промптов получаются насыщенные группы (все ответы правильные или все неправильные) — они дают нулевую дисперсию награды и не приносят градиентного сигнала. Ранее использовались либо динамическая выборка с перебором (DPS, тратит много роллаутов), либо предсказание сложности до сэмплирования (ненадёжно при смене политики). SARA решает задачу как последовательное выделение бюджета с оптимальной остановкой.

Почему это важно?

Эффективность RLVR упирается в стоимость роллаутов, особенно при обучении на одном GPU. SARA позволяет не тратить полный бюджет на уже решившиеся промпты. Метод использует Beta-апостериор для оценки вероятности успеха, закрытый предиктор эффективности группы и двухпороговое правило типа SPRT. Насыщенные группы отбрасываются после короткого зондирования, а освободившийся бюджет направляется на новые промпты. Дополнительных вычислительных затрат на предсказание не требуется.

Что подтверждено?

В работе приведены теоретические доказательства надёжности отбрасывания, ожидаемой экономии роллаутов, доминирования по yield при фиксированном бюджете и связи yield с нормой градиента GRPO. Эксперименты на математических рассуждениях и планировании с моделями 1.5B и 3B на одном GPU показали: SARA дотягивает до точности DPS (оба ниже DS oracle), но тратит на 22% меньше роллаутов. Композиция SARA + DPS даёт наилучшую точность (чуть выше DS) при 67% сокращении роллаутов — то есть почти равномерная стоимость.

Пункт Detail
Платформа arXiv cs.LG
Дата публикации 30 июля 2026
Базовые модели 5B, 3B
Экономия роллаутов vs DPS 22%
Экономия (SARA + DPS) 67%
Теоретические гарантии abandoned reliability, yield dominance, связь с GRPO

На что обратить внимание?

Метод проверен на моделях до 3B; масштабирование на 7B+ и влияние на качество финальной политики в долгой перспективе пока не раскрыты. Исходный код не опубликован, но авторы обещают открыть репозиторий. Стоит следить за появлением реализации и тестами на других бенчмарках (например, математических рассуждениях или задачах с верифицируемыми наградами).

Источник: https://arxiv.org/abs/2607.26253
Верификация: https://arxiv.org/