Когда про GRPO заговорили массово, это обычно связывали с DeepSeek-R1 и январём 2025 года. Но исторически метод появился раньше: публично он описан в работе DeepSeekMath, а затем был перенесён в DeepSeek-R1 уже как базовый RL-механизм для reasoning-моделей. Для практиков здесь важен не только бренд DeepSeek, а сама инженерная идея: как упростить PPO так, чтобы reinforcement learning на длинных рассуждениях стал дешевле и масштабируемее.
Ниже мы разбираем именно первоисточники: DeepSeekMath 2024 и DeepSeek-R1 2025/2026, плюс peer-reviewed версию статьи в Nature. Главный вывод такой: GRPO — это не «магия рассуждений», а конкретный способ убрать отдельную value-модель, заменить её внутригрупповой нормализацией наград и тем самым сделать RL для проверяемых задач более практичным.
Коротко
- Насколько можно судить по самим материалам DeepSeek, публично GRPO впервые появляется в arXiv-версии DeepSeekMath от 5 февраля 2024 года; в 2025 году метод стал широко заметен уже через DeepSeek-R1.
- Главное отличие GRPO от PPO: DeepSeek убирает отдельную critic/value-модель и считает advantage относительно группы ответов на один и тот же запрос.
- В DeepSeekMath переход от DeepSeekMath-Instruct 7B к DeepSeekMath-RL 7B дал рост на GSM8K с 82,9% до 88,2%, на MATH с 46,8% до 51,7% и на CMATH с 84,6% до 88,8%.
- В DeepSeek-R1 тот же каркас используется в гораздо более длинном RL: 16 сэмплов на вопрос, до 32 768 токенов на ранних шагах и до 65 536 после 8,2k шага; финальный DeepSeek-R1 показал 79,8 на AIME 2024 Pass@1 и 97,3 на MATH-500 Pass@1.
- Сильная сторона GRPO — задачи с проверяемым ответом. Сами авторы отдельно предупреждают о reward hacking, language mixing и более слабой пригодности чистого RL для открытых, плохо верифицируемых задач.
Контекст
Чтобы понять, зачем DeepSeek вообще понадобился GRPO, полезно вспомнить, где в LLM-пайплайнах обычно используется PPO. После InstructGPT PPO стало стандартной точкой отсчёта для RLHF и постобучения языковых моделей. Но у PPO в LLM-настройке есть цена: кроме policy-модели вам обычно нужен ещё и отдельный value- или critic-компонент, а это дополнительная память, вычисления и нестабильность обучения.
В DeepSeekMath авторы формулируют задачу прямо: им нужен RL-алгоритм, который сохраняет сильные стороны PPO, но упрощает тренировку. В их формулировке GRPO «отказывается от critic-модели» и оценивает baseline по групповым score, что должно уменьшать вычислительную и memory-нагрузку. В peer-reviewed версии DeepSeek-R1 эта же идея повторяется почти теми же словами: GRPO был предложен для упрощения тренировки и снижения resource consumption по сравнению с PPO.
Важный исторический нюанс: источник-подсказка в брифе указывает на DeepSeek 2025, и это оправдано, если говорить о популяризации метода. Но если говорить о происхождении, GRPO надо разбирать начиная с DeepSeekMath, а не с DeepSeek-R1. Иначе теряется главное: R1 не изобрёл GRPO, а масштабировал уже описанную схему на reasoning-модель другого класса.
Почему это особенно важно именно для рассуждений? Потому что reasoning-задачи вроде математики, олимпиадного кода или логики часто допускают верификатор: точный ответ, тесты, компилятор, формальный формат вывода. Там reward можно привязать не к «красоте текста», а к проверяемому результату. Это та среда, где GRPO и вообще RL с verifiable rewards имеют наилучшие шансы работать предсказуемо.
Метод
Идея GRPO проще, чем кажется по формулам. Вместо того чтобы учить отдельную value-модель предсказывать ожидаемую ценность каждого состояния, DeepSeek делает несколько сэмплов ответов на один и тот же вопрос и сравнивает их между собой.
Как это работает по шагам
- Берётся запрос
q. - Старая policy генерирует группу ответов
{o1, o2, ..., oG}. - Каждый ответ получает reward: rule-based или model-based, в зависимости от пайплайна.
- Для каждого ответа считается относительное преимущество не по отдельной value-сети, а по положению внутри группы.
- Policy обновляется PPO-подобным clipped objective с KL-регуляризацией к reference policy.
В упрощённом виде advantage в DeepSeek-R1 и DeepSeekMath задаётся так:
A_i = (r_i - mean(r_1 ... r_G)) / std(r_1 ... r_G)
С инженерной точки зрения здесь три ключевые вещи.
- Нет отдельной value-модели. Это и есть главная экономия относительно actor-critic PPO.
- Baseline относительный, а не абсолютный. Важно не только то, хороший ли ответ вообще, а насколько он лучше или хуже соседних ответов на тот же вопрос.
- KL к reference policy остаётся. GRPO не отказывается от стабилизации полностью; он убирает critic, но не идею ограничивать резкий отрыв новой policy от опорной.
В DeepSeekMath авторы отдельно рассматривают outcome supervision и process supervision. При outcome supervision нормализованный reward вешается на весь ответ целиком. При process supervision reward может приходить по шагам рассуждения, а advantage для токена зависит от последующих step-level reward. Это важно, потому что GRPO у DeepSeek — не только «одна формула», а целый класс обучения вокруг группового сравнения.
В DeepSeek-R1-Zero reward-дизайн ещё строже: rule-based accuracy reward плюс format reward. Для финального DeepSeek-R1 схема становится смешанной: для reasoning-данных сохраняются rule-based reward, а для general data добавляются model-based reward. Кроме того, в первом RL-этапе R1 вводится language consistency reward, потому что без него модель склонна смешивать языки в chain-of-thought.
На уровне training details в DeepSeek-R1 авторы указывают одинаково и в arXiv-версии, и в Nature: learning rate 3×10-6, KL coefficient 0,001 и sampling temperature 1 для rollout; на каждый вопрос берутся 16 сэмплов. Максимальная длина rollout до 8,2k шага составляет 32 768 токенов, после этого — 65 536 токенов; общее обучение идёт 10 400 шагов, при batch size 512 на шаг. Это полезная деталь для практиков: «упрощённый RL» здесь не значит «дешёвый RL» в бытовом смысле. GRPO убирает один крупный компонент, но не отменяет дорогие многократные rollout на длинных ответах.
Результаты
Если смотреть на доказательства по порядку, то первое убедительное свидетельство полезности GRPO приходит из DeepSeekMath. Там RL-модель сравнивается не с абстрактным baseline, а с собственной instruction-tuned версией того же семейства.
| Срез | Метрика | До RL/GRPO | После RL/GRPO | Что показывает |
|---|---|---|---|---|
| DeepSeekMath 7B | GSM8K | 82,9% | 88,2% | Рост на in-domain математике |
| DeepSeekMath 7B | MATH | 46,8% | 51,7% | Рост на competition-level математике |
| DeepSeekMath 7B | CMATH | 84,6% | 88,8% | Перенос на out-of-domain китайскую математику |
Эти цифры совпадают между arXiv-статьёй DeepSeekMath и официальным репозиторием DeepSeek-Math. Для практического чтения это важнее маркетингового тезиса «GRPO работает»: у нас есть конкретный выигрыш на нескольких benchmark и понятный baseline внутри одного семейства моделей.
Вторая ступень — DeepSeek-R1. Здесь ситуация сложнее: финальный R1 строится не только на GRPO, а на многостадийном пайплайне с cold-start SFT, rejection sampling, двумя RL-стадиями и дополнительным general alignment. Поэтому следующую таблицу нельзя читать как «чистую абляцию GRPO против PPO». Это сравнение пайплайна DeepSeek-V3 и финального DeepSeek-R1, где GRPO — ключевой RL-механизм, но не единственный фактор.
| Модель | GPQA Diamond Pass@1 | LiveCodeBench Pass@1-COT | AIME 2024 Pass@1 | MATH-500 Pass@1 |
|---|---|---|---|---|
| DeepSeek-V3 | 59,1 | 36,2 | 39,2 | 90,2 |
| DeepSeek-R1 | 71,5 | 65,9 | 79,8 | 97,3 |
Здесь цифры подтверждаются как arXiv-версией DeepSeek-R1, так и официальным репозиторием DeepSeek-R1; по AIME 2024 и MATH-500 они также совпадают с публикацией в Nature. Для reasoning-практиков важны две интерпретации. Первая: длинный RL-пайплайн с GRPO действительно масштабируется до очень сильных результатов на проверяемых задачах. Вторая: сам факт сильного результата ещё не означает, что именно GRPO даёт весь выигрыш; на масштабе R1 DeepSeek не публикует чистую PPO-vs-GRPO абляцию при прочих равных.
Есть и более тонкий эмпирический сигнал. В DeepSeek-R1-Zero авторы показывают, что по ходу RL увеличиваются и accuracy, и средняя длина ответа. Иными словами, модель начинает «тратить» больше токенов на размышление без явного hand-crafted обучения конкретному стилю рассуждения. Это хорошо согласуется с более широким трендом на test-time compute: обучение поощряет не просто правильный финальный ответ, а стратегии, в которых модель чаще проверяет себя, перебирает альтернативы и возвращается к предыдущим шагам.
Интерпретация
Наш комментарий
На наш взгляд, практическая ценность GRPO не в том, что DeepSeek нашла «новую форму интеллекта», а в другом: команда показала рабочий компромисс между теоретически знакомым PPO и инженерными ограничениями LLM-RL. Если у вас есть задача с надёжным верификатором, отдельная value-сеть действительно может быть не самым выгодным местом для расхода памяти и compute.
Отсюда и более широкий смысл GRPO для reasoning-моделей. DeepSeek фактически делает ставку на три вещи сразу: много rollout на один запрос, относительное сравнение этих rollout внутри группы и максимально проверяемый reward. В таком режиме модель учится не «копировать человеческое объяснение», а искать поведение, которое чаще приводит к правильному ответу.
Важно и то, чего GRPO не обещает. Он не доказывает, что опубликованный chain-of-thought всегда является истинной внутренней причиной ответа. Он не гарантирует перенос на открытые творческие задачи. И он не заменяет весь остальной post-training. Финальный DeepSeek-R1 сам показывает это своим устройством: после R1-Zero DeepSeek пришлось добавлять cold-start данные, новые SFT-стадии и смешанные reward, чтобы улучшить читаемость и поведение модели вне узкого reasoning-режима.
Ограничения
У GRPO есть как минимум четыре существенных ограничения, и почти все они названы самими авторами.
- Зависимость от надёжного reward. В Nature и arXiv-версии DeepSeek-R1 авторы прямо пишут, что pure RL зависит от reliable reward signals. Для writing и других плохо верифицируемых задач такие reward строить трудно.
- Reward hacking. Авторы отдельно предупреждают, что model-based reward легче эксплуатировать по мере обучения. Это одна из причин, почему для reasoning-задач DeepSeek предпочитает rule-based проверку там, где это возможно.
- Language mixing и readability. DeepSeek-R1-Zero показал сильные reasoning-способности, но был плохо читаем и смешивал английский с китайским. Чтобы исправить это, DeepSeek добавляет language consistency reward и дополнительные этапы обучения.
- Нет чистой публичной абляции PPO против GRPO на масштабе R1. Для DeepSeekMath есть достаточно ясный выигрыш от RL-стадии с GRPO относительно Instruct-модели. Но для R1 публичные результаты показывают многостадийный пайплайн целиком, а не лабораторный эксперимент «PPO vs GRPO при одинаковых данных и compute».
Есть и ещё один практический предел. В DeepSeek-R1 авторы признают, что software-engineering benchmarks улучшились не так сильно, как math и coding competition, потому что сами RL-оценки в этом домене слишком медленны. Это хороший reminder: даже удачный RL-алгоритм упирается в стоимость environment и verifier.
Вывод
GRPO стоит понимать не как отдельный мифологизированный «секрет DeepSeek», а как конкретное упрощение PPO для LLM-RL. Оно убирает отдельную value-модель, переводит advantage в режим внутригруппового сравнения и особенно хорошо сочетается с задачами, где correctness можно проверить автоматически.
Если вам нужен короткий итог, он такой: истоки GRPO лежат в DeepSeekMath 2024, а настоящее промышленное значение метод получил через DeepSeek-R1 в 2025 году. Для практиков главный урок не в названии алгоритма, а в дизайне всей системы: verifiable reward, много rollout, жёсткая KL-стабилизация и честное понимание того, где RL действительно уместен, а где без SFT и дополнительных механизмов не обойтись.
Источники
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- GitHub – deepseek-ai/DeepSeek-Math
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning
- GitHub – deepseek-ai/DeepSeek-R1
- Proximal Policy Optimization Algorithms
- Training language models to follow instructions with human feedback
FAQ
GRPO — это просто PPO с другим названием?
Нет. GRPO сохраняет PPO-подобный clipped objective и KL-регуляризацию, но убирает отдельную value-модель и считает advantage через относительное положение ответа внутри группы rollout.
GRPO придумали именно для DeepSeek-R1?
Нет. Популярность метод получил на волне DeepSeek-R1 в 2025 году, но публичное описание появляется раньше — в работе DeepSeekMath 2024.
Можно ли применять GRPO к любым задачам?
Лучше всего он подходит там, где есть хороший верификатор: математика, код, логика, формальные ответы. Для открытых текстовых задач авторы сами отмечают проблемы с reward design и reward hacking.
Доказывает ли GRPO, что модель «реально думает» так, как пишет в chain-of-thought?
Нет. GRPO оптимизирует поведение, связанное с reward, а не философский статус внутренних рассуждений. Наблюдаемый chain-of-thought полезен как тренировочный и диагностический артефакт, но его нельзя автоматически считать полным описанием внутреннего процесса модели.
