После выхода DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning 22 января 2025 года быстро возникла новая мода: «повторить R1 дёшево». Но под этой формулой скрывались разные задачи — восстановить закрытые ингредиенты пайплайна, получить похожее поведение без RL и воспроизвести сам эффект обучения с подкреплением на маленькой среде.
Ниже — исторический обзор именно волны января–марта 2025 года. Я сознательно не смешиваю её с более поздними проектами 2026 года: задача здесь не в том, чтобы выбрать «победителя», а в том, чтобы точно понять, что именно сделали Open-R1, s1 и TinyZero и что их результаты на самом деле доказывают.
Коротко
- Open-R1, s1 и TinyZero решали три разные задачи, хотя все они ссылались на DeepSeek-R1.
- Open-R1 в ранней фазе восстанавливал прежде всего data pipeline и дистилляцию вокруг R1, а не полный end-to-end RL-рецепт.
- s1 показал, что часть «рассуждающего» поведения можно получить через SFT на 1000 примерах и budget forcing, то есть вообще без RL.
- TinyZero воспроизводил скорее эффект R1-Zero на игрушечных проверяемых задачах вроде Countdown, а не широкие результаты на AIME, GPQA или MATH.
- Слово «задёшево» в этих проектах относительное: дешевле фронтирного посттрейна — да; дешево в абсолютном смысле — далеко не всегда.
Контекст
DeepSeek в статье от 22 января 2025 года описала семейство DeepSeek-R1 и отдельно подчеркнула роль обучения с подкреплением в развитии reasoning-поведения. При этом для внешних исследователей оставались неполностью раскрытыми детали сбора данных, точный состав промежуточных датасетов и воспроизводимый открытый пайплайн для повторения результатов на чужой базе.
Именно на этот разрыв и отреагировали открытые проекты. Hugging Face запустила Open-R1 28 января 2025 года как попытку собрать воспроизводимый стек вокруг DeepSeek-R1; работа s1: Simple test-time scaling появилась на arXiv в конце января 2025 года как аргумент, что часть эффекта можно получить гораздо более простым рецептом; TinyZero в те же дни предложил минималистичную RL-репродукцию «aha moment» на узких арифметических задачах.
Здесь важно не спутать уровни сравнения. Ни один из этих проектов не обучал с нуля фронтирную базовую модель масштаба R1. Все они стартовали с уже сильных открытых или доступных моделей и пытались удешевить именно post-training, дистилляцию или локальный RL-этап.
Метод
Open-R1: восстановить открытый пайплайн вокруг R1
В стартовом анонсе Open-R1 Hugging Face прямо пишет, что цель проекта — реконструировать недостающие ингредиенты DeepSeek-R1: датасеты, тренировочный код и оценки. На раннем этапе акцент был не на «чистом RL с нуля», а на сборе синтетических reasoning-трасс от сильной учительской модели и последующей дистилляции в более компактную открытую модель.
Ключевой артефакт ранней фазы — OpenR1-Math-220k. В update #2 и карточке датасета указано, что набор собран на базе 400 тысяч задач из NuminaMath 1.5, из которых после фильтрации получено 220 тысяч математических задач с 2–4 reasoning-трассами от DeepSeek-R1. Там же указано, что генерация шла на кластере в 512 H100. Это уже хорошо показывает: проект был заметно более открытым, чем исходный релиз R1, но слово «дешево» к нему применимо только относительно стоимости полномасштабного frontier-посттрейна.
s1: получить похожее поведение без RL
Авторы s1 выбрали другой маршрут. Они взяли Qwen2.5-32B-Instruct, собрали небольшой набор s1K из 1000 тщательно отобранных примеров с reasoning-трассами от Gemini Thinking Experimental и дообучили модель в режиме SFT. Главная идея заключалась в том, что для части задач важен не столько сложный RL-пайплайн, сколько возможность модели тратить больше вычислений во время ответа.
Для этого в s1 вводится budget forcing: модель можно принудить завершать рассуждение раньше либо, наоборот, продолжать его, добавляя сигнал вроде Wait. В статье это подаётся как простой способ управлять test-time compute без отдельной сложной RL-схемы.
TinyZero: свести R1-Zero к минимальной RL-среде
TinyZero ещё сильнее упрощает постановку. Его авторы прямо описывают проект как репродукцию DeepSeek R1 Zero на задачах Countdown и multiplication. Здесь нет попытки сразу соревноваться на широком наборе академических бенчмарков; ставка делается на проверяемую награду в узкой среде, где можно увидеть, появляется ли у модели самопроверка, поиск и более длинные цепочки решения.
По официальному README, TinyZero использует инфраструктуру veRL и показывает, что модель класса 3B может выработать такие стратегии, тогда как 0.5B, по сообщению авторов, делает это нестабильно или не делает вовсе. Это важный научный редукционизм: проект не повторяет весь DeepSeek-R1, а изолирует гипотезу о том, что некоторые reasoning-паттерны действительно могут возникать из RL на верифицируемой награде.
Результаты
Если свести три проекта в одну таблицу, то становится видно: они сравнимы не по методу один к одному, а по вопросу «какой кусок R1 можно удешевить и открыть».
| Проект | Что именно повторяли | Основной рецепт | Масштаб, о котором сообщают источники | Подтверждённые результаты | Что это не доказывает |
|---|---|---|---|---|---|
| Open-R1 | Открытый data pipeline и дистилляцию вокруг DeepSeek-R1 | Генерация reasoning-трасс DeepSeek-R1 на NuminaMath 1.5, затем SFT для Qwen2.5-Math-7B-Instruct | По update #2 и карточке датасета: 220 тыс. задач, 2–4 траектории на задачу, исходно 400 тыс. задач, генерация на 512 H100 | По таблице Hugging Face в update #2: OpenR1-Qwen-7B получил 90.6 на MATH-500, 36.7 на AIME24 и 40.0 на AIME25; DeepSeek-Distill-Qwen-7B в той же схеме оценки — 91.6, 43.3 и 40.0 | Это не end-to-end реплика R1-Zero/R1; сами авторы показывают расхождение с цифрами DeepSeek из-за другого eval setup |
| s1 | Похожее reasoning-поведение и test-time scaling без RL | SFT на s1K из 1000 примеров + budget forcing | Статья сообщает о 1000 обучающих примерах и обучении за 26 минут на 16 H100 для s1-32B | По статье: s1-32B получил 56.7 на AIME24, 93.0 на MATH500 и 59.6 на GPQA Diamond; budget forcing поднимает AIME24 с 50.0 до 56.7 | Это не воспроизведение RL-рецепта DeepSeek; значительная часть эффекта приходит от качественных teacher traces |
| TinyZero | R1-Zero-подобное emergence на игрушечных верифицируемых задачах | RL на Qwen2.5-base в Countdown и multiplication | По README проекта: 3B-конфигурация обучается на 2 GPU; карточки Countdown-датасетов Hugging Face показывают 490,364 и 449,570 строк в двух версиях | По README, 3B-модель вырабатывает self-verification и search, а 0.5B этого не показывает стабильно; оценку «менее 30 долларов» авторы дают сами, без отдельной независимой верификации в статье | Нет сопоставимых с AIME, GPQA и MATH результатов; из узкой среды нельзя напрямую вывести общий уровень reasoning-модели |
Отдельно стоит зафиксировать главное методическое расхождение. Open-R1 показывает силу открытой дистилляции и реконструкции данных; s1 показывает силу маленького, но качественного SFT-набора вместе с управлением test-time compute; TinyZero показывает, что часть поведения типа R1-Zero может появляться в минимальной RL-среде. Это три разные научные гипотезы, а не три версии одного и того же эксперимента.
Интерпретация
Наш комментарий
Если убрать шум вокруг формулы «мы тоже сделали R1», ранняя картина 2025 года выглядит довольно трезво. Самый воспроизводимый путь к заметному улучшению на сложных reasoning-задачах тогда проходил не через героическое повторение полного RL-пайплайна, а через дистилляцию, качественные teacher traces и более умное расходование вычислений во время ответа.
Open-R1 оказался важен не потому, что доказал возможность «собрать R1 дома», а потому, что сделал видимой настоящую цену скрытого ингредиента: данных. Когда проекту для одного лишь math-корпуса нужны сотни тысяч задач, несколько reasoning-трасс на каждую и кластер из 512 H100 для генерации, становится ясно, что открытость упирается не только в код, но и в стоимость синтетического supervision.
s1, наоборот, был сильным контраргументом против слишком широких выводов из R1. Он показал, что часть того, что пользователи воспринимают как «модель начала думать», можно получить без RL, если дать модели хорошие примеры и позволить ей тратить больше токенов на внутренний ход решения. Это не отменяет RL, но сужает область, где именно он обязателен.
TinyZero важен по другой причине. Он не спорит за лидерство на общих бенчмарках, зато предлагает минимальную лабораторию для проверки идеи об emergent reasoning из RL. Для исследователя это полезнее громких сравнений: проще понять, что именно рождается из reward-сигнала, а что приходит из teacher distillation, масштабной предобученной базы или длинного контекста.
Ограничения
Во-первых, эти три проекта плохо сравниваются «в лоб». Open-R1 в ранней фазе оценивался в math-ориентированной постановке через lighteval; s1 — на AIME24, MATH500 и GPQA Diamond; TinyZero — в игрушечной среде Countdown и multiplication. Сводить их к одной шкале качества было бы некорректно.
Во-вторых, «дешевизна» считается по-разному. В s1 статья даёт понятный ориентир по обучению на 16 H100, но не превращает его в полную калькуляцию всей цепочки. В Open-R1 есть данные по 512 H100 для генерации math-набора, но это только часть общей стоимости. В TinyZero цифра «менее 30 долларов» есть в README, однако в первичных источниках нет отдельной независимой бухгалтерии затрат.
В-третьих, все три проекта сильно зависят от уже существующих сильных базовых моделей или сильных учителей. Поэтому они не отвечают на вопрос, можно ли дешево воспроизвести весь стек DeepSeek-R1, начиная с предобучения базы. Они отвечают только на более узкий вопрос: какой кусок reasoning-поведения можно относительно недорого перенести, усилить или спровоцировать.
В-четвёртых, ранние оценки 2025 года были чувствительны к деталям протокола. Сам Open-R1 в update #2 прямо показывает, что результаты DeepSeek-Distill-Qwen-7B в их lighteval-оценке отличаются от чисел из статьи DeepSeek. Это хороший сигнал осторожности: даже при одинаковом названии модели и бенчмарка цифры могут заметно плавать из-за настроек оценки.
Заключение
Волна Open-R1, s1 и TinyZero была не серией прямых копий DeepSeek-R1, а серией экспериментов по декомпозиции его успеха. Open-R1 вскрывал роль данных и дистилляции, s1 — роль качественных траекторий и test-time compute, TinyZero — роль RL в минимальной верифицируемой среде.
Если запомнить одну мысль, то она такая: в начале 2025 года «повторить R1 задёшево» означало три разные вещи. И самый полезный вывод для практиков не в том, что R1 якобы уже легко реплицируется, а в том, что reasoning можно разложить на несколько более локальных, реально воспроизводимых механизмов.
Источники
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Open-R1: Fully Open Reproduction of DeepSeek-R1
- Open-R1 Update #2: A glimpse into DeepSeek R1’s ingredients
- OpenR1-Math-220k
- s1: Simple test-time scaling
- s1: Simple test-time scaling (EMNLP 2025 paper PDF)
- TinyZero
- Countdown-Tasks-3to4
- Countdown-Tasks-3to4-Unique
FAQ
Open-R1 действительно воспроизвёл DeepSeek-R1?
Не полностью. В ранней фазе 2025 года проект в первую очередь восстанавливал открытый пайплайн данных и дистилляции вокруг R1, а не весь исходный RL-рецепт end-to-end.
s1 — это тоже RL-подход?
Нет. Основная идея s1 — SFT на небольшом наборе качественных reasoning-трасс и управление test-time compute через budget forcing.
TinyZero доказывает, что общий reasoning можно получить на домашнем бюджете?
Нет, такой вывод был бы слишком сильным. TinyZero показывает интересный RL-эффект на узких верифицируемых задачах, но не даёт сопоставимой картины на широких reasoning-бенчмарках.
Что из этого полезнее практику сегодня?
Если вам нужен воспроизводимый инженерный рецепт, наиболее прикладные идеи в этой тройке — дистилляция качественных teacher traces и аккуратное управление test-time budget. Если вас интересует исследовательская механика reasoning, TinyZero полезен как минимальная лаборатория.
