20 января 2025 года DeepSeek выпустила DeepSeek-R1 и шесть дистиллированных моделей на базах Qwen2.5 и Llama 3.x. В этом релизе «дистилляция» означала не сжатие весов teacher-модели, а перенос её паттернов рассуждения в более дешёвые плотные (dense) модели через supervised fine-tuning на данных, сгенерированных R1. Ниже — разбор именно первого релиза 2025 года, а не более поздних обновлений линейки.
Коротко
- Teacher в этой истории — DeepSeek-R1, mixture-of-experts-модель с 671B общих параметров и 37B активируемых; students — шесть dense-моделей размеров 1.5B, 7B, 8B, 14B, 32B и 70B.
- По README и карточкам DeepSeek, student-модели получили reasoning-поведение через fine-tuning на примерах, сгенерированных DeepSeek-R1; для Qwen-вариантов в карточках прямо указан объём 800k curated samples.
- В опубликованных таблицах DeepSeek сильнейшие students — DeepSeek-R1-Distill-Qwen-32B и DeepSeek-R1-Distill-Llama-70B. На выбранных публичных метриках они опережают o1-mini по AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench, но уступают ему по CodeForces rating.
- Это важный результат для практики, но не доказательство, что маленькая модель «стала R1». Оценка проводилась с большим бюджетом вывода: до 32,768 токенов генерации, temperature 0.6, top-p 0.95 и 64 сэмпла на запрос для pass@1.
- Позднейшие работы показали, что дистилляция длинных chain-of-thought остаётся чувствительной к размеру student-модели, качеству данных и тому, какие шаги рассуждения вообще стоит учить.
Контекст
Исходная проблема у DeepSeek была двойная. С одной стороны, DeepSeek-R1-Zero показал, что reasoning можно резко поднять reinforcement learning без предварительного supervised fine-tuning; с другой — сам DeepSeek пишет, что у R1-Zero оставались repetition, poor readability и language mixing. Поэтому для DeepSeek-R1 компания добавила cold-start data и собрала пайплайн из двух RL-стадий и двух SFT-стадий.
Для рынка важнее другое: сам DeepSeek-R1 слишком велик для массового локального запуска. В README и карточках модели он описан как MoE с 671B total params и 37B activated params. Поэтому логичный следующий шаг — не пытаться раздавать всем teacher, а перенести его поведение в более дешёвые student-модели.
Здесь и появляется ключевой поворот релиза 20 января 2025 года: DeepSeek открыла не только сам R1, но и шесть distilled-моделей, плюс разрешила коммерческое использование и дальнейшую дистилляцию под MIT. Практический смысл был прост: reasoning перестал быть привязан только к очень большой модели.
Метод
В этом релизе дистилляция устроена довольно прозрачно. По описанию DeepSeek, компания брала reasoning data, сгенерированные DeepSeek-R1, и дообучала на них готовые open-weight базы. То есть речь не о пересчёте весов teacher в меньший размер, а о teacher-generated supervision поверх уже обученных Qwen и Llama.
- Teacher: DeepSeek-R1, построенный на отдельном посттренинговом пайплайне с cold-start, двумя RL-стадиями и двумя SFT-стадиями.
- Data: reasoning traces, сгенерированные DeepSeek-R1. Для Qwen-вариантов в карточках DeepSeek прямо указано, что они fine-tuned with 800k samples curated with DeepSeek-R1; для Llama-вариантов в той же секции объём не уточняется.
- Students: DeepSeek-R1-Distill-Qwen-1.5B, 7B, 14B, 32B; DeepSeek-R1-Distill-Llama-8B и 70B.
- Base models: Qwen2.5-Math-1.5B, Qwen2.5-Math-7B, Llama-3.1-8B, Qwen2.5-14B, Qwen2.5-32B и Llama-3.3-70B-Instruct соответственно.
- Runtime detail: DeepSeek пишет, что слегка изменила configs и tokenizers, поэтому модели стоит запускать именно с их настройками.
Это важная деталь для интерпретации. Students отличаются не только размером, но и базой: младшие Qwen собраны поверх math-специализированных checkpoints, 32B — уже поверх общего Qwen2.5-32B, а 70B Llama — поверх instruct-модели. Поэтому «силу дистилляции» нельзя полностью отделить от качества выбранной базы.
Результаты
DeepSeek публикует единый протокол оценки в README и карточках моделей: maximum generation length 32,768 tokens, temperature 0.6, top-p 0.95 и 64 ответа на запрос для pass@1. Ниже — укороченная таблица distilled-моделей из релиза; она удобна именно для сравнения student-рядов между собой и с o1-mini и QwQ-32B-Preview.
| Модель | База | AIME 2024 pass@1 | MATH-500 pass@1 | GPQA Diamond pass@1 | LiveCodeBench pass@1 | CodeForces rating |
|---|---|---|---|---|---|---|
| o1-mini | — | 63.6 | 90.0 | 60.0 | 53.8 | 1820 |
| QwQ-32B-Preview | — | 44.0 | 90.6 | 54.5 | 41.9 | 1316 |
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | 28.9 | 83.9 | 33.8 | 16.9 | 954 |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5-Math-7B | 55.5 | 92.8 | 49.1 | 37.6 | 1189 |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5-14B | 69.7 | 93.9 | 59.1 | 53.1 | 1481 |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5-32B | 72.6 | 94.3 | 62.1 | 57.2 | 1691 |
| DeepSeek-R1-Distill-Llama-8B | Llama-3.1-8B | 50.4 | 89.1 | 49.0 | 39.6 | 1205 |
| DeepSeek-R1-Distill-Llama-70B | Llama-3.3-70B-Instruct | 70.0 | 94.5 | 65.2 | 57.5 | 1633 |
Если смотреть на Qwen-ветку, рост почти монотонный по всем пяти показателям: от 28.9 до 72.6 на AIME 2024, от 83.9 до 94.3 на MATH-500, от 33.8 до 62.1 на GPQA Diamond, от 16.9 до 57.2 на LiveCodeBench и от 954 до 1691 на CodeForces rating. Это хороший индикатор того, что teacher traces действительно переносятся по size ladder, а не дают случайный выигрыш только одной модели.
Сильнейший Qwen-student, DeepSeek-R1-Distill-Qwen-32B, в таблице DeepSeek выше o1-mini на четырёх из пяти выбранных здесь метрик: AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench. Но по CodeForces rating o1-mini остаётся впереди: 1820 против 1691. Похожая картина и у DeepSeek-R1-Distill-Llama-70B: он выше o1-mini на AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench, но ниже по CodeForces rating.
Важно и то, чего в таблице нет. DeepSeek не публикует рядом базовые Qwen и Llama checkpoints с тем же протоколом на всех этих метриках, поэтому из релиза нельзя точно разложить выигрыш на вклад базы, teacher data и tokenizer/config tweaks. Но в пределах опубликованных чисел релиз убедительно показал: хорошие dense students могут перенести заметную часть reasoning-поведения без полного MoE-teacher.
Интерпретация
Наш комментарий
Главная практическая новость тут не в том, что «маленькие модели внезапно стали умными». Скорее DeepSeek показала продуктовую форму reasoning в open-weight мире: большую teacher-модель можно использовать как генератор данных, а затем распространять более дешёвые students, которые закрывают заметную часть задач.
Для инженера это меняет экономику. Если вам нужен reasoning-подобный режим в локальном или бюджетном развёртывании, student 7B–32B становится отдельной точкой дизайна: хуже teacher, но существенно проще в запуске, обслуживании и планировании latency. Релиз R1 фактически легитимизировал связку сильный teacher → synthetic reasoning data → open student как отдельный посттренинговый маршрут.
Есть и более тонкий вывод. DeepSeek переносит не только качество финального ответа, но и стиль решения: длинное рассуждение, самопроверку, промежуточные шаги. Именно поэтому вокруг R1 почти сразу выросла волна работ уже не про «сделать ещё один большой reasoner», а про «как правильно учить smaller students на длинных CoT».
Ограничения и критика
- Это не «чистое сжатие» teacher. Students стартуют с разных и уже сильных open-weight баз. Особенно это видно по Qwen2.5-Math и Llama-3.3-70B-Instruct. Поэтому итоговая сила модели — сумма базы и distillation recipe, а не только «магия R1».
- Публичные числа завязаны на бюджет вывода. DeepSeek оценивает модели с максимумом 32,768 токенов генерации и 64 сэмплами на запрос для pass@1. Для production one-shot поведения это не то же самое, что один жадный или один temperature-controlled запуск.
- Пайплайн раскрыт не полностью на уровне данных. README и model cards называют базы, объёмы и итоговые оценки, но не публикуют в том же релизе полный датасет teacher traces и не дают детального разложения вклада data curation, prompt templates и tokenizer/config tweaks.
- Позднейшие исследования показали learnability gap у малых students. В Small Models Struggle to Learn from Strong Reasoners авторы пишут, что малые модели не всегда стабильно выигрывают от long CoT и от distillation from larger teachers; в Capture the Key in Reasoning to Enhance CoT Distillation Generalization показано, что plain SFT on correct CoTs может заставлять student копировать форму рассуждения, а не действительно усваивать ключевые шаги.
- Рецепт DeepSeek не оказался финальной точкой. По данным одной последующей работы, AM-Distill-Qwen-32B, обученная простым SFT на отдельно собранном reasoning dataset, обошла DeepSeek-R1-Distill-Qwen-32B на AIME2024, MATH-500, GPQA-Diamond и LiveCodeBench. Это не опровержение релиза R1, а скорее сигнал, что качество distilled data и способ их отбора остаются открытой инженерной задачей.
Вывод
В первом релизе DeepSeek-R1 дистилляция означала перенос reasoning-поведения из большого MoE-teacher в серию уже существующих dense-баз Qwen и Llama через teacher-generated supervision. На опубликованных DeepSeek бенчмарках это сработало: особенно у 32B и 70B students, которые приблизились к o1-mini и на части метрик его обошли.
Но практический урок ещё важнее академического: long-CoT distillation работает, только если учитывать размер student-модели, тип базы, качество synthetic data и реальный budget вывода. То есть «упаковка R1» — это не готовая кнопка, а инженерный рецепт со множеством подвижных частей.
Источники
- DeepSeek-R1 Release | DeepSeek API Docs
- Change Log | DeepSeek API Docs
- deepseek-ai/DeepSeek-R1 README
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- deepseek-ai/DeepSeek-R1 · Hugging Face
- deepseek-ai/DeepSeek-R1-Distill-Qwen-32B · Hugging Face
- Small Models Struggle to Learn from Strong Reasoners
- Capture the Key in Reasoning to Enhance CoT Distillation Generalization
- 1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training
FAQ
Это была дистилляция весов или поведения?
Поведения. DeepSeek дообучала готовые open-weight базы на примерах рассуждения, сгенерированных DeepSeek-R1; это не публикация «сжатой копии» весов 671B teacher-модели.
Почему именно DeepSeek-R1-Distill-Qwen-32B чаще всего обсуждали после релиза?
Потому что в публичной таблице DeepSeek именно этот student дал самый заметный баланс между размером и результатом: он выше o1-mini на нескольких reasoning-бенчмарках, оставаясь при этом плотной 32B-моделью.
Можно ли считать любой R1-distill эквивалентом самого DeepSeek-R1?
Нет. Публичные таблицы показывают близость на части задач, но не доказывают эквивалентность teacher-модели по всему распределению задач и режимов вывода.
Почему важно, что DeepSeek использовала 64 сэмпла на запрос для pass@1?
Потому что такой протокол отражает не только качество весов, но и выигрыш от дополнительного test-time compute. В one-shot продакшн-сценарии абсолютные числа могут вести себя иначе.
