Запись архива

Дистилляция DeepSeek-R1: как R1 «упаковали» в модели 1.5B–70B

Разбираем первый релиз DeepSeek-R1 от 20 января 2025 года: что именно дистиллировали в Qwen и Llama, какие результаты показали модели 1.5B–70B и где у подхода ограничения.

Схема дистилляции DeepSeek-R1: teacher-модель генерирует reasoning traces, из которых через SFT обучают шесть student-моделей Qwen и Llama размеров от 1.5B до 70B

20 января 2025 года DeepSeek выпустила DeepSeek-R1 и шесть дистиллированных моделей на базах Qwen2.5 и Llama 3.x. В этом релизе «дистилляция» означала не сжатие весов teacher-модели, а перенос её паттернов рассуждения в более дешёвые плотные (dense) модели через supervised fine-tuning на данных, сгенерированных R1. Ниже — разбор именно первого релиза 2025 года, а не более поздних обновлений линейки.

Коротко

  • Teacher в этой истории — DeepSeek-R1, mixture-of-experts-модель с 671B общих параметров и 37B активируемых; students — шесть dense-моделей размеров 1.5B, 7B, 8B, 14B, 32B и 70B.
  • По README и карточкам DeepSeek, student-модели получили reasoning-поведение через fine-tuning на примерах, сгенерированных DeepSeek-R1; для Qwen-вариантов в карточках прямо указан объём 800k curated samples.
  • В опубликованных таблицах DeepSeek сильнейшие students — DeepSeek-R1-Distill-Qwen-32B и DeepSeek-R1-Distill-Llama-70B. На выбранных публичных метриках они опережают o1-mini по AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench, но уступают ему по CodeForces rating.
  • Это важный результат для практики, но не доказательство, что маленькая модель «стала R1». Оценка проводилась с большим бюджетом вывода: до 32,768 токенов генерации, temperature 0.6, top-p 0.95 и 64 сэмпла на запрос для pass@1.
  • Позднейшие работы показали, что дистилляция длинных chain-of-thought остаётся чувствительной к размеру student-модели, качеству данных и тому, какие шаги рассуждения вообще стоит учить.

Контекст

Исходная проблема у DeepSeek была двойная. С одной стороны, DeepSeek-R1-Zero показал, что reasoning можно резко поднять reinforcement learning без предварительного supervised fine-tuning; с другой — сам DeepSeek пишет, что у R1-Zero оставались repetition, poor readability и language mixing. Поэтому для DeepSeek-R1 компания добавила cold-start data и собрала пайплайн из двух RL-стадий и двух SFT-стадий.

Для рынка важнее другое: сам DeepSeek-R1 слишком велик для массового локального запуска. В README и карточках модели он описан как MoE с 671B total params и 37B activated params. Поэтому логичный следующий шаг — не пытаться раздавать всем teacher, а перенести его поведение в более дешёвые student-модели.

Здесь и появляется ключевой поворот релиза 20 января 2025 года: DeepSeek открыла не только сам R1, но и шесть distilled-моделей, плюс разрешила коммерческое использование и дальнейшую дистилляцию под MIT. Практический смысл был прост: reasoning перестал быть привязан только к очень большой модели.

Метод

В этом релизе дистилляция устроена довольно прозрачно. По описанию DeepSeek, компания брала reasoning data, сгенерированные DeepSeek-R1, и дообучала на них готовые open-weight базы. То есть речь не о пересчёте весов teacher в меньший размер, а о teacher-generated supervision поверх уже обученных Qwen и Llama.

  1. Teacher: DeepSeek-R1, построенный на отдельном посттренинговом пайплайне с cold-start, двумя RL-стадиями и двумя SFT-стадиями.
  2. Data: reasoning traces, сгенерированные DeepSeek-R1. Для Qwen-вариантов в карточках DeepSeek прямо указано, что они fine-tuned with 800k samples curated with DeepSeek-R1; для Llama-вариантов в той же секции объём не уточняется.
  3. Students: DeepSeek-R1-Distill-Qwen-1.5B, 7B, 14B, 32B; DeepSeek-R1-Distill-Llama-8B и 70B.
  4. Base models: Qwen2.5-Math-1.5B, Qwen2.5-Math-7B, Llama-3.1-8B, Qwen2.5-14B, Qwen2.5-32B и Llama-3.3-70B-Instruct соответственно.
  5. Runtime detail: DeepSeek пишет, что слегка изменила configs и tokenizers, поэтому модели стоит запускать именно с их настройками.

Это важная деталь для интерпретации. Students отличаются не только размером, но и базой: младшие Qwen собраны поверх math-специализированных checkpoints, 32B — уже поверх общего Qwen2.5-32B, а 70B Llama — поверх instruct-модели. Поэтому «силу дистилляции» нельзя полностью отделить от качества выбранной базы.

Результаты

DeepSeek публикует единый протокол оценки в README и карточках моделей: maximum generation length 32,768 tokens, temperature 0.6, top-p 0.95 и 64 ответа на запрос для pass@1. Ниже — укороченная таблица distilled-моделей из релиза; она удобна именно для сравнения student-рядов между собой и с o1-mini и QwQ-32B-Preview.

Модель База AIME 2024 pass@1 MATH-500 pass@1 GPQA Diamond pass@1 LiveCodeBench pass@1 CodeForces rating
o1-mini 63.6 90.0 60.0 53.8 1820
QwQ-32B-Preview 44.0 90.6 54.5 41.9 1316
DeepSeek-R1-Distill-Qwen-1.5B Qwen2.5-Math-1.5B 28.9 83.9 33.8 16.9 954
DeepSeek-R1-Distill-Qwen-7B Qwen2.5-Math-7B 55.5 92.8 49.1 37.6 1189
DeepSeek-R1-Distill-Qwen-14B Qwen2.5-14B 69.7 93.9 59.1 53.1 1481
DeepSeek-R1-Distill-Qwen-32B Qwen2.5-32B 72.6 94.3 62.1 57.2 1691
DeepSeek-R1-Distill-Llama-8B Llama-3.1-8B 50.4 89.1 49.0 39.6 1205
DeepSeek-R1-Distill-Llama-70B Llama-3.3-70B-Instruct 70.0 94.5 65.2 57.5 1633

Если смотреть на Qwen-ветку, рост почти монотонный по всем пяти показателям: от 28.9 до 72.6 на AIME 2024, от 83.9 до 94.3 на MATH-500, от 33.8 до 62.1 на GPQA Diamond, от 16.9 до 57.2 на LiveCodeBench и от 954 до 1691 на CodeForces rating. Это хороший индикатор того, что teacher traces действительно переносятся по size ladder, а не дают случайный выигрыш только одной модели.

Сильнейший Qwen-student, DeepSeek-R1-Distill-Qwen-32B, в таблице DeepSeek выше o1-mini на четырёх из пяти выбранных здесь метрик: AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench. Но по CodeForces rating o1-mini остаётся впереди: 1820 против 1691. Похожая картина и у DeepSeek-R1-Distill-Llama-70B: он выше o1-mini на AIME 2024, MATH-500, GPQA Diamond и LiveCodeBench, но ниже по CodeForces rating.

Важно и то, чего в таблице нет. DeepSeek не публикует рядом базовые Qwen и Llama checkpoints с тем же протоколом на всех этих метриках, поэтому из релиза нельзя точно разложить выигрыш на вклад базы, teacher data и tokenizer/config tweaks. Но в пределах опубликованных чисел релиз убедительно показал: хорошие dense students могут перенести заметную часть reasoning-поведения без полного MoE-teacher.

Интерпретация

Наш комментарий

Главная практическая новость тут не в том, что «маленькие модели внезапно стали умными». Скорее DeepSeek показала продуктовую форму reasoning в open-weight мире: большую teacher-модель можно использовать как генератор данных, а затем распространять более дешёвые students, которые закрывают заметную часть задач.

Для инженера это меняет экономику. Если вам нужен reasoning-подобный режим в локальном или бюджетном развёртывании, student 7B–32B становится отдельной точкой дизайна: хуже teacher, но существенно проще в запуске, обслуживании и планировании latency. Релиз R1 фактически легитимизировал связку сильный teacher → synthetic reasoning data → open student как отдельный посттренинговый маршрут.

Есть и более тонкий вывод. DeepSeek переносит не только качество финального ответа, но и стиль решения: длинное рассуждение, самопроверку, промежуточные шаги. Именно поэтому вокруг R1 почти сразу выросла волна работ уже не про «сделать ещё один большой reasoner», а про «как правильно учить smaller students на длинных CoT».

Ограничения и критика

  • Это не «чистое сжатие» teacher. Students стартуют с разных и уже сильных open-weight баз. Особенно это видно по Qwen2.5-Math и Llama-3.3-70B-Instruct. Поэтому итоговая сила модели — сумма базы и distillation recipe, а не только «магия R1».
  • Публичные числа завязаны на бюджет вывода. DeepSeek оценивает модели с максимумом 32,768 токенов генерации и 64 сэмплами на запрос для pass@1. Для production one-shot поведения это не то же самое, что один жадный или один temperature-controlled запуск.
  • Пайплайн раскрыт не полностью на уровне данных. README и model cards называют базы, объёмы и итоговые оценки, но не публикуют в том же релизе полный датасет teacher traces и не дают детального разложения вклада data curation, prompt templates и tokenizer/config tweaks.
  • Позднейшие исследования показали learnability gap у малых students. В Small Models Struggle to Learn from Strong Reasoners авторы пишут, что малые модели не всегда стабильно выигрывают от long CoT и от distillation from larger teachers; в Capture the Key in Reasoning to Enhance CoT Distillation Generalization показано, что plain SFT on correct CoTs может заставлять student копировать форму рассуждения, а не действительно усваивать ключевые шаги.
  • Рецепт DeepSeek не оказался финальной точкой. По данным одной последующей работы, AM-Distill-Qwen-32B, обученная простым SFT на отдельно собранном reasoning dataset, обошла DeepSeek-R1-Distill-Qwen-32B на AIME2024, MATH-500, GPQA-Diamond и LiveCodeBench. Это не опровержение релиза R1, а скорее сигнал, что качество distilled data и способ их отбора остаются открытой инженерной задачей.

Вывод

В первом релизе DeepSeek-R1 дистилляция означала перенос reasoning-поведения из большого MoE-teacher в серию уже существующих dense-баз Qwen и Llama через teacher-generated supervision. На опубликованных DeepSeek бенчмарках это сработало: особенно у 32B и 70B students, которые приблизились к o1-mini и на части метрик его обошли.

Но практический урок ещё важнее академического: long-CoT distillation работает, только если учитывать размер student-модели, тип базы, качество synthetic data и реальный budget вывода. То есть «упаковка R1» — это не готовая кнопка, а инженерный рецепт со множеством подвижных частей.

Источники

FAQ

Это была дистилляция весов или поведения?

Поведения. DeepSeek дообучала готовые open-weight базы на примерах рассуждения, сгенерированных DeepSeek-R1; это не публикация «сжатой копии» весов 671B teacher-модели.

Почему именно DeepSeek-R1-Distill-Qwen-32B чаще всего обсуждали после релиза?

Потому что в публичной таблице DeepSeek именно этот student дал самый заметный баланс между размером и результатом: он выше o1-mini на нескольких reasoning-бенчмарках, оставаясь при этом плотной 32B-моделью.

Можно ли считать любой R1-distill эквивалентом самого DeepSeek-R1?

Нет. Публичные таблицы показывают близость на части задач, но не доказывают эквивалентность teacher-модели по всему распределению задач и режимов вывода.

Почему важно, что DeepSeek использовала 64 сэмпла на запрос для pass@1?

Потому что такой протокол отражает не только качество весов, но и выигрыш от дополнительного test-time compute. В one-shot продакшн-сценарии абсолютные числа могут вести себя иначе.

Читайте также