Запись архива

DeepSeek V3 и R1: что именно поставило под сомнение «рв» закрытых моделей

Разбираем пакет DeepSeek конца 2024 — января 2025 года: V3, R1 и дистилляты. Не новостной шум, а первоисточники — чтобы понять, что именно сузило «рв» закрытых frontier-моделей.

Схема эволюции DeepSeek от V2 с MLA и DeepSeekMoE к V3 и reasoning-модели R1 с дистилляцией в меньшие открытые модели

Этот разбор ограничен историческим окном конца 2024 — января 2025 года: публичный апдейт DeepSeek-V3 в API 26 декабря 2024 года, arXiv-отчёт от 27 декабря 2024-го, релиз DeepSeek-R1 20 января 2025-го и paper от 22 января 2025-го. Именно этот набор первоисточников и породил тезис, что у закрытых frontier-моделей нет непробиваемого «рва».

Если убрать рыночный шум, картина прозаичнее: DeepSeek показала не «чудо-модель за копейки», а связку из эффективной MoE-архитектуры, инженерии инференса, RL-посттрейнинга и открытой дистилляции. Для практиков важно не то, что «кто-то кого-то шокировал», а какие элементы этого пакета реально меняют экономику и темп разработки.

Коротко

  • В рассматриваемом окне DeepSeek опубликовала два ключевых релиза: DeepSeek-V3 и затем DeepSeek-R1; второй опирается на базу V3 и добавляет reasoning-посттрейнинг с RL.
  • Техническая новизна была не в одном трюке, а в комбинации: MoE, MLA, FP8, балансировка без auxiliary loss и затем reasoning через RL и дистилляцию.
  • По официальной таблице DeepSeek-R1, R1 вышел на уровень, сопоставимый с OpenAI o1-1217 на AIME 2024, MATH-500 и SWE Verified, но не обошёл его везде: на GPQA-Diamond o1-1217 выше.
  • Самый практический сигнал для рынка был не только в флагмане 671B/37B, а в том, что reasoning удалось дистиллировать в открытые dense-модели 32B и 70B.
  • Это не доказывает, что закрытые модели потеряли все преимущества. Скорее, январь 2025 года показал: часть предполагаемого «рва» оказалась уже не продуктовым секретом, а воспроизводимым инженерным пакетом.

Контекст

Под «рвом» в этой статье я имею в виду не юридический термин, а удобную рабочую метафору: сочетание вычислительного бюджета, внутренних датасетов, закрытого посттрейнинга, собственной инфраструктуры инференса и отсутствия открытых весов. До DeepSeek-V3 и DeepSeek-R1 распространённой была гипотеза, что reasoning-уровень закрытых моделей останется API-привилегией крупных лабораторий дольше, чем обычные чат-модели.

Важно и то, что «эффект DeepSeek» не начался с нуля в январе 2025 года. В DeepSeek-V2 авторы уже описали два фундаментальных кирпича: Multi-head Latent Attention (MLA) и DeepSeekMoE. По их данным, относительно DeepSeek 67B это дало 93.3% сокращения KV-cache и 5.76x рост максимальной скорости генерации при более низкой цене обучения; именно на этой базе затем строился V3.

Поэтому корректнее говорить не о «внезапном чуде», а о последовательности: сначала авторы упростили экономику длинного контекста и sparse-вычислений, потом подняли качество открытой модели до уровня, который можно сравнивать с закрытыми системами, а затем показали, что reasoning можно не только держать в API, но и разливать в меньшие открытые модели через дистилляцию.

Метод

Что представлял собой DeepSeek-V3

В техотчёте DeepSeek-V3 описан как MoE-модель с 671B общих параметров и 37B активируемых на токен, с окном контекста 128K и предобучением на 14.8T токенов. Архитектурно V3 сохраняет линию V2: MLA отвечает за более дешёвый инференс и KV-cache, а DeepSeekMoE — за sparse-вычисления в FFN.

Новое в V3, по версии авторов, — это балансировка экспертов без auxiliary loss и Multi-Token Prediction (MTP). Первая часть важна потому, что классическая балансировка в MoE часто улучшает загрузку экспертов ценой деградации качества. Вторая — потому, что MTP одновременно работает как тренировочная цель и как задел под speculative decoding.

С инженерной стороны V3 также важен тем, что DeepSeek прямо подчёркивает FP8-трейнинг. В официальных README и model card указано, что на старте публиковались FP8-веса, для BF16 предлагался отдельный скрипт конвертации, а прямой поддержки в Hugging Face Transformers на тот момент ещё не было. Для практиков это означает простую вещь: «открытые веса» не равны «запустил в любом стеке без трения».

Отдельная деталь, которую полезно не потерять в пересказах: в paper для V3 фигурирует 2.788M H800 GPU-hours как счётчик полного обучения, а в официальном репозитории отдельно вынесены 2.664M H800 GPU-hours на pretraining и ещё 0.1M GPU-hours на последующие стадии. Это близкие, но не идентичные рамки учёта, и их не стоит автоматически превращать в одну «магическую цену модели».

Что добавил DeepSeek-R1

В январе 2025 года DeepSeek сместила фокус с архитектуры на reasoning. В paper DeepSeek-R1 авторы сначала вводят R1-Zero — модель, получающую reasoning-поведение через крупномасштабный RL без предварительного SFT. Затем они отдельно признают ограничения этого подхода: плохую читаемость, повторы и смешение языков. Собственно DeepSeek-R1 — это уже не «чистый RL в проде», а pipeline с cold-start данными и несколькими стадиями RL/SFT.

Ключевой практический ход — дистилляция. Вместе с R1 были опубликованы не только флагманские reasoning-модели, но и шесть меньших dense-чекпоинтов на базах Qwen2.5 и Llama: 1.5B, 7B, 8B, 14B, 32B и 70B. Именно это сильнее всего било по тезису о непроходимом «рве»: если reasoning-паттерны можно сжать в открытые меньшие модели, то барьер для повторного использования резко падает.

Ещё одна полезная для чтения таблиц деталь: в официальной оценке R1 авторы фиксируют максимальную длину генерации 32,768 токенов; для бенчмарков со sampling используется temperature 0.6, top-p 0.95 и 64 ответа на запрос для оценки pass@1. Это не мелочь: сравнение reasoning-моделей очень чувствительно к decoding setup.

Результаты

Если смотреть не на заголовки новостей, а на официальные таблицы DeepSeek-R1, то главный факт января 2025 года выглядел так: R1 действительно подошёл вплотную к o1-1217 на ряде reasoning- и code-задач, но не превзошёл его универсально. Для чистоты ниже я использую только цифры из официальной оценки DeepSeek-R1, где V3, R1 и o1-1217 сведены в один авторский сетап.

Модель Архитектура / размер GPQA-Diamond (Pass@1) AIME 2024 (Pass@1) MATH-500 (Pass@1) SWE Verified (Resolved)
DeepSeek-V3 MoE, 671B total / 37B active 59.1 39.2 90.2 42.0
DeepSeek-R1 MoE, 671B total / 37B active 71.5 79.8 97.3 49.2
OpenAI o1-1217 закрытая reasoning-модель 75.7 79.2 96.4 48.9

Из этой таблицы видно несколько вещей. Во-первых, переход от V3 к R1 — это не косметика: на AIME 2024 скачок идёт с 39.2 до 79.8, на GPQA-Diamond — с 59.1 до 71.5, на SWE Verified — с 42.0 до 49.2. Во-вторых, утверждение о «паритете с o1» требует аккуратности: на AIME 2024, MATH-500 и SWE Verified цифры действительно очень близки или слегка в пользу R1, но на GPQA-Diamond закрытая модель выше.

В кодовых и математических задачах картина похожая. По той же таблице R1 показывает 65.9 на LiveCodeBench (Pass@1-COT) против 63.4 у o1-1217 и 2029 против 2061 на Codeforces rating. То есть речь не о тотальном превосходстве, а о том, что открытая reasoning-модель уже вошла в диапазон, где сравнение с лучшими закрытыми системами перестало выглядеть натяжкой.

Ещё важнее оказались дистилляты. По официальной таблице DeepSeek-R1-Distill-Qwen-32B набирает 72.6 на AIME 2024, 94.3 на MATH-500 и 57.2 на LiveCodeBench; Distill-Llama-70B — 70.0, 94.5 и 57.5 соответственно. Это и был главный удар по идее «закрытый moat = недоступный reasoning»: не только флагман приблизился к o1, но и reasoning стал переносимым в более дешёвые открытые чекпоинты.

Наконец, важно не потерять скромный, но принципиальный факт о V3: ещё до R1 авторы описывали модель как систему, которая сочетает высокое качество с относительно умеренным активным compute на токен и открытой публикацией весов. Даже если не принимать без оговорок авторскую формулировку про «сильнейшую open-source base model», сама комбинация open weights + frontier-adjacent quality + инженерная воспроизводимость инференса уже сужала пространство, в котором закрытые игроки могли рассчитывать только на секретность.

Интерпретация

Наш комментарий

На мой взгляд, DeepSeek подорвала не сам факт существования преимуществ у закрытых лабораторий, а более узкую версию мифа: будто reasoning-фронтир надолго останется возможен только при полностью закрытом стеке. Январь 2025 года показал, что это не так.

  • Архитектурный «рв» сузился, потому что MoE, MLA и aggressive systems engineering уже можно публиковать вместе с весами, а не держать только как внутреннее преимущество.
  • Посттрейнинговый «рв» сузился, потому что RL-reasoning оказался не магией одной компании. Более того, его следы можно дистиллировать в dense-модели меньшего размера.
  • Рыночный «рв» сузился, потому что открытые веса ускоряют вторичное распространение: разработчики могут локально запускать, дообучать, квантовать, строить приватные пайплайны и сравнивать альтернативные serving-стеки.

Но важно не перегнуть вывод. DeepSeek не доказала, что закрытые игроки лишились преимущества в безопасности, мультимодальности, агентности, продуктовой интеграции или масштабе внутренних eval-контуров. Она доказала более локальную вещь: часть того, что казалось «неприступным рвом», оказалось переносимой инженерной практикой.

Ограничения

Первое ограничение очевидно: почти все ключевые цифры здесь — авторские self-reported evaluations из официальных таблиц DeepSeek. Это хорошие первоисточники, но не независимая репликация.

Второе: open weights не равны полностью открытому стеку. Веса, отчёты и инструкции по запуску опубликованы, но полный pretraining corpus, вся процедура его очистки, точная экономика кластера и полный внутренний eval/prompt stack не раскрыты так, чтобы любой воспроизвёл путь от нуля.

Третье: цифры про эффективность легко искажаются в пересказах. Для V3 корректнее говорить о H800 GPU-hours, потому что именно так считают авторы. Перевод этих часов в «полную стоимость создания модели» требует дополнительных данных, которых в первоисточниках нет. Более того, paper и репозиторий используют немного разные рамки учёта для training cost.

Четвёртое: нельзя напрямую смешивать таблицы из разных фаз жизни модели. У DeepSeek-V3 исходный arXiv-submit датирован 27 декабря 2024 года, а R1-paper — 22 января 2025 года. При этом текущие README/model card для V3 уже отражают более позднее состояние репозитория. Для исторического разбора января 2025 года надёжнее опираться на даты в changelog и на R1-таблицу, где V3 и R1 сравниваются в одном наборе оценок.

Пятое: benchmark parity — не то же самое, что product parity. Даже если на AIME, MATH-500 или SWE Verified открытая модель сравнялась с закрытой, это ещё не означает равенство по latency, tool use, SLA, безопасности, мультимодальности или удобству интеграции.

Вывод

В историческом окне конца 2024 — января 2025 года DeepSeek показала не «конец закрытых моделей», а нечто более конкретное и для индустрии, возможно, важнее: reasoning-уровень перестал выглядеть исключительно закрытой привилегией. V3 сузила архитектурный и инфраструктурный разрыв, а R1 и особенно её дистилляты сузили разрыв в посттрейнинге и повторном использовании.

Если формулировать совсем коротко, DeepSeek не уничтожила «рв», а доказала, что он уже не такой широкий, как казалось в 2024 году.

Источники

FAQ

DeepSeek действительно «обошла» закрытые модели?

Не универсально. По официальной таблице R1 близка к o1-1217 или немного выше на AIME 2024, MATH-500 и SWE Verified, но ниже на GPQA-Diamond. Корректнее говорить о частичном паритете на ряде reasoning-задач.

Почему рынок так сильно отреагировал именно на дистилляты?

Потому что дистилляция делает reasoning-поведение переносимым в меньшие и более дешёвые модели. Для разработчиков это важнее символического лидерства флагмана: такие чекпоинты проще запускать, адаптировать и обслуживать.

Можно ли считать DeepSeek полностью открытым стеком?

Нет. Открыты веса, отчёты и часть инженерных инструкций, но это не полная воспроизводимость всего pipeline от датасетов до кластерной экономики и внутренних eval-циклов.

Что из этого важнее всего для практиков в 2026 году?

Не конкретный январский хайп, а урок: разрыв между «закрытым frontier» и «открытым production-grade» может быстро сужаться, если у открытой стороны появляются хорошие базовые архитектуры, сильный посттрейнинг и дистилляция.

Читайте также