Этот разбор ограничен историческим окном конца 2024 — января 2025 года: публичный апдейт DeepSeek-V3 в API 26 декабря 2024 года, arXiv-отчёт от 27 декабря 2024-го, релиз DeepSeek-R1 20 января 2025-го и paper от 22 января 2025-го. Именно этот набор первоисточников и породил тезис, что у закрытых frontier-моделей нет непробиваемого «рва».
Если убрать рыночный шум, картина прозаичнее: DeepSeek показала не «чудо-модель за копейки», а связку из эффективной MoE-архитектуры, инженерии инференса, RL-посттрейнинга и открытой дистилляции. Для практиков важно не то, что «кто-то кого-то шокировал», а какие элементы этого пакета реально меняют экономику и темп разработки.
Коротко
- В рассматриваемом окне DeepSeek опубликовала два ключевых релиза: DeepSeek-V3 и затем DeepSeek-R1; второй опирается на базу V3 и добавляет reasoning-посттрейнинг с RL.
- Техническая новизна была не в одном трюке, а в комбинации: MoE, MLA, FP8, балансировка без auxiliary loss и затем reasoning через RL и дистилляцию.
- По официальной таблице DeepSeek-R1, R1 вышел на уровень, сопоставимый с OpenAI o1-1217 на AIME 2024, MATH-500 и SWE Verified, но не обошёл его везде: на GPQA-Diamond o1-1217 выше.
- Самый практический сигнал для рынка был не только в флагмане 671B/37B, а в том, что reasoning удалось дистиллировать в открытые dense-модели 32B и 70B.
- Это не доказывает, что закрытые модели потеряли все преимущества. Скорее, январь 2025 года показал: часть предполагаемого «рва» оказалась уже не продуктовым секретом, а воспроизводимым инженерным пакетом.
Контекст
Под «рвом» в этой статье я имею в виду не юридический термин, а удобную рабочую метафору: сочетание вычислительного бюджета, внутренних датасетов, закрытого посттрейнинга, собственной инфраструктуры инференса и отсутствия открытых весов. До DeepSeek-V3 и DeepSeek-R1 распространённой была гипотеза, что reasoning-уровень закрытых моделей останется API-привилегией крупных лабораторий дольше, чем обычные чат-модели.
Важно и то, что «эффект DeepSeek» не начался с нуля в январе 2025 года. В DeepSeek-V2 авторы уже описали два фундаментальных кирпича: Multi-head Latent Attention (MLA) и DeepSeekMoE. По их данным, относительно DeepSeek 67B это дало 93.3% сокращения KV-cache и 5.76x рост максимальной скорости генерации при более низкой цене обучения; именно на этой базе затем строился V3.
Поэтому корректнее говорить не о «внезапном чуде», а о последовательности: сначала авторы упростили экономику длинного контекста и sparse-вычислений, потом подняли качество открытой модели до уровня, который можно сравнивать с закрытыми системами, а затем показали, что reasoning можно не только держать в API, но и разливать в меньшие открытые модели через дистилляцию.
Метод
Что представлял собой DeepSeek-V3
В техотчёте DeepSeek-V3 описан как MoE-модель с 671B общих параметров и 37B активируемых на токен, с окном контекста 128K и предобучением на 14.8T токенов. Архитектурно V3 сохраняет линию V2: MLA отвечает за более дешёвый инференс и KV-cache, а DeepSeekMoE — за sparse-вычисления в FFN.
Новое в V3, по версии авторов, — это балансировка экспертов без auxiliary loss и Multi-Token Prediction (MTP). Первая часть важна потому, что классическая балансировка в MoE часто улучшает загрузку экспертов ценой деградации качества. Вторая — потому, что MTP одновременно работает как тренировочная цель и как задел под speculative decoding.
С инженерной стороны V3 также важен тем, что DeepSeek прямо подчёркивает FP8-трейнинг. В официальных README и model card указано, что на старте публиковались FP8-веса, для BF16 предлагался отдельный скрипт конвертации, а прямой поддержки в Hugging Face Transformers на тот момент ещё не было. Для практиков это означает простую вещь: «открытые веса» не равны «запустил в любом стеке без трения».
Отдельная деталь, которую полезно не потерять в пересказах: в paper для V3 фигурирует 2.788M H800 GPU-hours как счётчик полного обучения, а в официальном репозитории отдельно вынесены 2.664M H800 GPU-hours на pretraining и ещё 0.1M GPU-hours на последующие стадии. Это близкие, но не идентичные рамки учёта, и их не стоит автоматически превращать в одну «магическую цену модели».
Что добавил DeepSeek-R1
В январе 2025 года DeepSeek сместила фокус с архитектуры на reasoning. В paper DeepSeek-R1 авторы сначала вводят R1-Zero — модель, получающую reasoning-поведение через крупномасштабный RL без предварительного SFT. Затем они отдельно признают ограничения этого подхода: плохую читаемость, повторы и смешение языков. Собственно DeepSeek-R1 — это уже не «чистый RL в проде», а pipeline с cold-start данными и несколькими стадиями RL/SFT.
Ключевой практический ход — дистилляция. Вместе с R1 были опубликованы не только флагманские reasoning-модели, но и шесть меньших dense-чекпоинтов на базах Qwen2.5 и Llama: 1.5B, 7B, 8B, 14B, 32B и 70B. Именно это сильнее всего било по тезису о непроходимом «рве»: если reasoning-паттерны можно сжать в открытые меньшие модели, то барьер для повторного использования резко падает.
Ещё одна полезная для чтения таблиц деталь: в официальной оценке R1 авторы фиксируют максимальную длину генерации 32,768 токенов; для бенчмарков со sampling используется temperature 0.6, top-p 0.95 и 64 ответа на запрос для оценки pass@1. Это не мелочь: сравнение reasoning-моделей очень чувствительно к decoding setup.
Результаты
Если смотреть не на заголовки новостей, а на официальные таблицы DeepSeek-R1, то главный факт января 2025 года выглядел так: R1 действительно подошёл вплотную к o1-1217 на ряде reasoning- и code-задач, но не превзошёл его универсально. Для чистоты ниже я использую только цифры из официальной оценки DeepSeek-R1, где V3, R1 и o1-1217 сведены в один авторский сетап.
| Модель | Архитектура / размер | GPQA-Diamond (Pass@1) | AIME 2024 (Pass@1) | MATH-500 (Pass@1) | SWE Verified (Resolved) |
|---|---|---|---|---|---|
| DeepSeek-V3 | MoE, 671B total / 37B active | 59.1 | 39.2 | 90.2 | 42.0 |
| DeepSeek-R1 | MoE, 671B total / 37B active | 71.5 | 79.8 | 97.3 | 49.2 |
| OpenAI o1-1217 | закрытая reasoning-модель | 75.7 | 79.2 | 96.4 | 48.9 |
Из этой таблицы видно несколько вещей. Во-первых, переход от V3 к R1 — это не косметика: на AIME 2024 скачок идёт с 39.2 до 79.8, на GPQA-Diamond — с 59.1 до 71.5, на SWE Verified — с 42.0 до 49.2. Во-вторых, утверждение о «паритете с o1» требует аккуратности: на AIME 2024, MATH-500 и SWE Verified цифры действительно очень близки или слегка в пользу R1, но на GPQA-Diamond закрытая модель выше.
В кодовых и математических задачах картина похожая. По той же таблице R1 показывает 65.9 на LiveCodeBench (Pass@1-COT) против 63.4 у o1-1217 и 2029 против 2061 на Codeforces rating. То есть речь не о тотальном превосходстве, а о том, что открытая reasoning-модель уже вошла в диапазон, где сравнение с лучшими закрытыми системами перестало выглядеть натяжкой.
Ещё важнее оказались дистилляты. По официальной таблице DeepSeek-R1-Distill-Qwen-32B набирает 72.6 на AIME 2024, 94.3 на MATH-500 и 57.2 на LiveCodeBench; Distill-Llama-70B — 70.0, 94.5 и 57.5 соответственно. Это и был главный удар по идее «закрытый moat = недоступный reasoning»: не только флагман приблизился к o1, но и reasoning стал переносимым в более дешёвые открытые чекпоинты.
Наконец, важно не потерять скромный, но принципиальный факт о V3: ещё до R1 авторы описывали модель как систему, которая сочетает высокое качество с относительно умеренным активным compute на токен и открытой публикацией весов. Даже если не принимать без оговорок авторскую формулировку про «сильнейшую open-source base model», сама комбинация open weights + frontier-adjacent quality + инженерная воспроизводимость инференса уже сужала пространство, в котором закрытые игроки могли рассчитывать только на секретность.
Интерпретация
Наш комментарий
На мой взгляд, DeepSeek подорвала не сам факт существования преимуществ у закрытых лабораторий, а более узкую версию мифа: будто reasoning-фронтир надолго останется возможен только при полностью закрытом стеке. Январь 2025 года показал, что это не так.
- Архитектурный «рв» сузился, потому что MoE, MLA и aggressive systems engineering уже можно публиковать вместе с весами, а не держать только как внутреннее преимущество.
- Посттрейнинговый «рв» сузился, потому что RL-reasoning оказался не магией одной компании. Более того, его следы можно дистиллировать в dense-модели меньшего размера.
- Рыночный «рв» сузился, потому что открытые веса ускоряют вторичное распространение: разработчики могут локально запускать, дообучать, квантовать, строить приватные пайплайны и сравнивать альтернативные serving-стеки.
Но важно не перегнуть вывод. DeepSeek не доказала, что закрытые игроки лишились преимущества в безопасности, мультимодальности, агентности, продуктовой интеграции или масштабе внутренних eval-контуров. Она доказала более локальную вещь: часть того, что казалось «неприступным рвом», оказалось переносимой инженерной практикой.
Ограничения
Первое ограничение очевидно: почти все ключевые цифры здесь — авторские self-reported evaluations из официальных таблиц DeepSeek. Это хорошие первоисточники, но не независимая репликация.
Второе: open weights не равны полностью открытому стеку. Веса, отчёты и инструкции по запуску опубликованы, но полный pretraining corpus, вся процедура его очистки, точная экономика кластера и полный внутренний eval/prompt stack не раскрыты так, чтобы любой воспроизвёл путь от нуля.
Третье: цифры про эффективность легко искажаются в пересказах. Для V3 корректнее говорить о H800 GPU-hours, потому что именно так считают авторы. Перевод этих часов в «полную стоимость создания модели» требует дополнительных данных, которых в первоисточниках нет. Более того, paper и репозиторий используют немного разные рамки учёта для training cost.
Четвёртое: нельзя напрямую смешивать таблицы из разных фаз жизни модели. У DeepSeek-V3 исходный arXiv-submit датирован 27 декабря 2024 года, а R1-paper — 22 января 2025 года. При этом текущие README/model card для V3 уже отражают более позднее состояние репозитория. Для исторического разбора января 2025 года надёжнее опираться на даты в changelog и на R1-таблицу, где V3 и R1 сравниваются в одном наборе оценок.
Пятое: benchmark parity — не то же самое, что product parity. Даже если на AIME, MATH-500 или SWE Verified открытая модель сравнялась с закрытой, это ещё не означает равенство по latency, tool use, SLA, безопасности, мультимодальности или удобству интеграции.
Вывод
В историческом окне конца 2024 — января 2025 года DeepSeek показала не «конец закрытых моделей», а нечто более конкретное и для индустрии, возможно, важнее: reasoning-уровень перестал выглядеть исключительно закрытой привилегией. V3 сузила архитектурный и инфраструктурный разрыв, а R1 и особенно её дистилляты сузили разрыв в посттрейнинге и повторном использовании.
Если формулировать совсем коротко, DeepSeek не уничтожила «рв», а доказала, что он уже не такой широкий, как казалось в 2024 году.
Источники
- DeepSeek-V3 Technical Report
- GitHub – deepseek-ai/DeepSeek-V3
- deepseek-ai/DeepSeek-V3 — Hugging Face model card
- DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
- GitHub – deepseek-ai/deepseek-v2
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- GitHub – deepseek-ai/DeepSeek-R1
- deepseek-ai/DeepSeek-R1 — Hugging Face model card
- Change Log | DeepSeek API Docs
FAQ
DeepSeek действительно «обошла» закрытые модели?
Не универсально. По официальной таблице R1 близка к o1-1217 или немного выше на AIME 2024, MATH-500 и SWE Verified, но ниже на GPQA-Diamond. Корректнее говорить о частичном паритете на ряде reasoning-задач.
Почему рынок так сильно отреагировал именно на дистилляты?
Потому что дистилляция делает reasoning-поведение переносимым в меньшие и более дешёвые модели. Для разработчиков это важнее символического лидерства флагмана: такие чекпоинты проще запускать, адаптировать и обслуживать.
Можно ли считать DeepSeek полностью открытым стеком?
Нет. Открыты веса, отчёты и часть инженерных инструкций, но это не полная воспроизводимость всего pipeline от датасетов до кластерной экономики и внутренних eval-циклов.
Что из этого важнее всего для практиков в 2026 году?
Не конкретный январский хайп, а урок: разрыв между «закрытым frontier» и «открытым production-grade» может быстро сужаться, если у открытой стороны появляются хорошие базовые архитектуры, сильный посттрейнинг и дистилляция.
