DeepSeek анонсировала DeepSeek-V3 26 декабря 2024 года, а технический отчёт был подан на arXiv 27 декабря 2024 года и обновлён 18 февраля 2025 года. Этот разбор касается именно того исторического среза, а не более поздних итераций линейки V3.
Главный повод для шума был не только в качестве модели, но и в цифре стоимости: 2.788M H800 GPU-hours, оценённых авторами в $5.576M при ставке $2 за GPU-hour. Для практиков здесь важнее не сам заголовок про «дешёвый фронтир», а то, как DeepSeek сочетает sparse-архитектуру, FP8-обучение и инженерную оптимизацию кластера.
Коротко
- DeepSeek-V3 — это MoE-модель с 671B общих параметров и 37B активируемых на токен; в основе лежат MLA и DeepSeekMoE, унаследованные от DeepSeek-V2.
- Новые элементы относительно V2 — auxiliary-loss-free балансировка экспертов и multi-token prediction (MTP) как дополнительная цель обучения.
- По собственным таблицам DeepSeek и официальной модельной карточке, V3 была сильнейшей открытой моделью на ряде бенчмарков конца 2024 года и часто подходила вплотную к Claude-3.5-Sonnet-1022 и GPT-4o-0513.
- Цифра $5.576M относится к официальному финальному training run и не включает прежние исследования, абляции и неудачные эксперименты; читать её как «полную цену создания модели» нельзя.
- Даже при открытых весах развёртывание остаётся тяжёлым: сам отчёт предупреждает, что рекомендуемая единица serving для эффективного инференса велика и неудобна для маленьких команд.
Контекст: какую проблему решала DeepSeek-V3
К концу 2024 года у индустрии было две конкурирующие линии масштабирования. Первая — просто наращивать параметры и compute. Вторая — искать архитектурные и системные приёмы, которые уменьшают стоимость обучения и инференса без резкого падения качества.
DeepSeek-V2 уже подготовила почву для второй линии. В её отчёте DeepSeek описывала Multi-head Latent Attention (MLA) как способ радикально сжать KV-cache, а DeepSeekMoE — как sparse-архитектуру, которая держит вычисления под контролем за счёт выборочной активации экспертов.
DeepSeek-V3 делает следующий шаг: не изобретает всё заново, а масштабирует уже проверенный стек. Поэтому эту работу полезно читать не как магический «дешёвый GPT-4-клон», а как демонстрацию того, что frontier-уровень всё сильнее зависит от совместного дизайна архитектуры, чисел точности, коммуникаций между узлами и посттренинга.
Метод: что именно сделали авторы
1. Сохранили базовую идею V2: sparse compute плюс дешёвый attention
На верхнем уровне DeepSeek-V3 — это Mixture-of-Experts (MoE): модель большая по общему числу параметров, но на каждом токене использует только часть вычислений. В отчёте и официальной карточке указаны 671B общих параметров и 37B активируемых на токен, а контекстное окно — 128K.
С точки зрения механики это важно по двум причинам. Во-первых, MLA уменьшает объём KV-cache, то есть снимает часть инференсного давления с памяти. Во-вторых, DeepSeekMoE позволяет держать активное вычисление существенно ниже общего объёма параметров, что и делает sparse-масштабирование практичным.
По параметрам, раскрытым в самом техотчёте, каждый MoE-слой в V3 содержит 1 shared expert и 256 routed experts, а на токен активируются 8 routed experts. Это одна из ключевых причин, почему DeepSeek-V3 нельзя сравнивать с dense-моделями только по числу «общих параметров».
2. Добавили auxiliary-loss-free балансировку экспертов
В обычных MoE-моделях балансировка экспертов часто достигается вспомогательным loss, который принуждает роутер равномернее распределять токены. Проблема в том, что такой loss вмешивается в основную оптимизацию и может ухудшать качество.
DeepSeek опирается на отдельную работу 2024 года про auxiliary-loss-free load balancing. Идея в том, чтобы не менять основную цель обучения напрямую, а корректировать routing scores через bias для каждого эксперта до top-K выбора, обновляя этот bias по исторической загрузке. На практике это должно уменьшать «налог на балансировку» и сохранять специализацию экспертов.
Внутренние абляции в техотчёте показывают, что такой подход обычно выигрывает у purely auxiliary-loss-based версии на большинстве проверенных задач. Это не независимая валидация, но как инженерный сигнал идея выглядит содержательно: авторы пытаются лечить не симптом, а причину конфликта между качеством и равномерной загрузкой.
3. Добавили multi-token prediction (MTP)
Вместо чистого next-token prediction DeepSeek-V3 обучают ещё и на предсказание нескольких будущих токенов. В отчёте MTP описан как последовательная схема: дополнительные модули предсказывают будущие токены, сохраняя причинную цепочку между шагами.
Практический смысл двойной. Во-первых, модель получает более плотный обучающий сигнал. Во-вторых, та же идея пригодна для speculative decoding, то есть для ускорения инференса за счёт предварительного предсказания следующего фрагмента.
Важно, что в абляциях DeepSeek сравнивает пары моделей с одинаковой инференсной стоимостью: MTP-модуль при обычном inference можно отбросить. Поэтому улучшение в их таблице не сводится к банальному добавлению большего числа активных параметров на проде.
4. Сделали ставку на FP8 и системную оптимизацию
Самый недооценённый слой этой работы — инфраструктурный. DeepSeek пишет, что обучала V3 с FP8 mixed precision, использовала DualPipe для pipeline parallelism и оптимизировала cross-node all-to-all коммуникацию так, чтобы вычисления и обмен данными почти перекрывали друг друга.
Это важно, потому что sparse-модели часто упираются не в математику, а в сеть и память. Если межузловая маршрутизация токенов дороже самой MoE-вычислительной части, теоретическая экономия быстро исчезает. V3 интересна именно тем, что авторы пытаются решить архитектуру и коммуникации как одну задачу.
Данные тоже подстроены под эту цель. В отчёте говорится о 14.8T токенов, повышенной доле математических и программных примеров относительно V2 и расширении мультиязычности за пределы английского и китайского. После предобучения они проводят двухэтапное расширение контекста с 4K до 32K и затем до 128K через YaRN, а затем SFT и RL-посттренинг.
Здесь есть важная историческая оговорка. В версии отчёта arXiv v2 от 18 февраля 2025 года авторы уже формулируют посттренинг как distillation reasoning-способностей из одной из моделей серии DeepSeek-R1. Это корректно читать как описание состояния отчёта на февраль 2025 года, а не механически переносить формулировку в декабрьский анонс.
Результаты: что показала модель
Сначала — про стоимость. Ниже разбивка, которую даёт один первичный источник, сам техотчёт DeepSeek-V3; независимого второго первичного документа с той же фазовой разбивкой мы не нашли, поэтому её стоит читать именно как заявленные авторами значения. Общая сумма 2.788M H800 GPU-hours и $5.576M подтверждается и техотчётом, и официальными материалами релиза.
| Этап | H800 GPU-hours | Оценка в USD |
|---|---|---|
| Pre-training | 2664K | $5.328M |
| Context extension | 119K | $0.238M |
| Post-training | 5K | $0.01M |
| Итого | 2788K | $5.576M |
Теперь — качество. Цифры в таблице ниже совпадают между техотчётом и официальной модельной карточкой DeepSeek-V3 на Hugging Face. Все модели там оценены с ограничением длины вывода до 8K; бенчмарки с менее чем 1000 примеров прогонялись несколько раз при разных temperature.
| Бенчмарк | DeepSeek-V3 | Claude-3.5-Sonnet-1022 | GPT-4o-0513 | Qwen2.5-72B-Inst. | Что видно |
|---|---|---|---|---|---|
| MMLU-Pro (EM) | 75.9 | 78.0 | 72.6 | 71.6 | Ниже Claude, но выше GPT-4o и Qwen2.5-72B. |
| GPQA-Diamond (Pass@1) | 59.1 | 65.0 | 49.9 | 49.0 | Сильный результат, но не лидер в этой таблице. |
| LongBench v2 (Acc.) | 48.7 | 41.0 | 48.1 | 39.4 | Практически на уровне GPT-4o и выше остальных в срезе. |
| LiveCodeBench (Pass@1) | 37.6 | 32.8 | 34.2 | 28.7 | Один из лучших сигналов по coding. |
| SWE Verified (Resolved) | 42.0 | 50.8 | 38.8 | 23.8 | Выше GPT-4o и Qwen, но заметно ниже Claude. |
| AIME 2024 (Pass@1) | 39.2 | 16.0 | 9.3 | 23.3 | Очень сильный математический сигнал на этом срезе. |
| MATH-500 (EM) | 90.2 | 78.3 | 74.6 | 80.0 | Самый сильный результат в таблице. |
| SimpleQA (Correct) | 24.9 | 28.4 | 38.2 | 9.1 | Короткая фактическая QA остаётся слабее GPT-4o и Claude. |
Если смотреть на профиль, картина довольно ясная. DeepSeek-V3 особенно сильна в математике и коде: AIME 2024, MATH-500, LiveCodeBench, Aider-Polyglot и Codeforces — это именно те зоны, где sparse-архитектура плюс data mix и посттренинг дали заметный выигрыш.
Но это не универсальное «победила всех». На GPQA-Diamond и SWE Verified впереди Claude-3.5-Sonnet-1022. На SimpleQA впереди GPT-4o-0513. То есть DeepSeek-V3 выглядит не как ровная доминация, а как очень удачное сочетание высокой эффективности и сильного профиля на reasoning-, math- и coding-задачах.
Есть и ещё один важный результат, о котором часто забывают за заголовком про цену. Авторы пишут, что на каждый триллион токенов обучение V3 требует 180K H800 GPU-hours, что соответствует 3.7 дня на кластере из 2048 H800. Именно эта системная эффективность, а не один только MoE, делает историю V3 необычной.
Интерпретация: почему это важно
Наш комментарий
На наш взгляд, DeepSeek-V3 важна не потому, что якобы «доказала», будто frontier-модель можно построить почти без капитала. Она важна потому, что показала: к концу 2024 года frontier начал зависеть не только от масштаба, но и от качества системной инженерии почти на каждом слое стека.
У этой работы есть три практических вывода. Первый: считать нужно не только общие параметры, но и активируемые параметры, объём KV-cache, сетевой трафик и точность вычислений. Второй: sparse-модель становится по-настоящему дешёвой только тогда, когда routing, память и межузловая коммуникация оптимизированы совместно. Третий: хороший benchmark-профиль всё чаще строится не единственным «секретным ингредиентом», а длинной цепочкой маленьких инженерных решений.
Отсюда и главный урок для команд, которые строят собственные модели или inference-стек. DeepSeek-V3 — это скорее аргумент в пользу co-design между моделью и системой, чем аргумент в пользу простой экономии на железе. Если взять только один кусок, например MoE без оптимизации коммуникации, повторить эффект не получится.
Ограничения и критика
- $5.576M — не полная стоимость создания модели. Сам техотчёт прямо оговаривает, что цифра относится только к официальному обучению DeepSeek-V3 и не включает прежние исследования, архитектурные абляции и неудачные эксперименты. Stanford CRFM в своём transparency report отдельно отмечает, что это не total model cost и что неучтённые non-compute затраты не раскрыты.
- Часть сильных заявлений основана на self-reported evaluation. Мы видим аккуратно оформленные таблицы, но это всё равно результаты, собранные и представленные самими авторами. Они полезны, однако не равны независимому внешнему аудиту по единому протоколу.
- Serving остаётся тяжёлым. В версии v2 техотчёта DeepSeek прямо пишет, что рекомендуемая единица развёртывания для эффективного inference велика. По тому же отчёту минимальная единица decoding состоит из 40 узлов и 320 GPU; это сильное напоминание, что «открытые веса» и «дешёвый production» — не одно и то же.
- Есть пробелы в раскрытии данных. В отчёте есть общий размер корпуса и его качественное описание, но нет полной языковой композиции по долям. Stanford CRFM также отмечает отсутствие раскрытия энергопотребления финального training run.
- Исторический нарратив легко перепутать. Если читать только позднюю версию отчёта, можно незаметно смешать декабрьский релиз V3 и февральскую формулировку про distillation из серии R1. Для точного анализа это разные моменты времени.
Вывод
DeepSeek-V3 — это не миф о «фронтире за копейки», а очень сильная демонстрация того, как sparse-архитектура, FP8-обучение и грамотная организация кластера меняют экономику больших моделей. В историческом срезе конца 2024 года она действительно выглядела как один из самых серьёзных открытых вызовов закрытым frontier-системам.
Но практический вывод должен быть трезвым: headline-цифра $5.576M описывает не всю цену, а только заявленную стоимость финального run. Настоящая ценность отчёта — в том, что он показывает, где именно можно выигрывать compute без прямой капитуляции по качеству.
Источники
- DeepSeek-V3 Technical Report
- DeepSeek-V3 Technical Report (PDF)
- Introducing DeepSeek-V3
- deepseek-ai/DeepSeek-V3 on Hugging Face
- DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
- DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
- Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
- DeepSeek Transparency Report
FAQ
Правда ли, что DeepSeek-V3 стоила всего $5.576M?
Только если говорить о заявленной авторами стоимости официального финального training run при допущении $2 за H800 GPU-hour. Эта цифра не включает ранние исследования, абляции, неудачные запуски и организационные расходы.
Что в V3 нового относительно DeepSeek-V2?
Главные добавления — auxiliary-loss-free балансировка экспертов и multi-token prediction. Базовые архитектурные опоры MLA и DeepSeekMoE пришли из V2.
Почему сравнение по общему числу параметров здесь вводит в заблуждение?
Потому что DeepSeek-V3 — sparse MoE-модель. У неё 671B общих параметров, но на один токен активируется только 37B, поэтому её compute-профиль ближе к активной части, а не к полной сумме весов.
Где V3 сильнее всего, а где слабее?
По таблицам DeepSeek она особенно сильна в математике и коде, включая AIME 2024, MATH-500 и LiveCodeBench. При этом на GPQA-Diamond, SWE Verified и особенно SimpleQA есть задачи, где Claude-3.5-Sonnet-1022 или GPT-4o-0513 выглядят лучше.
