Запись архива

DeepSeek-V3: что стоит за «фронтиром за 5,6 млн долларов»

Исторический разбор DeepSeek-V3 конца 2024 года: что означают 671B/37B, откуда взялась цифра $5.576M, какие инженерные решения дали выигрыш и где заканчивается этот нарратив.

Схема DeepSeek-V3: токен проходит через MLA, затем через роутер MoE с одним shared expert и набором routed experts, после чего MTP-модуль добавляет предсказание будущих токенов

DeepSeek анонсировала DeepSeek-V3 26 декабря 2024 года, а технический отчёт был подан на arXiv 27 декабря 2024 года и обновлён 18 февраля 2025 года. Этот разбор касается именно того исторического среза, а не более поздних итераций линейки V3.

Главный повод для шума был не только в качестве модели, но и в цифре стоимости: 2.788M H800 GPU-hours, оценённых авторами в $5.576M при ставке $2 за GPU-hour. Для практиков здесь важнее не сам заголовок про «дешёвый фронтир», а то, как DeepSeek сочетает sparse-архитектуру, FP8-обучение и инженерную оптимизацию кластера.

Коротко

  • DeepSeek-V3 — это MoE-модель с 671B общих параметров и 37B активируемых на токен; в основе лежат MLA и DeepSeekMoE, унаследованные от DeepSeek-V2.
  • Новые элементы относительно V2 — auxiliary-loss-free балансировка экспертов и multi-token prediction (MTP) как дополнительная цель обучения.
  • По собственным таблицам DeepSeek и официальной модельной карточке, V3 была сильнейшей открытой моделью на ряде бенчмарков конца 2024 года и часто подходила вплотную к Claude-3.5-Sonnet-1022 и GPT-4o-0513.
  • Цифра $5.576M относится к официальному финальному training run и не включает прежние исследования, абляции и неудачные эксперименты; читать её как «полную цену создания модели» нельзя.
  • Даже при открытых весах развёртывание остаётся тяжёлым: сам отчёт предупреждает, что рекомендуемая единица serving для эффективного инференса велика и неудобна для маленьких команд.

Контекст: какую проблему решала DeepSeek-V3

К концу 2024 года у индустрии было две конкурирующие линии масштабирования. Первая — просто наращивать параметры и compute. Вторая — искать архитектурные и системные приёмы, которые уменьшают стоимость обучения и инференса без резкого падения качества.

DeepSeek-V2 уже подготовила почву для второй линии. В её отчёте DeepSeek описывала Multi-head Latent Attention (MLA) как способ радикально сжать KV-cache, а DeepSeekMoE — как sparse-архитектуру, которая держит вычисления под контролем за счёт выборочной активации экспертов.

DeepSeek-V3 делает следующий шаг: не изобретает всё заново, а масштабирует уже проверенный стек. Поэтому эту работу полезно читать не как магический «дешёвый GPT-4-клон», а как демонстрацию того, что frontier-уровень всё сильнее зависит от совместного дизайна архитектуры, чисел точности, коммуникаций между узлами и посттренинга.

Метод: что именно сделали авторы

1. Сохранили базовую идею V2: sparse compute плюс дешёвый attention

На верхнем уровне DeepSeek-V3 — это Mixture-of-Experts (MoE): модель большая по общему числу параметров, но на каждом токене использует только часть вычислений. В отчёте и официальной карточке указаны 671B общих параметров и 37B активируемых на токен, а контекстное окно — 128K.

С точки зрения механики это важно по двум причинам. Во-первых, MLA уменьшает объём KV-cache, то есть снимает часть инференсного давления с памяти. Во-вторых, DeepSeekMoE позволяет держать активное вычисление существенно ниже общего объёма параметров, что и делает sparse-масштабирование практичным.

По параметрам, раскрытым в самом техотчёте, каждый MoE-слой в V3 содержит 1 shared expert и 256 routed experts, а на токен активируются 8 routed experts. Это одна из ключевых причин, почему DeepSeek-V3 нельзя сравнивать с dense-моделями только по числу «общих параметров».

2. Добавили auxiliary-loss-free балансировку экспертов

В обычных MoE-моделях балансировка экспертов часто достигается вспомогательным loss, который принуждает роутер равномернее распределять токены. Проблема в том, что такой loss вмешивается в основную оптимизацию и может ухудшать качество.

DeepSeek опирается на отдельную работу 2024 года про auxiliary-loss-free load balancing. Идея в том, чтобы не менять основную цель обучения напрямую, а корректировать routing scores через bias для каждого эксперта до top-K выбора, обновляя этот bias по исторической загрузке. На практике это должно уменьшать «налог на балансировку» и сохранять специализацию экспертов.

Внутренние абляции в техотчёте показывают, что такой подход обычно выигрывает у purely auxiliary-loss-based версии на большинстве проверенных задач. Это не независимая валидация, но как инженерный сигнал идея выглядит содержательно: авторы пытаются лечить не симптом, а причину конфликта между качеством и равномерной загрузкой.

3. Добавили multi-token prediction (MTP)

Вместо чистого next-token prediction DeepSeek-V3 обучают ещё и на предсказание нескольких будущих токенов. В отчёте MTP описан как последовательная схема: дополнительные модули предсказывают будущие токены, сохраняя причинную цепочку между шагами.

Практический смысл двойной. Во-первых, модель получает более плотный обучающий сигнал. Во-вторых, та же идея пригодна для speculative decoding, то есть для ускорения инференса за счёт предварительного предсказания следующего фрагмента.

Важно, что в абляциях DeepSeek сравнивает пары моделей с одинаковой инференсной стоимостью: MTP-модуль при обычном inference можно отбросить. Поэтому улучшение в их таблице не сводится к банальному добавлению большего числа активных параметров на проде.

4. Сделали ставку на FP8 и системную оптимизацию

Самый недооценённый слой этой работы — инфраструктурный. DeepSeek пишет, что обучала V3 с FP8 mixed precision, использовала DualPipe для pipeline parallelism и оптимизировала cross-node all-to-all коммуникацию так, чтобы вычисления и обмен данными почти перекрывали друг друга.

Это важно, потому что sparse-модели часто упираются не в математику, а в сеть и память. Если межузловая маршрутизация токенов дороже самой MoE-вычислительной части, теоретическая экономия быстро исчезает. V3 интересна именно тем, что авторы пытаются решить архитектуру и коммуникации как одну задачу.

Данные тоже подстроены под эту цель. В отчёте говорится о 14.8T токенов, повышенной доле математических и программных примеров относительно V2 и расширении мультиязычности за пределы английского и китайского. После предобучения они проводят двухэтапное расширение контекста с 4K до 32K и затем до 128K через YaRN, а затем SFT и RL-посттренинг.

Здесь есть важная историческая оговорка. В версии отчёта arXiv v2 от 18 февраля 2025 года авторы уже формулируют посттренинг как distillation reasoning-способностей из одной из моделей серии DeepSeek-R1. Это корректно читать как описание состояния отчёта на февраль 2025 года, а не механически переносить формулировку в декабрьский анонс.

Результаты: что показала модель

Сначала — про стоимость. Ниже разбивка, которую даёт один первичный источник, сам техотчёт DeepSeek-V3; независимого второго первичного документа с той же фазовой разбивкой мы не нашли, поэтому её стоит читать именно как заявленные авторами значения. Общая сумма 2.788M H800 GPU-hours и $5.576M подтверждается и техотчётом, и официальными материалами релиза.

Этап H800 GPU-hours Оценка в USD
Pre-training 2664K $5.328M
Context extension 119K $0.238M
Post-training 5K $0.01M
Итого 2788K $5.576M

Теперь — качество. Цифры в таблице ниже совпадают между техотчётом и официальной модельной карточкой DeepSeek-V3 на Hugging Face. Все модели там оценены с ограничением длины вывода до 8K; бенчмарки с менее чем 1000 примеров прогонялись несколько раз при разных temperature.

Бенчмарк DeepSeek-V3 Claude-3.5-Sonnet-1022 GPT-4o-0513 Qwen2.5-72B-Inst. Что видно
MMLU-Pro (EM) 75.9 78.0 72.6 71.6 Ниже Claude, но выше GPT-4o и Qwen2.5-72B.
GPQA-Diamond (Pass@1) 59.1 65.0 49.9 49.0 Сильный результат, но не лидер в этой таблице.
LongBench v2 (Acc.) 48.7 41.0 48.1 39.4 Практически на уровне GPT-4o и выше остальных в срезе.
LiveCodeBench (Pass@1) 37.6 32.8 34.2 28.7 Один из лучших сигналов по coding.
SWE Verified (Resolved) 42.0 50.8 38.8 23.8 Выше GPT-4o и Qwen, но заметно ниже Claude.
AIME 2024 (Pass@1) 39.2 16.0 9.3 23.3 Очень сильный математический сигнал на этом срезе.
MATH-500 (EM) 90.2 78.3 74.6 80.0 Самый сильный результат в таблице.
SimpleQA (Correct) 24.9 28.4 38.2 9.1 Короткая фактическая QA остаётся слабее GPT-4o и Claude.

Если смотреть на профиль, картина довольно ясная. DeepSeek-V3 особенно сильна в математике и коде: AIME 2024, MATH-500, LiveCodeBench, Aider-Polyglot и Codeforces — это именно те зоны, где sparse-архитектура плюс data mix и посттренинг дали заметный выигрыш.

Но это не универсальное «победила всех». На GPQA-Diamond и SWE Verified впереди Claude-3.5-Sonnet-1022. На SimpleQA впереди GPT-4o-0513. То есть DeepSeek-V3 выглядит не как ровная доминация, а как очень удачное сочетание высокой эффективности и сильного профиля на reasoning-, math- и coding-задачах.

Есть и ещё один важный результат, о котором часто забывают за заголовком про цену. Авторы пишут, что на каждый триллион токенов обучение V3 требует 180K H800 GPU-hours, что соответствует 3.7 дня на кластере из 2048 H800. Именно эта системная эффективность, а не один только MoE, делает историю V3 необычной.

Интерпретация: почему это важно

Наш комментарий

На наш взгляд, DeepSeek-V3 важна не потому, что якобы «доказала», будто frontier-модель можно построить почти без капитала. Она важна потому, что показала: к концу 2024 года frontier начал зависеть не только от масштаба, но и от качества системной инженерии почти на каждом слое стека.

У этой работы есть три практических вывода. Первый: считать нужно не только общие параметры, но и активируемые параметры, объём KV-cache, сетевой трафик и точность вычислений. Второй: sparse-модель становится по-настоящему дешёвой только тогда, когда routing, память и межузловая коммуникация оптимизированы совместно. Третий: хороший benchmark-профиль всё чаще строится не единственным «секретным ингредиентом», а длинной цепочкой маленьких инженерных решений.

Отсюда и главный урок для команд, которые строят собственные модели или inference-стек. DeepSeek-V3 — это скорее аргумент в пользу co-design между моделью и системой, чем аргумент в пользу простой экономии на железе. Если взять только один кусок, например MoE без оптимизации коммуникации, повторить эффект не получится.

Ограничения и критика

  • $5.576M — не полная стоимость создания модели. Сам техотчёт прямо оговаривает, что цифра относится только к официальному обучению DeepSeek-V3 и не включает прежние исследования, архитектурные абляции и неудачные эксперименты. Stanford CRFM в своём transparency report отдельно отмечает, что это не total model cost и что неучтённые non-compute затраты не раскрыты.
  • Часть сильных заявлений основана на self-reported evaluation. Мы видим аккуратно оформленные таблицы, но это всё равно результаты, собранные и представленные самими авторами. Они полезны, однако не равны независимому внешнему аудиту по единому протоколу.
  • Serving остаётся тяжёлым. В версии v2 техотчёта DeepSeek прямо пишет, что рекомендуемая единица развёртывания для эффективного inference велика. По тому же отчёту минимальная единица decoding состоит из 40 узлов и 320 GPU; это сильное напоминание, что «открытые веса» и «дешёвый production» — не одно и то же.
  • Есть пробелы в раскрытии данных. В отчёте есть общий размер корпуса и его качественное описание, но нет полной языковой композиции по долям. Stanford CRFM также отмечает отсутствие раскрытия энергопотребления финального training run.
  • Исторический нарратив легко перепутать. Если читать только позднюю версию отчёта, можно незаметно смешать декабрьский релиз V3 и февральскую формулировку про distillation из серии R1. Для точного анализа это разные моменты времени.

Вывод

DeepSeek-V3 — это не миф о «фронтире за копейки», а очень сильная демонстрация того, как sparse-архитектура, FP8-обучение и грамотная организация кластера меняют экономику больших моделей. В историческом срезе конца 2024 года она действительно выглядела как один из самых серьёзных открытых вызовов закрытым frontier-системам.

Но практический вывод должен быть трезвым: headline-цифра $5.576M описывает не всю цену, а только заявленную стоимость финального run. Настоящая ценность отчёта — в том, что он показывает, где именно можно выигрывать compute без прямой капитуляции по качеству.

Источники

FAQ

Правда ли, что DeepSeek-V3 стоила всего $5.576M?

Только если говорить о заявленной авторами стоимости официального финального training run при допущении $2 за H800 GPU-hour. Эта цифра не включает ранние исследования, абляции, неудачные запуски и организационные расходы.

Что в V3 нового относительно DeepSeek-V2?

Главные добавления — auxiliary-loss-free балансировка экспертов и multi-token prediction. Базовые архитектурные опоры MLA и DeepSeekMoE пришли из V2.

Почему сравнение по общему числу параметров здесь вводит в заблуждение?

Потому что DeepSeek-V3 — sparse MoE-модель. У неё 671B общих параметров, но на один токен активируется только 37B, поэтому её compute-профиль ближе к активной части, а не к полной сумме весов.

Где V3 сильнее всего, а где слабее?

По таблицам DeepSeek она особенно сильна в математике и коде, включая AIME 2024, MATH-500 и LiveCodeBench. При этом на GPQA-Diamond, SWE Verified и особенно SimpleQA есть задачи, где Claude-3.5-Sonnet-1022 или GPT-4o-0513 выглядят лучше.

Читайте также