Запись архива

Китайский DeepSeek-V3 догоняет GPT-4: разбор обновлённой модели и её возможностей

DeepSeek выпустила обновление V3 — модель показывает результаты, сопоставимые с GPT-4, при значительно меньших вычислительных затратах. Разбираем ключевые изменения, бенчмарки и что это значит для разработчиков.

Редакционная обложка COMRAD404: Китайский DeepSeek-V3 догоняет GPT-4: разбор обновлённой модели и её возможностей
Редакционная обложка COMRAD404: Китайский DeepSeek-V3 догоняет GPT-4: разбор обновлённой модели и её возможностей
Редакционная тематическая обложка COMRAD404

Китайская лаборатория DeepSeek выпустила значительное обновление своей флагманской модели DeepSeek-V3. Первые тесты показывают, что новая версия вплотную приблизилась к GPT-4 по целому ряду бенчмарков, а по некоторым — даже превзошла конкурента. Для сообщества это важный сигнал: эффективные открытые модели становятся реальной альтернативой проприетарным гигантам. Однако ключевой вопрос для разработчиков и исследователей — насколько эти результаты применимы в реальных проектах, особенно с учётом отсутствия независимой верификации.

Что изменилось в DeepSeek-V3

DeepSeek-V3 изначально строилась на архитектуре Mixture of Experts (MoE) с 671 миллиардом параметров, из которых для каждого токена активируется только 37 миллиардов. Это ключевое инженерное решение, позволяющее получать высокое качество при существенно меньших вычислительных затратах на инференс. В обновлении середины 2025 года основное нововведение — мультимодальность: модель теперь обрабатывает изображения, хотя её сильная сторона — текст и код.

Основные изменения в обновлённой версии:

Параметр DeepSeek-V3 (предыдущая) DeepSeek-V3 (обновлённая)
Общее число параметров 671B 671B
Активируемых на токен 37B 37B
Контекстное окно 128K токенов 128K токенов
Поддержка мультимодальности Текст Текст + изображения
Дата обучения Конец 2024 Середина 2025

Сравнение бенчмарков с GPT-4

Команда DeepSeek опубликовала результаты на стандартных наборах тестов. Данные взяты из официального блога лаборатории и пока не прошли независимую верификацию в полном объёме. Однако предварительные цифры впечатляют.

Бенчмарк DeepSeek-V3 (новая) GPT-4 (по данным OpenAI)
MMLU (knowledge) 5% 4%
HumanEval (coding) 6% 0%
GSM8K (math) 0% 5%
HellaSwag (reasoning) 3% 0%

По MMLU новая V3 показывает результат на два процентных пункта выше GPT-4. На тесте генерации кода HumanEval — 82.6% против 81.0%. В математике (GSM8K) результат практически идентичен. Эти цифры делают DeepSeek-V3 одной из сильнейших открытых моделей на текущий момент. Однако стоит учитывать, что сравнение проводится с GPT-4, а не с более свежими GPT-4o или GPT-4.1. Кроме того, тесты проводились на английском языке, и для русскоязычных задач качество может отличаться.

Архитектурные детали и эффективность

Ключевое преимущество DeepSeek-V3 — экономичность. Благодаря MoE-архитектуре, инференс модели требует примерно в 10 раз меньше FLOPs, чем у плотной модели сопоставимого качества. Это означает:

  • Более низкую стоимость запуска на собственных серверах.
  • Возможность развёртывания на менее мощном оборудовании.
  • Меньшее энергопотребление.

Для разработчиков, которые хотят запустить модель локально или в облаке, это прямой путь к снижению operational costs без серьёзной потери качества. Например, на одном NVIDIA A100 80GB можно запустить инференс с разумной скоростью, используя FP16 и offloading части весов. Для сравнения, GPT-4 требует значительно более мощных кластеров, что делает DeepSeek-V3 привлекательной альтернативой для стартапов и небольших команд.

Ограничения и что стоит проверить

Несмотря на впечатляющие бенчмарки, есть несколько важных оговорок:

  • Результаты предоставлены самой DeepSeek. Независимые тесты, например, от LMSYS или Artificial Analysis, пока не опубликованы.
  • Модель обучена на данных, которые могут иметь региональный уклон — преобладание китайского и английского контента.
  • Для русскоязычных задач качество может отличаться от заявленного на стандартных бенчмарках. Тесты на русском языке пока не проводились.
  • DeepSeek-V3 доступна под лицензией MIT, но точные условия использования коммерческих продуктов на её основе стоит уточнять отдельно — например, для случаев с высокой нагрузкой или встраивания в проприетарные системы.

Практические шаги для разработчика

Если вы работаете с LLM и ищете эффективную open-source альтернативу, DeepSeek-V3 заслуживает тестирования. Вот несколько практических шагов:

Запустите модель через Hugging Face Transformers или vLLM для оценки latency и потребления памяти. Используйте официальный репозиторий DeepSeek на GitHub.
2. Протестируйте на своих датасетах — особенно если ваш сценарий связан с кодом или структурированными данными. Сравните с текущей версией GPT-4o через API.
3. Сравните стоимость инференса с GPT-4o через API — для высоконагруженных проектов разница может быть существенной. Ориентировочно, V3 в 5-7 раз дешевле при сопоставимом качестве.

Перспективы и выводы

Для тех, кто следит за рынком LLM, DeepSeek-V3 — ещё одно подтверждение тренда: открытые модели не просто догоняют проприетарные, но и делают это с существенно лучшей экономикой. Следующим шагом стоит ожидать независимых бенчмарков и тестов на специализированных задачах, включая русский язык и длинные контексты. Если ваша команда уже использует GPT-4, но хочет снизить затраты, DeepSeek-V3 — один из наиболее перспективных кандидатов для замены. Начните с малого: запустите пару тестовых запросов и оцените результат на своих данных. Особое внимание уделите задачам, связанным с кодом и структурированными данными — именно здесь модель показывает наилучшие результаты.