DeepSeek V3.2 стоит рассматривать прежде всего как экономичную модель с открытыми весами для массовой обработки текста и длинного контекста, а не как универсальный выбор для сложной разработки. В редакционном срезе она занимает 57-е место: высокий балл эффективности и заметное пользовательское предпочтение компенсируют среднюю оценку качества и слабый кодовый профиль.
Главный практический аргумент в её пользу — сочетание контекста 163 840 токенов, цены в срезе $0,269 за миллион входных и $0,40 за миллион выходных токенов, а также весов под лицензией MIT. Главный повод не принимать решение по таблице — отсутствие данных Artificial Analysis Intelligence Index и независимых измерений скорости. Уверенность редакции в профиле поэтому средняя.
Коротко
- Подходит: пакетная обработка документов, суммаризация, извлечение данных, классификация, черновики текстов, внутренние ассистенты и эксперименты с самостоятельным размещением модели.
- Требует проверки: генерация и исправление кода, автономные программные агенты, задачи с жёсткими требованиями к фактической точности.
- Сильнейшая сторона профиля: эффективность — 92,3 из 100.
- Самый слабый суббалл: кодинг — 36,2 из 100.
- COMRAD Score: 63,8 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
- Статус: финальный релиз, не preview; веса опубликованы под MIT.
Паспорт DeepSeek V3.2
| Параметр | Значение в срезе |
|---|---|
| Разработчик | DeepSeek |
| Место COMRAD404 | 57 |
| COMRAD Score | 63,8 / 100 |
| Редакционная уверенность | Средняя |
| Лицензия весов | MIT |
| Открытые веса | Да |
| Reasoning в оцениваемом профиле | Нет |
| Контекст | 163 840 токенов |
| Цена входа | $0,269 за 1 млн токенов |
| Цена выхода | $0,40 за 1 млн токенов |
| Скорость генерации | Данных в срезе нет |
| Время до первого токена | Данных в срезе нет |
Цены относятся к зафиксированному предложению API-провайдера и режиму измерения. Они не являются постоянной характеристикой весов: тариф, кэширование, регион, квоты и выбранный хостинг способны изменить итоговую стоимость.
Место в рейтинге
DeepSeek V3.2 находится на 57-й позиции редакции 2026 H2 с методологией 1.0. Её итог нельзя читать как среднее арифметическое публичных бенчмарков. COMRAD Score строится из пяти нормализованных суббаллов с разным весом: качество даёт 40% итоговой оценки, пользовательское предпочтение — 30%, кодинг — 15%, эффективность — 10%, доступность — 5%.
Профиль получается неравномерным. Модель существенно выигрывает за счёт эффективности и результатов слепых пользовательских сравнений, но теряет позиции из-за качества на уровне 50,0 и кодинга 36,2. Поэтому 57-е место описывает компромисс: модель привлекательна по эксплуатационным параметрам, однако редакционные данные не подтверждают столь же сильную универсальность.
Посмотреть соседние позиции и правила интерпретации можно в общем рейтинге моделей ИИ COMRAD404.
Что означают пять суббаллов
| Суббалл | Оценка | Практическая интерпретация |
|---|---|---|
| Качество | 50,0 | Средний уровень в редакционной нормализации; независимый Intelligence Index отсутствует. |
| Предпочтение людей | 86,2 | Ответы часто выигрывают или выглядят убедительно в слепом пользовательском выборе. |
| Кодинг | 36,2 | Не следует выбирать модель для разработки без отдельного набора репозиторных тестов. |
| Эффективность | 92,3 | Сильное сочетание цены и доступного контекста в зафиксированном срезе. |
| Доступность | 65,4 | Открытые веса расширяют варианты размещения, но крупная модель усложняет инфраструктуру. |
Суббаллы показывают разные свойства и не являются процентами качества. Например, эффективность 92,3 не означает, что модель использует 92,3% ресурсов оптимальным образом. Это редакционная нормализованная оценка относительно методологии и набора моделей конкретного выпуска.
Независимые измерения
В Text Arena модель получила рейтинг 1425,3, 106-е место и 46 493 голоса. LMArena rating — статистический показатель, рассчитанный по слепым попарным сравнениям ответов, а не доля правильных решений. Большое число голосов делает сигнал пользовательского предпочтения содержательным, но не превращает его в тест фактической точности.
В Code Arena зафиксированы рейтинг 1360,6 и 85-е место. Этот результат учтён в кодовом суббалле, но его также нельзя читать как процент решённых задач. Arena измеряет сравнительное предпочтение в заданном пуле ответов, тогда как реальная разработка дополнительно требует прохождения тестов, соблюдения архитектуры проекта, работы с зависимостями и корректных правок в нескольких файлах.
Artificial Analysis Intelligence Index для DeepSeek V3.2 в переданном срезе отсутствует и не оценивался редакцией искусственно. Восстанавливать его по результатам другого поколения DeepSeek или по заявлениям разработчика некорректно. Именно этот пробел ограничивает уверенность в выводах об общем качестве.
Официальный профиль модели
DeepSeek выпустила финальную V3.2 1 декабря 2025 года как преемника экспериментальной V3.2-Exp. Разработчик связывает версию с DeepSeek Sparse Attention, масштабируемым обучением с подкреплением и подготовкой данных для агентных сценариев. Это официальные заявления команды, а не независимые измерения COMRAD404.
Веса и карточка модели опубликованы на Hugging Face под лицензией MIT. Карточка указывает размер 685 млрд параметров и предлагает запуск через совместимые серверы инференса. Наличие открытых весов даёт возможность хранить данные в собственном контуре, фиксировать версию и менять слой обслуживания. При этом оно не означает, что локальный запуск прост или дёшев: исходный размер предполагает серьёзные требования к памяти, ускорителям, квантованию и распределённому инференсу.
В паспорте поле reasoning отмечено как false. Это характеристика оцениваемого нерассуждающего профиля, а не утверждение, что семейство V3.2 технически не умеет работать в thinking-режиме. Официальный релиз описывает варианты с рассуждением и использованием инструментов. Смешивать их результаты нельзя: режим способен изменить длину ответа, задержку, стоимость и качество.
Возможности и сценарии
Длинные документы и базы знаний
Контекст 163 840 токенов позволяет передавать крупные инструкции, наборы документов, переписки или фрагменты кодовой базы. Практическая ценность зависит не только от формального лимита: проверяйте, находит ли модель факт в начале, середине и конце контекста, не смешивает ли версии документов и умеет ли отказаться от ответа при отсутствии основания.
Массовая обработка текста
Высокий суббалл эффективности делает модель кандидатом для классификации обращений, извлечения полей, нормализации карточек, перевода черновиков и суммаризации. Здесь желательно требовать JSON по схеме, валидировать результат программно и повторно отправлять только неудачные записи. Такой конвейер обычно надёжнее свободного диалога.
Ассистенты с инструментами
Официальные материалы описывают tool use и обновлённый формат сообщений. Для собственного размещения потребуется точно соблюдать шаблон чата и разбор результата. В карточке модели прямо отмечено, что демонстрационный парсер рассчитан на корректно сформированный вывод и без дополнительной обработки ошибок не подходит для production-сценария.
Программирование
DeepSeek V3.2 может создавать функции, тесты, SQL и объяснения кода, однако кодовый суббалл 36,2 не поддерживает выбор модели только по репутации семейства. Более безопасная роль — генератор первого варианта под контролем линтера, компилятора, тестов и ревьюера. Для автономного изменения репозитория нужен отдельный пилот.
Цена и скорость
В рейтинговом срезе миллион входных токенов стоит $0,269, миллион выходных — $0,40. Например, задача с 100 тысячами входных и 10 тысячами выходных токенов имеет ориентировочную токенную стоимость около $0,0309 без учёта кэша, повторов, системных накладных расходов и минимальных тарифных единиц провайдера.
У цены есть важное ограничение: после релиза новых поколений официальный API DeepSeek изменил доступные идентификаторы и тарифную политику. По состоянию на 31 августа 2026 года нельзя предполагать, что старый псевдоним API всё ещё направляет запросы именно в V3.2. При воспроизводимом тесте фиксируйте точный идентификатор модели, провайдера, дату, регион и режим.
Данных о выходных токенах в секунду и времени до первого токена в паспорте нет. Поэтому нельзя обещать быстрый интерактивный ответ на основании высокого балла эффективности. Измерьте отдельно короткие запросы, длинный prefill, потоковую генерацию и параллельную нагрузку: эти режимы создают разные задержки.
Развёртывание и доступ
Открытые веса под MIT позволяют строить собственный контур и не зависеть от одного API. Это полезно для регулируемых данных, воспроизводимых исследований и долгоживущих продуктов. Одновременно карточка модели указывает масштаб 685B, поэтому полноценное размещение исходной версии — инфраструктурный проект, а не установка настольного приложения.
Перед выбором между API и self-hosted посчитайте полную стоимость: ускорители, резервирование, инженерное сопровождение, хранение весов, мониторинг, обновления сервера инференса и простой оборудования. Для нерегулярной нагрузки внешний API может быть дешевле; для стабильного крупного потока и строгого контроля данных собственный кластер способен оказаться оправданным.
Ограничения
- Нет Intelligence Index. Общая оценка качества опирается на неполное покрытие независимыми источниками.
- Нет измерений скорости. Неизвестны output tokens/s и time to first token в условиях рейтингового среза.
- Слабый кодовый суббалл. Для программных агентов и автоматических исправлений нужен жёсткий тестовый шлюз.
- Разрыв между привлекательностью и проверяемостью. Высокое предпочтение людей может отражать стиль и убедительность, но не гарантирует точность.
- Большой размер весов. Открытая лицензия не отменяет стоимости оборудования и сложности распределённого запуска.
- Зависимость от режима. Thinking и non-thinking нельзя оценивать как одну конфигурацию.
- Изменчивость API. Цена, доступность точной версии и псевдонимы моделей зависят от провайдера и даты.
Кому стоит выбрать DeepSeek V3.2
Модель выглядит рационально для команд, которым нужны открытые веса, длинный контекст и низкая токенная стоимость при большом объёме текстовых операций. Особенно уместны процессы, где результат можно проверить схемой, правилами или вторичным классификатором.
Она менее убедительна как единственная модель для критичного кодинга, точных экспертных консультаций и автономных действий с необратимыми последствиями. В таких системах итоговый выбор должен определяться не местом в общем рейтинге, а долей успешных примеров, частотой опасных ошибок и полной стоимостью одного принятого результата.
Как проверить на своей задаче
- Зафиксируйте конфигурацию. Запишите провайдера, точный model ID, режим reasoning, параметры семплирования, лимит ответа и дату теста.
- Соберите 50–200 реальных примеров. Включите типичные, редкие, длинные и намеренно конфликтующие запросы.
- Определите критерии до запуска. Например: точность полей, прохождение тестов, наличие ссылок на документы, допустимая задержка и цена успешного ответа.
- Проверяйте длинный контекст отдельно. Размещайте контрольные факты в разных частях входа и добавляйте похожие, но неверные сведения.
- Для кода запускайте инструменты. Компиляция, статический анализ, тесты и проверка diff обязательны; субъективной оценки ответа недостаточно.
- Измеряйте эксплуатацию. Сохраняйте TTFT, tokens/s, число повторных запросов, токены и стоимость каждого принятого результата.
- Проведите слепое сравнение. Уберите названия моделей и попросите экспертов оценить ответы по одной шкале.
- Повторите тест после смены API. Псевдоним может начать обслуживаться другой версией, даже если клиентский код не менялся.
FAQ
DeepSeek V3.2 занимает высокое место в рейтинге?
Она находится на 57-м месте выпуска COMRAD404 2026 H2 с итогом 63,8 из 100. Позицию поддерживают эффективность и пользовательское предпочтение, а ограничивают качество и кодинг.
COMRAD Score 63,8 означает 63,8% правильных ответов?
Нет. Это нормализованная редакционная оценка из пяти суббаллов с разными весами, а не процент точности.
Подходит ли модель для программирования?
Для черновиков, SQL, тестов и объяснений — потенциально да. Для автономной разработки её нужно проверять особенно строго: кодовый суббалл составляет 36,2.
Можно ли запустить DeepSeek V3.2 локально?
Веса опубликованы под MIT, поэтому самостоятельное размещение разрешено. Но карточка указывает масштаб 685B: исходный вариант требует серьёзной вычислительной инфраструктуры или подходящей оптимизации.
Есть ли у DeepSeek V3.2 reasoning-режим?
Официальное семейство поддерживает thinking-сценарии, однако в паспорте COMRAD404 оцениваемый профиль отмечен как non-reasoning. Результаты разных режимов нельзя автоматически переносить друг на друга.
Насколько модель быстрая?
В срезе нет данных о токенах в секунду и времени до первого токена. Скорость следует измерять у выбранного провайдера или на собственной инфраструктуре.
Почему уверенность оценки средняя?
Для модели есть данные LMArena по тексту и коду, но отсутствует Artificial Analysis Intelligence Index и независимый срез скорости.
Источники
- Официальный релиз DeepSeek V3.2 — дата финального выпуска, режимы работы, tool use и публикация весов.
- Карточка DeepSeek V3.2 — лицензия MIT, файлы весов, рекомендации по запуску и особенности шаблона чата.
- Технический отчёт DeepSeek V3.2 — описание DeepSeek Sparse Attention, обучения и агентной подготовки.
- Репозиторий DeepSeek V3.2-Exp — код инференса и техническая основа архитектуры V3.2.
- Журнал изменений DeepSeek API — смена поколений, идентификаторов и условий доступа через официальный API.
- LMArena Text Leaderboard — независимый Text Arena rating, место и число голосов из рейтингового среза.
- LMArena Leaderboard — данные Code Arena, использованные в кодовом суббалле.
- Artificial Analysis LLM Leaderboard — источник, проверенный на наличие Intelligence Index, цен, скорости и контекста; Intelligence Index для модели в срезе отсутствует.
