DeepSeek V3.1 Terminus Thinking — практичная модель для задач с рассуждением и агентными сценариями, но не универсальный лидер. В редакционном рейтинге COMRAD404 она занимает 52-е место с COMRAD Score 64,2 из 100. Главная особенность профиля — заметный разрыв между высоким результатом по человеческому предпочтению и эффективностью и более сдержанными оценками качества и кодинга.
Такое сочетание делает модель интересной для недорогих API-интеграций, многошагового поиска, подготовки текстов и рабочих прототипов агентов. При этом для критичных программных задач, строгой фактической точности и низколатентных сервисов её стоит сначала проверить на собственном наборе примеров: в паспортном срезе нет независимого Artificial Analysis Intelligence Index, рейтинга LMArena Code, скорости генерации и времени до первого токена.
Коротко
Terminus — обновление DeepSeek V3.1, представленное разработчиком 22 сентября 2025 года. В официальном сообщении DeepSeek указала на уменьшение случаев смешения китайского и английского языков, исчезновение отдельных аномальных символов и дополнительную оптимизацию Code Agent и Search Agent. Это именно заявление разработчика, а не независимое измерение COMRAD404.
- Итоговая оценка: 64,2 из 100 по редакционной шкале COMRAD404.
- Позиция: 52-е место в выпуске 2026 H2.
- Сильные стороны профиля: human preference 83,9 и efficiency 82,7.
- Слабые стороны профиля: quality 50,0 и coding 50,0.
- Доступ: open weights, лицензия MIT; это не означает, что локальный запуск будет простым или дешёвым.
- Контекст: 163 840 токенов в паспортном срезе.
- Цена: 0,27 доллара за миллион входных токенов и 1,00 доллар за миллион выходных токенов.
В карточке модели на Hugging Face также указано, что Terminus сохраняет структуру DeepSeek-V3 и распространяется с весами под MIT. Для самостоятельного запуска разработчик предлагает использовать совместимые инструменты инференса, но публикует отдельные технические оговорки, о которых важно помнить перед развёртыванием.
Паспорт модели
| Параметр | Значение в срезе 31 августа 2026 года |
|---|---|
| Модель | DeepSeek V3.1 Terminus Thinking |
| Разработчик | DeepSeek |
| Место в COMRAD404 | 52 |
| COMRAD Score | 64,2 из 100 |
| Рассуждение | Да |
| Preview | Нет |
| Open weights | Да |
| Лицензия | MIT |
| LMArena Text | 1417,0; 120-е место; 3367 голосов |
| Контекст | 163 840 токенов |
| Цена входа / выхода | 0,27 / 1,00 доллара за 1 млн токенов |
| Скорость и TTFT | Данных в срезе нет |
| Artificial Analysis Index | Данных в срезе нет |
| LMArena Code | Данных в срезе нет |
Все значения в таблице относятся к конкретному редакционному срезу и не должны восприниматься как постоянные свойства API. Цена может измениться, а рейтинг LMArena — сдвинуться по мере накопления новых голосов и изменения состава моделей.
Место в рейтинге
52-я позиция ставит DeepSeek V3.1 Terminus Thinking в середину расширенного списка моделей COMRAD404. Это не означает, что модель одинаково средняя во всех задачах. COMRAD Score складывается из пяти нормализованных редакционных суббаллов 0–100, а не из процентов правильных ответов и не из одного публичного теста.
Расчёт использует следующие веса: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. При таком распределении высокая оценка пользовательского предпочтения заметно поддерживает итог, но не может полностью компенсировать quality 50,0 и coding 50,0. Эффективность 82,7 дополнительно улучшает положение, а access 65,4 даёт положительный, но небольшой вклад.
Отдельно в паспорте зафиксирован результат Text Arena: рейтинг 1417,0, 120-е место и 3367 голосов. LMArena rating — это статистический показатель, полученный из слепых попарных сравнений, а не доля правильных ответов. Его разумно читать как сигнал о пользовательском восприятии текстовых ответов при данном объёме выборки, а не как прямой прогноз качества конкретного корпоративного сценария.
Редакционная интерпретация такова: Terminus способен давать ответы, которые пользователи часто считают удачными и полезными, особенно при работе с рассуждением и длинными инструкциями. Однако сама по себе хорошая воспринимаемость не доказывает устойчивость к сложным кодовым регрессиям, фактическим ошибкам или нестандартным форматам вывода.
Полный контекст рейтинга доступен на странице рейтинга COMRAD404. В ней следует смотреть именно на дату выпуска и методологию, а не переносить значения между разными редакционными срезами.
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Что это означает для выбора |
|---|---|---|---|
| Quality | 50,0 | 0,40 | Основной ограничитель итогового балла; нужна проверка точности и стабильности на доменных задачах. |
| Human preference | 83,9 | 0,30 | Сильный сигнал по удобству и воспринимаемому качеству диалога. |
| Coding | 50,0 | 0,15 | Нельзя считать модель подтверждённым выбором для разработки без собственного теста. |
| Efficiency | 82,7 | 0,10 | Хорошая редакционная оценка экономичности профиля, но фактическая задержка не измерена. |
| Access | 65,4 | 0,05 | Open weights и MIT поддерживают доступность, но инфраструктурный порог остаётся существенным. |
Как читать профиль метрик
Профиль Terminus нельзя свести к формуле «дёшево — значит слабее» или «высокое human preference — значит подходит для всего». В нём одновременно присутствуют три разных сигнала.
Первый — пользовательская оценка. Human preference 83,9 указывает на сильную сторону модели в открытом диалоге: ответ может казаться понятным, уместным и хорошо оформленным. Это особенно важно для ассистентов, редакторских инструментов, внутренних справочных систем и черновой аналитики.
Второй — эффективность. Оценка 82,7 поддерживает сценарии с большим количеством запросов, где стоимость и расход токенов влияют на экономику продукта. Но это не скорость в токенах в секунду. В паспорте нет ни output tokens per second, ни time to first token, поэтому делать вывод о задержке нельзя.
Третий — качество и кодинг. Оба суббалла равны 50,0, а quality имеет наибольший вес. Поэтому модель не стоит выбирать только по цене или наличию весов, если ошибка в ответе дороже экономии на API. Для кода особенно важны тесты на репозитории заказчика, работу с существующим стилем, исправление ошибок и соблюдение форматов сборки.
Возможности и сценарии
Тексты, анализ и рабочие документы
Модель логично рассматривать для подготовки черновиков, структурирования заметок, извлечения требований из больших документов, преобразования текста в заданный формат и многошагового анализа. Контекст 163 840 токенов позволяет проверять длинные входы, но максимальное окно не гарантирует, что каждая деталь будет одинаково хорошо использована. На практике важны разбиение документов, схема промпта и контроль ссылок на исходные фрагменты.
Рассуждение
Признак reasoning в паспорте означает, что модель относится к классу решений с режимом рассуждения. Для задач с несколькими условиями, вычислениями, планированием и разбором противоречивых требований это может быть полезнее, чем короткая генерация без промежуточной работы. Однако рассуждение не устраняет галлюцинации: итог всё равно нужно проверять по фактам и тестам.
Поиск и инструменты
DeepSeek в официальном обновлении заявляет об улучшении Search Agent и Code Agent, а в карточке модели описывает формат работы с tool calls и поисковым агентом. На практике Terminus может быть основой для оркестратора, который вызывает поиск, базу данных, файловую систему или тестовый раннер. Сама модель не заменяет эти инструменты: качество агента зависит от схемы функций, обработки ошибок, лимитов, таймаутов и правил повторного вызова.
Программирование
Для генерации небольших функций, объяснения фрагментов и подготовки тестов модель стоит попробовать. Для автономного изменения большого репозитория нужен более строгий контур: изолированная среда, проверка diff, запуск тестов и ограничение полномочий. Отсутствие в паспорте LMArena Code rating и code rank означает, что редакция не располагает сопоставимым независимым сигналом именно по кодовым сражениям.
Локальное развёртывание
Наличие open weights и MIT делает Terminus пригодной для экспериментов с самостоятельным инференсом и собственным контуром обработки данных. Это преимущество для команд, которым важны контроль маршрутизации запросов и возможность менять стек. Но открытые веса не равны открытому программному обеспечению без ограничений: нужно отдельно учитывать лицензию, условия использования инфраструктуры и совместимость рантайма.
Цена и скорость
В паспортном срезе указана цена 0,27 доллара за 1 млн входных токенов и 1,00 доллар за 1 млн выходных токенов. Если условно обработать 100 тысяч входных и 20 тысяч выходных токенов, арифметическая стоимость составит около 0,047 доллара. Это ориентир для понимания порядка затрат, а не обещание итогового счёта: провайдер может считать кэшированные токены иначе, менять тарифы или предоставлять модель в другом режиме.
Цена выхода выше цены входа примерно в 3,7 раза, поэтому длинные ответы, рассуждения и неограниченные циклы агента могут быстро стать главным источником расходов. Для экономии полезно ограничивать максимальный вывод, отделять внутренние шаги агента от пользовательского ответа, кэшировать стабильные инструкции и заранее задавать условия остановки.
Данных о выходной скорости и времени до первого токена в срезе нет. Поэтому нельзя честно обещать, что модель подойдёт для голосового интерфейса, интерактивного редактора или сервиса с жёстким SLA. Для таких задач нужно измерять p50 и p95 задержки у конкретного провайдера, в конкретном регионе, с конкретным размером запроса и выбранным режимом рассуждения.
Официальная документация DeepSeek отдельно предупреждает, что цены могут меняться и рекомендует проверять страницу тарифов перед пополнением баланса. Это особенно важно для Terminus, поскольку API-алиасы и доступность отдельных версий могут обновляться.
Доступность и лицензия
Паспорт отмечает модель как open weights и указывает лицензию MIT. Официальная карточка Terminus размещена в организации DeepSeek на Hugging Face; там же приведены примеры запуска через Transformers, vLLM и SGLang. Это снижает барьер для прототипирования по сравнению с полностью закрытым API, но не превращает локальный инференс в задачу для обычного ноутбука.
При выборе локального стека нужно проверить, поддерживает ли он точный формат весов, шаблон чата и режим рассуждения. В карточке Terminus есть важное предупреждение: параметры self_attn.o_proj в текущем checkpoint не соответствуют формату масштабирования UE8M0 FP8. Разработчик называет это известной проблемой, которая должна быть исправлена в будущих релизах. Для production-развёртывания это означает необходимость зафиксировать конкретный checkpoint и прогнать полный тест загрузки до закупки вычислительных ресурсов.
Ограничения
- Ограниченная уверенность. В паспорте confidence отмечена как «ограниченная», поэтому итоговую оценку следует использовать как ориентир, а не как гарантию результата.
- Нет полного набора независимых метрик. Artificial Analysis Intelligence Index, LMArena Code rating и code rank отсутствуют в срезе.
- Нет измерений задержки. Отсутствуют output tokens per second и time to first token.
- Невысокие quality и coding. Оба суббалла равны 50,0 и особенно важны для задач, где ошибка приводит к финансовому, юридическому или техническому ущербу.
- Контекст требует проверки. 163 840 токенов — заявленный размер окна в паспорте, но не гарантия одинаковой точности на любой длине входа.
- Сложность локального запуска. Открытые веса требуют совместимого рантайма, памяти, сетевого хранилища и операционного контроля.
- Неполная информация о мультимодальности. В паспорте нет отметки о работе с изображениями, аудио или видео; выбирать модель для таких задач без отдельной проверки не стоит.
Preview в паспорте отмечен как false, то есть модель не помечена как предварительная версия в редакционном срезе. Это не является обещанием готовности к любому production-сценарию: готовность определяется стабильностью конкретного API, политикой провайдера и результатами тестов команды.
Как проверить на своей задаче
- Зафиксируйте объект теста. Запишите точный идентификатор модели или checkpoint, провайдера, дату, режим рассуждения, системную инструкцию и параметры генерации. Не смешивайте результаты разных API-алиасов.
- Соберите репрезентативный набор. Возьмите не меньше 30–50 реальных примеров: простые, пограничные и заведомо сложные. Для агента добавьте ошибки инструментов, неполные ответы API, повторные вызовы и конфликтующие инструкции.
- Разделите критерии. Оценивайте отдельно фактическую корректность, соблюдение формата, полноту, качество рассуждения, успешность вызова инструментов и необходимость ручной правки. Один общий балл скроет причину неудачи.
- Проверьте длинный контекст. Разложите документы по нескольким длинам, добавьте контрольные факты в начале, середине и конце и попросите модель указать источник каждого вывода. Так можно увидеть разницу между размером окна и реальной надёжностью извлечения.
- Для кода используйте исполняемую проверку. Сравнивайте не красоту объяснения, а прохождение тестов, корректность diff, отсутствие побочных изменений и устойчивость к повторному запуску.
- Измерьте стоимость и задержку. Записывайте число входных и выходных токенов, стоимость запроса, время до первого токена и полное время ответа. Делайте несколько повторов и считайте хотя бы медиану и 95-й перцентиль.
- Проведите ручной аудит. Отдельно просмотрите уверенные ошибки, смешение языков, выдуманные ссылки, лишние действия агента и случаи, когда модель не остановилась после выполнения задачи.
Минимальный практический вывод стоит формулировать не как «модель хорошая» или «модель плохая», а как: «из 40 задач она без правки решила 29, ещё 7 — после проверки, 4 завершились ошибкой; средняя стоимость составила …». Такой отчёт полезнее переноса рейтинга из публичной таблицы в ваш продукт.
Кому подойдёт модель
Terminus стоит рассматривать командам, которым нужен недорогой доступ к модели с рассуждением, длинным контекстом и возможностью строить агентные прототипы. Она особенно уместна для внутренних ассистентов, черновой обработки документов, поисковых цепочек с внешним инструментом, классификации и преобразования текстов, а также для локальных экспериментов с открытыми весами.
Осторожнее следует выбирать её для автономного программирования, систем с жёстким SLA, юридических и медицинских выводов, финансовых решений и любых процессов, где ошибку нельзя быстро обнаружить. В этих случаях преимущества цены и доступности должны быть подтверждены собственным тестированием качества, а не только высоким human preference.
FAQ
Какое место занимает DeepSeek V3.1 Terminus Thinking?
В выпуске COMRAD404 2026 H2 модель занимает 52-е место и получает COMRAD Score 64,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
Что означает рейтинг LMArena 1417,0?
Это статистический рейтинг текстовых ответов, рассчитанный по слепым попарным сравнениям. В паспорте также указаны 120-е место и 3367 голосов. Число 1417,0 нельзя читать как 14,17% качества.
Подходит ли модель для программирования?
Подходит для проверки генерации функций, тестов, объяснений и небольших исправлений. Но coding-суббалл равен 50,0, а независимые LMArena Code rating и code rank в срезе отсутствуют, поэтому крупные репозитории и автономные агенты нужно тестировать отдельно.
Сколько стоит использование через API?
В паспортном срезе указаны 0,27 доллара за 1 млн входных токенов и 1,00 доллар за 1 млн выходных токенов. Тарифы зависят от провайдера, режима, кэширования и даты, поэтому перед запуском нужно проверить актуальные условия.
Можно ли запустить модель локально?
Да, модель помечена как open weights, а лицензия указана как MIT. Официальная карточка приводит инструкции для совместимых рантаймов, но локальный запуск требует подходящей инфраструктуры и проверки формата весов. В карточке также зафиксирована известная проблема с параметрами self_attn.o_proj и UE8M0 FP8.
Есть ли у модели подтверждённая скорость генерации?
Нет. В срезе отсутствуют output tokens per second и time to first token. Скорость нужно измерять самостоятельно у выбранного API-провайдера или в локальном рантайме.
Источники
Официальное обновление DeepSeek V3.1 Terminus — название модели, дата обновления, заявленные исправления языка и улучшения Code Agent и Search Agent.
Официальная карточка DeepSeek-V3.1-Terminus на Hugging Face — лицензия, open weights, инструкции локального запуска, режимы использования и техническое предупреждение о FP8.
LMArena Text Leaderboard — независимый источник для Text Arena rating, позиции и количества голосов; в статье использованы значения из переданного паспортного среза.
Официальная документация DeepSeek по тарифам — единицы тарификации и предупреждение о возможном изменении цен.
Artificial Analysis LLM Leaderboard — внешний источник для проверки Intelligence Index, цен, скорости и контекста; по данной модели соответствующий Intelligence Index в паспортном срезе не зафиксирован.
