Запись архива

DeepSeek V3.1 Terminus Thinking: обзор и место в рейтинге

DeepSeek V3.1 Terminus Thinking занимает 52-е место в рейтинге COMRAD404. Модель сильна по пользовательскому предпочтению, доступности и эффективности, но её итоговый профиль ограничивают умеренные оценки качества и кодинга.

DeepSeek V3.1 Terminus Thinking — профиль модели, метрики COMRAD404 и параметры API

DeepSeek V3.1 Terminus Thinking — практичная модель для задач с рассуждением и агентными сценариями, но не универсальный лидер. В редакционном рейтинге COMRAD404 она занимает 52-е место с COMRAD Score 64,2 из 100. Главная особенность профиля — заметный разрыв между высоким результатом по человеческому предпочтению и эффективностью и более сдержанными оценками качества и кодинга.

Такое сочетание делает модель интересной для недорогих API-интеграций, многошагового поиска, подготовки текстов и рабочих прототипов агентов. При этом для критичных программных задач, строгой фактической точности и низколатентных сервисов её стоит сначала проверить на собственном наборе примеров: в паспортном срезе нет независимого Artificial Analysis Intelligence Index, рейтинга LMArena Code, скорости генерации и времени до первого токена.

Коротко

Terminus — обновление DeepSeek V3.1, представленное разработчиком 22 сентября 2025 года. В официальном сообщении DeepSeek указала на уменьшение случаев смешения китайского и английского языков, исчезновение отдельных аномальных символов и дополнительную оптимизацию Code Agent и Search Agent. Это именно заявление разработчика, а не независимое измерение COMRAD404.

  • Итоговая оценка: 64,2 из 100 по редакционной шкале COMRAD404.
  • Позиция: 52-е место в выпуске 2026 H2.
  • Сильные стороны профиля: human preference 83,9 и efficiency 82,7.
  • Слабые стороны профиля: quality 50,0 и coding 50,0.
  • Доступ: open weights, лицензия MIT; это не означает, что локальный запуск будет простым или дешёвым.
  • Контекст: 163 840 токенов в паспортном срезе.
  • Цена: 0,27 доллара за миллион входных токенов и 1,00 доллар за миллион выходных токенов.

В карточке модели на Hugging Face также указано, что Terminus сохраняет структуру DeepSeek-V3 и распространяется с весами под MIT. Для самостоятельного запуска разработчик предлагает использовать совместимые инструменты инференса, но публикует отдельные технические оговорки, о которых важно помнить перед развёртыванием.

Паспорт модели

Параметр Значение в срезе 31 августа 2026 года
Модель DeepSeek V3.1 Terminus Thinking
Разработчик DeepSeek
Место в COMRAD404 52
COMRAD Score 64,2 из 100
Рассуждение Да
Preview Нет
Open weights Да
Лицензия MIT
LMArena Text 1417,0; 120-е место; 3367 голосов
Контекст 163 840 токенов
Цена входа / выхода 0,27 / 1,00 доллара за 1 млн токенов
Скорость и TTFT Данных в срезе нет
Artificial Analysis Index Данных в срезе нет
LMArena Code Данных в срезе нет

Все значения в таблице относятся к конкретному редакционному срезу и не должны восприниматься как постоянные свойства API. Цена может измениться, а рейтинг LMArena — сдвинуться по мере накопления новых голосов и изменения состава моделей.

Место в рейтинге

52-я позиция ставит DeepSeek V3.1 Terminus Thinking в середину расширенного списка моделей COMRAD404. Это не означает, что модель одинаково средняя во всех задачах. COMRAD Score складывается из пяти нормализованных редакционных суббаллов 0–100, а не из процентов правильных ответов и не из одного публичного теста.

Расчёт использует следующие веса: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. При таком распределении высокая оценка пользовательского предпочтения заметно поддерживает итог, но не может полностью компенсировать quality 50,0 и coding 50,0. Эффективность 82,7 дополнительно улучшает положение, а access 65,4 даёт положительный, но небольшой вклад.

Отдельно в паспорте зафиксирован результат Text Arena: рейтинг 1417,0, 120-е место и 3367 голосов. LMArena rating — это статистический показатель, полученный из слепых попарных сравнений, а не доля правильных ответов. Его разумно читать как сигнал о пользовательском восприятии текстовых ответов при данном объёме выборки, а не как прямой прогноз качества конкретного корпоративного сценария.

Редакционная интерпретация такова: Terminus способен давать ответы, которые пользователи часто считают удачными и полезными, особенно при работе с рассуждением и длинными инструкциями. Однако сама по себе хорошая воспринимаемость не доказывает устойчивость к сложным кодовым регрессиям, фактическим ошибкам или нестандартным форматам вывода.

Полный контекст рейтинга доступен на странице рейтинга COMRAD404. В ней следует смотреть именно на дату выпуска и методологию, а не переносить значения между разными редакционными срезами.

Разбор пяти суббаллов

Суббалл Оценка Вес Что это означает для выбора
Quality 50,0 0,40 Основной ограничитель итогового балла; нужна проверка точности и стабильности на доменных задачах.
Human preference 83,9 0,30 Сильный сигнал по удобству и воспринимаемому качеству диалога.
Coding 50,0 0,15 Нельзя считать модель подтверждённым выбором для разработки без собственного теста.
Efficiency 82,7 0,10 Хорошая редакционная оценка экономичности профиля, но фактическая задержка не измерена.
Access 65,4 0,05 Open weights и MIT поддерживают доступность, но инфраструктурный порог остаётся существенным.

Как читать профиль метрик

Профиль Terminus нельзя свести к формуле «дёшево — значит слабее» или «высокое human preference — значит подходит для всего». В нём одновременно присутствуют три разных сигнала.

Первый — пользовательская оценка. Human preference 83,9 указывает на сильную сторону модели в открытом диалоге: ответ может казаться понятным, уместным и хорошо оформленным. Это особенно важно для ассистентов, редакторских инструментов, внутренних справочных систем и черновой аналитики.

Второй — эффективность. Оценка 82,7 поддерживает сценарии с большим количеством запросов, где стоимость и расход токенов влияют на экономику продукта. Но это не скорость в токенах в секунду. В паспорте нет ни output tokens per second, ни time to first token, поэтому делать вывод о задержке нельзя.

Третий — качество и кодинг. Оба суббалла равны 50,0, а quality имеет наибольший вес. Поэтому модель не стоит выбирать только по цене или наличию весов, если ошибка в ответе дороже экономии на API. Для кода особенно важны тесты на репозитории заказчика, работу с существующим стилем, исправление ошибок и соблюдение форматов сборки.

Возможности и сценарии

Тексты, анализ и рабочие документы

Модель логично рассматривать для подготовки черновиков, структурирования заметок, извлечения требований из больших документов, преобразования текста в заданный формат и многошагового анализа. Контекст 163 840 токенов позволяет проверять длинные входы, но максимальное окно не гарантирует, что каждая деталь будет одинаково хорошо использована. На практике важны разбиение документов, схема промпта и контроль ссылок на исходные фрагменты.

Рассуждение

Признак reasoning в паспорте означает, что модель относится к классу решений с режимом рассуждения. Для задач с несколькими условиями, вычислениями, планированием и разбором противоречивых требований это может быть полезнее, чем короткая генерация без промежуточной работы. Однако рассуждение не устраняет галлюцинации: итог всё равно нужно проверять по фактам и тестам.

Поиск и инструменты

DeepSeek в официальном обновлении заявляет об улучшении Search Agent и Code Agent, а в карточке модели описывает формат работы с tool calls и поисковым агентом. На практике Terminus может быть основой для оркестратора, который вызывает поиск, базу данных, файловую систему или тестовый раннер. Сама модель не заменяет эти инструменты: качество агента зависит от схемы функций, обработки ошибок, лимитов, таймаутов и правил повторного вызова.

Программирование

Для генерации небольших функций, объяснения фрагментов и подготовки тестов модель стоит попробовать. Для автономного изменения большого репозитория нужен более строгий контур: изолированная среда, проверка diff, запуск тестов и ограничение полномочий. Отсутствие в паспорте LMArena Code rating и code rank означает, что редакция не располагает сопоставимым независимым сигналом именно по кодовым сражениям.

Локальное развёртывание

Наличие open weights и MIT делает Terminus пригодной для экспериментов с самостоятельным инференсом и собственным контуром обработки данных. Это преимущество для команд, которым важны контроль маршрутизации запросов и возможность менять стек. Но открытые веса не равны открытому программному обеспечению без ограничений: нужно отдельно учитывать лицензию, условия использования инфраструктуры и совместимость рантайма.

Цена и скорость

В паспортном срезе указана цена 0,27 доллара за 1 млн входных токенов и 1,00 доллар за 1 млн выходных токенов. Если условно обработать 100 тысяч входных и 20 тысяч выходных токенов, арифметическая стоимость составит около 0,047 доллара. Это ориентир для понимания порядка затрат, а не обещание итогового счёта: провайдер может считать кэшированные токены иначе, менять тарифы или предоставлять модель в другом режиме.

Цена выхода выше цены входа примерно в 3,7 раза, поэтому длинные ответы, рассуждения и неограниченные циклы агента могут быстро стать главным источником расходов. Для экономии полезно ограничивать максимальный вывод, отделять внутренние шаги агента от пользовательского ответа, кэшировать стабильные инструкции и заранее задавать условия остановки.

Данных о выходной скорости и времени до первого токена в срезе нет. Поэтому нельзя честно обещать, что модель подойдёт для голосового интерфейса, интерактивного редактора или сервиса с жёстким SLA. Для таких задач нужно измерять p50 и p95 задержки у конкретного провайдера, в конкретном регионе, с конкретным размером запроса и выбранным режимом рассуждения.

Официальная документация DeepSeek отдельно предупреждает, что цены могут меняться и рекомендует проверять страницу тарифов перед пополнением баланса. Это особенно важно для Terminus, поскольку API-алиасы и доступность отдельных версий могут обновляться.

Доступность и лицензия

Паспорт отмечает модель как open weights и указывает лицензию MIT. Официальная карточка Terminus размещена в организации DeepSeek на Hugging Face; там же приведены примеры запуска через Transformers, vLLM и SGLang. Это снижает барьер для прототипирования по сравнению с полностью закрытым API, но не превращает локальный инференс в задачу для обычного ноутбука.

При выборе локального стека нужно проверить, поддерживает ли он точный формат весов, шаблон чата и режим рассуждения. В карточке Terminus есть важное предупреждение: параметры self_attn.o_proj в текущем checkpoint не соответствуют формату масштабирования UE8M0 FP8. Разработчик называет это известной проблемой, которая должна быть исправлена в будущих релизах. Для production-развёртывания это означает необходимость зафиксировать конкретный checkpoint и прогнать полный тест загрузки до закупки вычислительных ресурсов.

Ограничения

  • Ограниченная уверенность. В паспорте confidence отмечена как «ограниченная», поэтому итоговую оценку следует использовать как ориентир, а не как гарантию результата.
  • Нет полного набора независимых метрик. Artificial Analysis Intelligence Index, LMArena Code rating и code rank отсутствуют в срезе.
  • Нет измерений задержки. Отсутствуют output tokens per second и time to first token.
  • Невысокие quality и coding. Оба суббалла равны 50,0 и особенно важны для задач, где ошибка приводит к финансовому, юридическому или техническому ущербу.
  • Контекст требует проверки. 163 840 токенов — заявленный размер окна в паспорте, но не гарантия одинаковой точности на любой длине входа.
  • Сложность локального запуска. Открытые веса требуют совместимого рантайма, памяти, сетевого хранилища и операционного контроля.
  • Неполная информация о мультимодальности. В паспорте нет отметки о работе с изображениями, аудио или видео; выбирать модель для таких задач без отдельной проверки не стоит.

Preview в паспорте отмечен как false, то есть модель не помечена как предварительная версия в редакционном срезе. Это не является обещанием готовности к любому production-сценарию: готовность определяется стабильностью конкретного API, политикой провайдера и результатами тестов команды.

Как проверить на своей задаче

  1. Зафиксируйте объект теста. Запишите точный идентификатор модели или checkpoint, провайдера, дату, режим рассуждения, системную инструкцию и параметры генерации. Не смешивайте результаты разных API-алиасов.
  2. Соберите репрезентативный набор. Возьмите не меньше 30–50 реальных примеров: простые, пограничные и заведомо сложные. Для агента добавьте ошибки инструментов, неполные ответы API, повторные вызовы и конфликтующие инструкции.
  3. Разделите критерии. Оценивайте отдельно фактическую корректность, соблюдение формата, полноту, качество рассуждения, успешность вызова инструментов и необходимость ручной правки. Один общий балл скроет причину неудачи.
  4. Проверьте длинный контекст. Разложите документы по нескольким длинам, добавьте контрольные факты в начале, середине и конце и попросите модель указать источник каждого вывода. Так можно увидеть разницу между размером окна и реальной надёжностью извлечения.
  5. Для кода используйте исполняемую проверку. Сравнивайте не красоту объяснения, а прохождение тестов, корректность diff, отсутствие побочных изменений и устойчивость к повторному запуску.
  6. Измерьте стоимость и задержку. Записывайте число входных и выходных токенов, стоимость запроса, время до первого токена и полное время ответа. Делайте несколько повторов и считайте хотя бы медиану и 95-й перцентиль.
  7. Проведите ручной аудит. Отдельно просмотрите уверенные ошибки, смешение языков, выдуманные ссылки, лишние действия агента и случаи, когда модель не остановилась после выполнения задачи.

Минимальный практический вывод стоит формулировать не как «модель хорошая» или «модель плохая», а как: «из 40 задач она без правки решила 29, ещё 7 — после проверки, 4 завершились ошибкой; средняя стоимость составила …». Такой отчёт полезнее переноса рейтинга из публичной таблицы в ваш продукт.

Кому подойдёт модель

Terminus стоит рассматривать командам, которым нужен недорогой доступ к модели с рассуждением, длинным контекстом и возможностью строить агентные прототипы. Она особенно уместна для внутренних ассистентов, черновой обработки документов, поисковых цепочек с внешним инструментом, классификации и преобразования текстов, а также для локальных экспериментов с открытыми весами.

Осторожнее следует выбирать её для автономного программирования, систем с жёстким SLA, юридических и медицинских выводов, финансовых решений и любых процессов, где ошибку нельзя быстро обнаружить. В этих случаях преимущества цены и доступности должны быть подтверждены собственным тестированием качества, а не только высоким human preference.

FAQ

Какое место занимает DeepSeek V3.1 Terminus Thinking?

В выпуске COMRAD404 2026 H2 модель занимает 52-е место и получает COMRAD Score 64,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.

Что означает рейтинг LMArena 1417,0?

Это статистический рейтинг текстовых ответов, рассчитанный по слепым попарным сравнениям. В паспорте также указаны 120-е место и 3367 голосов. Число 1417,0 нельзя читать как 14,17% качества.

Подходит ли модель для программирования?

Подходит для проверки генерации функций, тестов, объяснений и небольших исправлений. Но coding-суббалл равен 50,0, а независимые LMArena Code rating и code rank в срезе отсутствуют, поэтому крупные репозитории и автономные агенты нужно тестировать отдельно.

Сколько стоит использование через API?

В паспортном срезе указаны 0,27 доллара за 1 млн входных токенов и 1,00 доллар за 1 млн выходных токенов. Тарифы зависят от провайдера, режима, кэширования и даты, поэтому перед запуском нужно проверить актуальные условия.

Можно ли запустить модель локально?

Да, модель помечена как open weights, а лицензия указана как MIT. Официальная карточка приводит инструкции для совместимых рантаймов, но локальный запуск требует подходящей инфраструктуры и проверки формата весов. В карточке также зафиксирована известная проблема с параметрами self_attn.o_proj и UE8M0 FP8.

Есть ли у модели подтверждённая скорость генерации?

Нет. В срезе отсутствуют output tokens per second и time to first token. Скорость нужно измерять самостоятельно у выбранного API-провайдера или в локальном рантайме.

Источники

Официальное обновление DeepSeek V3.1 Terminus — название модели, дата обновления, заявленные исправления языка и улучшения Code Agent и Search Agent.

Официальная карточка DeepSeek-V3.1-Terminus на Hugging Face — лицензия, open weights, инструкции локального запуска, режимы использования и техническое предупреждение о FP8.

LMArena Text Leaderboard — независимый источник для Text Arena rating, позиции и количества голосов; в статье использованы значения из переданного паспортного среза.

Официальная документация DeepSeek по тарифам — единицы тарификации и предупреждение о возможном изменении цен.

Artificial Analysis LLM Leaderboard — внешний источник для проверки Intelligence Index, цен, скорости и контекста; по данной модели соответствующий Intelligence Index в паспортном срезе не зафиксирован.