
Главный вывод, который следует из опубликованных 24 апреля 2026 года материалов DeepSeek и независимых тестов, звучит парадоксально: DeepSeek-V4 не является абсолютным лидером по сырым бенчмаркам, но это, возможно, самый важный релиз года для тех, кто строит агентов. Проблема не в том, чтобы накормить модель миллионом токенов, а в том, чтобы она могла с этим контекстом работать, не сжигая бюджет на GPU и не теряя нить рассуждений. V4 решает именно эту задачу, и решает её архитектурно, а не просто наращиванием памяти.
Компания выпустила две модели: DeepSeek-V4-Pro (1,6 трлн параметров, 49 млрд активных) и DeepSeek-V4-Flash (284 млрд, 13 млрд активных). Обе — открытые, с лицензией MIT. Обе поддерживают контекст в 1 млн токенов. Однако ключевое отличие от предшественников — не размер, а то, как модель с этим размером обходится.
Тезис, который нужно проверить: DeepSeek утверждает, что V4-Pro на контексте в 1 млн токенов требует лишь 27% вычислительных затрат (FLOPs) на один токен и 10% памяти KV-кэша по сравнению с V3.2. Цифры впечатляющие, но они требуют верификации через понимание архитектуры.
Почему агенты ломались раньше
Типичный сценарий работы агента — это длинная цепочка вызовов инструментов: SWE-bench задача, многошаговый сеанс просмотра веб-страниц, сотни команд в терминале. Каждый результат работы инструмента добавляется в контекст, и последующие токены платят полную стоимость внимания ко всему, что было ранее. Два числа становятся критическими: FLOPs на один токен и размер KV-кэша. Оба растут линейно (а в случае полного внимания — квадратично) с длиной последовательности. На практике это означало, что агент либо «замерзал» (GPU заполнялся кэшем), либо контекст «вылетал» за бюджет, либо модель начинала деградировать в середине задачи. V4 спроектирована для устранения именно этих «предсказуемых поломок», как пишут авторы в блоге на Hugging Face.
Две механики внимания вместо одной
Архитектурная инновация V4 — это расщепление механизма внимания на два комплементарных слоя, которые чередуются по глубине сети.
Первый — Compressed Sparse Attention, или CSA. Он сжимает KV-пары в 4 раза по оси последовательности с помощью softmax-гейтированной пулинговой операции с обучаемым позиционным смещением. После сжатия lightning indexer (работающий в FP4 с ReLU-оценкой multi-head dot product) выбирает top-k сжатых блоков для каждого запроса. Этот механизм наследует идею разреженного выбора из DeepSeek Sparse Attention в V3.2, но теперь поиск идёт по блокам, которые уже в 4 раза короче. Параллельно работает sliding-window ветка для самых последних несжатых токенов.
Второй — Heavily Compressed Attention, HCA. Здесь сжатие идёт уже в 128 раз, а разреженный отбор убирается: каждый запрос плотно взаимодействует с каждым сжатым блоком. Поскольку сжатая последовательность очень коротка, плотное внимание оказывается дешёвым. Снова есть sliding-window компонент для свежих токенов.
Слои чередуются. В V4-Pro (61 слой) первые два — HCA, затем идёт чередование CSA и HCA вплоть до предпоследнего, а последний блок MTP работает только на sliding-window. Эта конструкция позволяет разным слоям нести разные паттерны внимания, не тратя ёмкость на универсальность.
Ключевой момент: DeepSeek использует FP8 для хранения большинства KV-записей и BF16 только для RoPE-размерностей. Lightning indexer внутри CSA работает в FP4. В сочетании с коэффициентами сжатия это даёт те самые 2% от размера KV-кэша по сравнению с групповым вниманием (GQA) с 8 головами в bfloat16.
Независимая проверка цифр
Цифры DeepSeek подтверждаются косвенно. В техническом отчёте (arXiv: 2606.19348v1) прямо указано: на контексте в 1 млн токенов V4-Pro требует 27% FLOPs и 10% KV-кэша от V3.2. V4-Flash снижает эти показатели до 10% FLOPs и 7% KV-кэша. Бенчмарки на искусственных данных, такие как RULER и MRCR, где модель должна извлекать факты из длинного контекста, показывают, что V4-Pro-Max (режим максимального рассуждения) действительно способен обрабатывать миллион токенов без катастрофической потери точности. Однако, как отмечает независимый обозреватель Томас Вигольд в своём тестировании, на реальных задачах с кодом V4 иногда флагштрит ложные срабатывания, находя проблемы там, где их нет. Это не опровергает цифры эффективности, но напоминает, что бенчмарки — не вся история.
Пост-тренинг, который меняет правила игры для агентов
Эффективное внимание — необходимое, но не достаточное условие для агентов. DeepSeek внедрила три важных изменения в пост-тренинге.
Первое: сохранение рассуждений между вызовами инструментов. В V3.2 цепочка рассуждений сбрасывалась при каждом новом сообщении пользователя. Для одношаговых запросов это нормально. Но для многошаговых агентских сценариев, где пользователь отправляет уточнение после того, как агент уже сделал несколько вызовов инструментов, модель теряла накопленные рассуждения и была вынуждена реконструировать состояние. V4 сохраняет полную историю рассуждений через все раунды, включая повороты пользователя. Для разговоров без инструментов старое поведение сохраняется — рассуждения сбрасываются на каждом новом сообщении, чтобы контекст оставался компактным.
Второе: новый формат вызова инструментов на основе XML и специальный токен |DSML|. XML-формат снижает количество ошибок экранирования по сравнению с JSON-строками, которые часто ломаются, когда модель генерирует вложенные кавычки. Схема разделяет строковые параметры (передаются как есть с string=»true») и структурированные (передаются как JSON с string=»false»). Это устраняет целый класс ошибок парсинга чисел и булевых значений, которые типичны для JSON-форматов.
Третье: обучение агентского поведения с RL в реальных средах. Для этого DeepSeek построила платформу DSec (DeepSeek Elastic Compute) на Rust, которая предоставляет четыре типа сред выполнения через единый Python SDK: вызовы функций, контейнеры, microVM (Firecracker) и полноценные VM (QEMU). Один кластер может запускать сотни тысяч песочниц одновременно. Три ключевые возможности DSec: быстрая загрузка образов через layered 3FS-хранилище (RL-роллауты не ждут запуска контейнера), воспроизведение траекторий с защитой от прерываний (прерванные шаги обучения возобновляются без перезапуска вызовов инструментов) и единый API для всех сред. Эти инфраструктурные решения позволили обучить агентское поведение, которое просто не было возможно раньше.
Эволюция релиза: от превью к официальным версиям
Превью-релиз от 24 апреля был только началом. 13 августа 2026 года DeepSeek выпустила официальную версию V4-Pro (маркировка 0813) с присоединённым модулем спекулятивного декодирования DSpark. По заявлению компании, новая версия превосходит превью на всех агентских бенчмарках и конкурентоспособна с сильнейшими проприетарными моделями. Поддерживаются три уровня усилия рассуждения: low, high и max.
Ещё более интересная история произошла с V4-Flash. 31 июля 2026 года вышла версия 0731, которая, сохранив ту же архитектуру и размер, была переобучена и теперь превосходит превью-версию V4-Pro на всех девяти агентских бенчмарках, которые публикует DeepSeek. Модель с 13 млрд активных параметров бьёт модель с 49 млрд активных — при значительно меньшей стоимости инференса. Это меняет логику выбора модели для агентских задач.
Практические последствия и ограничения
Что это означает для инженера, строящего агента? Если ваша задача — длинная цепочка вызовов инструментов с контекстом в сотни тысяч токенов, V4-Flash-0731 становится моделью по умолчанию. Она дешевле, быстрее и, по крайней мере на бенчмарках DeepSeek, не уступает Pro. Однако есть нюанс: как отмечает независимый тестер на Reddit, V4-Flash может «сжечь» $5 на OpenRouter за один день при активном использовании, если не настроить лимиты. Это не проблема модели, а вопрос тарификации и контроля.
Важное ограничение: DeepSeek-V4 — текстовая модель. Мультимодальности нет. Если нужна работа с изображениями, придётся смотреть в сторону Kimi K2.6 или Gemini. Также модель не поставляется с Jinja-шаблоном чата — нужно использовать отдельные Python-скрипты из репозитория для кодирования сообщений. Это небольшая, но реальная проблема при интеграции.
Что может изменить вывод
Вывод о том, что V4 — лучшая модель для агентов, основан на архитектурных решениях и бенчмарках DeepSeek. Независимые тесты, такие как обзор Томаса Вигольда, показывают, что на сложных задачах кодирования V4 может уступать Claude или GPT-5.5. Если ваша задача — не длинные агентские цепочки, а разовые сложные запросы, возможно, другие модели окажутся лучше. Кроме того, реальная эффективность на контексте в миллион токенов в production-среде ещё требует независимого подтверждения — тесты на RULER не всегда коррелируют с поведением в реальном приложении.
DeepSeek-V4 — это архитектурный прорыв в области эффективности контекста. Она не переписывает правила игры для всех задач, но для агентов, работающих с длинными траекториями, она предлагает решение, которого индустрия ждала. Вопрос теперь в том, насколько быстро сообщество адаптирует свои пайплайны под новые возможности.