Запись архива

Qwen3.5 397B A17B: обзор модели Alibaba

Qwen3.5 397B A17B выделяется высокой пользовательской предпочтительностью, открытыми весами и длинным контекстом, но её средние оценки качества и кода требуют обязательного теста на целевой нагрузке.

Профиль Qwen3.5 397B A17B с оценками качества, кода, эффективности и доступности

Qwen3.5 397B A17B стоит рассматривать не как безусловного лидера по качеству, а как доступную для самостоятельного развёртывания reasoning-модель с сильным пользовательским восприятием, мультимодальностью и контекстом 262 144 токена. Её профиль заметно неравномерен: высокий результат по предпочтениям людей и доступности соседствует со средними оценками качества и эффективности и более слабым кодовым суббаллом. Поэтому модель особенно интересна командам, которым важны контроль над инфраструктурой, длинные документы и возможность выбирать между API и собственным сервером, но не подходит для внедрения только по позиции в таблице.

Коротко

  • Место: 55-е в рейтинге COMRAD404, редакция 2026 H2.
  • COMRAD Score: 63,9 из 100 — нормализованная редакционная оценка, а не процент правильных ответов.
  • Главные плюсы: открытые веса под Apache 2.0, reasoning-режим, мультимодальная основа, контекст 262 144 токена и высокий суббалл человеческих предпочтений.
  • Главные риски: кодовый профиль слабее общего пользовательского восприятия, а самостоятельный запуск модели такого масштаба требует серьёзной инфраструктуры.
  • Практический вывод: хороший кандидат для пилота с длинными материалами, внутренними агентами и контролируемым развёртыванием; качество кода и соблюдение форматов следует проверять отдельно.

Паспорт модели

Параметр Значение в срезе
Модель Qwen3.5 397B A17B
Организация Alibaba
Место в COMRAD404 55
COMRAD Score 63,9
Reasoning Да
Статус preview Нет
Открытые веса Да
Лицензия Apache 2.0
Контекст 262 144 токена
Уверенность профиля Высокая
Дата среза 31 августа 2026 года

Открытые веса здесь означают возможность получить и развернуть опубликованные артефакты модели на условиях Apache 2.0. Это не следует автоматически переносить на весь программный стек: лицензии серверов инференса, библиотек, контейнеров, обучающих данных и сторонних интеграций проверяются отдельно.

Место в рейтинге

Qwen3.5 397B A17B занимает 55-е место с COMRAD Score 63,9. Итог рассчитан по методологии 1.0: качество получает вес 40%, человеческие предпочтения — 30%, код — 15%, эффективность — 10%, доступность — 5%. Взвешивание пяти суббаллов даёт 63,86, округлённые до 63,9.

Эта позиция отражает компромисс, а не единственную шкалу «умности». Высокие 90,6 за человеческие предпочтения заметно поддерживают итог, однако наиболее весомый компонент — качество — равен 51,3. Кодовый суббалл 42,7 также ограничивает модель в рейтинге. Полную таблицу и правила чтения результатов смотрите в рейтинге ИИ-моделей COMRAD404.

Важно не смешивать показатели. COMRAD Score и суббаллы — нормализованные редакционные оценки от 0 до 100. LMArena rating — статистический рейтинг, построенный по слепым попарным сравнениям ответов. Artificial Analysis Intelligence Index — отдельный индекс независимого измерителя. Ни один из них не является процентом качества или гарантированной вероятностью правильного ответа.

Как устроена Qwen3.5 397B A17B

Официальная карточка описывает модель как причинную языковую модель с визуальным энкодером. В языковой части заявлены 397 млрд параметров всего и 17 млрд активируемых при обработке токена. Обозначение A17B как раз указывает на активную часть разреженной архитектуры Mixture-of-Experts, а не на полный размер весов.

Разработчик сообщает о гибридной схеме, объединяющей Gated DeltaNet, обычное внимание и MoE-слои. Для покупателя API архитектурные детали вторичны, но при самостоятельном развёртывании они имеют практическое значение: активные параметры не равны объёму всей модели в памяти, а ожидаемая экономичность вычислений не отменяет необходимости разместить полный набор весов и обслуживать длинный KV-кэш.

Модель является мультимодальной: официальные примеры показывают текстовые, графические и видеовходы. Reasoning включён по умолчанию, а прямой ответ без этапа рассуждения задаётся параметрами API или шаблона чата. Официальная карточка отдельно предупреждает, что прежние текстовые переключатели /think и /nothink для этой версии не считаются поддерживаемым способом управления режимом.

Разбор пяти суббаллов

Компонент Оценка Вес Редакционная интерпретация
Качество 51,3 40% Средний результат по наиболее весомой группе независимых измерений; сложные задачи нельзя считать закрытыми без проверки.
Человеческие предпочтения 90,6 30% Ответы часто убедительно воспринимаются пользователями в слепом сравнении.
Код 42,7 15% Программирование — более рискованная зона профиля, особенно для правок репозиториев и автономных агентов.
Эффективность 51,1 10% Цена и измеренная скорость конкурентны не сами по себе, а в сочетании с фактическим качеством на задаче.
Доступность 92,9 5% Открытые веса, разрешительная лицензия и варианты самостоятельного запуска дают команде широкий контроль.

Главная особенность профиля — разрыв между человеческим предпочтением и инструментальными измерениями. LMArena Text rating составляет 1441,5 при 71 882 голосах и 80-м месте текстовой таблицы. Высокий редакционный суббалл 90,6 не противоречит сырому месту: нормализация учитывает шкалу и распределение исходных значений, тогда как место показывает только порядок участников в конкретном срезе.

Artificial Analysis Intelligence Index равен 34,3; значение не является оценочным восстановлением — источник присутствует в срезе. Для кода зафиксированы LMArena Code rating 1398,2 и 70-е место. Сочетание этих данных объясняет, почему модель может нравиться в диалоге, но не получать столь же высокий итог по задачам, где важны проверяемая правильность и работа с программным кодом.

Возможности и сценарии

Длинные документы и базы знаний

Контекст 262 144 токена позволяет передавать крупные отчёты, наборы внутренних инструкций, протоколы, документацию или значительные фрагменты репозитория. Это не гарантирует одинакового внимания ко всем частям окна. Полезный сценарий — извлечение фактов с обязательными ссылками на фрагменты входа, а не просьба «проанализировать всё» без критериев.

Мультимодальный анализ

Визуальный энкодер делает модель кандидатом для разбора скриншотов, схем, отсканированных документов, фотографий интерфейсов и видео. В рабочем тесте нужно отдельно оценивать OCR, локализацию объектов, понимание таблиц и устойчивость выводов при плохом качестве изображения. Официальные демонстрации подтверждают наличие функций, но не заменяют независимую приёмку.

Агенты и вызов инструментов

Карточка модели содержит рекомендации по tool calling и интеграции с Qwen-Agent, vLLM и SGLang. Это позволяет строить ассистентов, которые обращаются к поиску, файловой системе или внутренним API. Однако кодовый суббалл 42,7 требует ограничивать права агента, валидировать аргументы функций и выполнять операции записи только через подтверждение или песочницу.

Диалоговые интерфейсы

Сильный результат человеческих предпочтений делает модель интересной для поддержки, внутренних помощников, редактирования и объяснения материалов. Но приятный стиль способен скрывать фактическую ошибку. Для ответов о политике компании, финансах, медицине, праве и безопасности нужны retrieval, цитирование источников и детерминированные проверки.

Разработка программного обеспечения

Модель можно пробовать для объяснения кода, генерации тестов, документации и небольших локальных изменений. Для многофайловых патчей, миграций и автономного исправления дефектов исходный профиль недостаточно силён, чтобы доверять результату без CI. Компиляция, статический анализ, тесты и просмотр diff должны оставаться обязательными этапами.

Цена и скорость

В зафиксированном измерении цена составила $0,39 за миллион входных токенов и $2,34 за миллион выходных. Пример: запрос со 100 000 входных и 10 000 выходных токенов обойдётся примерно в $0,0624 без учёта дополнительных сборов, повторных запросов, кэширования, инструментов и мультимодальной обработки.

Измеренная скорость генерации — 80,9 выходного токена в секунду, время до первого токена — 1,9 секунды. Это показатели конкретного API-провайдера и режима тестирования, а не постоянные свойства весов. На практике результат меняют длина контекста, reasoning, пакетная обработка, квантование, аппаратное обеспечение, регион и текущая загрузка сервиса.

При оценке бюджета нужно считать не только тариф за токены. Reasoning способен увеличивать объём генерации, длинный контекст — стоимость входа и требования к памяти, а агентный цикл — число обращений. Для продукта важнее стоимость успешно выполненной операции: цена всех запросов, делённая на количество ответов, прошедших проверку.

Развёртывание и контроль

Официальная карточка предоставляет примеры OpenAI-совместимого сервера для vLLM, SGLang и Transformers. Для производительной нагрузки разработчик рекомендует специализированные движки инференса. В приведённых официальных командах для полного контекста используется тензорный параллелизм на восьми GPU — это полезный ориентир масштаба, но не универсальная спецификация оборудования.

Самостоятельное размещение даёт контроль над журналированием, сетевым периметром, версиями весов и политиками хранения данных. Обратная сторона — ответственность за совместимость библиотек, безопасность эндпоинта, мониторинг, обновления и воспроизводимость. Перед эксплуатацией стоит зафиксировать хеш или ревизию модели, версию движка, шаблон чата и параметры сэмплирования.

Управляемый API снижает инфраструктурную нагрузку, однако имя и возможности размещённого сервиса могут отличаться от опубликованных весов. Официальная карточка связывает модель с облачным вариантом Qwen3.5-Plus, но одновременно указывает на дополнительные функции хостинга. Их нельзя автоматически считать идентичными при сравнении результатов.

Ограничения

  • Неравномерный профиль. Высокая предпочтительность ответов не компенсирует автоматически среднее инструментальное качество и более слабый кодовый результат.
  • Большой полный размер. 17 млрд активных параметров не означают, что модель можно хранить как обычную модель на 17 млрд параметров.
  • Стоимость длинного контекста. Максимальное окно может быть технически доступно, но дорого и медленно в реальной цепочке.
  • Зависимость от сервера. Поддержка reasoning, изображений, видео, tool calling и параметров сэмплирования различается между движками и провайдерами.
  • Риск убедительных ошибок. Высокий LMArena-профиль измеряет предпочтение людей, а не фактическую безошибочность.
  • Код требует исполнения. Сгенерированные патчи нельзя принимать без тестов, анализа зависимостей и проверки безопасности.
  • Данные могут устаревать. Цены, скорость, места и интерфейсы приведены на 31 августа 2026 года и после этой даты могут измениться.

Кому модель подойдёт

Qwen3.5 397B A17B стоит включить в шорт-лист организациям, которым нужны открытые веса, разрешительная лицензия, длинный контекст и мультимодальные входы. Особенно логичен пилот для внутренних систем с закрытыми документами, исследовательских стендов, агентных прототипов и продуктов, где можно автоматически проверять результат.

Модель менее очевидна для небольших команд, желающих запустить полный вариант на одной доступной машине, а также для задач, где почти весь объём составляет автономная генерация production-кода. Если единственный критерий — минимальная цена запроса, паспорт тоже недостаточен: нужно учитывать долю успешных ответов и затраты на исправление ошибок.

Как проверить на своей задаче

  1. Соберите 50–200 реальных примеров. Включите типовые, редкие и намеренно сложные случаи, а также данные с чувствительной информацией в обезличенном виде.
  2. Определите критерии до запуска. Например: фактическая точность, полнота, валидность JSON, число успешных tool calls, прохождение тестов, задержка и стоимость.
  3. Разделите режимы. Сравните reasoning и прямой ответ, короткий и длинный контекст, текстовые и мультимодальные запросы.
  4. Зафиксируйте конфигурацию. Сохраните провайдера, идентификатор модели, дату, температуру, лимит вывода, шаблон чата и системный промпт.
  5. Проверяйте автоматически. Для кода запускайте тесты и линтеры; для структурированных ответов — JSON Schema; для документов — сверку цитат с исходными фрагментами.
  6. Проведите слепую оценку. Не показывайте экспертам имя модели и перемешайте ответы, чтобы стиль не подменял правильность.
  7. Посчитайте экономику результата. Сравнивайте стоимость успешно решённого кейса, а не только цену миллиона токенов.
  8. Проверьте безопасность. Протестируйте prompt injection, утечки системных инструкций, опасные аргументы инструментов и попытки записать данные без разрешения.

FAQ

Qwen3.5 397B A17B — открытая модель?

Её веса опубликованы под лицензией Apache 2.0, поэтому корректно говорить об открытых весах. Это не делает автоматически открытым программным обеспечением весь стек развёртывания и все связанные компоненты.

Что означают 397B и A17B?

По официальной карточке, языковая часть содержит 397 млрд параметров всего, а при обработке активируется около 17 млрд. Это разреженная MoE-модель; A17B не описывает полный объём весов.

Подходит ли модель для программирования?

Она пригодна для пилота, объяснения кода, тестов и ограниченных правок, но кодовый суббалл 42,7 указывает на необходимость строгой проверки. Для production-патчей обязательны CI, статический анализ и ревью.

Можно ли доверять LMArena rating 1441,5 как проценту точности?

Нет. Это статистический рейтинг по слепым попарным сравнениям. Он отражает относительное пользовательское предпочтение ответов и не равен доле правильных решений.

Сколько стоит использование Qwen3.5 397B A17B?

В срезе указаны $0,39 за миллион входных и $2,34 за миллион выходных токенов. Реальная цена зависит от API-провайдера, региона, режима, кэширования и дополнительных функций.

Можно ли развернуть модель самостоятельно?

Да, официальная карточка содержит инструкции для vLLM, SGLang и Transformers. Однако полный размер модели и длинный контекст требуют серьёзных ресурсов; активные 17 млрд параметров нельзя трактовать как объём хранения.

Источники