Qwen3.5 397B A17B стоит рассматривать не как безусловного лидера по качеству, а как доступную для самостоятельного развёртывания reasoning-модель с сильным пользовательским восприятием, мультимодальностью и контекстом 262 144 токена. Её профиль заметно неравномерен: высокий результат по предпочтениям людей и доступности соседствует со средними оценками качества и эффективности и более слабым кодовым суббаллом. Поэтому модель особенно интересна командам, которым важны контроль над инфраструктурой, длинные документы и возможность выбирать между API и собственным сервером, но не подходит для внедрения только по позиции в таблице.
Коротко
- Место: 55-е в рейтинге COMRAD404, редакция 2026 H2.
- COMRAD Score: 63,9 из 100 — нормализованная редакционная оценка, а не процент правильных ответов.
- Главные плюсы: открытые веса под Apache 2.0, reasoning-режим, мультимодальная основа, контекст 262 144 токена и высокий суббалл человеческих предпочтений.
- Главные риски: кодовый профиль слабее общего пользовательского восприятия, а самостоятельный запуск модели такого масштаба требует серьёзной инфраструктуры.
- Практический вывод: хороший кандидат для пилота с длинными материалами, внутренними агентами и контролируемым развёртыванием; качество кода и соблюдение форматов следует проверять отдельно.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Qwen3.5 397B A17B |
| Организация | Alibaba |
| Место в COMRAD404 | 55 |
| COMRAD Score | 63,9 |
| Reasoning | Да |
| Статус preview | Нет |
| Открытые веса | Да |
| Лицензия | Apache 2.0 |
| Контекст | 262 144 токена |
| Уверенность профиля | Высокая |
| Дата среза | 31 августа 2026 года |
Открытые веса здесь означают возможность получить и развернуть опубликованные артефакты модели на условиях Apache 2.0. Это не следует автоматически переносить на весь программный стек: лицензии серверов инференса, библиотек, контейнеров, обучающих данных и сторонних интеграций проверяются отдельно.
Место в рейтинге
Qwen3.5 397B A17B занимает 55-е место с COMRAD Score 63,9. Итог рассчитан по методологии 1.0: качество получает вес 40%, человеческие предпочтения — 30%, код — 15%, эффективность — 10%, доступность — 5%. Взвешивание пяти суббаллов даёт 63,86, округлённые до 63,9.
Эта позиция отражает компромисс, а не единственную шкалу «умности». Высокие 90,6 за человеческие предпочтения заметно поддерживают итог, однако наиболее весомый компонент — качество — равен 51,3. Кодовый суббалл 42,7 также ограничивает модель в рейтинге. Полную таблицу и правила чтения результатов смотрите в рейтинге ИИ-моделей COMRAD404.
Важно не смешивать показатели. COMRAD Score и суббаллы — нормализованные редакционные оценки от 0 до 100. LMArena rating — статистический рейтинг, построенный по слепым попарным сравнениям ответов. Artificial Analysis Intelligence Index — отдельный индекс независимого измерителя. Ни один из них не является процентом качества или гарантированной вероятностью правильного ответа.
Как устроена Qwen3.5 397B A17B
Официальная карточка описывает модель как причинную языковую модель с визуальным энкодером. В языковой части заявлены 397 млрд параметров всего и 17 млрд активируемых при обработке токена. Обозначение A17B как раз указывает на активную часть разреженной архитектуры Mixture-of-Experts, а не на полный размер весов.
Разработчик сообщает о гибридной схеме, объединяющей Gated DeltaNet, обычное внимание и MoE-слои. Для покупателя API архитектурные детали вторичны, но при самостоятельном развёртывании они имеют практическое значение: активные параметры не равны объёму всей модели в памяти, а ожидаемая экономичность вычислений не отменяет необходимости разместить полный набор весов и обслуживать длинный KV-кэш.
Модель является мультимодальной: официальные примеры показывают текстовые, графические и видеовходы. Reasoning включён по умолчанию, а прямой ответ без этапа рассуждения задаётся параметрами API или шаблона чата. Официальная карточка отдельно предупреждает, что прежние текстовые переключатели /think и /nothink для этой версии не считаются поддерживаемым способом управления режимом.
Разбор пяти суббаллов
| Компонент | Оценка | Вес | Редакционная интерпретация |
|---|---|---|---|
| Качество | 51,3 | 40% | Средний результат по наиболее весомой группе независимых измерений; сложные задачи нельзя считать закрытыми без проверки. |
| Человеческие предпочтения | 90,6 | 30% | Ответы часто убедительно воспринимаются пользователями в слепом сравнении. |
| Код | 42,7 | 15% | Программирование — более рискованная зона профиля, особенно для правок репозиториев и автономных агентов. |
| Эффективность | 51,1 | 10% | Цена и измеренная скорость конкурентны не сами по себе, а в сочетании с фактическим качеством на задаче. |
| Доступность | 92,9 | 5% | Открытые веса, разрешительная лицензия и варианты самостоятельного запуска дают команде широкий контроль. |
Главная особенность профиля — разрыв между человеческим предпочтением и инструментальными измерениями. LMArena Text rating составляет 1441,5 при 71 882 голосах и 80-м месте текстовой таблицы. Высокий редакционный суббалл 90,6 не противоречит сырому месту: нормализация учитывает шкалу и распределение исходных значений, тогда как место показывает только порядок участников в конкретном срезе.
Artificial Analysis Intelligence Index равен 34,3; значение не является оценочным восстановлением — источник присутствует в срезе. Для кода зафиксированы LMArena Code rating 1398,2 и 70-е место. Сочетание этих данных объясняет, почему модель может нравиться в диалоге, но не получать столь же высокий итог по задачам, где важны проверяемая правильность и работа с программным кодом.
Возможности и сценарии
Длинные документы и базы знаний
Контекст 262 144 токена позволяет передавать крупные отчёты, наборы внутренних инструкций, протоколы, документацию или значительные фрагменты репозитория. Это не гарантирует одинакового внимания ко всем частям окна. Полезный сценарий — извлечение фактов с обязательными ссылками на фрагменты входа, а не просьба «проанализировать всё» без критериев.
Мультимодальный анализ
Визуальный энкодер делает модель кандидатом для разбора скриншотов, схем, отсканированных документов, фотографий интерфейсов и видео. В рабочем тесте нужно отдельно оценивать OCR, локализацию объектов, понимание таблиц и устойчивость выводов при плохом качестве изображения. Официальные демонстрации подтверждают наличие функций, но не заменяют независимую приёмку.
Агенты и вызов инструментов
Карточка модели содержит рекомендации по tool calling и интеграции с Qwen-Agent, vLLM и SGLang. Это позволяет строить ассистентов, которые обращаются к поиску, файловой системе или внутренним API. Однако кодовый суббалл 42,7 требует ограничивать права агента, валидировать аргументы функций и выполнять операции записи только через подтверждение или песочницу.
Диалоговые интерфейсы
Сильный результат человеческих предпочтений делает модель интересной для поддержки, внутренних помощников, редактирования и объяснения материалов. Но приятный стиль способен скрывать фактическую ошибку. Для ответов о политике компании, финансах, медицине, праве и безопасности нужны retrieval, цитирование источников и детерминированные проверки.
Разработка программного обеспечения
Модель можно пробовать для объяснения кода, генерации тестов, документации и небольших локальных изменений. Для многофайловых патчей, миграций и автономного исправления дефектов исходный профиль недостаточно силён, чтобы доверять результату без CI. Компиляция, статический анализ, тесты и просмотр diff должны оставаться обязательными этапами.
Цена и скорость
В зафиксированном измерении цена составила $0,39 за миллион входных токенов и $2,34 за миллион выходных. Пример: запрос со 100 000 входных и 10 000 выходных токенов обойдётся примерно в $0,0624 без учёта дополнительных сборов, повторных запросов, кэширования, инструментов и мультимодальной обработки.
Измеренная скорость генерации — 80,9 выходного токена в секунду, время до первого токена — 1,9 секунды. Это показатели конкретного API-провайдера и режима тестирования, а не постоянные свойства весов. На практике результат меняют длина контекста, reasoning, пакетная обработка, квантование, аппаратное обеспечение, регион и текущая загрузка сервиса.
При оценке бюджета нужно считать не только тариф за токены. Reasoning способен увеличивать объём генерации, длинный контекст — стоимость входа и требования к памяти, а агентный цикл — число обращений. Для продукта важнее стоимость успешно выполненной операции: цена всех запросов, делённая на количество ответов, прошедших проверку.
Развёртывание и контроль
Официальная карточка предоставляет примеры OpenAI-совместимого сервера для vLLM, SGLang и Transformers. Для производительной нагрузки разработчик рекомендует специализированные движки инференса. В приведённых официальных командах для полного контекста используется тензорный параллелизм на восьми GPU — это полезный ориентир масштаба, но не универсальная спецификация оборудования.
Самостоятельное размещение даёт контроль над журналированием, сетевым периметром, версиями весов и политиками хранения данных. Обратная сторона — ответственность за совместимость библиотек, безопасность эндпоинта, мониторинг, обновления и воспроизводимость. Перед эксплуатацией стоит зафиксировать хеш или ревизию модели, версию движка, шаблон чата и параметры сэмплирования.
Управляемый API снижает инфраструктурную нагрузку, однако имя и возможности размещённого сервиса могут отличаться от опубликованных весов. Официальная карточка связывает модель с облачным вариантом Qwen3.5-Plus, но одновременно указывает на дополнительные функции хостинга. Их нельзя автоматически считать идентичными при сравнении результатов.
Ограничения
- Неравномерный профиль. Высокая предпочтительность ответов не компенсирует автоматически среднее инструментальное качество и более слабый кодовый результат.
- Большой полный размер. 17 млрд активных параметров не означают, что модель можно хранить как обычную модель на 17 млрд параметров.
- Стоимость длинного контекста. Максимальное окно может быть технически доступно, но дорого и медленно в реальной цепочке.
- Зависимость от сервера. Поддержка reasoning, изображений, видео, tool calling и параметров сэмплирования различается между движками и провайдерами.
- Риск убедительных ошибок. Высокий LMArena-профиль измеряет предпочтение людей, а не фактическую безошибочность.
- Код требует исполнения. Сгенерированные патчи нельзя принимать без тестов, анализа зависимостей и проверки безопасности.
- Данные могут устаревать. Цены, скорость, места и интерфейсы приведены на 31 августа 2026 года и после этой даты могут измениться.
Кому модель подойдёт
Qwen3.5 397B A17B стоит включить в шорт-лист организациям, которым нужны открытые веса, разрешительная лицензия, длинный контекст и мультимодальные входы. Особенно логичен пилот для внутренних систем с закрытыми документами, исследовательских стендов, агентных прототипов и продуктов, где можно автоматически проверять результат.
Модель менее очевидна для небольших команд, желающих запустить полный вариант на одной доступной машине, а также для задач, где почти весь объём составляет автономная генерация production-кода. Если единственный критерий — минимальная цена запроса, паспорт тоже недостаточен: нужно учитывать долю успешных ответов и затраты на исправление ошибок.
Как проверить на своей задаче
- Соберите 50–200 реальных примеров. Включите типовые, редкие и намеренно сложные случаи, а также данные с чувствительной информацией в обезличенном виде.
- Определите критерии до запуска. Например: фактическая точность, полнота, валидность JSON, число успешных tool calls, прохождение тестов, задержка и стоимость.
- Разделите режимы. Сравните reasoning и прямой ответ, короткий и длинный контекст, текстовые и мультимодальные запросы.
- Зафиксируйте конфигурацию. Сохраните провайдера, идентификатор модели, дату, температуру, лимит вывода, шаблон чата и системный промпт.
- Проверяйте автоматически. Для кода запускайте тесты и линтеры; для структурированных ответов — JSON Schema; для документов — сверку цитат с исходными фрагментами.
- Проведите слепую оценку. Не показывайте экспертам имя модели и перемешайте ответы, чтобы стиль не подменял правильность.
- Посчитайте экономику результата. Сравнивайте стоимость успешно решённого кейса, а не только цену миллиона токенов.
- Проверьте безопасность. Протестируйте prompt injection, утечки системных инструкций, опасные аргументы инструментов и попытки записать данные без разрешения.
FAQ
Qwen3.5 397B A17B — открытая модель?
Её веса опубликованы под лицензией Apache 2.0, поэтому корректно говорить об открытых весах. Это не делает автоматически открытым программным обеспечением весь стек развёртывания и все связанные компоненты.
Что означают 397B и A17B?
По официальной карточке, языковая часть содержит 397 млрд параметров всего, а при обработке активируется около 17 млрд. Это разреженная MoE-модель; A17B не описывает полный объём весов.
Подходит ли модель для программирования?
Она пригодна для пилота, объяснения кода, тестов и ограниченных правок, но кодовый суббалл 42,7 указывает на необходимость строгой проверки. Для production-патчей обязательны CI, статический анализ и ревью.
Можно ли доверять LMArena rating 1441,5 как проценту точности?
Нет. Это статистический рейтинг по слепым попарным сравнениям. Он отражает относительное пользовательское предпочтение ответов и не равен доле правильных решений.
Сколько стоит использование Qwen3.5 397B A17B?
В срезе указаны $0,39 за миллион входных и $2,34 за миллион выходных токенов. Реальная цена зависит от API-провайдера, региона, режима, кэширования и дополнительных функций.
Можно ли развернуть модель самостоятельно?
Да, официальная карточка содержит инструкции для vLLM, SGLang и Transformers. Однако полный размер модели и длинный контекст требуют серьёзных ресурсов; активные 17 млрд параметров нельзя трактовать как объём хранения.
Источники
- Официальная карточка Qwen3.5-397B-A17B — архитектура, лицензия, контекст, мультимодальность и инструкции запуска.
- Официальный материал Qwen3.5 — описание поколения и заявленные разработчиком направления развития.
- Репозиторий Qwen-Agent — официальный инструментарий для агентных интеграций.
- Документация Alibaba Cloud Model Studio — варианты API и совместимых интерфейсов.
- Artificial Analysis LLM Leaderboard — Intelligence Index, цена, скорость и контекст в зафиксированном срезе.
- LMArena Text Leaderboard — текстовый рейтинг, место и число голосов.
- LMArena Leaderboard — данные Code Arena, использованные в кодовом суббалле.
