Qwen3.5 122B A10B — модель для тех, кому нужны открытые веса, мультимодальный ввод и разумная стоимость API, но не максимальные показатели общего качества или программирования. В срезе COMRAD404 на 31 августа 2026 года она занимает 79-е место с COMRAD Score 61,8. Профиль неоднородный: редакционная оценка особенно поддержана человеческими предпочтениями и доступностью, тогда как качество и кодирование заметно слабее.
Практический вывод простой: модель имеет смысл рассматривать для локального развёртывания, анализа изображений, внутренних ассистентов, текстовых рабочих процессов и прототипов агентов. Для задач, где ошибка в коде, строгом следовании инструкции или сложном рассуждении обходится дорого, её стоит проверять на собственных примерах, а не выбирать только по названию или размеру.
Коротко
- Разработчик: Alibaba, семейство Qwen.
- Тип: мультимодальная модель с поддержкой текста и изображений; официальная карточка описывает её как causal language model with vision encoder.
- Архитектурный класс: sparse Mixture-of-Experts; 122 млрд параметров всего и 10 млрд активируемых параметров указаны в официальной карточке модели.
- Рассуждение: поддерживается.
- Открытые веса: да; в паспорте указана лицензия Apache 2.0.
- Контекст: 262 144 токена в редакционном срезе.
- API-цена: 0,26 доллара за миллион входных токенов и 2,08 доллара за миллион выходных токенов в зафиксированном измерении.
- Скорость: 129,1 выходного токена в секунду; время до первого токена — 1,82 секунды.
- Итог COMRAD404: 61,8 из 100; место — 79.
Здесь важно не путать редакционные баллы с процентом правильных ответов. COMRAD Score и пять суббаллов — нормализованные оценки COMRAD404 по шкале от 0 до 100. LMArena rating, напротив, является статистическим рейтингом по слепым попарным сравнениям, а не долей успешных ответов.
Паспорт модели
| Параметр | Значение |
|---|---|
| Название | Qwen3.5 122B A10B |
| Разработчик | Alibaba |
| Лицензия | Apache 2.0 |
| Открытые веса | Да |
| Рассуждение | Да |
| Статус preview | Нет |
| Контекст | 262 144 токена |
| COMRAD Score | 61,8 из 100 |
| Место в рейтинге | 79 |
| Уверенность среза | Высокая |
Статус preview в паспорте не указан: модель оценивается как обычный релиз, а не как предварительная версия. Это не означает автоматической гарантии стабильности любого API-провайдера или каждой сторонней сборки весов. Для локального запуска следует отдельно учитывать формат квантования, совместимость сервера инференса, доступную память и поддержку мультимодальных входов.
Место в рейтинге
79-е место и COMRAD Score 61,8 показывают не абстрактную «силу модели», а её положение внутри редакционной системы оценки. Вес качества в методологии составляет 0,4, человеческих предпочтений — 0,3, кодирования — 0,15, эффективности — 0,1, доступа — 0,05. Поэтому высокий балл доступности и хороший результат в пользовательских сравнениях способны заметно поднять итог, даже если специализированные показатели остаются средними.
В абсолютных значениях профиль выглядит так: качество — 48,6, human preference — 84,0, coding — 41,0, efficiency — 64,2, access — 92,9. Разрыв между 84,0 в человеческих предпочтениях и 41,0 в кодировании — главный сигнал для выбора. Модель может хорошо восприниматься в диалоге, формулировать ответы естественно и быть удобной для широкого круга задач, но это не заменяет проверку генерации, исправления и рефакторинга кода.
В LMArena текстовый рейтинг модели составляет 1417,3 при 28 389 голосах; это 118-е место в Text Arena. В Code Arena указаны 1357,8 и 87-е место. Эти числа нельзя складывать с COMRAD Score или трактовать как проценты. Они отражают разные процедуры измерения и разные свойства поведения модели.
Что говорят метрики
Artificial Analysis Intelligence Index — 32,8. Это отдельный индекс Artificial Analysis со своей шкалой и методикой. В паспорте указано, что значение не является оценкой, восстановленной редакцией: estimated равно false. Индекс полезен как независимый ориентир общего уровня, но сам по себе не объясняет, почему модель получила высокий пользовательский балл или низкий coding-суббалл.
LMArena Text — 1417,3. Высокий human preference в COMRAD404 согласуется с заметным результатом в слепых текстовых сравнениях, однако место 118 показывает, что текстовая привлекательность не равна лидерству во всём наборе моделей. На результат влияют формулировка запросов, состав соперников, режимы ответа и статистическая неопределённость.
LMArena Code — 1357,8. Более низкое 87-е место в Code Arena и coding-суббалл 41,0 подсказывают осторожность в инженерных сценариях. Это не доказательство того, что модель плохо программирует вообще. Скорее, код следует считать зоной обязательного прикладного тестирования: особенно если нужны точные изменения в существующем репозитории, работа с тестами и соблюдение локальных соглашений.
Разбор пяти суббаллов
| Суббалл | Оценка | Редакционная интерпретация |
|---|---|---|
| Quality | 48,6 | Средняя опора для сложных универсальных задач; проверка фактов и рассуждений обязательна. |
| Human preference | 84,0 | Сильная сторона: ответы хорошо воспринимаются в пользовательском сравнении. |
| Coding | 41,0 | Слабое место профиля; нужен набор реальных задач и автоматические тесты. |
| Efficiency | 64,2 | Хороший баланс активных параметров, скорости и стоимости, но не универсальная гарантия экономичности. |
| Access | 92,9 | Открытые веса и Apache 2.0 повышают доступность для самостоятельного запуска и интеграции. |
Таблица описывает именно редакционную интерпретацию пяти нормализованных суббаллов. Это не пять независимых экзаменационных процентов. Например, access учитывает практическую доступность модели, а не вероятность получить корректный ответ; efficiency не означает, что любой запрос будет выполняться с одинаковой задержкой.
Возможности и сценарии
Официальная карточка Qwen3.5-122B-A10B указывает поддержку мультимодального режима и способы запуска через Transformers, vLLM и SGLang. Для пользователя это означает возможность строить не только чат по тексту, но и рабочие процессы с изображениями: классификацию содержимого, извлечение сведений из скриншотов, предварительный разбор документов и визуальные подсказки для оператора.
Наиболее естественный сценарий — внутренний ассистент с контролируемым контекстом. Открытые веса позволяют выбрать место хранения данных, настроить собственный сервер и не передавать чувствительные документы внешнему API. Apache 2.0 обычно удобна для интеграции, но юридическую применимость конкретной схемы использования всё равно нужно проверять по лицензии и требованиям организации.
Модель также подходит для прототипов агентных цепочек, где важны рассуждение, вызов инструментов и обработка нескольких типов входных данных. Однако прототип не следует сразу считать готовой производственной системой. Нужны тайм-ауты, ограничение полномочий инструментов, журналирование, валидация аргументов и ручной маршрут для рискованных действий.
Для длинных документов заявленный контекст в 262 144 токена выглядит практически значимым, но большой лимит не гарантирует одинаковое качество на любой позиции контекста. Проверяйте поиск сведений в начале, середине и конце документа, а также поведение при конфликтующих инструкциях и повторяющихся фрагментах.
Архитектура и развёртывание
Обозначение A10B относится к активируемой части MoE-модели: всего указано 122 млрд параметров, из которых 10 млрд активны для конкретного шага вычисления. Это помогает объяснить, почему модель нельзя оценивать только по числу 122B. Активность экспертов влияет на вычисления, но память для хранения весов, KV-кэш, мультимодальные компоненты и настройки параллелизма по-прежнему предъявляют серьёзные требования к инфраструктуре.
Официальные инструкции показывают запуск через Transformers и серверные режимы vLLM или SGLang. В карточке отдельно приведены режимы для рассуждений, вызова инструментов, text-only и multi-token prediction. На практике совместимость зависит от версии фреймворка, драйверов, формата весов и конкретной видеопамяти. Перед внедрением лучше зафиксировать версии зависимостей и собрать воспроизводимый тестовый стенд.
Открытые веса не равны автоматически открытому программному обеспечению без ограничений. В данном паспорте указана лицензия Apache 2.0, но пользователь всё равно должен учитывать условия распространения производных артефактов, сторонних квантований, компонентов сервера и используемых датасетов. Отдельно проверяйте, какую именно сборку вы скачиваете: базовые веса, FP8-вариант или пользовательскую квантизацию нельзя считать полностью взаимозаменяемыми.
Цена и скорость
В редакционном срезе для API указана цена 0,26 доллара за миллион входных токенов и 2,08 доллара за миллион выходных токенов. Такое соотношение делает особенно важным контроль длины ответа: длинные рассуждения и большие генерации увеличивают расходы заметнее, чем короткий входной запрос.
Измеренная скорость составляет 129,1 выходного токена в секунду, а время до первого токена — 1,82 секунды. Это разные характеристики. Первая описывает темп генерации после начала ответа, вторая — задержку до появления первого фрагмента. Пользовательский опыт зависит также от длины очереди, региона, нагрузки, стриминга, размера контекста и настроек провайдера.
Цена и скорость не являются неизменными свойствами модели. Они зависят от API-провайдера, режима обслуживания, тарифа, кэширования, квантования и текущей нагрузки. Поэтому числа выше следует читать как значения конкретного зафиксированного среза, а перед закупкой повторно проверять коммерческие условия и измерять задержку на собственном типе запросов.
Ограничения
Главное ограничение профиля — разрыв между удобством общения и специализированной надёжностью. Human preference 84,0 не отменяет quality 48,6 и coding 41,0. Модель может дать убедительный, хорошо оформленный ответ, который потребует проверки по источнику, компиляции или прогону тестов.
Мультимодальность также не означает безошибочное понимание любого изображения. Для скриншотов интерфейсов, таблиц, мелкого текста, схем и фотографий с неоднозначными объектами нужны контрольные примеры. Если изображение содержит персональные или коммерчески чувствительные сведения, заранее определите, будет ли оно обрабатываться локально или отправляться провайдеру.
Данные по безопасности, устойчивости к prompt injection, отказам при использовании инструментов и качеству на конкретных языках в переданном паспорте отсутствуют. Не следует восстанавливать их по общему имени семейства. Для таких свойств нужны отдельные испытания на вашей политике доступа, предметной области и типичных вредоносных сценариях.
Паспорт также не содержит оценки стоимости локального запуска, минимальной конфигурации оборудования, энергопотребления или точной производительности на выбранной видеокарте. Эти параметры зависят от формата весов и окружения, поэтому их нужно измерять отдельно.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите не демонстрационные вопросы, а 50–200 реальных примеров: обычные, пограничные и заведомо сложные.
- Разделите задачи по типам. Минимальный набор должен включать фактические ответы, длинный контекст, структурированный вывод, изображения, рассуждение и код.
- Зафиксируйте режим. Запишите системный промпт, температуру, лимит вывода, формат квантизации, версию сервера и настройки reasoning. Иначе сравнение будет неповторимым.
- Проверяйте не только текст. Для JSON используйте схему, для кода — линтер и тесты, для извлечения данных — эталонную разметку, для изображений — заранее подготовленные правильные ответы.
- Измерьте эксплуатацию. Считайте стоимость входа и выхода, время до первого токена, скорость после старта, долю тайм-аутов и потребление памяти.
- Проверьте отказоустойчивость. Добавьте противоречивые инструкции, неполные документы, попытки подмены системных правил и запросы на опасные действия.
- Сравнивайте с базовой линией. Используйте текущую модель в вашем продукте или простой детерминированный алгоритм, но не делайте вывод по одному удачному диалогу.
Для первого пилота разумно использовать два режима: короткие ответы без лишнего рассуждения для массовых запросов и отдельный лимит для сложных задач. Так можно увидеть, действительно ли дополнительные токены улучшают результат или только увеличивают стоимость.
Кому подойдёт модель
Qwen3.5 122B A10B подходит командам, которым важны открытые веса, возможность локального контроля, мультимодальные сценарии и доступный API. Это также кандидат для исследовательских стендов, внутренних поисково-аналитических инструментов и автоматизации, где ответ проходит последующую проверку человеком или программным валидатором.
Модель менее очевидна как единственный движок для критического программирования, автономных действий без подтверждения и задач, где привлекательный стиль ответа может скрыть фактическую ошибку. В таких случаях её лучше использовать как один из компонентов конвейера: генератор черновика, классификатор, помощник оператора или модель второго мнения.
Редакционный вердикт
Qwen3.5 122B A10B — прагматичный компромисс между доступностью и качеством. В рейтинге COMRAD404 её сильные стороны — access 92,9, human preference 84,0 и efficiency 64,2; слабые — coding 41,0 и quality 48,6. Поэтому лучший аргумент в пользу модели — не номинальные 122 млрд параметров, а сочетание открытых весов, мультимодальности, длинного контекста и умеренной цены.
Выбирать её стоит тогда, когда вы готовы встроить проверку результата в процесс. Если задача допускает валидацию, локальную донастройку инфраструктуры и постепенный пилот, модель заслуживает теста. Если же требуется безусловная надёжность в коде, фактах или действиях с внешними системами, сначала проведите собственный бенчмарк и не переносите высокий пользовательский рейтинг на все классы задач.
FAQ
Qwen3.5 122B A10B — открытая модель?
Да. В паспорте указаны открытые веса и лицензия Apache 2.0. Это повышает доступность для локального запуска, но условия конкретных квантований, серверов и производных компонентов нужно проверять отдельно.
Что означает A10B в названии?
В официальной карточке указано 122 млрд параметров всего и 10 млрд активируемых параметров. Обозначение A10B связано с активной частью sparse MoE-архитектуры, а не означает, что весь набор весов имеет размер 10 млрд параметров.
Можно ли использовать модель для программирования?
Можно, но с осторожностью. Coding-суббалл COMRAD404 составляет 41,0, а рейтинг Code Arena — 1357,8 при 87-м месте. Для рабочего кода необходимы компиляция, тесты, линтеры и проверка изменений человеком.
Сколько стоит API?
В срезе указано 0,26 доллара за миллион входных токенов и 2,08 доллара за миллион выходных токенов. Это не вечный тариф: цена зависит от провайдера, режима и даты проверки.
Какая у модели скорость?
В паспорте указаны 129,1 выходного токена в секунду и 1,82 секунды до первого токена. Эти значения относятся к зафиксированному измерению и могут меняться из-за провайдера, нагрузки, контекста и настроек.
Какой контекст поддерживается?
В редакционном паспорте указано 262 144 токена. Реальная полезность длинного контекста зависит от качества поиска информации по всему окну, режима сервера и доступной памяти.
Есть ли данные по безопасности и устойчивости к атакам?
В переданном паспорте таких метрик нет. Их нельзя достоверно восстановить по общему описанию модели; для внедрения нужно провести собственные тесты на prompt injection, утечки данных и неправильные вызовы инструментов.
Источники
Рейтинг и редакционный срез: COMRAD404 AI Ranking.
Официальные материалы, использованные для проверки описания:
- Официальная карточка Qwen3.5 122B A10B на Hugging Face — название, разработчик, лицензия, тип модели, способы запуска и заявленные архитектурные характеристики.
- Официальная FP8-карточка Qwen3.5 122B A10B — сведения о совместимых инструментах, контексте, мультимодальности и рекомендациях по развёртыванию.
- Официальный репозиторий Qwen — дата публикации семейства Qwen3.5 и ссылки на модельные карточки.
