Запись архива

Qwen3.5 27B: обзор модели, рейтинги, цена и сценарии

Qwen3.5 27B занимает 99-е место в рейтинге COMRAD404: модель привлекает сильным пользовательским предпочтением, доступной ценой и большим контекстом, но заметно уступает по кодингу и общей качественной оценке.

Qwen3.5 27B — профиль модели Alibaba с рейтингом COMRAD404, ценой API и разбором суббаллов

Qwen3.5 27B — практичный открытый по весам мультимодальный вариант для задач, где важнее стоимость, широкий контекст и удобство развёртывания, чем максимальный результат в программировании. В срезе COMRAD404 от 31 августа 2026 года модель получила COMRAD Score 60,7 и заняла 99-е место. Её профиль неоднороден: редакционная оценка эффективности составляет 75,9, доступности — 67,9, а человеческого предпочтения — 81,4. При этом качество оценено в 50,0, а кодирование — только в 35,4.

Такой набор баллов не означает, что Qwen3.5 27B годится только для простых диалогов. Он показывает другое: модель может быть удобным рабочим инструментом при контролируемой цене и наличии собственной инфраструктуры, но её не стоит выбирать вслепую для агентной разработки, сложного рефакторинга или сценариев, где качество кода является главным критерием.

Коротко

  • Итоговый балл: 60,7 из 100 по нормализованной редакционной шкале COMRAD404.
  • Позиция: 99-е место в выпуске 2026 H2.
  • Сильные стороны: человеческое предпочтение 81,4, эффективность 75,9, контекст 262 144 токена, открытые веса и лицензия Apache 2.0.
  • Слабые стороны: качество 50,0 и кодовый суббалл 35,4; независимый Artificial Analysis Intelligence Index в зафиксированном срезе отсутствует.
  • Цена в паспорте: 0,195 доллара за миллион входных токенов и 1,56 доллара за миллион выходных токенов.
  • Ограничение по измерениям: скорость генерации и время до первого токена в паспорте не указаны.

COMRAD Score — это не процент правильных ответов и не среднее значение одного теста. Это нормализованная редакционная оценка по пяти направлениям. Аналогично, рейтинг LMArena — статистический показатель, рассчитанный по слепым попарным сравнениям, а не доля успешных ответов.

Паспорт модели

Параметр Значение
Модель Qwen3.5 27B
Разработчик Alibaba
Место в COMRAD404 99
COMRAD Score 60,7 из 100
Лицензия Apache 2.0
Open weights Да; это не тождественно отсутствию лицензионных ограничений
Reasoning в паспорте Нет
Preview Нет
Контекст 262 144 токена
Artificial Analysis Intelligence Index Нет данных в срезе
LMArena Text 1407,9; 136-е место; 27 241 голос
LMArena Code 1357,4; 88-е место

Официальная карточка Qwen3.5 27B на Hugging Face описывает репозиторий как набор весов посттренированной модели в формате Transformers. В ней также указаны мультимодальный тип, поддержка изображений, собственная длина контекста 262 144 токена и совместимость с рядом инструментов для запуска. Эти сведения относятся к заявлению разработчика и не заменяют независимое тестирование конкретного провайдера или сборки.

Важна разница между паспортом и официальной документацией. В редакционном паспорте поле reasoning отмечено как false, поэтому модель не получила отдельной классификации reasoning для рейтинга. В официальной карточке при этом описывается режим, в котором модель может формировать скрытый процесс рассуждения перед ответом. Эти обозначения не следует автоматически складывать в один вывод: первое — редакционная характеристика профиля, второе — инструкция по использованию конкретной реализации.

Место в рейтинге

99-я позиция отражает не одну провальную характеристику, а баланс пяти суббаллов. На итог сильнее всего влияет качество: его вес в методике составляет 0,4, то есть 40 процентов вклада в COMRAD Score. Человеческое предпочтение имеет вес 0,3 и заметно поддерживает итоговую оценку. Кодирование учитывается с весом 0,15, эффективность — 0,1, доступ — 0,05.

Если применить эти веса к паспорту, получается 50,0 × 0,4 + 81,4 × 0,3 + 35,4 × 0,15 + 75,9 × 0,1 + 67,9 × 0,05 = 60,715, что округляется до 60,7. Поэтому высокая оценка предпочтения не может полностью компенсировать слабый результат в качестве и программировании.

Текстовый рейтинг LMArena 1407,9 соответствует 136-му месту в текстовой таблице и основан на 27 241 голосе. Это полезный индикатор того, как модель воспринималась пользователями в попарных сравнениях, но не универсальный тест знаний, точности или безопасности. В Code Arena показатель выше по позиции: 1357,4 и 88-е место. Однако это всё равно не превращает модель в специализированную coding-модель: кодовый суббалл COMRAD404 равен 35,4 и учитывает собственную редакционную нормализацию.

Подробнее о месте модели и методике можно узнать в общем рейтинге COMRAD404. Для корректного чтения цифр используйте именно выпуск 2026 H2 и срез на 31 августа 2026 года: рейтинги меняются вместе с составом моделей, голосами и ценами.

Разбор пяти суббаллов

Суббалл Оценка Вес Что это значит для выбора
Качество 50,0 0,40 Главная зона риска: перед внедрением нужны тесты на фактических данных и требованиях к точности.
Человеческое предпочтение 81,4 0,30 Модель часто воспринимается как удобная и приемлемая в диалоге, но предпочтение не равно достоверности.
Кодирование 35,4 0,15 Не лучший кандидат для задач, где цена ошибки в коде выше стоимости дополнительной проверки.
Эффективность 75,9 0,10 Сочетание цены и доступного контекста выглядит выгодно при больших объёмах входных данных.
Доступ 67,9 0,05 Открытые веса и Apache 2.0 повышают гибкость, но запуск требует подходящего железа и ПО.

Суббаллы следует читать как профиль, а не как пять независимых процентов успеха. Например, эффективность 75,9 не обещает определённую задержку, а доступ 67,9 не означает, что модель можно без подготовки запустить на любой видеокарте. Это нормализованные оценки редакции, предназначенные для сравнения моделей внутри одной методики.

Возможности и сценарии

Главное практическое преимущество Qwen3.5 27B — сочетание открытых весов, большого контекста и мультимодального интерфейса. Официальная карточка указывает тип causal language model with vision encoder и примеры работы с текстовыми и изображенческими сообщениями. Это делает модель кандидатом для обработки документов, анализа скриншотов, извлечения сведений из изображений и подготовки черновиков на основе смешанных входных данных.

Документы и внутренние базы

Контекст 262 144 токена полезен для длинных инструкций, нескольких документов, истории переписки или крупного набора исходных материалов. На практике это не отменяет необходимость разбивки данных, поиска по базе и контроля цитат: длинное окно позволяет принять больше текста, но не гарантирует, что модель одинаково хорошо использует каждый его фрагмент.

Мультимодальные рабочие процессы

Модель можно проверять на разборе скриншотов, таблиц, схем, фотографий интерфейсов и документов. В качестве простых задач подойдут классификация изображений, описание элементов экрана, поиск несоответствий в макете и извлечение полей из формы. Для юридических, медицинских и финансовых документов результат должен проходить проверку человеком, особенно если изображение низкого качества или содержит мелкий текст.

Помощник для текста

Высокий суббалл человеческого предпочтения делает модель разумным кандидатом для черновиков, перефразирования, суммаризации, многоязычной поддержки и диалоговых интерфейсов. Перед запуском стоит проверить стиль ответов, следование формату, склонность к лишним пояснениям и устойчивость к противоречивым инструкциям.

Локальное или частное развёртывание

Open weights и Apache 2.0 позволяют рассматривать собственный inference-контур, однако «открытые веса» не означают автоматически открытое программное обеспечение или отсутствие обязательств по лицензии. Нужно отдельно проверить лицензионные условия, происхождение квантованных сборок, требования к памяти, поддержку нужного движка и правила обработки пользовательских данных.

Цена и скорость

В паспорте указаны ориентиры API-цены: 0,195 доллара за миллион входных токенов и 1,56 доллара за миллион выходных токенов. Это разные единицы тарификации, поэтому сравнивать их с единой ценой за запрос некорректно. Выходные токены примерно в восемь раз дороже входных, и длинные ответы могут быстро изменить итоговую стоимость.

Пример нагрузки Расчёт Стоимость по паспорту
1 млн входных + 100 тыс. выходных токенов 1 × 0,195 + 0,1 × 1,56 0,351 доллара
10 млн входных + 1 млн выходных токенов 10 × 0,195 + 1 × 1,56 3,51 доллара
100 тыс. входных + 20 тыс. выходных токенов 0,1 × 0,195 + 0,02 × 1,56 0,0505 доллара

Расчёты показывают механику, а не фиксированный публичный тариф на все случаи. Цена зависит от API-провайдера, региона, режима, кеширования, пакетной обработки и дополнительных возможностей. В паспорте нет значения output tokens per second и нет time to first token. Поэтому обещать конкретную скорость или задержку нельзя. Даже при одинаковом названии модели результаты будут различаться между локальным запуском, облачным API, квантованной сборкой и разными серверными движками.

Инфраструктура и интеграция

Официальная карточка перечисляет совместимость с Transformers, vLLM, SGLang и другими инструментами экосистемы. Для разработчика это означает несколько путей интеграции: локальный эксперимент через Transformers, OpenAI-совместимый сервер или высокопроизводительное обслуживание через специализированный inference-движок. Выбор зависит от доступной памяти, числа запросов, необходимости изображений и требуемой длины контекста.

Большое окно контекста нельзя рассматривать отдельно от стоимости KV-кэша и требований к памяти. При длинных запросах узким местом может стать не сама загрузка весов, а обслуживание нескольких параллельных сессий. Поэтому в пилоте нужно измерять не только время ответа одного запроса, но и поведение при реальной конкуренции, длине истории и одновременной обработке изображений.

Ограничения

  • Слабый кодовый профиль. Показатель 35,4 в редакционной шкале требует осторожности в генерации патчей, тестов, миграций и команд для production-инфраструктуры.
  • Неизвестный Intelligence Index. Artificial Analysis Intelligence Index в паспорте отсутствует, поэтому нельзя заполнять пробел оценкой из другого среза или из памяти.
  • Нет данных о скорости. Отсутствуют токены в секунду и время до первого токена; производительность нужно измерять самостоятельно.
  • Рейтинг не равен гарантии. LMArena отражает попарные предпочтения пользователей, а не полноту знаний и не устойчивость к фактическим ошибкам.
  • Контекст не равен качеству работы с контекстом. 262 144 токена задают вместимость, но не гарантируют точное извлечение фактов из очень длинного ввода.
  • Лицензионная проверка обязательна. Apache 2.0 обычно удобна для интеграции, но конкретное применение всё равно нужно сверять с текстом лицензии, модельной карточкой и политиками организации.
  • Мультимодальность требует отдельного теста. Результат зависит от разрешения изображения, типа документа, OCR, формата входа и выбранного runtime.

Отдельно стоит учитывать среднюю уверенность паспорта. Это не утверждение о низком качестве модели, а сигнал о том, что итоговую оценку не следует принимать как точную границу возможностей. Для закупки или массового внедрения нужны собственные данные, контрольные примеры и повторяемая процедура измерений.

Как проверить на своей задаче

  1. Сформулируйте критерий успеха. Определите, что считается правильным ответом: точность извлечения, доля корректных JSON, прохождение тестов, экономия времени оператора или стоимость одной завершённой задачи.
  2. Соберите репрезентативную выборку. Включите обычные, сложные и пограничные случаи. Не ограничивайтесь примерами, на которых модель уже показывала хороший результат.
  3. Зафиксируйте параметры. Запишите версию весов, квантование, движок, длину контекста, температуру, лимит вывода, системный промпт и параметры мультимодального входа.
  4. Разделите качество и цену. Сначала оцените ответы вслепую, затем посчитайте входные и выходные токены. Дешёвый запрос с длинным ответом может оказаться дороже короткого и более точного.
  5. Проверьте отказоустойчивость. Добавьте неполные данные, конфликтующие инструкции, повреждённые изображения, слишком длинный контекст и повторяющиеся запросы.
  6. Для кода используйте исполняемую проверку. Генерируемый код нужно запускать в изолированной среде, прогонять тестами и проверять на небезопасные операции. Само впечатление от ответа не является тестом качества.
  7. Измерьте задержку при нагрузке. Зафиксируйте time to first token, полное время ответа, tokens per second, p50 и p95. Эти данные особенно важны, поскольку в редакционном паспорте скорость отсутствует.
  8. Сравните режимы. Если провайдер предлагает разные настройки рассуждения, vision или кеширования, тестируйте их раздельно и не смешивайте результаты в одну цифру.

Минимальный пилот можно начать со 100–300 реальных запросов, трёх повторов для нестабильных задач и ручной разметки причин ошибок. Для документов добавьте проверку пропущенных полей и выдуманных сведений; для кода — компиляцию, тесты и оценку ревьюера; для диалога — полноту, тональность и соблюдение формата.

Кому подойдёт модель

Qwen3.5 27B имеет смысл рассматривать командам, которым нужны открытые веса, возможность контролировать контур исполнения и большой контекст без перехода к самой тяжёлой модели. Это может быть внутренний помощник по документам, мультимодальный классификатор, инструмент подготовки черновиков, интерфейс для анализа скриншотов или недорогой API-слой для задач с большим объёмом входных данных.

Модель подходит хуже, если основная ценность продукта строится на безошибочном программировании, сложных автономных действиях или строгой фактической точности без участия человека. В таких случаях её можно включить в пилот как один из вариантов, но решение должно опираться на собственный тестовый набор, а не на одно место в рейтинге.

FAQ

Qwen3.5 27B — открытая модель?

У модели открытые веса, а в паспорте указана лицензия Apache 2.0. Это облегчает самостоятельное развёртывание, но не означает, что весь связанный софт является открытым или что лицензионную проверку можно пропустить.

Какое место занимает Qwen3.5 27B?

В срезе COMRAD404 от 31 августа 2026 года модель занимает 99-е место с COMRAD Score 60,7 из 100.

Хорошо ли Qwen3.5 27B пишет код?

Паспорт даёт кодовый суббалл 35,4. Это слабее других сторон профиля, поэтому код следует компилировать, тестировать и проверять в изолированной среде.

Сколько стоит миллион токенов?

В зафиксированном паспорте указано 0,195 доллара за миллион входных токенов и 1,56 доллара за миллион выходных. Реальный тариф зависит от API-провайдера и режима.

Какая у модели скорость?

Данных о скорости генерации и времени до первого токена в срезе нет. Их нужно измерить на выбранном провайдере или локальной конфигурации.

Какой у Qwen3.5 27B контекст?

В паспорте указано 262 144 токена. Это максимальная вместимость контекста в редакционном срезе, а не гарантия одинаково точной работы на любой длине входа.

Источники

Редакционная оговорка: числовые показатели рейтинга, цены, контекст и места приведены строго по паспорту модели и срезу на 31 августа 2026 года. Официальные заявления разработчика отделены от независимых измерений и интерпретации COMRAD404.