Qwen3.5 Max Preview — модель для тех, кому важнее качество субъективного диалога, чем прозрачность, стабильность и полнота технических характеристик. В рейтинге COMRAD404 за второе полугодие 2026 года она получила 62,6 балла из 100 и заняла 69-е место. Это не означает 62,6% правильных ответов: COMRAD Score представляет собой нормализованную редакционную оценку, собранную из пяти суббаллов.
Профиль модели неоднороден. Сильнейший показатель — human preference, 97,2 из 100. Он говорит о благоприятном восприятии ответов в пользовательских сравнениях. При этом quality и coding получили по 50,0, efficiency — 43,5, а access — 32,5. Для прикладного выбора это означает следующее: Qwen3.5 Max Preview может хорошо подходить для открытых текстовых задач и диалога, но паспорт не даёт достаточных оснований считать её универсальным решением для программирования, массовых вызовов или длинного контекста.
Коротко
- Модель: Qwen3.5 Max Preview.
- Разработчик: Alibaba.
- Статус: preview; модель ещё нельзя рассматривать как production-ready без собственной проверки стабильности.
- Лицензия: Proprietary.
- Open weights: нет.
- Режим reasoning: в паспорте не отмечен.
- COMRAD Score: 62,6 из 100.
- Место в COMRAD404: 69.
- LMArena Text: 1465,5 рейтинговых пунктов, 44-е место, 21 478 голосов.
- Цена: 1,20 доллара за миллион входных токенов и 6,00 доллара за миллион выходных токенов в зафиксированном паспорте.
Главный практический вывод: модель стоит тестировать в задачах, где качество формулировки, естественность диалога и субъективная полезность важнее возможности развернуть веса самостоятельно. Для критичных процессов нужно отдельно проверить повторяемость ответов, работу с инструментами, лимиты API и изменения поведения между версиями.
Паспорт модели
| Параметр | Значение на 31 августа 2026 года |
|---|---|
| Название | Qwen3.5 Max Preview |
| Организация | Alibaba |
| Лицензия | Proprietary |
| Open weights | Нет |
| Reasoning | Нет в паспорте |
| Статус preview | Да |
| Уверенность оценки | Ограниченная |
| COMRAD Score | 62,6 из 100 |
| Место COMRAD404 | 69 |
| Контекст | Данных в срезе нет |
| Скорость генерации | Данных в срезе нет |
| Time to first token | Данных в срезе нет |
Паспорт описывает именно размещённую модель Qwen3.5 Max Preview, а не всё семейство Qwen и не соседние версии. Поэтому сведения о других моделях Qwen3, Qwen3.5 или последующих поколениях нельзя автоматически переносить на этот объект оценки. В доступном web research точная официальная страница модели указана разработчиком, однако отдельная публичная model card, подробная архитектурная спецификация или репозиторий с весами для этой proprietary preview-модели в редакционном срезе не подтверждены.
Место в рейтинге
Внутри методологии COMRAD404 Qwen3.5 Max Preview находится на 69-й позиции в редакции 2026 H2. Итоговый балл 62,6 рассчитывается с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Если перемножить переданные суббаллы на эти веса и округлить результат, получается тот же итоговый показатель.
Важно не смешивать два уровня оценки. COMRAD Score — редакционная нормализованная шкала от 0 до 100. LMArena rating — статистический рейтинг по слепым попарным сравнениям, а не процент правильных ответов. В паспорте для текстового режима указаны 1465,5 пункта LMArena, 44-е место и 21 478 пользовательских голосов. Поэтому позиция 69 в COMRAD404 и позиция 44 в LMArena не противоречат друг другу: это разные системы, с разными наборами факторов и способом представления результата.
Наличие 21 478 голосов делает текстовый показатель заметным независимым сигналом, но не превращает его в исчерпывающий тест. Слепые сравнения хорошо отражают воспринимаемую полезность ответа в конкретных диалогах, однако не заменяют проверку фактической точности, устойчивости формата, стоимости длинных цепочек и поведения в вашем API-режиме.
В паспорте нет Artificial Analysis Intelligence Index. Также отсутствуют отдельные данные LMArena Code. Это ограничивает интерпретацию позиции: модель получила сильный сигнал по текстовым предпочтениям, но для инженерного выбора нельзя делать вывод о качестве кода только из текстового рейтинга.
Разбор пяти суббаллов
| Суббалл | Оценка | Что означает для выбора |
|---|---|---|
| Quality | 50,0 из 100 | Средняя редакционная оценка общего качества; универсальность не подтверждена как сильная сторона. |
| Human preference | 97,2 из 100 | Главное преимущество профиля: ответы хорошо воспринимаются в пользовательских сравнениях. |
| Coding | 50,0 из 100 | Нет основания считать модель специализированным инструментом разработки. |
| Efficiency | 43,5 из 100 | Оценка сдержанная; при этом точные значения скорости в паспорте отсутствуют. |
| Access | 32,5 из 100 | Доступность и условия использования заметно тянут итоговый профиль вниз. |
Что показывает профиль метрик
Разрыв между human preference на уровне 97,2 и остальными суббаллами — наиболее важная особенность модели. Она может производить ответы, которые пользователи считают более удачными по стилю, структуре, уместности или общей убедительности. Но приятный и уверенный ответ не гарантирует фактическую точность. Для рабочих процессов с юридическими, финансовыми, медицинскими или операционными последствиями этот разрыв нужно закрывать внешней валидацией.
Quality на уровне 50,0 указывает на отсутствие выраженного преимущества по агрегированной редакционной оценке. Это не провал и не процент успешных ответов, а нормализованное место модели по соответствующему измерению. Coding получил такое же значение, поэтому сценарии генерации кода, исправления ошибок и работы с репозиторием требуют отдельного стенда. Низкий access-балл особенно важен для команд: даже хорошая модель может оказаться неудобной, если ограничения доступа, региональные условия, лимиты или интеграционные возможности не соответствуют задаче.
Возможности и сценарии
Диалог, редактура и работа с текстом
Высокий human preference делает модель логичным кандидатом для черновиков, переписывания, структурирования заметок, подготовки вариантов ответа клиенту и интерактивного уточнения требований. Здесь полезность определяется не только точностью, но и тем, насколько легко читать результат, продолжать диалог и корректировать направление работы.
Для редакторских задач следует использовать инструкции с явными ограничениями: длина, тон, обязательные факты, запрещённые формулировки и формат выдачи. Даже при хорошем пользовательском восприятии preview-модель может менять стиль или структуру между вызовами, поэтому шаблон необходимо проверять на серии однотипных запросов.
Поиск идей и подготовка черновиков
Модель подходит для генерации вариантов, декомпозиции задачи и первичного наброска. Оптимальный процесс — использовать её как слой подготовки, а не как единственный источник истины. Факты, цифры, ссылки и выводы, от которых зависит решение, нужно перепроверять по первоисточникам или через отдельный инструмент.
Программирование
Суббалл coding равен 50,0, а lmarena_code_rating и lmarena_code_rank в паспорте отсутствуют. Поэтому Qwen3.5 Max Preview нельзя рекомендовать как подтвержденно сильную coding-модель. Её можно включить в сравнительный тест для генерации функций, рефакторинга, объяснения ошибок и написания тестов, но решение о внедрении должно опираться на собственные репозитории и реальные issue, а не на общий текстовый рейтинг.
Агентные и инструментальные процессы
В паспорте нет отдельной оценки tool use, agentic coding или надёжности вызовов функций. Для агента это существенный пробел. Перед использованием нужно проверить соблюдение схем JSON, корректное завершение цепочки, поведение при ошибке инструмента, повторную отправку запроса и защиту от выдуманных результатов выполнения.
Цена и скорость
В зафиксированном паспорте указана цена 1,20 доллара за миллион входных токенов и 6,00 доллара за миллион выходных токенов. Это разные единицы тарификации: стоимость входа нельзя сравнивать с ценой выхода как с одинаковыми показателями. При длинных ответах и агентных циклах расход выходных токенов может стать главным компонентом счёта.
Цены зависят от API-провайдера, региона, тарифа, кэширования, пакетного режима и даты проверки. Перед закупкой нужно сверить актуальную страницу тарификации конкретного провайдера. Значения из паспорта — снимок для рейтинга, а не обещание неизменной цены.
Output tokens per second и time to first token в срезе отсутствуют. Нельзя честно заявить, что модель быстрая или медленная, а также рассчитать задержку ответа по имеющимся данным. Для интерактивного продукта измеряйте отдельно время до первого токена, скорость после старта, длину очереди и долю запросов с повторной попыткой.
Context tokens также не указаны. Это означает, что нельзя обещать поддержку определённого размера документа или длинной истории чата. Лимит контекста следует выяснять в документации используемого API и подтверждать практическим запросом с контролируемым числом токенов.
Ограничения
- Preview-статус. Модель находится в предварительном режиме. Поведение, доступность, лимиты, название endpoint и тарифы могут измениться. Preview нельзя считать production-ready без собственного приёмочного тестирования.
- Закрытая модель. Лицензия proprietary, open weights отсутствуют. Самостоятельное развёртывание весов и независимая модификация модели не заявлены в паспорте.
- Ограниченная уверенность. Редакционная уверенность в оценке обозначена как ограниченная. Это нужно учитывать при принятии решения по одной строке рейтинга.
- Нет Artificial Analysis Index. В срезе отсутствует Intelligence Index, поэтому нельзя восполнить его результатами других моделей или приблизительной оценкой.
- Нет кодового рейтинга LMArena. Текстовый рейтинг не является заменой специализированному тесту программирования.
- Нет технических показателей. Отсутствуют контекст, скорость генерации и time to first token.
- Риск убедительных ошибок. Высокая субъективная привлекательность ответа может маскировать неточность. В критических сценариях нужны цитирование, верификация и ограничения полномочий модели.
Как внедрять без лишнего риска
Начните с режима «черновик с проверкой». Модель может готовить варианты текста, классифицировать обращения, предлагать структуру ответа или формировать предварительный план действий, но финальное решение оставьте человеку или детерминированному сервису.
Для API задайте версионирование промптов, журналирование входов и выходов, ограничение максимального ответа и контроль стоимости. Не полагайтесь на название preview как на постоянный идентификатор: сохраняйте фактический model ID, дату вызова, провайдера и параметры запроса.
Если модель используется в цепочке инструментов, валидируйте каждый аргумент по схеме до исполнения. Результаты инструментов должны возвращаться в модель в явно отделённом формате, а ошибки — обрабатываться кодом, а не только инструкцией в системном промпте.
Как проверить на своей задаче
- Соберите набор из 50–200 реальных примеров. Включите обычные, сложные и пограничные случаи. Не ограничивайтесь демонстрационными промптами.
- Определите критерии до запуска. Для текста это могут быть фактическая точность, соблюдение длины, тональность и полнота. Для кода — прохождение тестов, корректность изменений и отсутствие побочных эффектов.
- Проведите слепую оценку. Смешайте ответы Qwen3.5 Max Preview с результатами текущего решения и попросите экспертов оценивать их без названий моделей.
- Повторите запросы. Проверьте стабильность формата, склонность к повторениям, чувствительность к небольшим изменениям формулировки и поведение при неполных данных.
- Измерьте стоимость. Зафиксируйте входные и выходные токены на типичной задаче, отдельно посчитайте длинные ответы и многошаговые сценарии.
- Измерьте задержку у выбранного провайдера. В паспорте скорость отсутствует, поэтому нужны реальные замеры в вашем регионе, тарифе и режиме нагрузки.
- Проверьте отказоустойчивость. Смоделируйте тайм-ауты, превышение лимита, ошибку инструмента, повреждённый JSON и повторную доставку запроса.
- Установите порог замены. Внедряйте модель только если выигрыш по качеству или стоимости компенсирует риски preview-статуса и закрытого доступа.
Для воспроизводимого сравнения зафиксируйте дату 31 августа 2026 года как исходную точку, но не выдавайте рейтинг за вечную характеристику. LMArena и цены меняются, а preview-модель может обновляться без сохранения прежнего поведения.
Итоговый вердикт
Qwen3.5 Max Preview — не очевидный выбор «по умолчанию», а кандидат для точечного пилота. Её сильная сторона — очень высокий human preference 97,2, а значит, модель заслуживает проверки в диалоговых и текстовых сценариях, где важны уместность и удобство результата. Однако quality и coding по 50,0, efficiency 43,5 и access 32,5 формируют более сдержанный общий профиль.
Покупатель получает относительно понятную цену, но не получает в паспорте данных о скорости, первом токене и размере контекста. Закрытая лицензия, отсутствие open weights, preview-статус и ограниченная уверенность дополнительно повышают требования к проверке. Для прототипа, редакторского помощника или внутреннего инструмента модель может быть разумным вариантом. Для стабильного production-контура её следует рассматривать только после тестов на собственных данных и при наличии плана отката.
FAQ
Какое место Qwen3.5 Max Preview занимает в рейтинге COMRAD404?
В редакции COMRAD404 2026 H2 модель занимает 69-е место и получает 62,6 балла из 100. Это нормализованная редакционная оценка, а не процент успешных ответов.
Что означает рейтинг LMArena 1465,5?
Это статистический рейтинг текстового режима, полученный по слепым попарным пользовательским сравнениям. В паспорте также указаны 44-е место и 21 478 голосов. Показатель не означает, что модель отвечает правильно в 1465,5 случаях или в 97,2% запросов.
Подходит ли модель для программирования?
Паспорт не подтверждает выраженное преимущество в кодинге: coding равен 50,0, а отдельные LMArena Code rating и rank отсутствуют. Модель можно тестировать на собственном наборе задач, но нельзя рекомендовать её как специализированное решение только по имеющимся данным.
Сколько стоит Qwen3.5 Max Preview?
В паспорте указаны 1,20 доллара за миллион входных токенов и 6,00 доллара за миллион выходных токенов. Это снимок для рейтинга; фактическая цена зависит от API-провайдера, режима и даты проверки.
Какой у модели размер контекста?
В зафиксированном срезе context tokens отсутствуют. Размер контекста нужно уточнять в документации конкретного API и проверять практическим тестом, а не переносить сведения с других моделей Qwen.
Можно ли развернуть модель самостоятельно?
Нет оснований так утверждать: в паспорте указано, что open weights отсутствуют, а лицензия proprietary. Модель следует рассматривать как закрытый доступный через провайдера сервис, пока официальные условия не говорят иного.
Можно ли считать модель готовой для production?
Нет. В паспорте отмечен статус preview. Для production необходимы собственные тесты качества, задержки, лимитов, стоимости, стабильности версии и процедуры отката.
Источники
Рейтинг COMRAD404: методология и редакция 2026 H2.
- Официальная страница Qwen3.5 Max Preview — название модели и первичная информация разработчика.
- LMArena Text Leaderboard — независимый рейтинг слепых пользовательских сравнений и число голосов.
- Artificial Analysis LLM Leaderboard — источник для проверки Intelligence Index, цен, скорости и контекста; для этой модели соответствующий показатель в паспорте отсутствует.
