Запись архива

Qwen3 Max 2025 09 23: обзор, возможности и ограничения

Qwen3 Max 2025-09-23 выделяется высокой оценкой пользовательских предпочтений и контекстом 262 144 токена, но занимает 94-е место из-за средних суббаллов качества и кода, закрытого доступа и пробелов в независимых измерениях.

Профиль Qwen3 Max 2025-09-23 с COMRAD Score 60.9 и пятью суббаллами

Qwen3 Max 2025-09-23 стоит рассматривать как закрытую текстовую модель для диалоговых продуктов, обработки больших документов и инструментальных сценариев, но не как очевидный универсальный выбор. Её главный аргумент — высокая редакционная оценка человеческих предпочтений. Главный риск — неполный профиль независимых измерений: в срезе нет Artificial Analysis Intelligence Index, скорости генерации, задержки первого токена и отдельного рейтинга кода.

Коротко

  • Итог: 94-е место и COMRAD Score 60.9 в рейтинге COMRAD404 2026 H2.
  • Сильная сторона: human preference — 85.7 из 100 нормализованных редакционных баллов.
  • Контекст: 262 144 токена, что делает модель кандидатом для длинных документов и крупных рабочих сессий.
  • Цена в зафиксированном паспорте: $0.78 за миллион входных и $3.90 за миллион выходных токенов.
  • Основная неопределённость: нет данных об Intelligence Index, фактической скорости, TTFT и LMArena Code.
  • Доступ: проприетарный API; веса не опубликованы.

Это не модель, которую разумно выбирать только по месту в таблице. Её профиль лучше подходит командам, готовым самостоятельно проверить качество ответов, длинный контекст, вызов инструментов и реальную задержку у своего API-провайдера.

Паспорт модели

Параметр Значение в срезе
Модель Qwen3 Max 2025 09 23
Разработчик Alibaba
Место 94
COMRAD Score 60.9
Лицензия Proprietary
Открытые веса Нет
Reasoning в паспорте Да
Preview Нет, это датированный стабильный снимок
LMArena Text 1423.8; место 109; 8 944 голоса
Artificial Analysis Intelligence Index Данных в срезе нет
LMArena Code Данных в срезе нет
Контекст 262 144 токена
Цена входа $0.78 за 1 млн токенов
Цена выхода $3.90 за 1 млн токенов
Скорость и TTFT Данных в срезе нет
Уверенность профиля Ограниченная

COMRAD Score и суббаллы ниже — оценки на шкале 0–100, а не проценты качества или вероятность правильного ответа. LMArena rating также нельзя читать как процент: это статистический рейтинг, рассчитанный по результатам слепых попарных сравнений.

Место в рейтинге

Qwen3 Max 2025-09-23 занимает 94-е место в выпуске 2026 H2 при итоговом COMRAD Score 60.9. Посмотреть модель в общем контексте можно в рейтинге ИИ-моделей COMRAD404. Методология версии 1.0 сильнее всего учитывает качество и человеческие предпочтения: их веса составляют 0.40 и 0.30. Код получает вес 0.15, эффективность — 0.10, доступ — 0.05.

Позицию модели поддерживает высокий human preference, но этого недостаточно, чтобы компенсировать quality 50.0, coding 50.0 и access 42.9. Особенно важно, что часть исходных метрик отсутствует. Итоговый балл поэтому описывает доступный набор сигналов, а не исчерпывающую проверку интеллекта, программирования и производительности.

Место 94 не означает, что модель будет девяносто четвёртым выбором для каждой задачи. Для русскоязычного ассистента, длинного корпоративного документа или агента с конкретным набором функций порядок кандидатов может измениться после прикладного теста. Рейтинг задаёт начальную гипотезу, а не заменяет приёмочные испытания.

Что говорят пять суббаллов

Суббалл Оценка Вес Практическое чтение
Quality 50.0 0.40 Нет основания ожидать стабильно высокого качества во всех классах задач без собственного теста
Human preference 85.7 0.30 Ответы сравнительно часто нравятся пользователям в слепом текстовом сравнении
Coding 50.0 0.15 Нейтральный редакционный результат, но отдельного сырого LMArena Code rating нет
Efficiency 55.0 0.10 Цена известна, однако скорость и задержка первого токена не измерены
Access 42.9 0.05 Закрытые веса и зависимость от облачного доступа ограничивают контроль над развёртыванием

Самая заметная асимметрия — разрыв между human preference 85.7 и quality 50.0. Редакционная интерпретация такова: модель способна давать удобные, убедительные и хорошо оформленные ответы, но приятная форма не гарантирует фактическую точность или устойчивое решение сложных задач. Для продукта это повод раздельно измерять удовлетворённость пользователя и число проверяемых ошибок.

Coding 50.0 также требует осторожности. В паспорте отсутствуют LMArena Code rating и место в кодовом рейтинге, поэтому суббалл нельзя представлять как прямое доказательство программистской квалификации модели. Нужен тест на вашем репозитории, языке и наборе инструментов.

Возможности и сценарии

Официальная страница Alibaba описывает Qwen3 Max 2025-09-23 как финальный снимок от 23 сентября 2025 года с улучшениями относительно preview-версии в агентном программировании и вызове инструментов. Это заявление разработчика, а не независимое измерение COMRAD404. Документация также указывает текстовый ввод и вывод, структурированные ответы и различающийся по регионам набор API-возможностей.

Диалоговые и редакционные продукты

Высокий human preference делает модель интересной для поддержки, внутренних помощников, переписывания текста, подготовки черновиков и многоходового диалога. Проверять нужно не только стиль, но и соблюдение ограничений: запрет домыслов, формат JSON, тон ответа, корректное признание нехватки данных и устойчивость к противоречивым инструкциям.

Работа с документами

Контекст 262 144 токена позволяет передавать крупные договоры, техническую документацию, журналы событий или несколько связанных файлов. Подходящие операции — поиск условий, сопоставление разделов, извлечение сущностей, подготовка резюме и ответы со ссылками на фрагменты исходника. При этом большой лимит не доказывает, что модель одинаково хорошо использует начало, середину и конец окна.

Инструментальные агенты

Модель можно рассматривать для сценариев, где LLM выбирает функцию, формирует аргументы и обрабатывает результат: поиск по базе знаний, запрос к CRM, создание заявки или запуск безопасной операции. Поддержка функции зависит от региона и интерфейса Model Studio, поэтому схему инструментов необходимо сверять с документацией конкретного endpoint, а не только с общим описанием семейства.

Программирование

Практический кандидат для генерации небольших патчей, объяснения кода, написания тестов и агентного редактирования проекта. Однако отсутствие сырого кодового рейтинга не позволяет рекомендовать модель для автономного слияния изменений. Минимальная безопасная схема — отдельная ветка, статический анализ, тесты, просмотр diff человеком и запрет на самостоятельную публикацию секретов или выполнение опасных команд.

Контекст и длинные данные

Заявленные в паспорте 262 144 токена — максимальный объём контекста, а не гарантированный размер полезной памяти. Эффективность длинного окна зависит от структуры запроса, расположения доказательств, числа отвлекающих фрагментов и требуемой точности цитирования.

Для документов лучше добавлять устойчивые идентификаторы разделов, нумерацию абзацев и требование возвращать источник каждого вывода. Если корпус регулярно приближается к пределу окна, выгоднее сначала провести поиск или ранжирование фрагментов, а затем отправлять модели релевантную выборку. Это уменьшает стоимость входа и упрощает аудит ошибок.

Отдельно проверьте задачу «иголка в стоге»: разместите контрольные факты в начале, середине и конце длинного текста, добавьте похожие ложные утверждения и измерьте полноту извлечения. Один успешный запрос на большом документе не подтверждает устойчивость всего контекстного окна.

Цена и скорость

В паспорте зафиксированы $0.78 за миллион входных и $3.90 за миллион выходных токенов. Выход примерно в пять раз дороже входа, поэтому длинные рассуждения, многословные ответы и агентные циклы могут сильнее влиять на бюджет, чем загрузка исходного документа.

Например, запрос со 100 000 входных и 20 000 выходных токенов по ставкам паспорта стоил бы около $0.156: $0.078 за вход и $0.078 за выход. Это расчётная иллюстрация, а не коммерческое предложение. Цена может меняться в зависимости от региона, длины запроса, API-провайдера, режима и актуального тарифа.

Данных о числе выходных токенов в секунду и time to first token в срезе нет. Поэтому нельзя утверждать, что модель быстрая или медленная, а суббалл efficiency 55.0 не следует превращать в обещание конкретной задержки. Для чат-интерфейса измеряйте медиану и высокий перцентиль TTFT; для пакетной обработки — полное время, пропускную способность, число повторных запросов и стоимость успешного результата.

Доступ, лицензия и интеграция

Qwen3 Max 2025-09-23 — проприетарная модель без открытых весов. Её нельзя считать открытым программным обеспечением или переносить в собственную инфраструктуру как опубликованный checkpoint. Доступ предполагает зависимость от облачного API, правил провайдера, региональной доступности, лимитов запросов и политики обработки данных.

Отдельной публичной model card с полным описанием архитектуры, размера, обучающего корпуса и процедур оценки для точного снимка в ходе исследования не найдено. Не найден и официальный репозиторий весов именно Qwen3 Max 2025-09-23. Поэтому мы не восстанавливаем архитектуру или число параметров по материалам о других моделях Qwen.

Есть важная терминологическая оговорка. В паспорте COMRAD404 поле reasoning установлено в true, но актуальная документация Model Studio для точного API-снимка помечает его как доступный только в non-thinking mode. Это можно согласовать, если понимать редакционный флаг как способность решать задачи, требующие рассуждения, а не как гарантию отдельного переключателя показа или включения chain of thought. Реальное поведение следует проверять на выбранном endpoint.

Ограничения

  • Нет Artificial Analysis Intelligence Index. В срезе отсутствует независимая сводная метрика этого источника; восстанавливать её по памяти нельзя.
  • Нет измерений скорости. Неизвестны output tokens per second и задержка первого токена.
  • Нет сырого кодового рейтинга. Coding 50.0 не подкреплён LMArena Code rating в переданном паспорте.
  • Закрытые веса. Нельзя независимо развернуть модель, зафиксировать серверную сборку или исследовать веса.
  • Региональные различия API. Function calling, web search и другие возможности могут зависеть от зоны обслуживания.
  • Риск убедительных ошибок. Высокая пользовательская симпатия к ответам не равна фактической надёжности.
  • Длинный контекст требует проверки. Лимит окна не гарантирует полное извлечение информации из любой позиции.
  • Ограниченная уверенность рейтингового профиля. Итог опирается на неполное покрытие независимыми источниками.

Как проверить на своей задаче

  1. Зафиксируйте точный ID. Используйте qwen3-max-2025-09-23, а не плавающий alias, который провайдер может перевести на более новую версию.
  2. Соберите 50–100 реальных примеров. Включите типичные запросы, редкие случаи, длинные входы, конфликтующие инструкции и данные с персональной информацией после необходимой очистки.
  3. Определите проверяемые критерии. Отдельно оцените фактическую точность, полноту, формат, стиль, цитирование, корректность tool calls, безопасность и стоимость.
  4. Проведите слепое сравнение. Уберите названия моделей и перемешайте ответы, чтобы предпочтение бренда не влияло на оценку.
  5. Проверьте код исполнением. Запускайте тесты и анализаторы в изолированной среде. Не оценивайте патч только по внешней убедительности.
  6. Измерьте длинный контекст. Расположите контрольные факты в разных частях документа и добавьте правдоподобные отвлекающие данные.
  7. Снимите эксплуатационные метрики. Запишите TTFT, полное время, токены, цену, ошибки API, повторы и долю ответов, потребовавших ручной правки.
  8. Повторите тест. Сделайте несколько прогонов с одинаковыми настройками: единичный удачный ответ не показывает вариативность.

Для внедрения заранее задайте порог приёмки. Например, модель проходит только при отсутствии критических фактических ошибок, валидном структурированном выводе и приемлемой стоимости успешной операции. Такой критерий полезнее общего впечатления от демонстрационного диалога.

Кому подходит модель

Qwen3 Max 2025-09-23 подходит команде, которой нужен фиксированный датированный снимок Alibaba, большой текстовый контекст и ответы, хорошо воспринимаемые пользователями. Наиболее разумные области пилота — ассистенты по документам, внутренние базы знаний, редакционные операции и контролируемые агенты с ограниченным набором инструментов.

Модель хуже соответствует проектам, где обязательны локальное развёртывание, открытые веса, полный аудит архитектуры или заранее подтверждённая низкая задержка. Она также не должна автоматически становиться основным кодовым агентом, если команда не подготовила собственный набор репозиторных тестов.

FAQ

Что означает COMRAD Score 60.9?

Это нормализованная редакционная оценка на шкале 0–100, рассчитанная из пяти суббаллов с разными весами. Она не означает 60.9% правильных ответов.

Почему у модели высокий human preference, но только 94-е место?

Human preference 85.7 поддерживает итог, однако quality и coding равны 50.0, efficiency — 55.0, access — 42.9. Кроме того, в профиле отсутствует несколько независимых метрик.

Есть ли у Qwen3 Max 2025-09-23 открытые веса?

Нет. В паспорте модель указана как проприетарная, open weights — false. Официального репозитория весов точного снимка в ходе исследования не найдено.

Поддерживает ли эта версия reasoning?

Паспорт COMRAD404 помечает reasoning как доступный, но документация Model Studio для точного снимка указывает non-thinking mode only. Не считайте редакционный флаг гарантией отдельного API-переключателя: проверьте поведение выбранного endpoint.

Подходит ли модель для программирования?

Её можно тестировать для генерации патчей, объяснения кода и tool-based разработки, однако данных LMArena Code в срезе нет. Решение следует принимать по тестам на собственном репозитории.

Можно ли считать цену $0.78/$3.90 постоянной?

Нет. Это значения из зафиксированного паспорта за миллион входных и выходных токенов. Реальные ставки зависят от провайдера, региона, режима и актуальной тарифной сетки.

Источники

  • Qwen3-Max: Just Scale it — официальное описание релиза и заявленных направлений улучшения.
  • Документация Alibaba Cloud Model Studio по qwen3-max — точный ID снимка, дата, модальности и региональные возможности API.
  • Тарифы Alibaba Cloud Model Studio — подтверждение зависимости стоимости от региона, длины запроса и режима.
  • LMArena Text Leaderboard — источник рейтинга по слепым попарным пользовательским сравнениям.
  • Artificial Analysis LLM Leaderboard — независимый источник Intelligence Index, стоимости и производительности; для этой модели соответствующих данных в переданном срезе нет.

Срез статьи и рейтингового паспорта: 31 августа 2026 года. Выпуск рейтинга: 2026 H2. Версия методологии: 1.0.