Запись архива

Qwen3 235B A22B No Thinking: обзор модели в рейтинге COMRAD404

Qwen3 235B A22B No Thinking занимает 78-е место в срезе COMRAD404 2026 H2. Разбираем качество, предпочтения пользователей, стоимость API, контекст, ограничения и сценарии применения.

Qwen3 235B A22B No Thinking — профиль модели Alibaba в рейтинге COMRAD404

Qwen3 235B A22B No Thinking — модель для тех случаев, когда важнее быстро получить связный ответ, чем запускать длинное рассуждение. В срезе COMRAD404 2026 H2 она занимает 78-е место с COMRAD Score 61,9. Это не лидер по совокупной оценке, но заметный вариант для диалогов, редактуры, многоязычных задач и сервисов, где задержка и стоимость важнее максимальной глубины решения.

Профиль модели неоднороден. Её сильнейшая сторона в паспорте — суббалл human preference 79,9: модель хорошо воспринимается в интерактивном текстовом общении. Efficiency также выше среднего по внутренней шкале — 72,2. При этом quality и coding получили по 50,0, а Artificial Analysis Intelligence Index в зафиксированном срезе отсутствует. Поэтому Qwen3 235B A22B No Thinking разумно рассматривать как производительный текстовый рабочий инструмент, но не как универсальную замену специализированной модели для сложного кода, строгой математики или задач, где требуется подтверждённая независимая оценка общего интеллекта.

Коротко

  • Место: 78-е в редакционном рейтинге COMRAD404, выпуск 2026 H2.
  • COMRAD Score: 61,9 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
  • Архитектурный профиль: семейство Qwen3 с открытыми весами; официальные материалы описывают Qwen3-235B-A22B как MoE-модель с 235 млрд общих и 22 млрд активируемых параметров.
  • Рабочий режим паспорта: No Thinking — без выдачи отдельного блока рассуждений и с приоритетом на скорость ответа.
  • Контекст: 131 072 токена в данных паспорта.
  • Цена: 0,455 доллара за миллион входных токенов и 1,82 доллара за миллион выходных токенов.
  • Главный плюс: высокий редакционный показатель человеческих предпочтений при умеренной стоимости.
  • Главный риск: отсутствуют зафиксированные данные по скорости, времени до первого токена, Artificial Analysis и кодовому рейтингу LMArena.

Паспорт модели

Параметр Значение в срезе
Название Qwen3 235B A22B No Thinking
Разработчик Alibaba
Место в COMRAD404 78
COMRAD Score 61,9 из 100
Лицензия Apache 2.0
Открытые веса Да
Preview Нет
Уровень уверенности редакции Ограниченная
Контекст 131 072 токена
Срез данных 31 августа 2026 года

Название No Thinking важно трактовать буквально: в данном профиле рассматривается режим без отдельного этапа рассуждения. Это не означает, что вся линейка Qwen3 лишена reasoning-возможностей. В официальной документации Qwen3 описан как гибридная модель, способная переключаться между thinking и non-thinking режимами. Однако показатели рейтингового паспорта относятся именно к указанной конфигурации, поэтому переносить на неё результаты отдельной thinking-версии нельзя.

Место в рейтинге

78-я позиция означает, что модель находится в середине рейтингового поля, а не в его верхней части. Внутренний COMRAD Score 61,9 складывается из пяти нормализованных суббаллов с разными весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Итог нельзя читать как вероятность успешного ответа или средний процент точности.

Позиция модели объясняется балансом сильных и слабых сторон. Высокий human preference заметно поддерживает результат: в слепых пользовательских сравнениях такие модели часто выигрывают за счёт естественной подачи, соблюдения формата и удобства диалога. Efficiency 72,2 также помогает итоговой оценке. Но два показателя по 50,0 — quality и coding — не дают модели подняться выше. Веса этих направлений особенно важны: quality имеет наибольший вклад в формулу, а coding занимает существенные 15%.

В паспорте приведён текстовый рейтинг LMArena 1402,4, 140-е место и 37 375 голосов. LMArena rating — статистический показатель, рассчитанный по слепым попарным сравнениям, а не доля правильных ответов. Он показывает положение модели в конкретной арене и выборке пользовательских предпочтений. Кодовый рейтинг LMArena и его место для этой записи отсутствуют.

Редакционная уверенность обозначена как ограниченная. Это сигнал не о непригодности модели, а о неполноте измерительного профиля: нет Artificial Analysis Intelligence Index, нет публично зафиксированных в паспорте скорости генерации и time to first token, а для программирования отсутствует отдельный LMArena-результат.

Полная методика и таблица рейтинга COMRAD404 помогают читать эту позицию в контексте остальных записей выпуска 2026 H2.

Разбор пяти суббаллов

Суббалл Оценка Что означает для выбора
Quality 50,0 Нет оснований считать модель лучшим универсальным исполнителем сложных задач; нужна проверка на собственных данных.
Human preference 79,9 Сильный профиль для диалогов, редактуры, объяснений и задач, где важны тон, структура и удобство ответа.
Coding 50,0 Код не следует считать подтверждённой специализацией; обязательны тесты компиляции, исправления ошибок и работы с репозиторием.
Efficiency 72,2 Режим без рассуждения и заявленная стоимость подходят для потоковых текстовых операций.
Access 64,3 Доступность оценивается положительно, но конкретные условия зависят от провайдера и инфраструктуры.

Суббаллы не являются процентами качества. Например, 79,9 human preference не означает, что 79,9% пользователей выберут модель в любой задаче. Это редакционная шкала COMRAD404, нормализованная для сопоставления моделей внутри выпуска.

Возможности и сценарии

Диалоговые и редакторские задачи

Наиболее естественная область применения — текстовые продукты с большим числом коротких или средних запросов. Это службы поддержки, внутренние ассистенты, подготовка черновиков, переписывание писем, классификация обращений, извлечение полей из документов и генерация вариантов формулировок. Высокий human preference указывает, что модель стоит проверять там, где пользователь оценивает не только фактологический результат, но и ясность, последовательность и соблюдение инструкции.

Многоязычные рабочие процессы

Официальные материалы Qwen3 заявляют поддержку более ста языков и диалектов, а документация описывает многоязычное следование инструкциям и перевод. Это делает модель кандидатом для локализации, обработки международной переписки и маршрутизации запросов между языками. Практическое качество всё равно нужно проверять отдельно: языковая поддержка не гарантирует одинаковую точность, стиль и устойчивость на каждом языке.

Агенты и вызов инструментов

В официальной карточке Qwen3 описывается интеграция с внешними инструментами и рекомендуются Qwen-Agent, MCP-конфигурации и совместимые API-эндпоинты. Для агента No Thinking может быть удобен как быстрый исполнитель простых действий: заполнить структуру, выбрать инструмент, сформировать аргументы вызова или подготовить краткое резюме результата. Для многошагового планирования с дорогими ошибками лучше включать отдельный режим рассуждения, если выбранный провайдер и конкретная модель его поддерживают.

Длинный контекст

131 072 токена — крупный контекстный лимит в паспорте. Он полезен для анализа длинных инструкций, нескольких документов, истории переписки и больших спецификаций. Но вместимость окна не равна гарантии качественного извлечения любого факта из его конца или середины. На длинных входах проверяйте потерю деталей, конфликтующие требования, повторения и рост стоимости выходных токенов.

Цена и скорость

В паспорте указаны 0,455 доллара за миллион входных токенов и 1,82 доллара за миллион выходных токенов. Выходная сторона в четыре раза дороже входной, поэтому экономичность зависит от формы запросов: длинные ответы, повторное объяснение и чрезмерно подробные инструкции будут заметно увеличивать счёт.

Это значения конкретного зафиксированного режима, а не универсальный бессрочный тариф модели. Цена зависит от API-провайдера, региона, пакетных условий, кэширования, лимитов и выбранного режима. Перед запуском в продакшене нужно сверить текущий прайс провайдера и уточнить, относится ли предложение к оригинальной модели, совместимому маршруту или квантизированной версии.

Показатели output tokens per second и time to first token в паспорте отсутствуют. Поэтому нельзя честно обещать конкретную скорость ответа или вычислять её из цены и размера модели. В официальном репозитории Qwen опубликованы отдельные инженерные замеры для различных GPU, квантований, длин входа и SGLang, но они не заменяют измерение у вашего API-провайдера: аппаратная конфигурация, батчинг, нагрузка и лимиты сети меняют результат.

Для бюджета полезно считать не только среднюю цену запроса, но и распределение длины входов и ответов. Например, для службы поддержки можно ограничить максимальный ответ, хранить компактную историю и вынести большие документы в поиск. Для аналитических задач разумно заранее установить порог, после которого запрос передаётся в более глубокий режим или на ручную проверку.

Развёртывание и лицензия

Qwen официально распространяет веса Qwen3-235B-A22B по лицензии Apache 2.0, а в паспорте для этой записи отмечены открытые веса. Открытые веса не следует автоматически называть открытым программным обеспечением: права на модель, код инференса, датасеты, торговые марки и отдельные компоненты могут регулироваться разными условиями. Перед коммерческим использованием проверьте текст лицензии и ограничения выбранного дистрибутива.

Официальные материалы указывают на использование Transformers, vLLM и SGLang, а также перечисляют инструменты для локального запуска и квантования. Для модели с 235 млрд общих параметров самостоятельное размещение требует серьёзной серверной инфраструктуры; сам факт наличия открытых весов не означает удобный запуск на одной потребительской видеокарте. Точную конфигурацию памяти и производительность нужно рассчитывать для конкретного формата весов, длины контекста и числа одновременных запросов.

Ограничения

  • Неполный профиль независимых метрик. Artificial Analysis Intelligence Index отсутствует, поэтому нельзя использовать его как дополнительное подтверждение общего уровня.
  • Нет кодового рейтинга LMArena. Значение coding 50,0 — редакционная оценка, а не прямой результат отдельной кодовой арены.
  • Нет данных о скорости. В паспорте отсутствуют output tokens per second и time to first token.
  • Режим имеет значение. Выводы о No Thinking нельзя без проверки переносить на thinking-режим или на обновлённые варианты Qwen3-2507.
  • Большое окно не гарантирует точность. На длинных документах возможны пропуски, неверные связи между фрагментами и рост расходов.
  • Открытые веса требуют инфраструктуры. Локальный запуск может оказаться дороже API после учёта GPU, памяти, обслуживания и энергопотребления.
  • Цена не фиксирована навсегда. Тарифы и условия API-провайдеров могут меняться, поэтому значения из паспорта нужно воспринимать как снимок.

Как проверить на своей задаче

Начните не с общего впечатления, а с небольшого набора реальных примеров. Возьмите 50–200 запросов, которые отражают распределение продакшена: короткие обращения, длинные документы, неоднозначные инструкции, запрещённые действия и типичные ошибки пользователей. Разделите их на группы и заранее определите критерии успеха.

  1. Зафиксируйте режим. Явно укажите No Thinking или параметр enable_thinking=false, если это поддерживает выбранный API. Не смешивайте результаты разных режимов.
  2. Стабилизируйте параметры. Запишите температуру, top-p, лимит ответа, системную инструкцию, формат JSON и версию эндпоинта. Повторяемость важнее единичного удачного ответа.
  3. Проверьте формат. Для JSON валидируйте схему программно; для классификации считайте confusion matrix; для извлечения данных проверяйте каждое поле отдельно.
  4. Оцените качество человеком. Слепое сравнение двух вариантов помогает измерить ясность, полезность, полноту и соответствие тону без влияния названия модели.
  5. Измерьте экономику. Считайте входные и выходные токены, среднюю и 95-й перцентиль задержки, долю повторных запросов и стоимость успешного результата.
  6. Для кода используйте исполняемые тесты. Проверяйте компиляцию, unit-тесты, безопасность зависимостей, сохранение API и способность исправлять собственные ошибки.
  7. Проведите длинноконтекстный тест. Разместите контрольные факты в начале, середине и конце документа, добавьте противоречивые инструкции и измерьте точность извлечения.

Итоговый выбор делайте по стоимости успешного сценария, а не по одному среднему баллу. Если модель хорошо справляется с диалогами, но часто ошибается в критичных полях, её можно оставить первым маршрутом для черновой обработки и добавить детерминированную валидацию или второй этап проверки.

Кому подойдёт модель

Qwen3 235B A22B No Thinking подходит командам, которым нужен сильный открытый по весам текстовый вариант для общения, переписывания, многоязычной обработки и простых агентных действий. Она особенно интересна, если в продукте много запросов со средним объёмом контекста и важны предсказуемый стиль, короткий отклик и контроль расходов.

Модель менее очевидна для задач, где главными критериями являются доказанная математическая точность, автономное программирование, строгая проверка фактов или сложное планирование. В этих случаях отсутствие части независимых метрик в срезе и средний coding-суббалл требуют собственного бенчмарка до принятия решения.

FAQ

Что означает No Thinking в названии?

Это профиль работы без отдельного блока рассуждения. В официальной документации семейство Qwen3 поддерживает переключение между thinking и non-thinking режимами, но паспорт рейтинга относится именно к варианту No Thinking.

Qwen3 235B A22B No Thinking — это 235 млрд активных параметров?

Нет. В официальном описании Qwen3-235B-A22B указаны 235 млрд общих параметров и 22 млрд активируемых параметров. Для MoE это разные величины.

Является ли COMRAD Score процентом точности?

Нет. COMRAD Score 61,9 и пять суббаллов — нормализованные редакционные оценки по шкале от 0 до 100. Они предназначены для сопоставления профилей, а не для трактовки как доли правильных ответов.

Можно ли считать цену 0,455 и 1,82 доллара постоянным тарифом?

Нет. Это значения паспорта для зафиксированного среза: 0,455 доллара за миллион входных токенов и 1,82 доллара за миллион выходных токенов. Актуальная стоимость зависит от провайдера, режима и условий API.

Известна ли скорость генерации модели?

В паспорте нет данных по output tokens per second и time to first token. Официальные инженерные замеры для отдельных конфигураций не позволяют обещать такую же скорость у любого провайдера.

Есть ли у модели подтверждённый кодовый рейтинг LMArena?

Нет. Для этой записи отсутствуют lmarena_code_rating и lmarena_code_rank. Суббалл coding равен 50,0 и является редакционной оценкой, которую нужно проверять тестами на собственном коде.

Источники

Числа рейтинга, суббаллы, цены и отметки об отсутствующих метриках взяты из переданного паспорта модели; ниже приведены материалы для проверки официальных характеристик и методологических контекстов.

  • Рейтинг COMRAD404 — место модели, COMRAD Score и редакционная методика.
  • Qwen3: Think Deeper, Act Faster — официальный анонс Qwen3, открытые веса, лицензия, MoE-профиль и заявленный контекст базового выпуска.
  • Qwen/Qwen3-235B-A22B — официальная карточка модели: параметры, режимы thinking и non-thinking, рекомендации по инференсу и интеграции с инструментами.
  • Qwen3 на GitHub — официальный репозиторий, документация, новости о версиях и способы запуска.
  • Qwen3 Concepts — официальное объяснение схемы названий, гибридных режимов и ограничений контекста.
  • Qwen3 Speed Benchmark — опубликованные разработчиком инженерные замеры для отдельных конфигураций SGLang, GPU и квантований.
  • LMArena Text Leaderboard — страница текстовой арены, с которой связан приведённый в паспорте статистический рейтинг.
  • Artificial Analysis LLM Leaderboard — источник, который проверялся для Intelligence Index, цены, скорости и контекста; в переданном срезе данных по модели нет.