Запись архива

Qwen3 235B A22B Instruct 2507: обзор модели

Qwen3 235B A22B Instruct 2507 занимает 49-е место в рейтинге COMRAD404. Это крупная MoE-модель с сильной пользовательской оценкой и низкой стоимостью API, но без подтверждённых данных о скорости и контексте в редакционном срезе.

Qwen3 235B A22B Instruct 2507 — профиль модели Alibaba в рейтинге COMRAD404

Qwen3 235B A22B Instruct 2507 — модель для тех, кому важны качество диалога, следование инструкциям и доступная API-цена, но не требуется встроенный режим рассуждений. В редакционном срезе COMRAD404 от 31 августа 2026 года она получила 64,5 балла и заняла 49-е место. Профиль неоднородный: суббалл человеческого предпочтения заметно выше остальных, эффективность также оценивается высоко, а качество и программирование получили по 50 баллов. Это не универсальный лидер, а практичный вариант для текстовых продуктов, где цена запроса важнее максимальной глубины reasoning.

Модель относится к семейству Qwen3, разработанному командой Qwen компании Alibaba. В официальной карточке указано, что это MoE-модель с 235 млрд параметров в общей конфигурации и 22 млрд активных параметров на токен. Для конкретной версии Instruct 2507 заявлен только non-thinking mode: она не должна генерировать блоки <think>. ([huggingface.co](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507?utm_source=openai))

Коротко

  • Итоговый COMRAD Score: 64,5 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
  • Позиция: 49-е место в выпуске COMRAD404 2026 H2.
  • Главное преимущество: высокий суббалл human preference — 85,5.
  • Практическая сильная сторона: efficiency — 81,9; в паспорте также указана низкая цена API.
  • Главное ограничение: reasoning в паспорте отмечен как отсутствующий, а данные о скорости, времени до первого токена и контексте в редакционном срезе не зафиксированы.
  • Лицензия: Apache 2.0; веса открыты, но это не означает автоматически, что весь стек вокруг модели является открытым программным обеспечением.

Выбирать Qwen3 235B A22B Instruct 2507 разумно для чат-ботов, классификации, суммаризации, генерации деловых и технических текстов, обработки многоязычных обращений и простых агентных сценариев. Для задач, где нужно явно управляемое многошаговое рассуждение, доказательство решения или специализированное программирование, паспорт рейтинга не даёт оснований считать эту версию оптимальным выбором.

Паспорт модели

Параметр Значение в срезе
Модель Qwen3 235B A22B Instruct 2507
Разработчик Alibaba
Дата среза 31 августа 2026 года
Выпуск рейтинга COMRAD404 2026 H2
Место 49
COMRAD Score 64,5 из 100
Лицензия Apache 2.0
Открытые веса Да
Reasoning Нет
Preview Нет
Уверенность редакционной оценки Ограниченная
Контекст Данные в паспорте отсутствуют

Паспорт нужно читать буквально. Открытые веса и лицензия Apache 2.0 делают модель удобной для самостоятельного развёртывания и адаптации, однако размер модели остаётся существенным. MoE-схема снижает число активных параметров на отдельном токене по сравнению с полным вычислением всех 235 млрд, но не превращает модель в лёгкий локальный чекпойнт. Для оценки инфраструктуры необходимо учитывать формат весов, квантование, KV-кэш, длину входа и число одновременных запросов.

Место в рейтинге

49-е место и COMRAD Score 64,5 означают, что модель находится в рабочей середине рейтинга, а не в его верхнем эшелоне. Это не оценка «64,5 процента качества». COMRAD Score — нормализованный редакционный индекс, который собирает пять суббаллов с разными весами. В данном случае наибольший вклад имеют quality с весом 0,4 и human preference с весом 0,3; coding учитывается с весом 0,15, efficiency — 0,1, access — 0,05.

Внешняя независимая опора в паспорте — LMArena Text. Для модели указаны рейтинг 1423,0, 110-е место в текстовом рейтинге и 95 676 голосов. LMArena rating — статистический результат слепых попарных сравнений пользовательских ответов, а не процент правильных ответов и не экспертная оценка полноты знаний. Большое число голосов повышает информативность позиции, но не отменяет зависимости результата от состава запросов, выбранных соперников и пользовательских предпочтений.

Artificial Analysis Intelligence Index в данном срезе отсутствует. Редакция не восстанавливала это значение по памяти и не подменяла его другими тестами. Аналогично, для LMArena Code нет ни рейтинга, ни места. Поэтому 50 баллов за coding следует воспринимать как редакционную нормализацию доступных данных, а не как опубликованный результат конкретного программного бенчмарка.

Полную методологическую рамку и положение модели можно сверить в рейтинге COMRAD404. Ссылка ведёт на общий рейтинг, а не на отдельную страницу модели.

Разбор пяти суббаллов

Суббалл Оценка Что это означает для выбора
Quality 50,0 Средний редакционный уровень без оснований считать модель стабильным лидером по общему качеству.
Human preference 85,5 Сильный профиль в субъективных диалоговых задачах, удобстве ответа и восприятии пользователями.
Coding 50,0 Нет запаса по сравнению с общей группой рейтинга; паспорт не содержит LMArena Code.
Efficiency 81,9 Хорошее соотношение редакционной полезности и вычислительной или ценовой практичности.
Access 62,5 Доступность выше среднего, но самостоятельный запуск крупной MoE-модели требует серьёзной инфраструктуры.

Что именно означает профиль метрик

Главная особенность профиля — разрыв между human preference 85,5 и quality 50,0. Это может означать, что ответы хорошо воспринимаются в диалоге: модель соблюдает формат, пишет естественно, охотно разворачивает объяснение и лучше подходит для открытых пользовательских формулировок. Но высокая субъективная предпочтительность не гарантирует точности фактов, устойчивости на редких случаях или одинакового качества на длинной цепочке зависимых шагов.

Связка efficiency 81,9 и цены 0,264 доллара за миллион входных токенов и 1,06 доллара за миллион выходных токенов делает модель интересной для больших текстовых потоков. При этом низкая цена единицы токена не равна низкой полной стоимости владения: в неё могут входить повторные запросы, хранение контекста, инструменты, ретраи, модерация, мониторинг и инфраструктура провайдера.

Равные оценки quality и coding по 50,0 требуют осторожности. Они не доказывают слабость модели в программировании, но и не позволяют рекомендовать её как специализированный coding-first выбор. Для генерации небольших фрагментов кода она может быть полезна, однако production-сценарий нужно проверять на собственном наборе задач: исправление ошибок, соблюдение API-контрактов, тесты, миграции, SQL и работу с большим репозиторием.

Возможности и сценарии

Текстовые помощники и поддержка

Высокий human preference делает модель кандидатом для клиентской поддержки, внутренних ассистентов и интерфейсов, где важны тон, структура и способность выдерживать многошаговый диалог. Она может формировать черновики ответов, извлекать факты из переданного контекста, классифицировать обращения и превращать неструктурированный текст в JSON. Для пользовательских ответов всё равно нужна проверка фактов и политика отказа при отсутствии данных.

Суммаризация и работа с документами

Модель подходит для первичной обработки договоров, тикетов, протоколов, отчётов и переписки: краткое резюме, список решений, извлечение дат, ролей и рисков. Официальные материалы Qwen для версии Instruct 2507 заявляют поддержку длинного контекста до 256K токенов и возможность расширения до миллиона, однако в паспорте COMRAD404 поле context_tokens не заполнено. Поэтому эти значения следует считать заявленными характеристиками модели, а не измерением, подтверждённым данным рейтингом. ([huggingface.co](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507?utm_source=openai))

Многоязычные задачи

Команда Qwen описывает Qwen3 как семейство с поддержкой более ста языков и диалектов, а для Instruct 2507 отдельно отмечает улучшение покрытия редких языковых вариантов. Это полезная отправная точка для международной поддержки и перевода, но качество именно на нужном языке, домене и стиле необходимо измерить отдельно. Общая заявка разработчика не заменяет тестирование русскоязычной терминологии, имён, единиц измерения и юридических формулировок. ([github.com](https://github.com/QwenLM/Qwen3/blob/main/docs/source/getting_started/concepts.md?ref=aiposthub.com&utm_source=openai))

Инструменты и агенты

Официальная карточка указывает на пригодность Qwen3 для tool calling, а документация Qwen показывает интеграцию через совместимые с OpenAI API серверы и Qwen-Agent. На практике это означает, что модель можно использовать как компонент маршрутизации вызовов, извлечения аргументов и подготовки действий. Но агентный сценарий нужно оценивать не только по красивому JSON: важны корректность выбора инструмента, устойчивость к неполному ответу API, повторяемость и безопасное поведение при неоднозначной команде. ([huggingface.co](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507?utm_source=openai))

Развёртывание и архитектурный профиль

Qwen3 235B A22B Instruct 2507 использует смесь экспертов: 235 млрд параметров указаны как общий объём, 22 млрд — как активируемые для токена. В model card также приведены 94 слоя, 128 экспертов и 8 активных экспертов. Эти данные относятся к официальному описанию конкретного чекпойнта, а не к показателям COMRAD404. ([huggingface.co](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507?utm_source=openai))

Для запуска разработчики показывают примеры с Transformers, vLLM и SGLang. В quickstart для этой версии указаны Transformers не ниже 4.51.0, параметры генерации temperature 0,7, top_p 0,8 и top_k 20. Такие параметры полезны как стартовая конфигурация, но не являются гарантией лучшего результата на каждой задаче. Версия Instruct 2507 работает в non-thinking mode, поэтому не следует переносить на неё настройки и парсеры, предназначенные для Qwen3 Thinking 2507. ([github.com](https://github.com/QwenLM/Qwen3/blob/main/docs/source/getting_started/quickstart.md?utm_source=openai))

Самостоятельное развёртывание потребует оценки GPU-памяти и пропускной способности. Открытые веса улучшают контроль над размещением данных, версиями фреймворков и квантованием, но не отменяют эксплуатационные расходы. Для небольших команд API обычно будет проще, чем собственный кластер. Для организаций с требованиями к локальной обработке, большим постоянным трафиком и готовой GPU-инфраструктурой локальный запуск может быть оправдан.

Цена и скорость

В паспорте указана цена 0,264 доллара за миллион входных токенов и 1,06 доллара за миллион выходных токенов. Это разные тарифные ставки для разных типов токенов; их нельзя складывать в одну «цену запроса» без знания объёма входа и выхода. Например, длинный системный промпт, история диалога и документы могут сделать входную часть доминирующей, тогда как развернутый ответ увеличит расходы по выходному тарифу.

Скорость генерации и время до первого токена в паспорте отсутствуют. Редакция не подставляет сюда значения из сторонних провайдеров: они зависят от аппаратуры, квантования, длины контекста, размера батча, очереди и режима API. Поэтому обещать конкретную задержку или постоянную скорость для Qwen3 235B A22B Instruct 2507 нельзя. При выборе провайдера нужно замерять p50 и p95 отдельно для коротких и длинных запросов.

Для предварительного расчёта стоимости используйте формулу: стоимость = входные токены / 1 000 000 × 0,264 + выходные токены / 1 000 000 × 1,06. В неё следует добавить стоимость инструментов, повторных попыток и инфраструктурных компонентов, если они тарифицируются отдельно. Цена из паспорта — ориентир конкретного режима поставки на дату среза, а не вечное обещание тарифа.

Ограничения

  • Нет встроенного reasoning-профиля. Паспорт отмечает reasoning как false. Модель может давать рассуждения в обычном тексте, но это не то же самое, что отдельный контролируемый режим reasoning.
  • Не подтверждён кодовый рейтинг. В срезе нет LMArena Code rating и rank, поэтому нельзя делать вывод о месте модели среди специализированных coding-систем.
  • Неизвестны скорость и задержка. Поля output tokens per second и time to first token seconds пусты.
  • Не указан контекст в рейтинговом паспорте. Официальные заявления о 256K и расширении до 1M не следует выдавать за независимое измерение COMRAD404.
  • Большая инфраструктурная нагрузка. MoE снижает активные вычисления на токен, но общий чекпойнт остаётся крупным и требует тщательного подбора GPU, формата и сервера.
  • Ограниченная уверенность. Редакционная confidence в паспорте — «ограниченная», поэтому итоговый балл лучше использовать как ориентир для shortlist, а не как единственное основание для закупки.
  • Галлюцинации и следование контексту нужно проверять. Даже при наличии RAG модель может выйти за пределы переданных материалов; доверять ей без валидации в критичных доменах нельзя.

Кому модель подойдёт

Qwen3 235B A22B Instruct 2507 подойдёт командам, которым нужен большой открытый чекпойнт для текстового сервиса, но важна экономичность API или возможность контролировать развёртывание. Это разумный кандидат для корпоративного помощника, многоязычной поддержки, суммаризации, извлечения данных и генерации черновиков. Высокий human preference особенно важен там, где результат оценивает человек, а не только автоматический тест.

Модель хуже подходит в трёх случаях. Во-первых, если нужен именно reasoning-модуль с отдельной политикой глубины рассуждений. Во-вторых, если основная нагрузка — сложный production-код, а в вашем процессе нет времени на строгую проверку. В-третьих, если команда рассчитывает на запуск «на одной обычной видеокарте»: паспорт не обещает такой сценарий, а общий размер модели делает его нетипичным.

Как проверить на своей задаче

  1. Соберите репрезентативный набор. Возьмите не демонстрационные вопросы, а 100–300 реальных запросов: простые, пограничные, конфликтные и с неполным контекстом.
  2. Разделите критерии. Отдельно оценивайте фактическую точность, следование формату, полноту, стиль, устойчивость и стоимость. Не смешивайте приятность ответа с правильностью.
  3. Зафиксируйте режим. Запишите провайдера, версию API, температуру, top_p, top_k, лимит выхода, системный промпт и настройки повторных попыток.
  4. Проверьте non-thinking поведение. Убедитесь, что интеграция не ожидает поля reasoning_content или блоки <think>, характерные для другой версии Qwen3.
  5. Тестируйте инструменты отдельно. Проверьте выбор функции, обязательные аргументы, типы данных, повторный вызов после ошибки и отказ от опасного действия.
  6. Измерьте экономику. Зафиксируйте входные и выходные токены на запрос, p50/p95 задержки, долю ошибок и количество ретраев. Пересчитайте месячную стоимость по фактическому трафику.
  7. Проведите слепую оценку. Покажите ответы специалистам без названия модели и соберите парные предпочтения. Это позволит понять, подтверждается ли высокий human preference на вашей аудитории.

Минимальный пилот стоит завершать не средним баллом, а решением по классам задач. Например, модель может пройти в production для суммаризации и черновиков поддержки, но остаться резервной для генерации кода или ответов без источников. Такой подход лучше отражает неоднородный профиль Qwen3 235B A22B Instruct 2507.

FAQ

Qwen3 235B A22B Instruct 2507 — это reasoning-модель?

Нет. В паспорте COMRAD404 reasoning отмечен как отсутствующий. Официальные материалы описывают Instruct 2507 как non-thinking вариант, который не генерирует блоки <think>. Не следует путать его с отдельной версией Qwen3 Thinking 2507.

Что означает 235B-A22B в названии?

Это обозначение MoE-архитектуры: 235 млрд параметров относятся к общей конфигурации, а около 22 млрд активируются для обработки отдельного токена. Активные параметры не равны объёму всего файла весов и не описывают требования к памяти полностью.

Сколько стоит модель?

В редакционном паспорте указаны 0,264 доллара за миллион входных токенов и 1,06 доллара за миллион выходных токенов. Тарифы зависят от API-провайдера и режима, поэтому перед запуском нужно сверить актуальный прайс и проверить фактический счёт.

Какая у модели скорость?

В срезе нет данных о скорости вывода и времени до первого токена. Эти показатели нельзя восстановить по цене или размеру модели: они меняются в зависимости от сервера, квантования, длины контекста и нагрузки.

Какой у модели размер контекста?

В паспорте COMRAD404 значение отсутствует. Официальная карточка Qwen заявляет нативный контекст 262 144 токена и возможность расширения до 1 010 000 токенов, но это нужно считать характеристикой разработчика и отдельно проверять на используемом сервере.

Можно ли использовать модель коммерчески?

В паспорте указана лицензия Apache 2.0, а веса отмечены как открытые. Перед коммерческим запуском всё равно нужно проверить лицензионные условия конкретного чекпойнта, используемых производных весов, провайдера и сопутствующих компонентов. Открытые веса не означают, что весь программный стек имеет ту же лицензию.

Источники

Редакционные оценки, место в рейтинге, суббаллы и все числовые поля паспорта взяты из переданного среза COMRAD404 на 31 августа 2026 года. Ниже приведены первичные материалы разработчика и документация инфраструктуры, использованные для проверки описания модели.

  • Model card Qwen3 235B A22B Instruct 2507 — название, разработчик, лицензия, MoE-профиль, заявленные характеристики и режим non-thinking. ([huggingface.co](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507?utm_source=openai))
  • Официальный репозиторий Qwen3 — сведения о выпуске Qwen3-2507, вариантах Instruct и Thinking, способах развёртывания и заявленном длинном контексте. ([github.com](https://github.com/qwenLM/qwen3?utm_source=openai))
  • Официальный quickstart Qwen3 — совместимые инструменты, параметры запуска и пример использования конкретной версии 235B-A22B-Instruct-2507. ([github.com](https://github.com/QwenLM/Qwen3/blob/main/docs/source/getting_started/quickstart.md?utm_source=openai))
  • Официальный анонс Qwen3 — описание семейства, открытых весов и общего позиционирования Qwen3 командой разработчика. ([qwenlm.github.io](https://qwenlm.github.io/blog/qwen3/?utm_source=openai))
  • LMArena Text Leaderboard — источник методологического типа метрики Text Arena; числовые значения для этой статьи взяты только из переданного паспорта.
  • Artificial Analysis LLM Leaderboard — источник для Intelligence Index, стоимости, скорости и контекста; в переданном паспорте данные по Intelligence Index отсутствуют.

Срез статьи: 31 августа 2026 года. Цена, доступность API, поддержка фреймворков и измерения производительности могут изменяться; перед внедрением их следует перепроверить у выбранного провайдера.