Qwen3 30B A3B Instruct 2507 стоит рассматривать прежде всего как экономичную текстовую модель для длинных документов, массовой генерации и собственного развертывания, а не как универсального лидера по качеству. Ее профиль держится на эффективности 97,9 и заметной пользовательской оценке, тогда как суббаллы качества и программирования остаются на уровне 50,0. В результате модель занимает 67-е место в рейтинге COMRAD404 со счетом 63,0.
Это версия без отдельного thinking-режима. Она отвечает напрямую, поддерживает открытые веса под Apache 2.0 и имеет нативный контекст 262 144 токена. Такой набор делает ее интересной для команд, которым важны управляемое развертывание, большой объем входных данных и низкая цена, но не отменяет необходимости собственного теста точности.
Коротко
- Лучший аргумент в пользу модели: сочетание длинного контекста, открытых весов и высокого редакционного суббалла эффективности.
- Главный риск: в срезе нет Artificial Analysis Intelligence Index, отдельного рейтинга LMArena Code и измеренной скорости генерации.
- Подходящие задачи: суммаризация документов, извлечение данных, классификация, черновики текстов, локальные помощники и недорогая пакетная обработка.
- С осторожностью: сложная математика, критически важные выводы, автономные изменения кода и агентные процессы без контроля.
- Вердикт: сильный кандидат для пилота, если цена и контроль инфраструктуры важнее максимального качества первого ответа.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Разработчик | Alibaba, команда Qwen |
| Версия | Qwen3 30B A3B Instruct 2507 |
| Место COMRAD404 | 67 |
| COMRAD Score | 63,0 из 100 |
| Режим рассуждения | Нет, версия Instruct работает без thinking-режима |
| Статус | Не preview |
| Веса и лицензия | Открытые веса, Apache 2.0 |
| Контекст | 262 144 токена |
| LMArena Text | 1382,3; место 169; 23 221 голос |
| Цена входа | $0,048 за 1 млн токенов |
| Цена выхода | $0,193 за 1 млн токенов |
| Скорость и TTFT | Данных в срезе нет |
| Уверенность профиля | Ограниченная |
Цены в паспорте относятся к зафиксированному предложению API и не являются постоянной характеристикой весов. У другого провайдера, в ином режиме или при самостоятельном хостинге экономика будет отличаться.
Место в рейтинге
В выпуске 2026 H2 модель находится на 67-й позиции. Полную таблицу и соседние позиции можно посмотреть в рейтинге моделей ИИ COMRAD404. Методология версии 1.0 использует нормализованные редакционные оценки от 0 до 100. Это не проценты правильных ответов и не вероятность того, что модель справится с конкретным запросом.
Итог формируется из пяти компонентов с разным весом. Качество дает 40% итоговой оценки, предпочтения пользователей — 30%, программирование — 15%, эффективность — 10%, доступность — 5%. Для этой модели арифметика выглядит так: 50,0 × 0,40 + 74,3 × 0,30 + 50,0 × 0,15 + 97,9 × 0,10 + 67,9 × 0,05 = 62,975, что после округления дает COMRAD Score 63,0.
Позицию нельзя читать как утверждение, что модель «правильно отвечает в 63% случаев». Рейтинг сводит неоднородные сигналы в сравнительную редакционную шкалу. Для Qwen3 30B A3B Instruct 2507 итог особенно зависит от хорошего пользовательского восприятия и эффективности, а уверенность ограничена неполным покрытием независимыми метриками.
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Что означает для выбора |
|---|---|---|---|
| Качество | 50,0 | 40% | Нейтральный уровень редакционной оценки; Intelligence Index в паспорте отсутствует. |
| Предпочтения людей | 74,3 | 30% | Сильная часть профиля, опирающаяся на текстовые сравнения LMArena. |
| Программирование | 50,0 | 15% | Отдельного LMArena Code datapoint нет, поэтому делать вывод о лидерстве в коде нельзя. |
| Эффективность | 97,9 | 10% | Главное преимущество профиля, связанное прежде всего с ценой и архитектурной экономичностью. |
| Доступность | 67,9 | 5% | Плюс дают открытые веса и Apache 2.0, но развертывание 30-миллиардной MoE-модели требует ресурсов. |
LMArena rating 1382,3 — статистический рейтинг по слепым попарным сравнениям ответов. Он не равен доле правильных ответов. Место 169 относится к текстовой таблице LMArena в зафиксированном срезе, а 23 221 голос указывает на объем сравнений, но не устраняет влияние состава запросов и версий развертывания.
Что представляет собой эта версия
По официальной карточке это причинная языковая MoE-модель: всего 30,5 млрд параметров, из которых для каждого токена активируется около 3,3 млрд. В архитектуре указаны 128 экспертов и восемь активных экспертов на токен. Обозначение A3B отражает именно порядок числа активируемых параметров, а не общий размер файлов модели.
Версия была выпущена 30 июля 2025 года как обновление non-thinking-варианта Qwen3-30B-A3B. Суффикс Instruct-2507 важен: это настроенная для диалога и выполнения инструкций модель, датированная июлем 2025 года. Ее не следует путать с Qwen3-30B-A3B-Thinking-2507 или первоначальной гибридной версией Qwen3.
Разработчик заявляет улучшения в следовании инструкциям, понимании текста, математике, коде, использовании инструментов, многоязычных знаниях и открытой генерации. Это официальные заявления Qwen, а не результаты независимого рейтинга COMRAD404. Редакционный профиль подтверждает хороший сигнал человеческих предпочтений, но не дает столь же сильного подтверждения общего качества и кода.
Возможности и сценарии
Длинные документы и поиск по корпусу
Контекст 262 144 токена позволяет передавать модели крупные отчеты, договоры, журналы событий или набор связанных документов без слишком агрессивной предварительной нарезки. Практически это подходит для подготовки резюме, поиска противоречий, извлечения реквизитов и построения ответов по внутренней базе знаний.
Размер окна сам по себе не гарантирует, что модель одинаково хорошо удержит каждую деталь. Для надежной работы нужны контрольные вопросы, указание разделов-источников и проверка извлеченных фрагментов. В системах RAG длинный контекст полезен как запас, но не заменяет качественный поиск.
Массовая текстовая обработка
Низкие паспортные цены делают модель кандидатом для классификации обращений, нормализации карточек товаров, генерации метаданных, перевода черновиков, выделения сущностей и подготовки нескольких вариантов текста. Здесь важны стабильный формат и невысокая стоимость каждой операции, а не максимальная глубина рассуждения.
Помощь с кодом
Официальная карточка заявляет улучшенные способности к программированию, однако в рейтинговом паспорте нет отдельного LMArena Code rating. Поэтому разумный старт — объяснение кода, генерация небольших функций, тестов и миграционных скриптов. Для крупных патчей следует обязательно запускать тесты, статический анализ и проверку человеком.
Инструменты и агенты
Официальные материалы описывают function calling и интеграцию через Qwen-Agent, MCP, vLLM и SGLang. Это позволяет строить помощников, которые вызывают поиск, базы данных или внутренние API. Но агентная пригодность зависит не только от модели: нужны строгие схемы аргументов, ограничения прав, тайм-ауты, журналирование и подтверждение необратимых действий.
Контекст и работа без thinking-режима
Нативное окно модели составляет 262 144 токена. В официальной карточке также приведена экспериментальная схема расширения примерно до одного миллиона токенов с дополнительной конфигурацией, специализированными механизмами внимания и высокими требованиями к памяти. В COMRAD404 учитывается паспортное значение 262 144, а не расширенный режим.
Instruct-версия поддерживает только non-thinking mode и не должна выводить блоки <think>...</think>. Это упрощает парсинг и делает расход выходных токенов более предсказуемым, но лишает пользователя отдельного управляемого бюджета рассуждения. Модель способна выполнять логические задачи, однако это не специализированная reasoning-версия.
Для сложного анализа полезнее разбивать процесс на проверяемые этапы: сначала извлечение фактов, затем построение вывода, после этого критика и финальная редактура. Такой конвейер обычно надежнее просьбы решить все одним длинным ответом.
Цена и скорость
В зафиксированном срезе вход стоит $0,048 за миллион токенов, выход — $0,193 за миллион токенов. Выход примерно в четыре раза дороже входа, поэтому ограничение длины ответа влияет на бюджет сильнее, чем сокращение небольшого системного промпта.
Например, запрос со 100 000 входных и 5 000 выходных токенов по этим тарифам стоил бы около $0,0058. Обработка одного миллиона входных токенов с генерацией 100 000 выходных обошлась бы примерно в $0,0673. Это расчет по ценам паспорта, без учета минимальной тарификации, кэширования, сетевых расходов и дополнительных услуг провайдера.
Данных о числе выходных токенов в секунду и времени до первого токена в срезе нет. Высокий суббалл эффективности 97,9 нельзя переводить в обещание конкретной задержки. Скорость зависит от провайдера, квантизации, ускорителей, длины контекста, размера пакета, параллелизма и параметров декодирования.
Развертывание и доступность
Веса опубликованы под Apache 2.0. Это дает широкие возможности для использования, модификации и коммерческого внедрения при соблюдении условий лицензии. В отличие от закрытого API, команда может выбирать среду размещения, квантизацию и политику хранения данных.
Официальные инструкции предусматривают запуск через Transformers, vLLM и SGLang с OpenAI-совместимым API. Однако MoE не означает, что в памяти достаточно держать только 3,3 млрд активных параметров: хранить требуется полный набор весов, а длинный контекст дополнительно расходует память на KV-кэш. Реальные требования зависят от формата весов и реализации сервера.
При локальном внедрении следует отдельно замерить холодный старт, потребление памяти, скорость prefill на длинных запросах, скорость декодирования и максимальное число параллельных пользователей. Облачная цена из паспорта не отражает совокупную стоимость собственного оборудования и эксплуатации.
Ограничения
- Неполное независимое покрытие. Artificial Analysis Intelligence Index отсутствует; значение не следует восстанавливать по памяти или по соседним версиям.
- Нет отдельной метрики кода. LMArena Code rating и место в кодовом рейтинге в срезе отсутствуют.
- Неизвестна измеренная скорость. Нет данных по output tokens per second и time to first token.
- Ограниченная уверенность. Итог 63,0 опирается не на полный набор независимых сигналов.
- Нет reasoning-режима. Для задач с длительным многошаговым поиском решения может потребоваться внешний конвейер или другая версия модели.
- Длинный контекст дорог для инфраструктуры. Максимальное окно увеличивает память, время загрузки входа и требования к серверу.
- Текстовая специализация. Паспорт не подтверждает нативную работу с изображениями, аудио или видео.
- Ошибки остаются возможными. Открытые веса, большая длина контекста и высокий рейтинг предпочтений не гарантируют фактическую точность.
Как проверить на своей задаче
- Соберите 50–200 реальных примеров. Используйте обезличенные обращения, документы, фрагменты кода и пограничные случаи, а не только демонстрационные запросы.
- Зафиксируйте критерии. Разделите точность фактов, полноту, соблюдение формата, стиль, задержку и стоимость. Для кода учитывайте прохождение тестов, а не впечатление от текста.
- Запускайте одну и ту же версию. Укажите полный идентификатор
Qwen/Qwen3-30B-A3B-Instruct-2507, провайдера, параметры генерации и шаблон чата. - Проверьте длинный контекст отдельно. Разместите контрольные факты в начале, середине и конце документа; измерьте не только наличие ответа, но и точность ссылок на исходный текст.
- Измерьте эксплуатационные показатели. Записывайте TTFT, токены в секунду, полную задержку, долю ошибок API, расход токенов и стоимость успешной операции.
- Проведите слепое сравнение. Перемешайте ответы кандидатов и попросите экспертов оценить их без названия модели.
- Протестируйте отказы. Добавьте неполные данные, конфликтующие инструкции, попытки prompt injection и вызовы инструментов с опасными параметрами.
- Назначьте порог внедрения. Например: не менее 95% валидного JSON, ноль критических фактических ошибок и приемлемый p95 времени ответа.
Для воспроизводимости сохраняйте идентификатор модели, хеш или ревизию весов, версию inference-сервера и все параметры декодирования. Одинаковое коммерческое имя у разных провайдеров не всегда означает идентичную конфигурацию.
Кому подойдет модель
Подойдет продуктовым и инженерным командам, которым нужна недорогая текстовая модель с открытыми весами, большим контекстом и возможностью собственного размещения. Особенно логичен пилот для пакетной обработки, корпоративного поиска, суммаризации и приложений, где ответы можно автоматически проверить.
Не должна быть выбором по умолчанию для задач, где ошибка приводит к финансовым, юридическим, медицинским или инфраструктурным последствиям. Также профиль недостаточно полон, чтобы без тестирования рекомендовать модель как основного автономного программиста или сложного reasoning-агента.
Практический вывод прост: Qwen3 30B A3B Instruct 2507 выгодно тестировать там, где объем велик, бюджет ограничен, а качество контролируется рубрикой, тестами или исходными документами. Покупать или разворачивать ее только на основании высокого суббалла эффективности не стоит.
FAQ
Является ли Qwen3 30B A3B Instruct 2507 reasoning-моделью?
Нет. Это Instruct-версия без отдельного thinking-режима; официальная карточка указывает, что она не генерирует блоки think. Логические задачи ей доступны, но управляемого бюджета скрытого рассуждения нет.
Можно ли развернуть модель локально?
Да. Веса доступны под Apache 2.0, а официальные инструкции охватывают Transformers, vLLM и SGLang. Требования к памяти зависят от точности весов, квантизации, длины контекста и нагрузки.
Что означает COMRAD Score 63,0?
Это нормализованная редакционная оценка по шкале 0–100, составленная из пяти суббаллов с разными весами. Она не означает 63% правильных ответов.
Насколько модель хороша для программирования?
Официально разработчик заявляет улучшения в коде, но в рейтинговом срезе нет LMArena Code rating. Пригодность следует проверять на собственных репозиториях, тестах и типичных задачах команды.
Гарантирован ли контекст в один миллион токенов?
Нет. Нативное значение в паспорте — 262 144 токена. Официальная карточка описывает отдельную расширенную конфигурацию примерно до миллиона токенов, требующую специального сервера и значительных ресурсов.
Почему у модели ограниченная уверенность профиля?
В срезе есть текстовый рейтинг LMArena, но отсутствуют Artificial Analysis Intelligence Index, LMArena Code и независимые показатели скорости. Поэтому часть важных выводов нельзя подтвердить полным набором метрик.
Источники
- Официальная карточка Qwen3-30B-A3B-Instruct-2507 — точная версия, лицензия, архитектура, нативный контекст, non-thinking-режим и инструкции запуска.
- Официальный репозиторий Qwen3 — дата выпуска версии 30 июля 2025 года, семейство Qwen3-2507 и поддерживаемые способы развертывания.
- Qwen3 Technical Report — устройство семейства Qwen3 и архитектурные принципы MoE; отчет относится к семейству и не заменяет карточку точной версии 2507.
- LMArena Text Leaderboard — источник статистического рейтинга по слепым попарным сравнениям; числа в статье взяты из зафиксированного паспорта.
- Artificial Analysis LLM Leaderboard — независимая площадка измерений; для этой модели Intelligence Index и показатели скорости в переданном срезе отсутствуют.
Фактический срез статьи: 31 августа 2026 года. Рейтинг COMRAD404 — выпуск 2026 H2, методология 1.0. Официальные заявления разработчика отделены от независимых метрик и редакционной интерпретации.
