Qwen3 235B A22B Thinking 2507 — модель для задач, где важнее последовательное рассуждение, чем мгновенный ответ. В редакционном срезе COMRAD404 она заняла 85-е место с COMRAD Score 61,3 из 100. Профиль неоднородный: человеческое предпочтение заметно сильнее общей оценки качества и кодинга, доступ оценивается выше среднего, а главная практическая неизвестность — отсутствие зафиксированной скорости генерации.
Модель интересна разработчикам, которым нужны открытые веса, длинный контекст и режим reasoning без перехода на дорогие закрытые API. Однако это не универсальный выбор по умолчанию: Thinking 2507 работает только в режиме рассуждений, требует серьёзной инфраструктуры при самостоятельном развёртывании, а цена из паспорта относится к конкретному API-срезу и может меняться у провайдера.
Коротко
- Итоговая позиция: 85-е место в рейтинге COMRAD404, редакционная оценка 61,3 из 100.
- Профиль: reasoning-модель с открытыми весами, построенная как MoE.
- Параметры: 235 млрд параметров всего, около 22 млрд активируются на одном проходе, согласно официальной карточке модели.
- Лицензия: Apache 2.0; открытые веса не означают, что вся система развёртывания или любой сервис вокруг неё автоматически является открытым ПО.
- Контекст в рейтинговом паспорте: 131 072 токена.
- Нативный контекст по официальной карточке: 262 144 токена. Эти значения относятся к разным источникам и не должны механически смешиваться.
- Цена в паспорте: 0,23 доллара за миллион входных токенов и 2,30 доллара за миллион выходных.
- Скорость: данных о токенах в секунду и времени до первого токена в срезе нет.
Главный вывод для выбора простой: модель стоит рассматривать как недорогой reasoning-бэкенд с возможностью самостоятельного контроля над весами, но перед внедрением нужно отдельно проверить задержку, стабильность длинного контекста, формат вывода и стоимость именно у выбранного провайдера.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Qwen3 235B A22B Thinking 2507 |
| Организация | Alibaba |
| Тип | Открытые веса, MoE, reasoning |
| Лицензия | Apache 2.0 |
| COMRAD404 | 85-е место; COMRAD Score 61,3 из 100 |
| LMArena Text | 1400 рейтинговых пунктов; 145-е место; 8795 голосов |
| Цена входа | 0,23 доллара за 1 млн токенов |
| Цена выхода | 2,30 доллара за 1 млн токенов |
| Скорость генерации | Нет данных в срезе |
| Время до первого токена | Нет данных в срезе |
| Контекст | 131 072 токена в рейтинговом паспорте |
Часть характеристик подтверждается официальной карточкой Qwen, а часть относится именно к редакционному измерительному срезу. Это важно для корректного чтения паспорта: цена, рейтинг, место и контекст из таблицы COMRAD404 не являются вечными свойствами модели.
Место в рейтинге
85-е место означает, что модель находится в середине редакционной шкалы, а не в группе лидеров по совокупному профилю. При этом COMRAD Score 61,3 нельзя трактовать как процент правильных ответов или вероятность получить хороший результат. Это нормализованная редакционная оценка по пяти направлениям.
Внешний ориентир LMArena Text даёт 1400 рейтинговых пунктов и 145-е место при 8795 пользовательских голосах. LMArena использует статистический рейтинг слепых попарных сравнений: число 1400 не означает 1400 правильных ответов и не является процентом качества. Разрыв между позициями COMRAD404 и LMArena объясняется разными методиками, весами и наборами сигналов, поэтому прямое преобразование одного места в другое некорректно.
В рейтинговом паспорте нет Artificial Analysis Intelligence Index. Это не повод считать модель слабее или сильнее по этой метрике: данных в зафиксированном срезе просто нет. Также отсутствует LMArena Code rating и место в кодовой категории. Поэтому выводы о программировании должны опираться на суббалл COMRAD404 и собственные тесты, а не на несуществующее в паспорте число.
Редакционная уверенность обозначена как ограниченная. Это адекватное предупреждение: у модели есть заметный сигнал человеческого предпочтения, но неполное покрытие независимыми метриками и отсутствие данных о скорости ограничивают точность практического прогноза.
Посмотреть методику и полный рейтинг COMRAD404.
Разбор пяти суббаллов
| Суббалл | Оценка | Что означает |
|---|---|---|
| Quality | 50,0 из 100 | Средний редакционный сигнал по общей качественной пригодности |
| Human preference | 79,2 из 100 | Сильный результат в оценках предпочтения пользователей или сравнительного восприятия |
| Coding | 50,0 из 100 | Средняя оценка по кодовым сценариям в используемом профиле |
| Efficiency | 68,3 из 100 | Хороший баланс вычислительной модели, цены и практической доступности |
| Access | 64,3 из 100 | Достаточно удобный доступ с учётом открытых весов и каналов использования |
Наибольший вес в итоговой формуле имеет Quality — 0,4, затем Human preference — 0,3. Coding получает вес 0,15, Efficiency — 0,1, Access — 0,05. Поэтому высокий результат по пользовательскому предпочтению заметно поддерживает итоговый балл, но не может полностью компенсировать средние 50,0 по качеству и кодингу.
Именно эта структура объясняет, почему модель не поднялась выше, несмотря на привлекательную цену и открытые веса. Для чатовых задач с понятными критериями ответа она может восприниматься лучше, чем подсказывает общий балл. Для системной разработки, где важны предсказуемость, скорость и кодовые тесты, паспорт оставляет больше вопросов.
Архитектура и режим работы
Официальная карточка описывает Qwen3 235B A22B Thinking 2507 как causal language model с архитектурой Mixture-of-Experts. Всего заявлено 235 млрд параметров, из них 22 млрд активных; используются 128 экспертов, а на токен выбираются 8 активных экспертов. В модели 94 слоя, 64 attention heads для Q и 4 для KV.
Такое устройство не превращает модель в «22-миллиардную» в бытовом смысле. Активная часть снижает вычислительную нагрузку на отдельный токен по сравнению с плотной моделью сопоставимого общего размера, но память для весов, квантизация, параллелизм и пропускная способность всё равно остаются серьёзными инженерными задачами.
Ключевое ограничение конкретной версии — поддержка только thinking mode. Официальная карточка указывает, что шаблон чата автоматически добавляет маркер <think>, а в результате может присутствовать только закрывающий маркер </think> без явно выведенного начала рассуждения. При интеграции нельзя предполагать, что вся цепочка рассуждений будет отображаться пользователю в том же виде, что и финальный ответ.
Qwen рекомендует использовать актуальные версии Transformers и поддерживаемые серверные фреймворки, включая vLLM и SGLang. В репозитории Qwen3 также приведены инструкции для TensorRT-LLM и OpenAI-совместимых серверов. Версии фреймворков, параметры tensor parallelism и реальная производительность должны проверяться отдельно перед эксплуатацией.
Возможности и сценарии
Сложные текстовые задачи
Thinking 2507 логично тестировать на многошаговом анализе, математических рассуждениях, разборе требований, классификации с объяснением и подготовке структурированных выводов. Увеличенный бюджет рассуждений может быть полезен там, где короткий интуитивный ответ часто приводит к пропуску условий.
Работа с длинными документами
Официальная карточка заявляет нативный контекст 262 144 токена, тогда как в паспорте COMRAD404 зафиксировано 131 072 токена. Для прикладной системы ориентироваться следует на лимит конкретного сервиса, выбранный сервером и реальную деградацию качества на длинных входах. Формальная длина окна сама по себе не доказывает, что модель одинаково хорошо использует каждый токен.
Программирование и технический анализ
Средний суббалл Coding — 50,0 из 100. Это не запрет на использование модели в разработке, но повод не назначать её единственным кодовым агентом без контрольного набора задач. Она может быть полезна для объяснения ошибок, проектирования решений, рефакторинга небольших фрагментов и анализа технической документации. Для автономного изменения большого репозитория обязательны песочница, тесты и проверка diff.
Многоязычные и исследовательские рабочие процессы
Модель можно рассматривать для подготовки черновиков, извлечения тезисов из материалов, составления сравнительных таблиц и последовательного решения задач на нескольких языках. Но официальные заявления разработчика о широких возможностях — это позиция Qwen, а не независимая гарантия качества в конкретной предметной области. Для юридических, медицинских и финансовых текстов нужен человеческий контроль.
Цена и скорость
В паспорте указаны 0,23 доллара за миллион входных токенов и 2,30 доллара за миллион выходных. Разница между тарифами существенная: длинное рассуждение может сделать стоимость ответа заметно выше, чем подсказывает цена входа. При оценке бюджета нужно считать не только пользовательский запрос, но и системные инструкции, историю диалога, скрытые reasoning-токены, повторные попытки и ответы инструментов.
Эти значения относятся к зафиксированному API-срезу и не должны восприниматься как постоянный прайс-лист Alibaba или всех провайдеров. Тариф зависит от маршрута, региона, режима, кэширования, лимитов и коммерческой политики сервиса. Перед закупкой проверьте актуальную страницу выбранного API и повторите расчёт на собственном распределении длины запросов и ответов.
Данных о выходной скорости в токенах в секунду и времени до первого токена в паспорте нет. Поэтому нельзя честно обещать, что модель будет быстрой даже при низкой цене. Для reasoning-модели задержка также зависит от фактической длины внутреннего рассуждения, размера батча, квантования, числа GPU и настроек сервера.
При локальном развёртывании цена API исчезает, но появляется стоимость оборудования, электроэнергии, хранения весов, обслуживания и инженерного времени. Открытые веса дают контроль и переносимость, однако не делают запуск 235-миллиардной MoE-модели дешёвым на обычном рабочем компьютере.
Ограничения
- Только thinking mode. Для простых запросов модель может тратить больше времени и выходных токенов, чем модель с быстрым нерассуждающим режимом.
- Нет подтверждённой скорости в срезе. Нельзя оценить SLA по паспорту COMRAD404.
- Неполное benchmark-покрытие. Artificial Analysis Index и LMArena Code в паспорте отсутствуют.
- Ограниченная уверенность. Итоговый балл следует использовать как ориентир для отбора, а не как замену пилотному тесту.
- Большая инфраструктурная нагрузка. 235 млрд параметров всего — серьёзное требование к памяти и распределённому инференсу, особенно на длинном контексте.
- Reasoning не равен истинности. Подробная внутренняя цепочка может выглядеть убедительно и при этом содержать ошибочные допущения.
- Провайдерская зависимость. Формат reasoning_content, лимиты контекста, инструментальные вызовы и стоимость могут различаться между API.
- Лицензионная проверка. Apache 2.0 обычно удобна для интеграции, но необходимо отдельно изучить условия конкретного дистрибутива, квантованной сборки и обвязки.
Не следует также переносить характеристики Thinking 2507 на Qwen3 Instruct 2507 или другие модели семейства. Названия похожи, но режимы, контекст, шаблоны чата и поведение могут различаться.
Как встроить модель в продукт
Для API-интеграции начните с проверки совместимости endpoint: поддерживаются ли нужные параметры генерации, structured output, tool calling, потоковая выдача и возврат reasoning-полей. Отдельно определите, что попадёт в пользовательский интерфейс, а что останется служебной частью ответа.
Для собственного сервера используйте рекомендованный стек только как отправную точку. Зафиксируйте версии Transformers, vLLM или SGLang в окружении, сохраните конфигурацию tokenizer и chat template, а затем прогоните нагрузочный тест. Ошибки на длинных контекстах и нестабильность при параллельных запросах часто проявляются не на одиночном демо, а в очереди.
В агентских сценариях задайте ограничение на число итераций, время выполнения и бюджет токенов. Thinking-модель может несколько раз перепроверять себя или строить длинное рассуждение, поэтому неконтролируемый агент способен быстро превратить низкую цену миллиона токенов в высокую стоимость задачи.
Как проверить на своей задаче
- Соберите реальные примеры. Возьмите 50–200 обезличенных запросов из рабочего процесса: обычные, сложные, пограничные и заведомо ошибочные.
- Определите критерии. Разделите точность, полноту, формат, цитируемость, безопасность, стоимость и задержку. Не сводите всё к одному субъективному впечатлению.
- Зафиксируйте промпты. Сохраните системные инструкции, температуру, top-p, лимит выходных токенов, формат инструментов и версию сервера.
- Проверьте режим рассуждений. Измерьте не только финальный ответ, но и расход выходных токенов, долю незавершённых ответов и случаи, когда рассуждение не помогает.
- Испытайте контекст. Подготовьте документы на 8K, 32K, 64K, 131K и более токенов, если это разрешает провайдер. Проверяйте поиск факта в начале, середине и конце текста.
- Отдельно протестируйте код. Используйте компиляцию, unit-тесты, тесты на регрессии и проверку безопасности. Самооценка модели не считается доказательством корректности.
- Посчитайте полную стоимость. Учитывайте вход, выход, повторные запросы, инструменты, кэш и простои. Сравнивайте не цену токена, а стоимость правильно выполненной задачи.
- Проведите нагрузочный прогон. Измерьте p50 и p95 задержки, пропускную способность, ошибки, тайм-ауты и поведение при параллельных запросах.
Практический критерий принятия: модель подходит, если на вашем наборе она даёт приемлемую точность при контролируемом расходе токенов и укладывается в задержку продукта. Если нужен быстрый диалог без рассуждений, сама специализация этой версии уже является аргументом против её выбора.
Кому модель подойдёт
Qwen3 235B A22B Thinking 2507 рационально рассматривать командам, которым нужны открытые веса, reasoning-функции и возможность выбирать между API и самостоятельным размещением. Это также кандидат для исследовательских стендов, внутренних помощников по анализу документов и задач, где стоимость входных токенов важна, а задержка не является единственным KPI.
Модель хуже подходит для массового пользовательского чата с жёсткими требованиями к времени ответа, для небольших команд без GPU-инфраструктуры и для задач, где нужен проверенный кодовый рейтинг. В таких случаях сначала оцените более лёгкие или специализированные варианты, но не переносите на них численные выводы из этого паспорта: в переданном срезе таких сравнительных значений нет.
FAQ
Что означает 85-е место?
Это позиция модели в редакционном рейтинге COMRAD404 за срез 31 августа 2026 года. Она не является процентом качества и не означает, что модель правильно отвечает на 85% запросов.
Можно ли считать 1400 в LMArena процентом?
Нет. 1400 — статистический рейтинговый показатель Text Arena, рассчитанный на основе слепых попарных сравнений. В паспорте также указаны 145-е место и 8795 голосов.
Какой у модели контекст: 131 072 или 262 144 токена?
131 072 токена — значение, зафиксированное в паспорте рейтинга. Официальная карточка Qwen указывает 262 144 токена нативного контекста. Это значения разных источников; для работы нужно ориентироваться на лимит конкретного API или конфигурации сервера.
Действительно ли модель бесплатна из-за Apache 2.0?
Нет. Apache 2.0 описывает условия использования и распространения соответствующих материалов, но инференс требует вычислительных ресурсов. API оплачивается по тарифу провайдера, а локальный запуск требует оборудования и сопровождения.
Есть ли у модели подтверждённая скорость?
В переданном рейтинговом срезе нет значений output tokens per second и time to first token. Поэтому скорость нужно измерять самостоятельно на выбранном API или сервере.
Подходит ли Thinking 2507 для программирования?
Использовать её для кода можно, особенно в задачах анализа, планирования и многошагового исправления. Но суббалл Coding равен 50,0 из 100, а отдельные LMArena Code rating и rank отсутствуют, поэтому перед внедрением нужны тесты с компиляцией и исполнением.
Можно ли отключить рассуждения?
Для этой конкретной версии официальная карточка указывает поддержку только thinking mode. Не следует автоматически переносить механизм отключения thinking с других моделей Qwen3 на Thinking 2507.
Источники
В статье разделены редакционные данные рейтинга, независимое пользовательское измерение и официальные материалы разработчика. Числа COMRAD404 взяты из переданного паспорта; модельные характеристики и рекомендации по запуску сверены с первичными материалами Qwen.
- COMRAD404 — рейтинг ИИ-моделей — позиция модели, COMRAD Score, суббаллы и редакционный срез.
- Официальная карточка Qwen3 235B A22B Thinking 2507 на Hugging Face — название, организация, лицензия, архитектурные параметры, режим thinking, контекст и инструкции запуска.
- Официальный репозиторий Qwen3 — материалы серии, поддерживаемые фреймворки и инструкции развёртывания.
- Официальный анонс Qwen3 от Qwen Team — описание семейства, подхода к обучению и заявленных возможностей базовой серии.
- LMArena Text Leaderboard — независимый рейтинг слепых попарных сравнений; в паспорте для модели зафиксированы 1400 пунктов, 145-е место и 8795 голосов.
- Artificial Analysis: LLM Leaderboard — источник, предусмотренный методикой для Intelligence Index, цены, скорости и контекста; значения Artificial Analysis Index для этой модели в переданном срезе отсутствуют.
