Запись архива

Qwen 2.5 и Qwen3: почему это семейство стало «тихим лидером» открытых моделей

Официальные материалы Alibaba за 2024–2025 годы показывают эволюцию Qwen от сильной open-weight линейки Qwen2.5 к Qwen3 с unified reasoning, MoE, Apache 2.0 и заметно более широкой мультиязычностью.

Схема эволюции Qwen2.5, QwQ-32B и Qwen3 с указанием размеров моделей, режимов reasoning и смены лицензии

Qwen 2.5 и Qwen3 удобно обсуждать не как два разрозненных релиза, а как одну линию развития, которая шла с 19 сентября 2024 года до как минимум 14 мая 2025 года: от Qwen2.5 и его технического отчёта к QwQ-32B, а затем к Qwen3. Если читать первоисточники подряд, видно не просто рост бенчмарков, а смену самой продуктовой логики: отдельные dense-модели, вертикальные ветки для кода и математики, отдельная reasoning-модель и, наконец, объединение «быстрого чата» и «размышления» в одном семействе.

Ниже — обзор именно этого исторического окна 2024–2025 годов по официальным блогам, technical report и model cards. Мы сознательно не подменяем его более поздними релизами: статья фиксирует, что именно утверждали источники Alibaba и что из них следует для практикующих разработчиков.

Коротко

  • Qwen2.5 был не одной моделью, а широкой open-weight-линейкой: dense-модели от 0.5B до 72B, длинный контекст, отдельные ветки Coder и Math, а также API-MoE-модели Turbo и Plus.
  • QwQ-32B в марте 2025 года был промежуточным шагом: отдельная reasoning-модель на 32B, где Alibaba обкатывала усиление через reinforcement learning.
  • Qwen3 не просто «следующая версия». По official sources это попытка собрать chat-режим и reasoning-режим в одном интерфейсе, добавить thinking budget, расширить мультиязычность до 119 языков и перейти на Apache 2.0 для всех моделей линейки.
  • Для практики самый важный сдвиг — не один рекордный график, а более цельный стек: dense и MoE, локальные размеры, reasoning без отдельной модели и заметно более понятные лицензионные условия, чем у флагманского Qwen2.5-72B-Instruct.
  • Ограничение важное: почти все ключевые таблицы производительности здесь — self-report самой команды Qwen. Это полезные данные, но не независимая репликация.

Контекст: что такое Qwen 2.5 / Qwen3 в историческом масштабе

В сентябре 2024 года Alibaba представила Qwen2.5 как большую линейку foundation-моделей, а не как один флагман. По официальному блогу и technical report, открытая часть семейства включала sizes 0.5B, 1.5B, 3B, 7B, 14B, 32B и 72B; предобучение было расширено до 18 трлн токенов, а языковая поддержка в блоге описывалась как «over 29 languages». Для разработчиков это был важный сигнал: Qwen претендует не только на верхний сегмент, но и на edge- и mid-range сценарии.

Дальше линия разветвилась. Осенью 2024 года появились специализированные ветки Qwen2.5-Coder и Qwen2.5-Math; в марте 2025 года — QwQ-32B, отдельная reasoning-модель, где акцент уже был не на общей инструкции, а на усилении рассуждения через RL. И уже 29 апреля 2025 года был анонсирован Qwen3, а 14 мая 2025 года опубликован его technical report. В нём Qwen3 описан как семейство dense- и MoE-моделей от 0.6B до 235B, обученное на 36 трлн токенов и 119 языках и диалектах.

Именно поэтому формулировка «Qwen 2.5 / 3» полезнее, чем спор о том, какая одна модель сильнее. Это история о том, как Alibaba строила полный открытый стек: базовые LLM, instruction-tuned варианты, специализированные expert-модели, отдельную reasoning-ветку и затем их частичную унификацию.

Метод: как читать линейку Qwen 2.5 и Qwen3 без хайпа

Для практики эту эволюцию лучше разбирать по четырём осям.

  • Ширина линейки. Qwen2.5 уже покрывал почти весь спектр размеров от 0.5B до 72B, а Qwen3 продолжил эту логику и добавил два открытых MoE-варианта: 30B-A3B и 235B-A22B.
  • Организация способностей. В 2024 году Alibaba держала код, математику и reasoning заметно более разнесёнными: Qwen2.5, Qwen2.5-Coder, Qwen2.5-Math, затем QwQ-32B. В Qwen3 часть этого разнесения схлопывается: thinking и non-thinking становятся режимами одной модели.
  • Данные и посттренинг. Для Qwen2.5 официально заявлены 18 трлн токенов предобучения и более 1 млн примеров для SFT плюс многостадийный RL. Для Qwen3 — 36 трлн токенов, мультиязычность на 119 языках и схема strong-to-weak distillation для малых моделей.
  • Лицензия и внедрение. Флагманский Qwen2.5-72B-Instruct на Hugging Face распространялся по Qwen LICENSE AGREEMENT, тогда как Qwen3 technical report и model card для Qwen3-235B-A22B прямо указывают Apache 2.0. Для индустрии это не косметика, а практический порог входа.

Ещё одна важная оговорка: в этом обзоре мы сознательно фокусируемся на текстовых LLM и reasoning-линии. У Qwen есть отдельные VL-, audio- и omni-релизы, но они меняют сравнение и уводят разговор в другой класс задач.

Результаты: что реально изменилось между Qwen2.5, QwQ и Qwen3

Ниже — сводка по benchmark-таблицам из Qwen3 Technical Report (Table 11–16). Для этих конкретных сочетаний моделей, режимов и версий бенчмарков мы не нашли второго первичного источника с теми же числами, поэтому таблицу стоит читать как авторский self-report команды Qwen, а не как независимую репликацию.

Модель Режим Активные / общие параметры AIME’25 BFCL v3 LiveCodeBench v5 Multi-IF
Qwen2.5-72B-Instruct non-thinking 72B / 72B 15.0 63.4 30.7 65.3
QwQ-32B thinking 32B / 32B 69.5 66.4 62.7 68.3
Qwen3-32B non-thinking 32B / 32B 20.2 63.0 31.3 70.7
Qwen3-32B thinking 32B / 32B 72.9 70.3 65.7 73.0
Qwen3-30B-A3B thinking 3B / 30B 70.9 69.1 62.6 72.2
Qwen3-235B-A22B thinking 22B / 235B 81.5 70.8 70.7 71.9

Из этой таблицы видны три практических вывода.

  1. QwQ-32B был не тупиковой веткой, а мостом. Он резко поднимает reasoning-уровень относительно Qwen2.5-72B-Instruct и показывает, зачем Alibaba вообще отделяла reasoning-модель весной 2025 года.
  2. Qwen3 делает reasoning более «операционной» функцией. Главное изменение — не только рост чисел, а то, что reasoning перестаёт жить в отдельной модели. В официальном блоге это оформлено как hybrid thinking modes с переключателем enable_thinking=True/False.
  3. MoE у Qwen3 — это не только про масштаб, но и про активные параметры. По блогу и report, 30B-A3B использует лишь 3B активных параметров на токен, а 235B-A22B — 22B. Для инфраструктуры это важнее общего числа параметров, чем для маркетинга.

Если смотреть шире benchmark-таблиц, то у Qwen3 есть ещё две структурные перемены. Во-первых, мультиязычность: официальные материалы говорят о расширении с «over 29 languages» у Qwen2.5 до 119 языков и диалектов у Qwen3. Во-вторых, лицензия: для Qwen3 report и model cards прямо говорят об Apache 2.0, тогда как флагманский Qwen2.5-72B-Instruct на Hugging Face остаётся под Qwen LICENSE AGREEMENT.

Интерпретация

Если абстрагироваться от привычного вопроса «кто первый в leaderboard», семейство Qwen оказывается сильным не из-за одного рекорда, а из-за редкой цельности. Qwen2.5 уже дал разработчикам набор размеров, длинный контекст и вертикальные ветки для кода и математики. QwQ-32B добавил отдельный reasoning-эксперимент. Qwen3 поверх этого сделал следующий шаг: объединил reasoning и быстрый ответ, расширил мультиязычность и снял часть лицензионного трения.

Наш комментарий

Именно здесь уместна формула «тихий лидер» — но не в смысле безусловного №1 на всех задачах. Скорее, речь о другом: Qwen редко был главным героем англоязычного медиа-цикла, однако по первоисточникам Alibaba последовательно закрывала почти все практические сегменты открытых LLM быстрее многих конкурентов. Не один флагман, а весь маршрут разработчика: маленькие локальные модели, mid-range dense, MoE, coder, math, reasoning и затем единый интерфейс для chat/reasoning.

Есть и второй слой. В 2024 году Qwen2.5 выглядел как очень сильный open-weight-набор, но не как полностью бесфрикционный открытый стек: флагманская лицензия была более ограничительной. В 2025 году Qwen3 делает шаг, который для бизнеса и open-source экосистемы, возможно, важнее части benchmark-прироста, — переводит семейство на Apache 2.0. Для многих команд это меняет не «интересно ли попробовать», а «можно ли строить продукт без отдельного юридического обхода».

Ограничения и критика

Первое ограничение — self-report. Почти все центральные числа здесь исходят из самих technical report Qwen. Это нормальная отправная точка, но не независимый аудит. Особенно осторожно стоит читать сравнения с закрытыми моделями, где режимы инференса и вычислительный бюджет не всегда сопоставимы.

Второе — сравнение thinking и non-thinking не является полностью честным apples-to-apples. Если одна модель получает больше времени и токенов на рассуждение, а другая отвечает быстро, часть выигрыша может быть связана не только с качеством обучения, но и с выделенным compute budget. Для Qwen3 это не баг, а часть дизайна, но интерпретировать такие таблицы нужно аккуратно.

Третье — слово «открытая» здесь неоднородно. Qwen2.5 и Qwen3 часто обсуждают в одном ряду, но их лицензионный режим различается. Кроме того, у Qwen2.5 были и API-only MoE-модели Turbo/Plus, то есть не вся лучшая производительность той эпохи была доступна как open weights.

Четвёртое — широкая мультиязычность не означает одинаковое качество по всем языкам. Qwen3 report действительно показывает отдельные таблицы для русского, немецкого, вьетнамского и других языков, но разброс там заметен, а часть сравнений идёт между разными режимами. Поэтому формулу «119 языков» стоит читать как claim о покрытии и полезной поддержке, а не как обещание равного качества.

Пятое — семейный обзор сглаживает различия внутри веток. Qwen2.5-Coder, Qwen2.5-Math, QwQ-32B и core Qwen3 решают разные задачи и обучались разными схемами. Если вы выбираете модель под production, смотреть нужно не только на семейство, но и на конкретную ветку, режим и лицензию.

Вывод

По официальным источникам 2024–2025 годов, Qwen прошёл путь от широкой и сильной open-weight линейки Qwen2.5 к более зрелой архитектуре Qwen3, где reasoning перестал быть отдельным продуктом и стал встроенным режимом. Это, вероятно, и есть главный смысл семейства: не один громкий релиз, а последовательная сборка полного открытого стека.

Если вам нужно короткое резюме для практики, оно такое: Qwen2.5 показал ширину и специализацию, QwQ-32B — проверил RL-путь для reasoning, Qwen3 — попытался превратить всё это в единый интерфейс с более понятной лицензией. Поэтому Qwen стоит помнить не только как ещё одну сильную модель, а как одну из самых системно выстроенных открытых линеек того периода.

Источники

FAQ

Чем Qwen3 принципиально отличается от Qwen2.5?

Главный сдвиг — не только в размерах и бенчмарках, а в объединении reasoning и обычного чат-режима в одной модели. Для Qwen2.5 reasoning-линия была вынесена отдельно в QwQ-32B; для Qwen3 это уже часть базового интерфейса.

Почему QwQ-32B вообще важен, если статья о Qwen2.5 и Qwen3?

Потому что QwQ-32B показывает промежуточную стадию: Alibaba сначала выделила reasoning в отдельную RL-модель, а уже затем встроила эту логику в Qwen3. Без QwQ переход от 2.5 к 3 выглядит менее понятным.

Можно ли считать Qwen2.5 полностью open-source в практическом смысле?

Не совсем. Флагманский Qwen2.5-72B-Instruct на Hugging Face распространялся по Qwen LICENSE AGREEMENT, тогда как для Qwen3 в official sources указан Apache 2.0. Для многих команд это существенная разница.

Означают ли 119 языков у Qwen3 одинаково сильное качество везде?

Нет. Это хороший признак ширины покрытия, но не гарантия одинакового качества. Даже в самом technical report видно, что результаты по языкам и задачам различаются.

Читайте также