Запись архива

Qwen3 VL 235B A22B Instruct: обзор модели в рейтинге COMRAD404

Qwen3 VL 235B A22B Instruct занимает 66-е место в рейтинге COMRAD404. Это открытая мультимодальная MoE-модель с сильным пользовательским профилем, большим контекстом и ограниченной уверенностью редакции из-за неполного набора независимых метрик.

Qwen3 VL 235B A22B Instruct — мультимодальная MoE-модель Alibaba с анализом изображений и видео

Qwen3 VL 235B A22B Instruct — модель для задач, где текст нужно анализировать вместе с изображениями или видео. В срезе COMRAD404 от 31 августа 2026 года она занимает 66-е место с COMRAD Score 63,0. Её профиль неоднороден: редакционная оценка человеческого предпочтения заметно выше оценок качества и кодинга, а эффективность и доступность выглядят умеренно сильными. Поэтому это не универсальный выбор «по умолчанию», а практичный кандидат для мультимодальных рабочих процессов, если важны открытые веса, длинный контекст и умеренная стоимость API.

Коротко

Qwen3 VL 235B A22B Instruct разработана Alibaba и распространяется с открытыми весами по лицензии Apache 2.0. В названии 235B-A22B отражена MoE-конфигурация: 235 млрд параметров относятся к общей модели, а около 22 млрд активируются для отдельного токена. Это объясняет сочетание крупного общего масштаба и сравнительно более умершей вычислительной нагрузки при инференсе, но не делает локальный запуск лёгким.

Модель относится к instruct-вариантам и в паспорте не отмечена как reasoning-модель. Для пользователя это означает ориентацию на непосредственное выполнение инструкции, а не на отдельный режим глубокого рассуждения с প্রকাশлением цепочки размышлений. Официальные материалы Qwen3-VL описывают поддержку анализа изображений, видео, пространственных отношений, извлечения текста и визуальных агентных сценариев. Эти заявления разработчика полезны для понимания назначения модели, но не заменяют независимую проверку на конкретных данных.

  • Позиция: 66-е место в рейтинге COMRAD404, редакция 2026 H2.
  • COMRAD Score: 63,0 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
  • Контекст: 262 144 токена в паспорте.
  • Цена: 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов в зафиксированном режиме провайдера.
  • Text Arena: рейтинг 1414,0, 127-е место и 11 225 голосов; это статистика слепых попарных сравнений, а не точность модели.
  • Уверенность редакции: ограниченная, поскольку часть ключевых независимых метрик в срезе отсутствует.

Место в рейтинге

66-е место ставит Qwen3 VL 235B A22B Instruct в середину рассматриваемого набора моделей COMRAD404. Такое положение нельзя трактовать как прямой вердикт о качестве на любой задаче: итоговый балл складывается из пяти нормализованных суббаллов с разными весами. Наибольший вклад имеют качество с весом 0,40 и человеческое предпочтение с весом 0,30; кодинг учитывается с весом 0,15, эффективность — 0,10, доступность — 0,05.

При COMRAD Score 63,0 модель выглядит убедительнее в пользовательских, открытых и субъективных сценариях, чем в узкой оценке программирования. Оценка human preference составляет 83,0, тогда как quality и coding — по 50,0. Это не означает, что модель непригодна для кода или систематически ошибается в знаниях. Это означает, что в редакционной нормализации именно эти стороны не дают ей такого же преимущества, как способность формулировать ответы, следовать запросу и восприниматься пользователями как полезная.

Картина дополнительно ограничена неполнотой данных. Для модели нет значения Artificial Analysis Intelligence Index, а в LMArena отсутствуют зафиксированные code rating и code rank. Также нет данных о скорости генерации и времени до первого токена. Поэтому 66-е место следует читать как результат имеющегося паспорта, а не как полностью закрытый профиль производительности.

Полный контекст методики и текущую позицию модели можно сверить на странице рейтинга COMRAD404. Значения относятся именно к редакции 2026 H2 и срезу 31 августа 2026 года; при обновлении провайдеров, таблиц и весов они могут измениться.

Паспорт модели

Параметр Значение в срезе
Модель Qwen3 VL 235B A22B Instruct
Организация Alibaba
Место 66
COMRAD Score 63,0 из 100
Лицензия Apache 2.0
Открытые веса Да
Reasoning Нет
Preview Нет
Уверенность Ограниченная
Контекст 262 144 токена
Вход 0,21 доллара за 1 млн токенов
Выход 1,90 доллара за 1 млн токенов
Скорость и TTFT Данных в срезе нет

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Quality 50,0 0,40 Средний вклад в общий профиль; независимых данных недостаточно для более уверенного вывода.
Human preference 83,0 0,30 Главная сильная сторона паспорта: ответы и следование инструкциям хорошо воспринимаются в пользовательских сравнениях.
Coding 50,0 0,15 Нейтральная редакционная оценка; отдельные code rating и rank LMArena отсутствуют.
Efficiency 72,2 0,10 Хороший нормализованный показатель, но фактическая скорость генерации в паспорте не указана.
Access 67,9 0,05 Открытые веса и доступ через API поддерживают доступность, хотя локальная инфраструктура остаётся требовательной.

Суббаллы являются нормализованными редакционными оценками по шкале 0–100. Их нельзя складывать с ценой, рейтингом LMArena или Intelligence Index как с величинами одной природы. Например, 83,0 в human preference не означает 83% успешных ответов, а 72,2 в efficiency не означает 72,2 токена в секунду.

Что означает архитектура и открытые веса

Официальный репозиторий Qwen3-VL позиционирует семейство как vision-language-модели с плотными и MoE-вариантами. Для Qwen3-VL-235B-A22B-Instruct опубликованы веса и инструкции запуска через Transformers, vLLM и SGLang. Открытые веса дают возможность контролировать размещение модели, выбирать формат квантования и строить собственный сервис вместо обязательной привязки к одному API.

При этом open weights не равны полностью свободному открытому программному обеспечению. В данном паспорте указана лицензия Apache 2.0; её условия нужно проверить перед коммерческим распространением, изменением, упаковкой и включением модели в продукт. Отдельно следует учитывать лицензии на используемые библиотеки, датасеты, адаптеры и пользовательские изображения или видео.

Размер 235B не следует напрямую воспринимать как объём памяти, необходимый в каждом запуске: на требования влияют точность весов, квантование, мультимодальный энкодер, длина контекста, число одновременных запросов и выбранный сервер. Однако это всё равно крупная модель, рассчитанная скорее на серверную инфраструктуру, чем на обычный ноутбук.

Возможности и сценарии

Сильнейший аргумент в пользу модели — мультимодальный характер. Она предназначена не только для диалога по тексту, но и для работы с визуальным входом. Практические сценарии включают разбор скриншотов интерфейсов, извлечение данных из документов и чеков, описание изображений, анализ последовательностей кадров, ответы по видеоматериалам и генерацию кода интерфейса по визуальному примеру.

Документы и изображения

Модель можно тестировать на счетах, таблицах, формах, презентациях и фотографиях объектов. Полезный режим — не просить «описать картинку» вообще, а задавать проверяемую структуру: список полей, значения, координаты, сомнительные фрагменты и уровень уверенности. Для OCR-подобных задач критично отдельно проверять цифры, знаки препинания, единицы измерения и порядок строк.

Видео и временные события

Официальные материалы Qwen3-VL заявляют улучшенное понимание видео и временной динамики. На практике качество будет зависеть от частоты выборки кадров, длительности ролика, разрешения и ограничений конкретного API или сервера. Поэтому модель подходит для первичной расшифровки событий, поиска сцен и ответов по содержанию, но важные выводы требуют сверки с исходным видео.

Интерфейсы и визуальные агенты

Репозиторий описывает визуальные агентные сценарии: распознавание элементов интерфейса, понимание их назначения и вызов инструментов. Это делает модель интересной для прототипов UI-автоматизации, поддержки операторов и тестирования веб-приложений. В production-системе такие действия нельзя разрешать без ограничений: нужны белые списки операций, журналирование, подтверждение опасных шагов и отдельная обработка персональных данных.

Код и визуальное программирование

Модель может быть полезна, когда код нужно получить из скриншота, схемы или прототипа. Она способна ускорить создание чернового HTML/CSS/JS или описания компонентов, но паспорт не содержит независимого code rating и code rank LMArena. Поэтому её стоит рассматривать как помощника для генерации и ревью, а не как подтверждённый инструмент автономной разработки.

Цена и скорость

В зафиксированном паспорте указана цена 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов. Приблизительную стоимость запроса можно оценивать формулой: входные токены × 0,21/1 000 000 плюс выходные токены × 1,90/1 000 000. Для мультимодальных запросов фактическая тарификация может учитывать токены, полученные из изображений или видео, по правилам конкретного API.

Наиболее заметна разница между входом и выходом: генерация стоит дороже чтения. Это выгодно для задач, где модель получает большой документ или изображение и возвращает короткую структурированную выжимку. Если же агент ведёт длинный диалог, многократно переписывает код или выдаёт большие отчёты, расходы растут быстрее.

Значения output tokens per second и time to first token в срезе отсутствуют. Нельзя подставлять вместо них цифры из другого варианта Qwen, другого квантования, другого GPU или другого провайдера. Цена и скорость зависят от API-провайдера, режима обслуживания, длины контекста, нагрузки и параметров генерации. Перед запуском продукта нужны собственные замеры на характерных запросах.

Независимые измерения

В LMArena Text для модели зафиксирован rating 1414,0, 127-е место и 11 225 голосов. Arena rating получают по слепым попарным сравнениям пользовательских ответов. Это показатель относительного предпочтения в конкретной арене, а не процент точных решений, не средний балл за мультимодальное понимание и не гарантия качества на корпоративном наборе данных.

Artificial Analysis Intelligence Index для этой модели в паспорте отсутствует. Редакция также не зафиксировала рейтинг и место в LMArena Code. Эти пропуски важны: по ним нельзя делать вывод о превосходстве или отставании модели. В статье используются только значения, переданные в паспорте, а официальные заявления Qwen3-VL приведены как описание заявленных возможностей, не как независимое подтверждение.

Ограничения

  • Неполная метрика качества. Нет Artificial Analysis Intelligence Index и отдельных code-метрик LMArena, поэтому уверенность редакции ограничена.
  • Крупная инфраструктура. Открытые веса улучшают контроль и доступность, но не превращают 235B MoE в модель для слабого локального устройства.
  • Мультимодальные ошибки. OCR, пространственные отношения, мелкий текст, таблицы и редкие объекты нужно проверять по оригиналу.
  • Длинный контекст не равен безошибочной памятью. Паспорт указывает 262 144 токена, а официальный репозиторий описывает возможность расширения до 1 млн с YaRN. Это режим настройки, а не обещание одинакового качества на всей длине.
  • Нет данных о задержке. При отсутствии TTFT и tokens per second нельзя заранее оценить интерактивность сервиса.
  • Агентные действия требуют контроля. Доступ к браузеру, файлам, платежам или административным функциям должен быть ограничен политиками и подтверждениями.
  • Лицензионная проверка обязательна. Apache 2.0 — конкретная лицензия с условиями, а не отказ от всех ограничений.

Как проверить на своей задаче

  1. Соберите репрезентативный набор. Возьмите 50–200 реальных примеров: изображения документов, скриншоты, видеофрагменты, вопросы пользователей и типовые запросы кода.
  2. Разделите входы по риску. Отдельно тестируйте обычные изображения, мелкий текст, сложные таблицы, несколько объектов, плохое освещение и длинные ролики.
  3. Задайте формат результата. Для извлечения данных используйте JSON-схему, обязательные поля и значение null для отсутствующих данных. Так проще измерять полноту и лишние поля.
  4. Проверьте фактические ошибки. Считайте не только впечатление от ответа, но и OCR-ошибки, пропущенные объекты, неверные координаты, выдуманные факты и нарушения формата.
  5. Сравните режимы. Повторите тесты на выбранном API и при локальном запуске с тем же разрешением, лимитом токенов и температурой.
  6. Измерьте экономику. Запишите входные и выходные токены, стоимость, TTFT, полную задержку, tokens per second и долю повторных запросов.
  7. Проведите стресс-тест. Увеличивайте длину контекста, число изображений и параллельность постепенно. Ошибки памяти и деградация скорости часто проявляются раньше функциональных ограничений.
  8. Проверьте безопасность. Для агентного режима протестируйте prompt injection на изображениях, скрытые инструкции в документах и попытки выполнить запрещённое действие.

Для пилота разумно начинать с режима «анализ без действия»: модель извлекает данные или предлагает шаг, а отдельный исполнитель и человек принимают решение. Если результат стабилен, можно добавлять инструменты по одному и оставлять журнал всех входов, ответов и действий.

Кому подойдёт модель

Qwen3 VL 235B A22B Instruct стоит рассматривать командам, которым нужна одна крупная мультимодальная модель для документов, изображений, видео и текстового диалога. Она особенно интересна при наличии GPU-инфраструктуры, требованиях к контролю над весами или желании не ограничиваться закрытым API. Открытая лицензия и высокий human preference в паспорте делают её привлекательной для прототипов ассистентов, визуального поиска, обработки обращений и UI-аналитики.

Выбор менее очевиден, если важны гарантированная задержка, компактный локальный запуск, подтверждённые code-бенчмарки или формальная воспроизводимость на узком домене. В этих случаях отсутствие скорости, TTFT и части независимых рейтингов нужно считать не мелкой оговоркой, а фактором закупочного и инженерного риска.

Итоговая оценка

Qwen3 VL 235B A22B Instruct получает 63,0 балла COMRAD и 66-е место не благодаря одной выдающейся цифре, а за счёт сочетания открытых весов, большого контекста, мультимодальных возможностей, доступности API и сильного пользовательского профиля. Её слабое место — неопределённость: в срезе нет Intelligence Index, code-рейтинга, скорости и времени до первого токена.

Практический вывод простой: модель заслуживает пилота для визуально-текстовых задач, но не должна внедряться по одному месту в рейтинге. Перед выбором проверьте качество на собственных изображениях и документах, стоимость мультимодальных токенов, задержку выбранного провайдера и поведение на ошибочных или вредоносных входах.

FAQ

Qwen3 VL 235B A22B Instruct — это reasoning-модель?

Нет. В переданном паспорте параметр reasoning отмечен как false. Модель относится к instruct-варианту. Это не запрещает ей решать сложные задачи, но отдельный reasoning-режим для этой записи рейтинга не заявлен.

Что означает 63,0 в COMRAD Score?

Это нормализованная редакционная оценка по шкале 0–100. Она не является процентом правильных ответов и не должна напрямую сравниваться с рейтингом LMArena или ценой токенов.

Насколько модель дорога в API?

В паспорте указаны 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов. Итоговая сумма зависит от длины запроса, мультимодальной тарификации и конкретного провайдера, поэтому перед запуском нужно проверить актуальный прайс и сделать собственный расчёт.

Можно ли запустить её локально?

Да, открытые веса и официальный репозиторий предусматривают варианты запуска через совместимые инструменты, включая Transformers, vLLM и SGLang. Но модель крупная, а требования к памяти зависят от формата весов, квантования, контекста и параллельности. Для обычного ноутбука такой запуск не следует считать реалистичным по умолчанию.

Есть ли у модели подтверждённый рейтинг по программированию?

В паспорте нет значения LMArena code rating и code rank. Суббалл coding равен 50,0 из 100, но это редакционная нормализация, а не отдельный независимый бенчмарк.

Можно ли использовать модель для автоматических действий в интерфейсе?

Официальные материалы описывают визуальные агентные сценарии, однако это не означает, что модель следует допускать к неограниченным действиям. Используйте белые списки операций, подтверждение рискованных шагов, журналирование и изоляцию секретов.

Источники

Фактический срез статьи: 31 августа 2026 года. Официальные описания возможностей отделены от независимых измерений и редакционной интерпретации.