Qwen3 VL 235B A22B Instruct — модель для задач, где текст нужно анализировать вместе с изображениями или видео. В срезе COMRAD404 от 31 августа 2026 года она занимает 66-е место с COMRAD Score 63,0. Её профиль неоднороден: редакционная оценка человеческого предпочтения заметно выше оценок качества и кодинга, а эффективность и доступность выглядят умеренно сильными. Поэтому это не универсальный выбор «по умолчанию», а практичный кандидат для мультимодальных рабочих процессов, если важны открытые веса, длинный контекст и умеренная стоимость API.
Коротко
Qwen3 VL 235B A22B Instruct разработана Alibaba и распространяется с открытыми весами по лицензии Apache 2.0. В названии 235B-A22B отражена MoE-конфигурация: 235 млрд параметров относятся к общей модели, а около 22 млрд активируются для отдельного токена. Это объясняет сочетание крупного общего масштаба и сравнительно более умершей вычислительной нагрузки при инференсе, но не делает локальный запуск лёгким.
Модель относится к instruct-вариантам и в паспорте не отмечена как reasoning-модель. Для пользователя это означает ориентацию на непосредственное выполнение инструкции, а не на отдельный режим глубокого рассуждения с প্রকাশлением цепочки размышлений. Официальные материалы Qwen3-VL описывают поддержку анализа изображений, видео, пространственных отношений, извлечения текста и визуальных агентных сценариев. Эти заявления разработчика полезны для понимания назначения модели, но не заменяют независимую проверку на конкретных данных.
- Позиция: 66-е место в рейтинге COMRAD404, редакция 2026 H2.
- COMRAD Score: 63,0 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
- Контекст: 262 144 токена в паспорте.
- Цена: 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов в зафиксированном режиме провайдера.
- Text Arena: рейтинг 1414,0, 127-е место и 11 225 голосов; это статистика слепых попарных сравнений, а не точность модели.
- Уверенность редакции: ограниченная, поскольку часть ключевых независимых метрик в срезе отсутствует.
Место в рейтинге
66-е место ставит Qwen3 VL 235B A22B Instruct в середину рассматриваемого набора моделей COMRAD404. Такое положение нельзя трактовать как прямой вердикт о качестве на любой задаче: итоговый балл складывается из пяти нормализованных суббаллов с разными весами. Наибольший вклад имеют качество с весом 0,40 и человеческое предпочтение с весом 0,30; кодинг учитывается с весом 0,15, эффективность — 0,10, доступность — 0,05.
При COMRAD Score 63,0 модель выглядит убедительнее в пользовательских, открытых и субъективных сценариях, чем в узкой оценке программирования. Оценка human preference составляет 83,0, тогда как quality и coding — по 50,0. Это не означает, что модель непригодна для кода или систематически ошибается в знаниях. Это означает, что в редакционной нормализации именно эти стороны не дают ей такого же преимущества, как способность формулировать ответы, следовать запросу и восприниматься пользователями как полезная.
Картина дополнительно ограничена неполнотой данных. Для модели нет значения Artificial Analysis Intelligence Index, а в LMArena отсутствуют зафиксированные code rating и code rank. Также нет данных о скорости генерации и времени до первого токена. Поэтому 66-е место следует читать как результат имеющегося паспорта, а не как полностью закрытый профиль производительности.
Полный контекст методики и текущую позицию модели можно сверить на странице рейтинга COMRAD404. Значения относятся именно к редакции 2026 H2 и срезу 31 августа 2026 года; при обновлении провайдеров, таблиц и весов они могут измениться.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Qwen3 VL 235B A22B Instruct |
| Организация | Alibaba |
| Место | 66 |
| COMRAD Score | 63,0 из 100 |
| Лицензия | Apache 2.0 |
| Открытые веса | Да |
| Reasoning | Нет |
| Preview | Нет |
| Уверенность | Ограниченная |
| Контекст | 262 144 токена |
| Вход | 0,21 доллара за 1 млн токенов |
| Выход | 1,90 доллара за 1 млн токенов |
| Скорость и TTFT | Данных в срезе нет |
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Редакционная интерпретация |
|---|---|---|---|
| Quality | 50,0 | 0,40 | Средний вклад в общий профиль; независимых данных недостаточно для более уверенного вывода. |
| Human preference | 83,0 | 0,30 | Главная сильная сторона паспорта: ответы и следование инструкциям хорошо воспринимаются в пользовательских сравнениях. |
| Coding | 50,0 | 0,15 | Нейтральная редакционная оценка; отдельные code rating и rank LMArena отсутствуют. |
| Efficiency | 72,2 | 0,10 | Хороший нормализованный показатель, но фактическая скорость генерации в паспорте не указана. |
| Access | 67,9 | 0,05 | Открытые веса и доступ через API поддерживают доступность, хотя локальная инфраструктура остаётся требовательной. |
Суббаллы являются нормализованными редакционными оценками по шкале 0–100. Их нельзя складывать с ценой, рейтингом LMArena или Intelligence Index как с величинами одной природы. Например, 83,0 в human preference не означает 83% успешных ответов, а 72,2 в efficiency не означает 72,2 токена в секунду.
Что означает архитектура и открытые веса
Официальный репозиторий Qwen3-VL позиционирует семейство как vision-language-модели с плотными и MoE-вариантами. Для Qwen3-VL-235B-A22B-Instruct опубликованы веса и инструкции запуска через Transformers, vLLM и SGLang. Открытые веса дают возможность контролировать размещение модели, выбирать формат квантования и строить собственный сервис вместо обязательной привязки к одному API.
При этом open weights не равны полностью свободному открытому программному обеспечению. В данном паспорте указана лицензия Apache 2.0; её условия нужно проверить перед коммерческим распространением, изменением, упаковкой и включением модели в продукт. Отдельно следует учитывать лицензии на используемые библиотеки, датасеты, адаптеры и пользовательские изображения или видео.
Размер 235B не следует напрямую воспринимать как объём памяти, необходимый в каждом запуске: на требования влияют точность весов, квантование, мультимодальный энкодер, длина контекста, число одновременных запросов и выбранный сервер. Однако это всё равно крупная модель, рассчитанная скорее на серверную инфраструктуру, чем на обычный ноутбук.
Возможности и сценарии
Сильнейший аргумент в пользу модели — мультимодальный характер. Она предназначена не только для диалога по тексту, но и для работы с визуальным входом. Практические сценарии включают разбор скриншотов интерфейсов, извлечение данных из документов и чеков, описание изображений, анализ последовательностей кадров, ответы по видеоматериалам и генерацию кода интерфейса по визуальному примеру.
Документы и изображения
Модель можно тестировать на счетах, таблицах, формах, презентациях и фотографиях объектов. Полезный режим — не просить «описать картинку» вообще, а задавать проверяемую структуру: список полей, значения, координаты, сомнительные фрагменты и уровень уверенности. Для OCR-подобных задач критично отдельно проверять цифры, знаки препинания, единицы измерения и порядок строк.
Видео и временные события
Официальные материалы Qwen3-VL заявляют улучшенное понимание видео и временной динамики. На практике качество будет зависеть от частоты выборки кадров, длительности ролика, разрешения и ограничений конкретного API или сервера. Поэтому модель подходит для первичной расшифровки событий, поиска сцен и ответов по содержанию, но важные выводы требуют сверки с исходным видео.
Интерфейсы и визуальные агенты
Репозиторий описывает визуальные агентные сценарии: распознавание элементов интерфейса, понимание их назначения и вызов инструментов. Это делает модель интересной для прототипов UI-автоматизации, поддержки операторов и тестирования веб-приложений. В production-системе такие действия нельзя разрешать без ограничений: нужны белые списки операций, журналирование, подтверждение опасных шагов и отдельная обработка персональных данных.
Код и визуальное программирование
Модель может быть полезна, когда код нужно получить из скриншота, схемы или прототипа. Она способна ускорить создание чернового HTML/CSS/JS или описания компонентов, но паспорт не содержит независимого code rating и code rank LMArena. Поэтому её стоит рассматривать как помощника для генерации и ревью, а не как подтверждённый инструмент автономной разработки.
Цена и скорость
В зафиксированном паспорте указана цена 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов. Приблизительную стоимость запроса можно оценивать формулой: входные токены × 0,21/1 000 000 плюс выходные токены × 1,90/1 000 000. Для мультимодальных запросов фактическая тарификация может учитывать токены, полученные из изображений или видео, по правилам конкретного API.
Наиболее заметна разница между входом и выходом: генерация стоит дороже чтения. Это выгодно для задач, где модель получает большой документ или изображение и возвращает короткую структурированную выжимку. Если же агент ведёт длинный диалог, многократно переписывает код или выдаёт большие отчёты, расходы растут быстрее.
Значения output tokens per second и time to first token в срезе отсутствуют. Нельзя подставлять вместо них цифры из другого варианта Qwen, другого квантования, другого GPU или другого провайдера. Цена и скорость зависят от API-провайдера, режима обслуживания, длины контекста, нагрузки и параметров генерации. Перед запуском продукта нужны собственные замеры на характерных запросах.
Независимые измерения
В LMArena Text для модели зафиксирован rating 1414,0, 127-е место и 11 225 голосов. Arena rating получают по слепым попарным сравнениям пользовательских ответов. Это показатель относительного предпочтения в конкретной арене, а не процент точных решений, не средний балл за мультимодальное понимание и не гарантия качества на корпоративном наборе данных.
Artificial Analysis Intelligence Index для этой модели в паспорте отсутствует. Редакция также не зафиксировала рейтинг и место в LMArena Code. Эти пропуски важны: по ним нельзя делать вывод о превосходстве или отставании модели. В статье используются только значения, переданные в паспорте, а официальные заявления Qwen3-VL приведены как описание заявленных возможностей, не как независимое подтверждение.
Ограничения
- Неполная метрика качества. Нет Artificial Analysis Intelligence Index и отдельных code-метрик LMArena, поэтому уверенность редакции ограничена.
- Крупная инфраструктура. Открытые веса улучшают контроль и доступность, но не превращают 235B MoE в модель для слабого локального устройства.
- Мультимодальные ошибки. OCR, пространственные отношения, мелкий текст, таблицы и редкие объекты нужно проверять по оригиналу.
- Длинный контекст не равен безошибочной памятью. Паспорт указывает 262 144 токена, а официальный репозиторий описывает возможность расширения до 1 млн с YaRN. Это режим настройки, а не обещание одинакового качества на всей длине.
- Нет данных о задержке. При отсутствии TTFT и tokens per second нельзя заранее оценить интерактивность сервиса.
- Агентные действия требуют контроля. Доступ к браузеру, файлам, платежам или административным функциям должен быть ограничен политиками и подтверждениями.
- Лицензионная проверка обязательна. Apache 2.0 — конкретная лицензия с условиями, а не отказ от всех ограничений.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите 50–200 реальных примеров: изображения документов, скриншоты, видеофрагменты, вопросы пользователей и типовые запросы кода.
- Разделите входы по риску. Отдельно тестируйте обычные изображения, мелкий текст, сложные таблицы, несколько объектов, плохое освещение и длинные ролики.
- Задайте формат результата. Для извлечения данных используйте JSON-схему, обязательные поля и значение
nullдля отсутствующих данных. Так проще измерять полноту и лишние поля. - Проверьте фактические ошибки. Считайте не только впечатление от ответа, но и OCR-ошибки, пропущенные объекты, неверные координаты, выдуманные факты и нарушения формата.
- Сравните режимы. Повторите тесты на выбранном API и при локальном запуске с тем же разрешением, лимитом токенов и температурой.
- Измерьте экономику. Запишите входные и выходные токены, стоимость, TTFT, полную задержку, tokens per second и долю повторных запросов.
- Проведите стресс-тест. Увеличивайте длину контекста, число изображений и параллельность постепенно. Ошибки памяти и деградация скорости часто проявляются раньше функциональных ограничений.
- Проверьте безопасность. Для агентного режима протестируйте prompt injection на изображениях, скрытые инструкции в документах и попытки выполнить запрещённое действие.
Для пилота разумно начинать с режима «анализ без действия»: модель извлекает данные или предлагает шаг, а отдельный исполнитель и человек принимают решение. Если результат стабилен, можно добавлять инструменты по одному и оставлять журнал всех входов, ответов и действий.
Кому подойдёт модель
Qwen3 VL 235B A22B Instruct стоит рассматривать командам, которым нужна одна крупная мультимодальная модель для документов, изображений, видео и текстового диалога. Она особенно интересна при наличии GPU-инфраструктуры, требованиях к контролю над весами или желании не ограничиваться закрытым API. Открытая лицензия и высокий human preference в паспорте делают её привлекательной для прототипов ассистентов, визуального поиска, обработки обращений и UI-аналитики.
Выбор менее очевиден, если важны гарантированная задержка, компактный локальный запуск, подтверждённые code-бенчмарки или формальная воспроизводимость на узком домене. В этих случаях отсутствие скорости, TTFT и части независимых рейтингов нужно считать не мелкой оговоркой, а фактором закупочного и инженерного риска.
Итоговая оценка
Qwen3 VL 235B A22B Instruct получает 63,0 балла COMRAD и 66-е место не благодаря одной выдающейся цифре, а за счёт сочетания открытых весов, большого контекста, мультимодальных возможностей, доступности API и сильного пользовательского профиля. Её слабое место — неопределённость: в срезе нет Intelligence Index, code-рейтинга, скорости и времени до первого токена.
Практический вывод простой: модель заслуживает пилота для визуально-текстовых задач, но не должна внедряться по одному месту в рейтинге. Перед выбором проверьте качество на собственных изображениях и документах, стоимость мультимодальных токенов, задержку выбранного провайдера и поведение на ошибочных или вредоносных входах.
FAQ
Qwen3 VL 235B A22B Instruct — это reasoning-модель?
Нет. В переданном паспорте параметр reasoning отмечен как false. Модель относится к instruct-варианту. Это не запрещает ей решать сложные задачи, но отдельный reasoning-режим для этой записи рейтинга не заявлен.
Что означает 63,0 в COMRAD Score?
Это нормализованная редакционная оценка по шкале 0–100. Она не является процентом правильных ответов и не должна напрямую сравниваться с рейтингом LMArena или ценой токенов.
Насколько модель дорога в API?
В паспорте указаны 0,21 доллара за миллион входных токенов и 1,90 доллара за миллион выходных токенов. Итоговая сумма зависит от длины запроса, мультимодальной тарификации и конкретного провайдера, поэтому перед запуском нужно проверить актуальный прайс и сделать собственный расчёт.
Можно ли запустить её локально?
Да, открытые веса и официальный репозиторий предусматривают варианты запуска через совместимые инструменты, включая Transformers, vLLM и SGLang. Но модель крупная, а требования к памяти зависят от формата весов, квантования, контекста и параллельности. Для обычного ноутбука такой запуск не следует считать реалистичным по умолчанию.
Есть ли у модели подтверждённый рейтинг по программированию?
В паспорте нет значения LMArena code rating и code rank. Суббалл coding равен 50,0 из 100, но это редакционная нормализация, а не отдельный независимый бенчмарк.
Можно ли использовать модель для автоматических действий в интерфейсе?
Официальные материалы описывают визуальные агентные сценарии, однако это не означает, что модель следует допускать к неограниченным действиям. Используйте белые списки операций, подтверждение рискованных шагов, журналирование и изоляцию секретов.
Источники
- COMRAD404 — рейтинг ИИ, редакция 2026 H2 — место модели, COMRAD Score, суббаллы и значения паспорта в срезе 31 августа 2026 года.
- Официальный репозиторий Qwen3-VL на GitHub — инструкции запуска, мультимодальные сценарии, варианты Transformers, vLLM и SGLang, сведения о контексте и YaRN.
- Карточка Qwen/Qwen3-VL-235B-A22B-Instruct на Hugging Face — репозиторий весов, лицензия Apache 2.0, примеры использования и заявленные возможности модели.
- Официальная страница модели Qwen — материал разработчика о Qwen3-VL и назначении семейства.
- LMArena Text Leaderboard — источник статистики Text Arena; в паспортной записи указаны rating 1414,0, 127-е место и 11 225 голосов.
- Artificial Analysis: LLM Leaderboard — справочный источник для Intelligence Index, цен, скорости, контекста и функций API; значения Artificial Analysis для этой модели в срезе отсутствуют.
Фактический срез статьи: 31 августа 2026 года. Официальные описания возможностей отделены от независимых измерений и редакционной интерпретации.
