Запись архива

GLM-4.5 Air: обзор модели Z.ai в рейтинге COMRAD404

GLM-4.5 Air занимает 96-е место в срезе COMRAD404 2026 H2. Это открытая по весам MoE-модель с сильной эффективностью, умеренными затратами и заметно более сдержанным профилем качества.

GLM-4.5 Air от Z.ai — профиль метрик, цены и сценариев применения

GLM-4.5 Air — модель для тех случаев, когда важнее стоимость и доступность, чем максимальный результат в открытых текстовых сравнениях. В редакционном срезе COMRAD404 2026 H2 она занимает 96-е место с COMRAD Score 60,8 из 100. Профиль неоднородный: эффективность получила 85,5, пользовательское предпочтение — 71,8, а качество и кодирование — по 50,0. Поэтому GLM-4.5 Air разумно рассматривать как недорогой универсальный компонент для прикладных агентов, автоматизации и массовых запросов, но не как безусловный выбор для самых сложных задач.

Ниже используются два типа сведений. Числа рейтинга, цены и доступные поля взяты исключительно из паспорта модели на 31 августа 2026 года. Описание архитектуры и режимов дополнено официальными материалами Z.ai и карточкой модели. Там, где в паспорте нет измерения, это отмечено прямо.

Коротко

GLM-4.5 Air — модель Z.ai с открытыми весами, лицензией MIT и заявленной MoE-архитектурой. В официальном описании семейства указаны 106 млрд общих параметров и 12 млрд активных параметров на проход, а также контекст до 128 тысяч токенов. Модель рассчитана на работу с текстом, кодом, инструментами и агентскими сценариями.

  • Место в COMRAD404: 96.
  • COMRAD Score: 60,8 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
  • Сильнейшая сторона профиля: эффективность — 85,5 из 100.
  • Рейтинг LMArena Text: 1373,3; это статистический рейтинг по слепым попарным сравнениям, не процент качества.
  • Цена в паспорте: 0,13 доллара за миллион входных токенов и 0,85 доллара за миллион выходных токенов.
  • Контекст: 131 072 токена в зафиксированном наборе данных.
  • Скорость: данных о токенах в секунду и времени до первого токена в срезе нет.
  • Уверенность редакционной оценки: ограниченная.

Паспорт модели

Параметр Значение в срезе
Модель GLM-4.5 Air
Разработчик Z.ai
Издание рейтинга COMRAD404 2026 H2
Дата среза 31 августа 2026 года
Место 96
Лицензия MIT
Открытые веса Да
Режим reasoning в паспорте Нет
Статус preview Нет
Контекст 131 072 токена
LMArena Text 1373,3; место 178; 30 368 голосов
Artificial Analysis Intelligence Index Данных в срезе нет

Место в рейтинге

96-я позиция означает, что GLM-4.5 Air находится в рабочей середине общего списка COMRAD404, а не среди лидеров по совокупности критериев. Однако сама позиция не описывает модель полностью: итоговый балл складывается из пяти нормализованных суббаллов с разными весами. Для GLM-4.5 Air это особенно важно, потому что высокий показатель эффективности заметно поддерживает итог, тогда как качество и кодирование ограничивают его рост.

Внешняя проверка в паспорте представлена текстовым рейтингом LMArena: 1373,3, 178-е место и 30 368 пользовательских голосов. LMArena измеряет предпочтение в слепых попарных сравнениях ответов. Такой показатель полезен для оценки общего впечатления от диалога, но не заменяет тесты на точность, воспроизводимость, соблюдение формата или успешность вызова инструментов.

В паспорте нет Artificial Analysis Intelligence Index, рейтинга LMArena Code и места в кодовой категории. Это не означает нулевой результат. Это означает, что для данного редакционного среза соответствующие данные не были доступны или не вошли в покрытие источников. Делать вывод о качестве программирования только по общему текстовому рейтингу нельзя.

Разбор пяти суббаллов

Суббалл Оценка Что это значит для выбора
Качество 50,0 Базовый уровень в редакционной шкале; нет основания считать модель лидером по сложным ответам.
Пользовательское предпочтение 71,8 Диалоговый профиль заметно лучше, чем можно было бы заключить по одному итоговому баллу.
Кодирование 50,0 Нужна собственная проверка на репозитории и тестах; независимого code-рейтинга в паспорте нет.
Эффективность 85,5 Главное преимущество: модель хорошо подходит для экономных и массовых вызовов.
Доступ 64,3 Открытые веса и MIT-лицензия улучшают контроль над размещением и интеграцией.

Что показывает профиль метрик

Самая полезная характеристика GLM-4.5 Air — не отдельное число, а разрыв между суббаллами. Эффективность 85,5 говорит о привлекательной экономике использования, но не гарантирует одинаковое качество на каждом типе запроса. Суббалл пользовательского предпочтения 71,8 показывает, что в интерактивном общении модель может восприниматься лучше, чем предполагает средний показатель качества.

Одновременно оценки 50,0 за качество и кодирование требуют аккуратной постановки задач. Для черновиков, классификации, извлечения структурированных полей, маршрутизации запросов и простых рабочих цепочек модель может быть рациональным вариантом. Для критичных расчётов, сложного рефакторинга, длинных зависимостей в коде и задач с жёсткой фактической точностью одной строки рейтинга недостаточно.

COMRAD Score 60,8 нельзя трактовать как «60,8 процента успешных ответов». Это редакционная нормализация нескольких направлений в шкалу от 0 до 100. Рейтинговый номер и LMArena rating также отвечают на разные вопросы: первый — о позиции в конкретной системе COMRAD404, второй — о статистическом предпочтении пользователей в текстовых сравнениях.

Возможности и сценарии

Официальные материалы Z.ai описывают GLM-4.5 и GLM-4.5 Air как модели для агентских приложений. Для семейства заявлены MoE-архитектура, поддержка вызова инструментов, веб-навигации, программной инженерии и фронтенд-разработки. В карточке GLM-4.5 Air также указаны отдельные thinking и non-thinking режимы. Это официальное описание возможностей семейства, а не независимое подтверждение каждого сценария в редакционном рейтинге.

Где модель выглядит уместно

  • Массовые текстовые операции. Классификация обращений, нормализация полей, извлечение сущностей и подготовка коротких резюме хорошо соответствуют высокой оценке эффективности.
  • Внутренние помощники. Открытые веса позволяют организовать собственный контур исполнения и контролировать размещение, хотя инфраструктурные расходы и настройка остаются на стороне команды.
  • Агентские прототипы. Вызов функций и инструментов можно использовать для экспериментов с маршрутизацией, поиском по базе знаний и последовательностью действий.
  • Работа с длинным контекстом. Паспорт указывает 131 072 токена, а официальная документация семейства — контекст до 128 тысяч токенов. На практике полезный объём зависит от шаблона, лимитов провайдера и выбранного runtime.
  • Недорогие API-сервисы. Низкая стоимость входа особенно интересна для задач, где выходной текст короткий и запросов много.

Где требуется осторожность

Если система принимает решения с высокой ценой ошибки, модель следует использовать с проверкой результата, ограниченным набором инструментов и журналированием действий. Высокий контекст не превращает модель в надёжную базу знаний: длинный промпт может увеличить стоимость и задержку, но не устранить ошибки извлечения или неверные выводы.

Архитектура и официальный статус

По официальной документации Z.ai, GLM-4.5 Air использует более компактную MoE-конфигурацию семейства: 106 млрд общих параметров и 12 млрд активных параметров на проход. Это объясняет, почему общий размер модели и вычислительная нагрузка не должны смешиваться в одну величину. Для локального запуска важны не только активные параметры, но и формат весов, квантование, пропускная способность памяти, поддержка конкретного движка и длина контекста.

Модель представлена как open weights и имеет лицензию MIT в паспорте. Это удобнее для самостоятельного развёртывания и вторичной интеграции, чем полностью закрытый API, но не отменяет проверки лицензий на сопутствующие библиотеки, датасеты, парсеры инструментов и пользовательский код. «Открытые веса» также не означает, что локальная эксплуатация будет бесплатной: потребуются GPU или внешний провайдер, мониторинг и обслуживание.

Паспорт отмечает reasoning: false и preview: false. Поэтому в рамках COMRAD404 модель не размечена как reasoning-модель и не считается preview. При этом официальная карточка семейства описывает thinking и non-thinking режимы. Это различие нужно сохранять: официальная функциональная характеристика и классификация конкретного рейтингового паспорта не являются одной и той же метрикой.

Цена и скорость

В зафиксированном паспорте указана цена 0,13 доллара за миллион входных токенов и 0,85 доллара за миллион выходных токенов. Это тарифные единицы API, а не стоимость полного пользовательского запроса. Итоговая сумма зависит от длины контекста, числа повторных вызовов, скрытых служебных сообщений, инструментов, кэширования и конкретного провайдера.

Данных о output tokens per second и time to first token в срезе нет. Поэтому нельзя честно назвать GLM-4.5 Air быстрой или медленной моделью на основании данного паспорта. Скорость может различаться между облачным API, локальным запуском, квантованной версией и разными режимами обработки. Перед выбором для интерактивного продукта эти показатели нужно измерять отдельно.

Для предварительной оценки бюджета можно использовать формулу: стоимость равна числу входных токенов, умноженному на 0,13 доллара за миллион, плюс число выходных токенов, умноженному на 0,85 доллара за миллион. В агентской цепочке формулу следует применять к каждому обращению, включая повторные попытки и вызовы инструментов.

Ограничения

  • Ограниченная уверенность. Паспорт прямо указывает confidence: ограниченная, поэтому итоговый балл не следует использовать как единственный критерий закупки или архитектурного решения.
  • Нет Artificial Analysis Index. В срезе отсутствует Intelligence Index, а также связанный с ним независимый набор показателей цены, скорости и контекста.
  • Нет code-рейтинга LMArena. Нельзя подменять его общим текстовым рейтингом 1373,3.
  • Нет замера скорости. Отсутствуют и скорость генерации, и время до первого токена.
  • Рейтинг не равен точности. LMArena основана на попарных предпочтениях, а COMRAD Score — на редакционной нормализации нескольких направлений.
  • Открытое размещение требует инженерной работы. Нужны подходящий инференс-движок, память, мониторинг, защита от злоупотреблений и тестирование совместимости с инструментами.
  • Контекст — не гарантия качества. 131 072 токена описывают лимит контекста в паспорте, но не гарантируют одинаково хорошую работу на любой длине входа.

Как проверить на своей задаче

  1. Соберите реальные примеры. Возьмите не демонстрационные промпты, а обезличенные запросы пользователей, документы и фрагменты кода, на которых система действительно будет работать.
  2. Разделите тесты по режимам. Отдельно проверьте короткие ответы, структурированный JSON, длинный контекст, вызов инструментов и задачи, требующие нескольких шагов.
  3. Заранее определите критерии. Для текста измеряйте полноту и фактические ошибки, для классификации — точность и полноту, для кода — прохождение тестов и число ручных исправлений.
  4. Проверьте устойчивость. Повторите каждый запрос несколько раз и протестируйте перестановку инструкций, шум в данных, неполный контекст и конфликтующие требования.
  5. Посчитайте реальную стоимость. Запишите входные и выходные токены, число повторов, обращения к инструментам и долю неудачных попыток. Сравнивайте не цену одного вызова, а цену успешно завершённой операции.
  6. Измерьте задержку самостоятельно. Зафиксируйте time to first token, полное время ответа и скорость генерации на том же провайдере и в том же регионе, где будет работать продукт.
  7. Проверьте контур безопасности. Ограничьте доступные функции, валидируйте аргументы инструментов, добавьте тайм-ауты и ручное подтверждение для необратимых действий.

Практический пилот для GLM-4.5 Air стоит начинать не с вопроса «насколько она умная», а с вопроса «какая доля моих операций завершается с приемлемой стоимостью и без ручного вмешательства». Такой подход лучше соответствует её профилю: высокий суббалл эффективности сочетается с более умеренными оценками качества и кодирования.

Итоговый вердикт

GLM-4.5 Air — рациональный кандидат для экономных текстовых и агентских сервисов, особенно если команде важны открытые веса, собственное размещение или возможность контролировать интеграцию. Её 96-е место и COMRAD Score 60,8 не обещают универсального лидерства, зато профиль метрик ясно показывает компромисс: модель делает ставку на эффективность и доступность.

Выбирать её стоит для потоковых операций, внутренних помощников, прототипов с инструментами и сценариев, где стоимость запроса важнее максимальной глубины ответа. Для критичного кода, сложного анализа и систем без последующей проверки сначала нужен собственный тестовый набор. Отсутствие в паспорте части независимых метрик — не недостаток самой модели, а ограничение доступного среза, которое следует учитывать при сравнении.

FAQ

Какое место занимает GLM-4.5 Air?

В издании COMRAD404 2026 H2 модель занимает 96-е место. Срез датирован 31 августа 2026 года.

Что означает COMRAD Score 60,8?

Это нормализованная редакционная оценка по шкале от 0 до 100. Она не является процентом правильных ответов и не означает, что модель отвечает верно в 60,8% случаев.

Почему у модели высокая эффективность, но средние качество и кодирование?

Пять суббаллов оценивают разные стороны профиля. У GLM-4.5 Air эффективность равна 85,5, а качество и кодирование — 50,0. Поэтому модель может быть выгодной для массовых операций, но требовать дополнительной проверки на сложных задачах.

Есть ли у GLM-4.5 Air открытые веса?

Да. В паспорте указано open_weights: true, а лицензия — MIT. При этом локальное использование всё равно требует совместимой инфраструктуры и проверки лицензий сопутствующих компонентов.

Какая цена указана в паспорте?

0,13 доллара за миллион входных токенов и 0,85 доллара за миллион выходных токенов. Это значения конкретного зафиксированного среза; цены зависят от API-провайдера и режима и могут меняться.

Известна ли скорость генерации?

Нет. В паспорте отсутствуют значения output tokens per second и time to first token. Их нужно измерять самостоятельно на выбранном провайдере или локальной конфигурации.

Можно ли считать GLM-4.5 Air reasoning-моделью?

В официальных материалах семейства описаны thinking и non-thinking режимы, но в паспорте COMRAD404 поле reasoning указано как false. Для целей этого рейтинга модель не размечена как reasoning-модель.

Источники

Рейтинговый срез: рейтинг ИИ-моделей COMRAD404, издание 2026 H2, методология 1.0, дата среза 31 августа 2026 года.