GLM-4.5 — практичный вариант для команд, которым нужны открытые веса, агентные функции и длинный контекст, но не требуется ориентироваться только на максимальную общую оценку. В редакционном срезе COMRAD404 от 31 августа 2026 года модель заняла 73-е место с COMRAD Score 62,2 из 100. Её профиль неоднороден: особенно заметен суббалл human preference — 82,3, тогда как quality и coding получили по 50,0. Это не портрет универсального лидера, а скорее модель с сильной воспринимаемой манерой ответа, доступностью и подходящими для API параметрами.
GLM-4.5 разработана Z.ai для агентных приложений: официальная документация описывает поддержку вызова инструментов, структурированных ответов, потоковой генерации, context caching и двух режимов работы — thinking и non-thinking. При этом в паспорте COMRAD404 поле reasoning отмечено как false. Поэтому редакционный вывод следует формулировать аккуратно: у модели есть документированный режим углублённого рассуждения, но сам паспорт не относит её к моделям с подтверждённым reasoning-флагом.
Коротко
- Итоговая оценка: 62,2 из 100; это нормализованный редакционный COMRAD Score, а не процент правильных ответов.
- Позиция: 73-е место в COMRAD404; отдельный Text Arena-рейтинг LMArena показывает 1411,3 балла и 132-е место при 23 710 голосах.
- Сильная сторона профиля: human preference 82,3 — лучший из пяти суббаллов модели.
- Слабые стороны профиля: quality и coding по 50,0; независимое значение Artificial Analysis Intelligence Index в срезе отсутствует.
- Контекст: 131 072 токена в паспорте, то есть примерно 128K в округлении документации Z.ai.
- Цена в паспорте: 0,6 доллара за миллион входных токенов и 2,2 доллара за миллион выходных токенов.
- Скорость: значения output tokens per second и time to first token в срезе нет.
- Формат распространения: open weights отмечены как доступные; лицензия модели в паспорте — MIT.
Паспорт модели
| Параметр | Значение |
|---|---|
| Модель | GLM-4.5 |
| Разработчик | Z.ai |
| Редакционный срез | 31 августа 2026 года |
| Издание рейтинга | COMRAD404 2026 H2 |
| Место в COMRAD404 | 73 |
| COMRAD Score | 62,2 из 100 |
| Лицензия | MIT |
| Open weights | Да |
| Reasoning-флаг паспорта | Нет |
| Preview | Нет |
| Уровень уверенности | Ограниченная |
| Контекст | 131 072 токена |
| Вход | 0,6 доллара за 1 млн токенов |
| Выход | 2,2 доллара за 1 млн токенов |
| Скорость и TTFT | Нет данных в срезе |
Паспорт не содержит Artificial Analysis Intelligence Index, кодового рейтинга LMArena и двух показателей задержки. Это важно: отсутствие числа не означает нулевой результат и не позволяет корректно восстановить показатель по другим источникам или по сходным моделям.
Место в рейтинге
73-я позиция и COMRAD Score 62,2 помещают GLM-4.5 в середину расширенного редакционного списка. Само место не следует читать как универсальный вердикт «модель хорошая» или «модель слабая». COMRAD Score собирается из пяти нормализованных суббаллов с разными весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. В результате высокий human preference заметно поддерживает итог, но не может полностью компенсировать средние значения quality и coding.
Расчёт по переданным весам даёт 62,215, что после округления соответствует 62,2. На итог сильнее всего влияют quality и human preference. Поэтому GLM-4.5 может восприниматься приятнее в диалоге, чем предполагает её общая позиция, но при выборе для программной разработки или задач, где важна стабильная точность, одной оценки пользовательского предпочтения недостаточно.
Отдельный результат LMArena нужно трактовать иначе. Значение 1411,3 — статистический рейтинг по слепым попарным сравнениям, а не доля правильных ответов. Место 132 и 23 710 голосов дают полезный сигнал о сравнительной привлекательности ответов в текстовых диалогах, но не заменяют тестирование на прикладных данных. В паспорте есть только текстовая Arena-метрика: кодовый рейтинг LMArena отсутствует.
Полный контекст рейтинга и методику издания можно посмотреть в рейтинге COMRAD404.
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Редакционная интерпретация |
|---|---|---|---|
| Quality | 50,0 | 40% | Средний вклад в общую оценку; запас для задач, где нужна максимально стабильная точность. |
| Human preference | 82,3 | 30% | Главный плюс профиля: ответы, вероятно, чаще воспринимаются как понятные, уместные и удобные в диалоге. |
| Coding | 50,0 | 15% | Нет основания считать GLM-4.5 специализированным выбором для критичных инженерных задач. |
| Efficiency | 68,1 | 10% | Хороший редакционный сигнал по эффективности, но фактическая скорость в паспорте не измерена. |
| Access | 64,3 | 5% | Доступность и открытые веса поддерживают оценку, однако конкретные условия зависят от провайдера и инфраструктуры. |
Что означает профиль метрик
Наиболее важная особенность GLM-4.5 — разрыв между восприятием и измеренными редакционными категориями. Human preference 82,3 говорит о сильной стороне в открытом диалоге: модель может хорошо подходить для черновиков, объяснений, ролевых сценариев, клиентских ассистентов и других интерфейсов, где важны тон, связность и субъективная полезность ответа.
Одновременно quality 50,0 не позволяет автоматически переносить этот вывод на точные ответы, сложные аналитические цепочки и задачи с высокой ценой ошибки. Coding 50,0 также не подтверждает преимущество в генерации и исправлении кода. Такой профиль особенно важен для продакт-команд: модель может быть удачной в первом пользовательском контакте, но критические операции лучше закрывать валидацией, инструментами, тестами и маршрутизацией на специализированные решения.
Efficiency 68,1 выглядит благоприятно, но его нельзя превращать в обещание конкретной задержки. В паспорте нет ни скорости генерации, ни time to first token. Цена известна, а реальная стоимость пользовательского сценария зависит от длины промпта, числа повторных вызовов, включённого thinking-режима, кеширования, инструментальных циклов и тарифа выбранного API-провайдера.
Архитектура и официально заявленные возможности
В официальной документации Z.ai GLM-4.5 описана как MoE-модель с 355 млрд общих параметров и 32 млрд активных параметров на прямой проход. Разработчик позиционирует её как основу для агентных приложений, объединяющую работу с кодом, рассуждения и вызов внешних инструментов. Это официальное описание возможностей, а не независимое подтверждение результатов COMRAD404.
Документация указывает на текстовый ввод и текстовый вывод, контекст 128K в округлённом обозначении и максимальный выход до 96K токенов. В паспорте рейтинга контекст зафиксирован точнее — 131 072 токена. Для прикладного проектирования следует ориентироваться на лимиты конкретного API-режима и оставлять запас под системные инструкции, историю диалога, tool calls и служебные поля.
Ключевая особенность API — параметр thinking.type со значениями enabled и disabled. В документации также сказано, что динамическое мышление включено по умолчанию. Это позволяет разделить лёгкие запросы и сложные задачи, но одновременно усложняет измерение цены и задержки: одинаковый промпт может вести себя по-разному в разных режимах и при разных настройках лимита вывода.
Возможности и сценарии
Диалоговые продукты и ассистенты
Высокий human preference делает GLM-4.5 кандидатом для FAQ, внутренних помощников, справочных интерфейсов и генерации текстовых черновиков. Она уместна там, где ответ сначала оценивает человек, а окончательное действие не выполняется без проверки. Для таких сценариев стоит заранее определить стиль, формат ответа, допустимые источники и правила эскалации к оператору.
Агентные цепочки
Официальная документация заявляет function call, структурированный вывод и интеграцию с инструментами. Это подходит для конвейеров, где модель планирует шаги, формирует аргументы вызова API, получает результат и продолжает диалог. Однако сам факт поддержки tool calling не гарантирует корректность маршрута. Нужны схемы JSON, проверка типов, тайм-ауты, повторные попытки и запрет опасных действий без подтверждения пользователя.
Код и разработка
Z.ai отдельно описывает сценарии software engineering, web development и front-end development. Для прототипов, объяснения ошибок, написания тестовых заготовок и рефакторинга небольших модулей модель можно включить в рабочий процесс. Суббалл coding 50,0 подсказывает, что для production-кода необходимы компиляция, тесты, статический анализ и ревью. Не следует выдавать доступ модели к репозиторию и инфраструктуре только на основании маркетингового описания агентных функций.
Длинные документы
Контекст 131 072 токена позволяет экспериментировать с большими наборами инструкций, документацией, журналами и несколькими связанными файлами. Но вместимость окна не равна способности безошибочно использовать каждый фрагмент. На длинных входах проверяйте извлечение фактов из начала, середины и конца документа, устойчивость к повторяющимся данным и поведение при конфликтующих инструкциях.
Цена и скорость
В зафиксированном паспорте указаны 0,6 доллара за миллион входных токенов и 2,2 доллара за миллион выходных токенов. Это разные единицы тарификации, поэтому их нельзя складывать или сравнивать с одной цифрой без расчёта фактического профиля запросов. Например, приложение с длинной историей и коротким ответом будет расходовать бюджет иначе, чем агент, который делает несколько вызовов и генерирует большие промежуточные результаты.
В паспорте отсутствуют output_tokens_per_second и time_to_first_token_seconds. Поэтому нельзя честно назвать GLM-4.5 быстрой в абсолютном смысле или обещать конкретную задержку. Скорость зависит от API-провайдера, региона, нагрузки, очереди, режима thinking, размера ответа, потоковой выдачи и инфраструктуры при локальном запуске. Перед закупкой или миграцией измеряйте p50 и p95, а не только лучший единичный результат.
Практическая смета должна включать не только токены ответа. Учтите системные сообщения, повторные попытки после ошибок валидации, tool calls, резюмирование длинного контекста и стоимость наблюдаемости. Для экономии можно отключать thinking на классификации и простом извлечении, но такое решение нужно подтверждать тестами качества на реальных запросах.
Доступность, open weights и лицензия
Паспорт отмечает open weights и лицензию MIT. Это делает модель интересной для организаций, которым важно контролировать размещение, сетевой периметр или возможность доработки. При этом open weights не следует автоматически называть открытым программным обеспечением во всём технологическом смысле: отдельно проверяйте лицензию исходного кода, inference-движка, токенизатора, адаптеров, датасетов и внутренних компонентов развёртывания.
Официальный репозиторий Z.ai содержит ссылки на веса и описывает варианты BF16 и FP8, а также интеграции с распространёнными инструментами инференса. Для полной модели требования к GPU остаются существенными: локальный запуск — это инфраструктурный проект, а не установка одного небольшого пакета. В расчёт нужно включить память под веса и KV-cache, параллелизм, резервирование, обновления и мониторинг.
Если локальное размещение не является обязательным, API обычно снижает операционную сложность. Но в этом случае появляются зависимости от политики провайдера, региона хранения данных, лимитов, версии endpoint и фактического тарифа. Снимок COMRAD404 фиксирует цену для рейтингового сравнения, а не бессрочную гарантию коммерческих условий.
Ограничения
- Ограниченная уверенность паспорта. Сам рейтинг указывает уровень confidence как «ограниченная», поэтому итоговую оценку следует использовать как ориентир, а не как замену собственному бенчмарку.
- Нет Artificial Analysis Index. В срезе отсутствует независимое значение Intelligence Index; восполнять его по памяти или по данным другой версии нельзя.
- Нет code-рейтинга LMArena. Текстовый рейтинг не показывает, как модель выступает именно в кодовых попарных сравнениях.
- Нет данных о скорости. Отсутствуют и скорость вывода, и время до первого токена.
- Несовпадение терминов reasoning. Паспорт содержит
reasoning: false, а официальная документация описывает thinking mode. Эти факты нельзя смешивать в одно утверждение о подтверждённом качестве рассуждений. - Большой контекст не гарантирует надёжное внимание. Длинное окно требует тестов на lost-in-the-middle, конфликтующие инструкции и точное цитирование.
- Агентные функции повышают поверхность риска. Вызовы инструментов могут приводить к ошибочным или нежелательным действиям без жёстких ограничений на стороне приложения.
- Цена не фиксирована навсегда. Тариф, доступность и производительность могут отличаться между API-провайдерами и режимами.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите 50–200 реальных запросов: простые, пограничные, длинные, с неоднозначными инструкциями и с ожидаемым форматом ответа.
- Разделите классы качества. Отдельно оценивайте фактическую точность, полноту, стиль, следование формату, работу с отказом и корректность вызова инструментов.
- Зафиксируйте режимы. Прогоните одинаковый набор с
thinkingenabled и disabled, одинаковыми temperature, max tokens и системной инструкцией. - Проверьте детерминированность. Повторите трудные запросы несколько раз и отметьте, как часто меняется итог, структура JSON или решение.
- Для кода запускайте тесты. Считайте не количество строк, а долю решений, которые проходят компиляцию, unit-тесты, линтер и проверку безопасности.
- Для агентов используйте песочницу. Ограничьте файловую систему, сеть, секреты и команды. Каждое действие, меняющее данные или инфраструктуру, делайте подтверждаемым.
- Измерьте экономику. Запишите input и output tokens, число повторов, стоимость одного успешного результата, p50/p95 TTFT и скорость потоковой выдачи у выбранного провайдера.
- Проверьте длинный контекст. Разложите контрольные факты по началу, середине и концу окна, добавьте отвлекающий материал и проверьте точность ссылок.
- Сравните с текущим baseline. Сопоставляйте GLM-4.5 не с абстрактным лидером, а с той моделью или правилом, которое уже используется в вашем продукте.
Минимальный критерий принятия стоит формулировать через бизнес-результат: например, не «модель отвечает красиво», а «не менее X% обращений закрываются без ручной правки при стоимости не выше Y». Значения X и Y команда должна определить сама, поскольку паспорт рейтинга их не задаёт.
FAQ
Подходит ли GLM-4.5 для production?
Паспорт не помечает модель как preview, но это не означает автоматическую production-ready гарантию для любого сценария. Для production нужны собственные тесты, контроль доступа к инструментам, мониторинг, обработка ошибок и план отката.
Есть ли у GLM-4.5 reasoning?
В паспорте COMRAD404 поле reasoning отмечено как false. При этом официальная документация Z.ai описывает режим thinking, который включается параметром thinking.type. Корректный вывод: документированная функция thinking есть, но паспорт не даёт модели reasoning-флаг.
Какая у модели длина контекста?
В паспорте зафиксировано 131 072 токена. Документация Z.ai обозначает это окно как 128K. На практике следует проверять лимит конкретного endpoint с учётом системных сообщений, истории и служебных данных.
Сколько стоит GLM-4.5?
В рейтинговом срезе указано 0,6 доллара за миллион входных токенов и 2,2 доллара за миллион выходных токенов. Это ориентир для данного среза: провайдер, регион, режим и дата тарификации могут изменить итоговую стоимость.
Известна ли скорость генерации?
Нет. Значения output tokens per second и time to first token в паспорте отсутствуют. Скорость нужно измерить самостоятельно у выбранного API-провайдера или на собственной инфраструктуре.
Можно ли запускать модель локально?
В паспорте указано наличие open weights, а официальный репозиторий Z.ai публикует материалы для развёртывания. Однако локальный запуск полноразмерной модели требует серьёзной GPU-инфраструктуры и проверки совместимости конкретной версии весов, формата и inference-движка.
Для каких задач GLM-4.5 разумно тестировать первой?
Начните с диалоговых ассистентов, генерации черновиков, структурированного извлечения, агентных прототипов и разработки с обязательными тестами. Именно в этих сценариях можно проверить сильный human preference, работу с инструментами и влияние thinking-режима, не выдавая модель за безусловный источник истины.
Источники
- COMRAD404 — рейтинг моделей ИИ — место GLM-4.5, COMRAD Score, суббаллы и методика редакционного среза.
- Z.ai — страница GLM-4.5 — официальный материал разработчика о назначении и возможностях модели.
- Z.AI Developer Documentation — GLM-4.5 — официальные сведения о MoE, контексте, режимах thinking, tool calling, структурированном выводе и примерах API.
- zai-org/GLM-4.5 на GitHub — официальный репозиторий, материалы модели, варианты весов и инструкции по интеграции.
- LMArena Text Leaderboard — независимый текстовый рейтинг по слепым попарным сравнениям; в паспорте использованы зафиксированные для GLM-4.5 значение, место и число голосов.
- Artificial Analysis — LLM Leaderboard — утверждённый источник для Intelligence Index, цен, скорости, контекста и API-функций; отдельное значение GLM-4.5 в переданном срезе отсутствует.
Редакционный вывод: GLM-4.5 стоит рассматривать как открытый и достаточно доступный фундамент для диалоговых и агентных прототипов, особенно если важны стиль общения и контроль над размещением. Для точного кодинга, критичных решений и оценки задержки её нельзя выбирать по одному общему баллу: сначала нужны собственные прогоны в двух режимах thinking, проверка инструментов и расчёт стоимости успешного сценария.
