Запись архива

GLM-5: обзор модели Z.ai с открытыми весами

GLM-5 выделяется высокой пользовательской предпочтительностью и контекстом 204 800 токенов, но занимает только 38-е место из-за умеренных оценок качества и кода. Разбираем профиль модели, стоимость API, ограничения и план собственного теста.

Профиль модели GLM-5 от Z.ai с COMRAD Score 66,0 и разбором пяти суббаллов

GLM-5 стоит рассматривать прежде всего как доступную модель с открытыми весами для длинных текстовых и агентных процессов, а не как безусловного лидера по качеству. Её главное преимущество в рейтинговом срезе — высокая пользовательская предпочтительность: 95,1 из 100 по редакционной шкале. Однако качество, программирование и эффективность заметно слабее, поэтому итоговый COMRAD Score составляет 66,0, а место в выпуске 2026 H2 — 38-е.

Практический вывод прост: GLM-5 заслуживает пилота, если важны контроль над развёртыванием, лицензия MIT, контекст до 204 800 токенов и приемлемая цена API. Для задач, где ошибка дорого обходится или требуется стабильно сильный код без проверки человеком, решение о внедрении нельзя принимать только по высокой оценке предпочтительности.

Коротко

  • Разработчик: Z.ai.
  • COMRAD Score: 66,0 из 100 — нормализованная редакционная оценка, а не процент правильных ответов.
  • Место: 38-е в выпуске рейтинга COMRAD404 2026 H2.
  • Главная сильная сторона: human preference — 95,1 из 100.
  • Главный сдерживающий фактор: quality — 50,0 из 100 при весе этого компонента 40%.
  • Контекст: 204 800 токенов по зафиксированному паспорту.
  • Стоимость API в срезе: $1,00 за миллион входных и $3,20 за миллион выходных токенов.
  • Открытые веса: да; в паспорте модели указана лицензия MIT.
  • Скорость: данных о токенах в секунду и времени до первого токена в срезе нет.

Паспорт модели

Параметр Значение Как читать
Модель GLM-5 Текстовая модель организации Z.ai
Место 38 Позиция в выпуске COMRAD404 2026 H2
COMRAD Score 66,0 Сводная редакционная оценка 0–100
LMArena Text 1457,8; место 53 Статистический рейтинг слепых попарных сравнений, не процент качества
Голоса LMArena Text 27 649 Объём наблюдений в переданном срезе
LMArena Code 1435,6; место 58 Отдельный рейтинг сравнений ответов на кодовые задачи
Контекст 204 800 токенов Предельный объём контекста по паспорту
Цена $1,00 ввод / $3,20 вывод За миллион токенов; зависит от провайдера и режима
Скорость и TTFT Нет данных В срезе отсутствуют измерения
Artificial Analysis Intelligence Index Нет данных Оценка не восстанавливалась по другим источникам
Веса и лицензия Открытые веса, MIT MIT относится к опубликованным весам в паспорте; лицензии сопутствующего кода следует проверять отдельно
Уверенность профиля Средняя Не все независимые метрики покрыты

Место в рейтинге

GLM-5 занимает 38-е место в рейтинге моделей ИИ COMRAD404 редакции 2026 H2. Позицию определяет не один тест, а взвешенная комбинация пяти суббаллов. На качество приходится 40% итоговой оценки, на пользовательскую предпочтительность — 30%, на программирование — 15%, на эффективность — 10%, на доступность — 5%.

У GLM-5 получается асимметричный профиль. Оценка human preference почти максимальна и вносит в итог около 28,53 балла. Но quality даёт только 20 баллов из потенциальных 40. Программирование добавляет 8,28, эффективность — 5,91, доступ — 3,33. После округления сумма формирует COMRAD Score 66,0.

Поэтому 38-е место нельзя трактовать как опровержение хорошего пользовательского впечатления. Скорее оно показывает, что приятные или убедительные ответы не полностью компенсируют среднюю измеренную надёжность на более широком наборе задач. Для выбора модели это важнее ярлыка «нравится пользователям»: ответы всё равно необходимо проверять на фактах, коде и соблюдении формальных условий.

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Quality 50,0 40% Средний результат по наиболее весомому компоненту ограничивает итоговую позицию
Human preference 95,1 30% Ответы очень часто выигрывают субъективное попарное сравнение
Coding 55,2 15% Подходит для помощи разработчику, но не оправдывает автономное принятие изменений
Efficiency 59,1 10% Умеренный баланс цены и доступных характеристик; измерений скорости нет
Access 66,6 5% Открытые веса и API расширяют варианты внедрения, но локальный запуск ресурсоёмок

Все пять значений — нормализованные редакционные оценки в диапазоне 0–100. Они не являются процентами качества, точности или успешно решённых задач. Смешивать их с рейтингами LMArena, ценой за токены либо размером контекста нельзя: это показатели с разным смыслом и единицами.

Что подтверждают официальные материалы

Официальная карточка GLM-5 на Hugging Face связывает модель с Z.ai, указывает лицензию MIT и предоставляет загружаемые веса. Технический отчёт был впервые опубликован 17 февраля 2026 года и обновлён 24 февраля 2026 года. Разработчик позиционирует модель для программирования, агентных процессов и продолжительных многошаговых задач.

Документация Z.ai описывает текстовый ввод и вывод, контекст порядка 200K, потоковую генерацию, вызов функций, кэширование контекста и структурированный вывод. В ней также заявлена поддержка нескольких режимов обдумывания. При этом в переданном рейтинговом паспорте поле reasoning имеет значение «нет». Это не обязательно техническое противоречие: редакционная классификация reasoning-моделей может быть уже, чем наличие управляемого thinking-режима в API. В профиле сохранено именно значение паспорта.

Заявления Z.ai о собственных и публичных бенчмарках следует отделять от независимых измерений. Они помогают понять назначение модели и рекомендуемую конфигурацию, но не заменяют результаты LMArena и тестирование на рабочих данных. Параметры архитектуры и обучения также не включены в таблицы рейтинга, поскольку числа рейтингового профиля берутся только из переданного паспорта.

Возможности и сценарии

Длинные документы и накопленный контекст

Окно в 204 800 токенов позволяет передавать модели объёмные спецификации, журналы, цепочки переписки, подборки исходных файлов и внутренние инструкции. Это делает GLM-5 кандидатом для анализа репозитория, подготовки сводок по нескольким документам и продолжительных агентных сессий. Большое окно, однако, не гарантирует одинакового внимания ко всем фрагментам. Критические требования лучше дублировать в начале задания и перед ожидаемым результатом, а найденные факты — сопровождать ссылками на исходные фрагменты.

Разработка с обязательным ревью

Кодовый суббалл 55,2 и LMArena Code rating 1435,6 при 58-м месте описывают рабочий, но не выдающийся профиль. Модель можно использовать для черновиков функций, тестов, миграций, объяснения незнакомого кода и поиска вероятных причин ошибки. Безопасный процесс предполагает запуск линтера, статического анализа, unit- и integration-тестов, а также ручное ревью изменений. Секреты и производственные данные в удалённый API отправлять не следует без подходящих договорных и технических мер.

Диалоги, редактура и подготовка материалов

Высокая пользовательская предпочтительность делает GLM-5 интересной для чат-интерфейсов, переписывания текста, подготовки вариантов ответа и интерактивных помощников. Но рейтинг LMArena отражает выбор людей между двумя анонимными ответами, а не доказанную фактическую точность. В контентных процессах модель разумно ставить на первый черновик, структуру и стилистическую адаптацию, оставляя проверку имён, дат, ссылок и чисел редактору.

Агентные цепочки и инструменты

Официальная документация заявляет function calling и структурированный вывод, поэтому GLM-5 можно проверять как основу агента, который выбирает инструменты и возвращает JSON. На практике важны не только правильные аргументы вызова, но и способность не вызывать лишние действия, запрашивать подтверждение перед необратимой операцией и восстанавливаться после ошибки инструмента. Для такого сценария общий чат-бенчмарк недостаточен.

Цена и скорость

В зафиксированном срезе API оценён в $1,00 за миллион входных токенов и $3,20 за миллион выходных токенов. Например, обработка 100 000 входных и генерация 10 000 выходных токенов по этим ставкам стоила бы около $0,132: $0,10 за ввод и $0,032 за вывод. Это расчёт стоимости токенов, а не полной стоимости продукта — к ней могут добавляться повторные запросы, хранение, поиск, инструменты и инфраструктура контроля.

Цена зависит от API-провайдера, тарифа, региона, режима модели и возможного кэширования. Значения из рейтингового среза не следует считать неизменными. Перед закупкой необходимо сверить актуальный прайс и отдельно измерить фактический расход токенов на типичном запросе.

Данных об output tokens per second и time to first token в паспорте нет. Поэтому по этому профилю нельзя утверждать, насколько быстро GLM-5 начинает ответ или завершает длинную генерацию. Для интерактивного продукта следует измерить медиану и 95-й перцентиль задержки у выбранного провайдера. Для пакетной обработки важнее пропускная способность и стоимость завершённой задачи, а не скорость одного потока.

Открытые веса и развёртывание

Открытые веса дают возможность развернуть модель в контролируемом контуре, менять серверный стек и проводить собственные оценки без привязки только к одному API. В карточке модели доступны инструкции для Transformers, vLLM и SGLang, а официальный репозиторий содержит материалы по запуску и интеграции.

При этом «открытые веса» не означают, что локальный запуск прост или дёшев. GLM-5 относится к крупным моделям, и официальные рецепты ориентированы на специализированную серверную инфраструктуру. До выбора self-hosted варианта нужно оценить память ускорителей, число узлов, формат весов, скорость межсоединений, нагрузочное резервирование и компетенции команды эксплуатации.

Паспорт указывает MIT для весов модели, а репозиторий сопутствующего кода на GitHub маркирован Apache-2.0. Это разные объекты лицензирования. Перед коммерческим использованием следует сохранить тексты применимых лицензий и проверить условия конкретных файлов, контейнеров, библиотек и производных сборок.

Ограничения

  • Нет Artificial Analysis Intelligence Index. В срезе отсутствует независимая интегральная метрика Artificial Analysis, поэтому качество не следует достраивать по памяти или по данным другой версии GLM.
  • Нет измерений задержки. Суббалл эффективности 59,1 не сообщает реальное число токенов в секунду и не заменяет нагрузочный тест.
  • Средний quality-профиль. Оценка 50,0 при максимальном весе компонента требует осторожности в фактических, юридических, медицинских, финансовых и иных чувствительных задачах.
  • Код требует проверки. Суббалл 55,2 и 58-е место в Code Arena не дают оснований автоматически сливать созданные моделью изменения.
  • Большой контекст не равен безошибочной памяти. Модель может пропускать условия, смешивать версии документов или уверенно достраивать отсутствующие детали.
  • Развёртывание весов ресурсоёмко. Доступ к весам снижает зависимость от API, но не отменяет аппаратные и эксплуатационные затраты.
  • Средняя уверенность профиля. Покрытие LMArena есть, однако часть независимых метрик отсутствует.

Кому подходит GLM-5

Модель выглядит уместно для команд, которым нужен длинный контекст, доступ к весам и возможность выбирать между API и собственным контуром. Особенно разумны пилоты в редактуре, внутренних ассистентах, поиске по документам, генерации тестов, анализе репозиториев и многошаговых процессах с контролируемыми инструментами.

GLM-5 менее убедительна как выбор «по умолчанию» для полностью автономной разработки, критического фактчекинга или процессов, где неизвестная задержка сама по себе является блокирующим риском. В этих случаях сначала понадобятся измерения на собственном наборе задач и сравнение с уже используемым решением. Паспорт не содержит данных других моделей, поэтому численное сравнение с ними здесь намеренно не проводится.

Как проверить на своей задаче

  1. Соберите 50–200 реальных примеров. Не заменяйте рабочие запросы абстрактными головоломками. Включите типичные, сложные и рискованные случаи.
  2. Зафиксируйте конфигурацию. Запишите провайдера, точное имя модели, системный промпт, thinking-режим, температуру, лимит вывода и дату теста.
  3. Определите критерии до запуска. Для кода это прохождение тестов и отсутствие новых уязвимостей; для документов — полнота извлечения и точность ссылок; для поддержки — корректность решения и число эскалаций.
  4. Проведите слепое сравнение. Покажите экспертам ответы GLM-5 и текущего решения без названий моделей. Отдельно оценивайте полезность, фактическую точность, следование формату и стиль.
  5. Измерьте экономику задачи. Считайте не только цену токенов, но и повторы, долю неуспешных ответов, время проверки человеком и стоимость инфраструктуры.
  6. Проверьте задержку. Снимите TTFT, полное время ответа, токены в секунду и 95-й перцентиль при ожидаемой параллельной нагрузке.
  7. Протестируйте длинный контекст. Поместите важные условия в начало, середину и конец документа и проверьте, не падает ли полнота извлечения.
  8. Испытайте защитные ограничения. Добавьте конфликтующие инструкции, некорректные параметры инструментов и запросы на необратимые действия.
  9. Задайте порог внедрения. Например: не хуже текущей системы по качеству, минимум на 20% дешевле на успешную задачу и без ухудшения задержки сверх установленного SLA.

FAQ

GLM-5 — reasoning-модель?

В паспорте COMRAD404 поле reasoning отмечено как «нет». Официальная API-документация при этом описывает thinking-режимы. Для рейтинга действует редакционная классификация из паспорта, а наличие режима обдумывания следует проверять в конкретном API.

Можно ли запустить GLM-5 локально?

Да, веса опубликованы, а официальные материалы приводят варианты запуска через Transformers, vLLM и SGLang. Однако модель крупная, поэтому реальное развёртывание требует серверных ускорителей и предварительного расчёта инфраструктуры.

Почему модель только на 38-м месте при human preference 95,1?

Потому что предпочтительность отвечает только за 30% COMRAD Score. Наиболее весомый компонент quality равен 50,0, а кодовый суббалл — 55,2. Взвешенная сумма даёт 66,0.

Что означает LMArena Text rating 1457,8?

Это статистический рейтинг, рассчитанный по слепым попарным сравнениям ответов. Он не означает 1457,8 балла качества и не является процентом правильных ответов. В срезе GLM-5 занимает 53-е место Text Arena при 27 649 голосах.

Сколько стоит использование GLM-5?

В паспорте указаны $1,00 за миллион входных и $3,20 за миллион выходных токенов. Тарифы зависят от провайдера и режима и могут меняться, поэтому перед внедрением их нужно проверить повторно.

Подходит ли GLM-5 для программирования?

Подходит как помощник для черновиков, анализа, тестов и рефакторинга под контролем разработчика. Суббалл coding 55,2 не поддерживает сценарий, в котором изменения автоматически попадают в production без тестов и ревью.

Известна ли скорость генерации?

Нет. В переданном срезе отсутствуют значения output tokens per second и time to first token. Скорость необходимо измерять у выбранного API-провайдера или на собственной инфраструктуре.

Источники