Запись архива

GLM-4.7: обзор модели Z.ai в рейтинге COMRAD404

GLM-4.7 стоит рассматривать как практичную открытую модель для разработки, агентских сценариев и длинных текстовых задач, но не как универсального лидера по качеству. В срезе COMRAD404 от 31 августа 2026 года она занимает 37-е место с.

GLM-4.7 от Z.ai — профиль модели с рейтингом COMRAD404, открытыми весами и API-метриками

GLM-4.7 стоит рассматривать как практичную открытую модель для разработки, агентских сценариев и длинных текстовых задач, но не как универсального лидера по качеству. В срезе COMRAD404 от 31 августа 2026 года она занимает 37-е место с COMRAD Score 66,1. Профиль неоднородный: редакционная оценка человеческого предпочтения очень высокая — 90,7 из 100, тогда как качество получает 50,0, а кодинг — 55,0. Это означает, что модель хорошо воспринимается пользователями и удобна в работе, но по совокупной надежности ответов и программированию заметно уступает собственному результату в пользовательских сравнениях.

GLM-4.7 разработана организацией Z.ai. В паспорте она отмечена как модель с открытыми весами под лицензией MIT. Это дает возможность запускать ее в совместимых локальных стеках, однако открытые веса не равны автоматически открытому программному обеспечению: права на код, инструменты инференса и производные компоненты нужно проверять отдельно.

Коротко

  • Позиция: 37-е место в редакционном рейтинге COMRAD404, выпуск 2026 H2.
  • Итоговая оценка: COMRAD Score 66,1 из 100. Это нормализованный редакционный балл, а не процент правильных ответов.
  • Главное преимущество: суббалл human preference — 90,7 из 100.
  • Сдерживающие факторы: quality 50,0 и coding 55,0; данных Artificial Analysis Intelligence Index в срезе нет.
  • Контекст: 204 800 токенов по паспорту модели.
  • Цена в зафиксированном режиме: 0,40 доллара за миллион входных токенов и 1,75 доллара за миллион выходных.
  • Скорость: значения output tokens per second и time to first token в срезе отсутствуют.
  • Кому подойдет: разработчикам, командам, которым нужны открытые веса, длинный контекст и доступный API.

Официальные материалы Z.ai описывают GLM-4.7 как модель с улучшениями в программировании, многошаговом выполнении и агентских задачах. Это заявление разработчика, а не независимое измерение. В редакционном паспорте поле reasoning отмечено как false, поэтому нельзя автоматически трактовать модель как отдельную reasoning-модель или переносить на нее характеристики других моделей семейства.

Место в рейтинге

GLM-4.7 находится на 37-й строке рейтинга COMRAD404. Ее итоговый балл рассчитывается из пяти нормализованных редакционных суббаллов с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. При этом сами суббаллы выражены по шкале от 0 до 100 и не являются процентами качества.

Высокий итоговый результат human preference заметно поддерживает общую позицию модели. Это важный сигнал для интерактивной работы: модель может восприниматься как понятный, удобный и достаточно естественный собеседник. Но пользовательское предпочтение не заменяет проверку фактов, устойчивости инструкций и качества кода. Низкие относительно него оценки quality и coding показывают, что комфорт взаимодействия и надежность результата — разные свойства.

На независимой LMArena Text Arena GLM-4.7 имеет рейтинг 1441,7, 79-е место и 11 887 голосов. В Code Arena указаны рейтинг 1434,5 и 59-е место. LMArena rating — это статистический результат слепых попарных сравнений, а не процент правильных ответов и не прямой показатель полноты знаний. Разница между текстовым и кодовым местами также не должна превращаться в простой вывод о том, что модель «на 59-м месте по качеству кода»: это место внутри конкретной арены и ее выборки сравнений.

COMRAD404 использует эти независимые измерения как часть редакционной системы, а не как единственный источник истины. Подробный контекст выпуска доступен на странице рейтинга COMRAD404.

Паспорт модели

Параметр Значение в срезе Как читать
Модель GLM-4.7 Конкретная версия, не весь ряд GLM
Разработчик Z.ai Организация, указанная в паспорте
Место 37 Позиция в выпуске COMRAD404 2026 H2
COMRAD Score 66,1 из 100 Нормализованная редакционная оценка
Лицензия MIT Условия нужно читать вместе с лицензиями окружения и производных компонентов
Открытые веса Да Доступен вариант работы с весами, но это не тождественно open source для всей системы
Reasoning в паспорте Нет Не следует приписывать отдельный reasoning-режим только по маркетинговому описанию
Preview Нет В паспорте модель не помечена как preview
Контекст 204 800 токенов Единица измерения — токены, а не страницы и не символы
Artificial Analysis Index Нет данных В зафиксированном срезе показатель отсутствует

Разбор пяти суббаллов

Суббалл Оценка Вес Редакционная интерпретация
Quality 50,0 40% Средняя опора для общего результата; требует проверки фактов, сложных выводов и стабильности на редких запросах
Human preference 90,7 30% Самая сильная сторона профиля; модель хорошо подходит для диалога и итеративной работы
Coding 55,0 15% Использовать для генерации и правок кода можно, но обязательны тесты и ревью
Efficiency 73,1 10% Хороший редакционный баланс стоимости и доступности; скорости в паспорте нет
Access 66,6 5% Открытые веса и API повышают практическую доступность, но инфраструктурные требования могут быть существенными

Пять суббаллов нужно читать как профиль, а не как пять независимых процентов. Например, efficiency 73,1 не означает, что модель на 73,1% эффективна, а human preference 90,7 не означает, что 90,7% пользователей выберут ее в любой задаче. Это сопоставимые редакционные индексы внутри методики COMRAD404.

Что означает высокий human preference

Самый заметный результат GLM-4.7 — 90,7 из 100 по человеческому предпочтению. Для прикладного пользователя это может проявляться в естественности диалога, способности поддерживать итерации, понятной подаче и меньшем количестве раздражающих ответов. Такой профиль особенно полезен там, где модель выступает не одноразовым генератором, а рабочим интерфейсом: уточняет требования, предлагает варианты, редактирует текст или помогает разобрать задачу по шагам.

Однако высокий preference не гарантирует фактическую точность. Пользователь может предпочесть уверенный и хорошо структурированный ответ даже тогда, когда отдельные утверждения требуют проверки. Поэтому в рабочих процессах стоит разделять два контура: модель отвечает за черновое решение и взаимодействие, а тесты, источники и человек — за приемку.

Качество и надежность ответов

Суббалл quality равен 50,0 из 100 и имеет наибольший вес — 40%. Именно поэтому сильное человеческое предпочтение не подняло GLM-4.7 выше в рейтинге. Для модели это означает смешанный профиль: она может быть удобной в использовании, но не должна получать безусловное доверие в задачах, где ошибка дорога.

На практике следует отдельно проверять арифметику, даты, ссылки, юридические и медицинские формулировки, причинно-следственные выводы, работу с неоднозначными требованиями и способность признавать нехватку данных. Большой контекст тоже не решает проблему автоматически: 204 800 токенов позволяют передать больше материала, но не гарантируют, что модель одинаково внимательно обработает каждый фрагмент.

Возможности и сценарии

Официальная документация Z.ai позиционирует GLM-4.7 для программирования, многошагового выполнения и агентских сценариев. В материалах разработчика отдельно упоминаются интеграции с инструментами разработки и подход «сначала подумать, затем действовать». Это описание возможностей и целевого применения от Z.ai; независимая часть профиля — рейтинги LMArena и редакционные оценки COMRAD404.

Разработка и сопровождение кода

Модель разумно использовать для создания заготовок, объяснения чужого кода, написания тестов, рефакторинга небольших модулей, подготовки SQL-запросов и поиска очевидных причин ошибок. Длинный контекст удобен для передачи нескольких связанных файлов, технического задания и журнала ошибок. Но coding 55,0 — аргумент в пользу режима «предложить и проверить», а не автоматического слияния изменений в основную ветку.

Агентские цепочки

GLM-4.7 может быть полезна как исполнитель подзадач: прочитать документацию, сформировать план, вызвать инструмент и подготовить результат для следующего шага. Для таких цепочек нужно ограничивать права инструментов, задавать формат промежуточных результатов и вводить лимиты на число итераций. Удобство диалога не означает, что агент всегда корректно выберет действие.

Тексты и аналитические черновики

Высокий human preference делает модель подходящей для структурирования заметок, переписывания, подготовки вариантов формулировок и первичного анализа документов. Критические выводы следует отделять от стилистической обработки: текст можно принять по форме, но фактические тезисы нужно проверять отдельно.

Открытые веса и локальный запуск

В паспорте указаны открытые веса и лицензия MIT. Официальная карточка модели на Hugging Face содержит инструкции для Transformers, а также описывает варианты запуска через vLLM и SGLang. Это подтверждает наличие пути к самостоятельному развертыванию, но не означает, что локальная эксплуатация будет простой или дешевой.

Большая модель требует серьезной GPU-инфраструктуры, подходящего формата весов, совместимых версий библиотек и настройки параллелизма. Стоимость собственного запуска складывается не только из лицензии: учитываются видеопамять, аренда серверов, электроэнергия, хранение, обслуживание и время инженеров. Для небольшой команды API может оказаться рациональнее, даже если сами веса доступны.

Цена и скорость

В паспорте COMRAD404 для зафиксированного режима указаны 0,40 доллара за миллион входных токенов и 1,75 доллара за миллион выходных токенов. Эти значения нельзя смешивать с качественными оценками или считать постоянной ценой самой модели. Тариф зависит от API-провайдера, выбранного режима, условий аккаунта и даты проверки.

Для грубой оценки бюджета нужно считать вход и выход раздельно. Например, запрос с одним миллионом входных и одним миллионом выходных токенов в указанном тарифе составил бы 2,15 доллара до учета скидок, ограничений и дополнительных условий провайдера. Это арифметическая иллюстрация по паспортным значениям, а не обещание фактического счета.

Показатели output tokens per second и time to first token в срезе отсутствуют. Поэтому нельзя делать вывод о том, насколько GLM-4.7 быстра в потоковой выдаче или как быстро начинает отвечать. Efficiency 73,1 — редакционный суббалл, а не измерение токенов в секунду. Перед внедрением скорость нужно замерить у конкретного провайдера или на конкретной локальной конфигурации.

Ограничения

  • Нет Artificial Analysis Intelligence Index. В паспорте отсутствует этот показатель, поэтому он не используется в статье и не восстанавливается по другим рейтингам.
  • Нет данных о скорости. Отсутствуют и скорость генерации, и время до первого токена.
  • Средний quality. Результат 50,0 требует фактчекинга и приемочных тестов.
  • Средний coding. Оценка 55,0 не отменяет необходимости запускать тесты, линтеры и статический анализ.
  • Большой контекст не равен полной памяти. Даже при лимите 204 800 токенов модель может пропустить важную деталь или неверно связать фрагменты.
  • Инфраструктурная цена. Открытые веса облегчают контроль над развертыванием, но не устраняют требования к вычислительным ресурсам.
  • Различия провайдеров. Цена, доступные функции, лимиты и задержка могут меняться в зависимости от API и режима.
  • Ограниченность внешних рейтингов. LMArena отражает слепые попарные предпочтения пользователей, а не полный набор инженерных и фактических тестов.

Как проверить на своей задаче

Начните не с общего впечатления, а с небольшого закрытого набора примеров. Возьмите 30–50 реальных задач из рабочего процесса и разделите их на категории: извлечение данных, следование формату, генерация текста, анализ документов, код, исправление ошибок и отказ от неподтвержденных утверждений.

  1. Зафиксируйте исходные запросы, контекст, допустимый формат ответа и критерии приемки.
  2. Проведите минимум три повтора для задач, где важна стабильность.
  3. Для кода запускайте сгенерированные тесты, проверяйте сборку, зависимости, безопасность и граничные случаи.
  4. Для документов измеряйте полноту извлечения, число пропусков и количество выдуманных ссылок.
  5. Для агентских задач ограничьте инструменты песочницей и сохраняйте журнал действий.
  6. Отдельно замерьте цену, время до первого токена, скорость вывода и долю неудачных запросов у выбранного провайдера.
  7. Сравните не только средний балл, но и худшие случаи: именно они определяют риск автоматизации.

Полезно вести таблицу с четырьмя полями: задача, ожидаемый результат, фактический результат и тип ошибки. Через несколько десятков примеров станет понятно, дает ли GLM-4.7 реальную экономию времени или лишь производит приятные на вид черновики.

Кому подойдет GLM-4.7

Модель подходит командам, которым важны открытые веса, возможность самостоятельного развертывания и доступный API-тариф. Она особенно уместна в редактуре, техническом письме, исследовательских черновиках, помощи разработчикам и прототипировании инструментальных агентов.

С осторожностью ее стоит выбирать для полностью автономных процессов, критических решений, автоматического изменения production-кода и задач, где ошибка не допускается. В этих сценариях GLM-4.7 может быть рабочим компонентом, но не единственным контролем качества.

Итоговая оценка

GLM-4.7 — модель с сильной пользовательской стороной и разумной экономикой доступа, но с более умеренными результатами в качестве и программировании. Ее 37-е место объясняется не одной слабостью, а разрывом между тем, насколько удобно с ней работать, и тем, насколько стабильно она решает сложные задачи.

Выбор в ее пользу оправдан, если приоритетами являются диалог, длинный контекст, открытые веса и контроль над способом развертывания. Если же главным критерием служит максимальная фактическая надежность или безошибочная генерация кода, паспорт не дает оснований принимать модель без собственного тестового прогона.

FAQ

Какое место занимает GLM-4.7?

GLM-4.7 занимает 37-е место в рейтинге COMRAD404, выпуск 2026 H2. Ее COMRAD Score равен 66,1 из 100.

Что является главным преимуществом модели?

Главное преимущество — высокий суббалл human preference: 90,7 из 100. Это редакционная оценка пользовательского предпочтения, а не процент правильных ответов.

Хорошо ли GLM-4.7 пишет код?

Редакционный coding-суббалл составляет 55,0 из 100. Модель можно применять для генерации, объяснения и рефакторинга кода, но результат нужно проверять тестами и ревью.

Сколько стоит использование GLM-4.7?

В паспорте указаны 0,40 доллара за миллион входных токенов и 1,75 доллара за миллион выходных токенов. Тариф зависит от API-провайдера и режима и не должен считаться неизменным.

Какая скорость у GLM-4.7?

В срезе нет данных об output tokens per second и time to first token. Скорость необходимо измерять отдельно у выбранного провайдера или на локальной инфраструктуре.

Можно ли запустить модель самостоятельно?

В паспорте указаны открытые веса и лицензия MIT. Официальная карточка модели содержит инструкции для совместимых инструментов, но самостоятельный запуск требует подходящей вычислительной инфраструктуры.

Есть ли у модели Artificial Analysis Intelligence Index?

В зафиксированном срезе данных Artificial Analysis Intelligence Index для GLM-4.7 нет. Поэтому этот показатель не используется в оценке статьи.

Источники

  • Страница модели GLM-4.7 на Hugging Face — официальная карточка, название, разработчик, лицензия, инструкции запуска и заявленные параметры модели.
  • Документация Z.ai: GLM-4.7 — официальное позиционирование, поддерживаемый контекст, сценарии программирования и агентской работы.
  • Документация Z.ai: Thinking Mode — официальное описание режимов работы и интеграции с API.
  • Release notes Z.ai — официальная запись о выпуске GLM-4.7 и последующих моделей семейства.
  • LMArena Text Leaderboard — независимый рейтинг слепых попарных сравнений текста и число голосов.
  • LMArena Leaderboard — независимые результаты Code Arena, использованные в кодовом суббалле.
  • Artificial Analysis: LLM Leaderboard — справочная страница для Intelligence Index, цен, скорости и контекста; показатель GLM-4.7 в данном паспорте отсутствует.