Запись архива

GLM-4.6: сильна в пользовательском выборе, но не в кодовом суббалле

GLM-4.6 занимает 90-е место с COMRAD Score 61,1. Модель выделяется высокой оценкой пользовательских предпочтений, доступными API-тарифами и контекстом 204 800 токенов, но её кодовый суббалл заметно слабее общего профиля.

Профиль GLM-4.6 с COMRAD Score 61,1, пятью суббаллами, ценой API и контекстом 204 800 токенов

GLM-4.6 стоит рассматривать прежде всего как доступную универсальную модель для текста, длинных документов и управляемых рабочих процессов, а не как безусловный выбор для сложной разработки. Её главный аргумент в рейтинге — высокий суббалл пользовательских предпочтений 86,0 при умеренной цене. Главный повод для осторожности — кодовый суббалл 31,1 и неполное покрытие независимыми измерениями.

Коротко

  • Место: 90-е в редакции рейтинга COMRAD404 2026 H2.
  • COMRAD Score: 61,1 — нормализованная редакционная оценка по шкале 0–100, а не процент качества.
  • Лучший суббалл: пользовательские предпочтения — 86,0.
  • Самый слабый суббалл: программирование — 31,1.
  • Контекст: 204 800 токенов в зафиксированном паспорте.
  • Цена API в срезе: $0,43 за миллион входных и $1,75 за миллион выходных токенов.
  • Открытые веса: да; карточка весов указывает лицензию MIT.
  • Уверенность профиля: средняя: есть данные LMArena, но нет Artificial Analysis Intelligence Index и замеров скорости.

Практический вывод: GLM-4.6 заслуживает пилота, если важны стоимость, длинный ввод, возможность самостоятельного размещения и субъективно приемлемые ответы. Для репозиторной разработки, автономного исправления ошибок и задач с жёсткими требованиями к задержке сначала нужен отдельный тест.

Паспорт модели

Параметр Значение в срезе
Модель GLM-4.6
Разработчик Z.ai
Место COMRAD404 90
COMRAD Score 61,1
LMArena Text 1424,8; место 108; 35 066 голосов
LMArena Code 1340,4; место 93
Artificial Analysis Intelligence Index Данных в срезе нет
Контекст 204 800 токенов
Цена входа $0,43 за 1 млн токенов
Цена выхода $1,75 за 1 млн токенов
Скорость генерации Данных в срезе нет
Время до первого токена Данных в срезе нет
Открытые веса Да
Лицензия MIT
Статус preview Нет

Паспорт фиксирует состояние данных на 31 августа 2026 года. Цена относится к конкретному API-срезу и не описывает стоимость самостоятельного развёртывания. Контекст, тарифы и доступные режимы также могут различаться у посредников и после обновлений платформы.

Место в рейтинге

GLM-4.6 занимает 90-е место в рейтинге моделей ИИ COMRAD404 редакции 2026 H2, методология 1.0. Позиция отражает не одну контрольную работу, а взвешенный профиль: качество имеет вес 40%, пользовательские предпочтения — 30%, программирование — 15%, эффективность — 10%, доступ — 5%.

При переданных суббаллах расчёт даёт 61,095, округлённые до COMRAD Score 61,1. Этот балл нельзя читать как «61,1% правильных ответов». Это редакционная нормализация разных характеристик, сведённых к общей шкале для выбора модели.

90-е место объясняется не ровным профилем, а компенсацией слабых и сильных сторон. Пользовательское предпочтение и эффективность поднимают итог, тогда как качество и особенно кодовый компонент ограничивают позицию. Поэтому место модели полезнее воспринимать как указатель на необходимость сценарного выбора, а не как универсальный вердикт.

Что говорят пять суббаллов

Суббалл Оценка Вес Практическое чтение
Качество 50,0 40% Средний результат редакционной нормализации; независимого Intelligence Index в срезе нет
Пользовательские предпочтения 86,0 30% Самая сильная часть профиля: ответы часто выигрывают субъективное сравнение
Программирование 31,1 15% Код нельзя считать надёжной специализацией без проверки на собственном репозитории
Эффективность 73,0 10% Хорошее сочетание паспортной цены и доступного контекста, но без данных о фактической скорости
Доступ 66,6 5% Есть API и опубликованные веса под MIT, однако локальная эксплуатация ресурсоёмка

Суббалл пользовательских предпочтений 86,0 согласуется с наличием крупной выборки LMArena Text: 35 066 голосов. Сам рейтинг LMArena 1424,8 — статистическая величина, рассчитанная по слепым попарным сравнениям, а не доля правильных ответов. Место 108 относится к соответствующей таблице и её составу на момент среза.

Кодовый рейтинг LMArena равен 1340,4 при месте 93, но редакционный кодовый суббалл составляет только 31,1. Это предупреждение против прямой замены одной метрики другой: рейтинг арены, позиция в таблице и нормализованный суббалл имеют разную методику и шкалу.

Возможности и сценарии

Официальные материалы Z.ai позиционируют GLM-4.6 как текстовую модель для программирования, работы с инструментами, поиска, письма, перевода и агентных процессов. Документация указывает текст на входе и выходе, поддержку вызова инструментов и потоковую передачу их аргументов. Это заявления разработчика; они описывают предусмотренные функции, но не гарантируют одинаковую надёжность в каждом приложении.

  • Обработка документов. Большой контекст позволяет передавать объёмные регламенты, переписку, журналы событий и несколько связанных файлов. Модель можно использовать для навигации, извлечения требований и подготовки чернового резюме.
  • Редакционные задачи. Высокий суббалл человеческих предпочтений делает GLM-4.6 кандидатом для переписывания, локализации, создания вариантов текста и приведения материала к заданному тону.
  • Внутренние помощники. Вызов функций подходит для интерфейсов к базе знаний, CRM, каталогу или системе заявок. Критические действия должны подтверждаться приложением, а не исполняться только на основании текста модели.
  • Перевод и многоязычные процессы. Разработчик отдельно заявляет улучшения для русского, французского, японского и корейского языков. Для закупки эту возможность следует проверять на собственной терминологии и реальных форматах.
  • Программирование. Модель можно тестировать для шаблонного кода, объяснения функций, преобразования форматов и небольших правок. Профиль рейтинга не даёт оснований без проверки поручать ей сложные миграции или автономное исправление репозитория.

Контекст и длинные входы

В паспорте указан контекст 204 800 токенов; официальная документация округляет его до 200K и отдельно сообщает о максимальном выводе до 128K для API. Эти значения описывают технический предел, а не гарантированный объём полезного внимания ко всем фрагментам запроса.

При работе с длинным контекстом качество зависит от структуры входа. Документы лучше снабжать идентификаторами разделов, отделять инструкции от материалов и требовать ссылки на конкретные фрагменты. Для извлечения фактов полезно сначала построить перечень источников, затем запрашивать ответ и в последнем проходе проверять каждое утверждение.

Не стоит автоматически заполнять всё окно. Длинный запрос повышает стоимость, увеличивает время подготовки ответа и может затруднить поиск нужной детали. Для регулярно обновляемого массива документов часто практичнее retrieval-пайплайн, который передаёт модели только релевантные выдержки.

Открытые веса и развёртывание

Карточка zai-org/GLM-4.6 публикует веса и указывает лицензию MIT. В данном случае речь не только о доступе к весам: паспорт также фиксирует MIT как лицензию модели. Перед коммерческим использованием всё равно следует сохранить тексты лицензий, проверить происхождение дополнительных компонентов и отдельно оценить требования законодательства и политики организации.

Официальная карточка описывает запуск через Transformers, vLLM и SGLang. Репозиторий семейства указывает конфигурацию 355B-A32B, а интерфейс Hugging Face показывает около 357 млрд параметров в файлах. Различие связано со способом представления размера; для планирования инфраструктуры важнее проверить конкретный вариант весов, точность и требования выбранного движка.

Это крупная модель, поэтому «открытые веса» не означают простой запуск на обычной рабочей станции. Самостоятельное размещение потребует серверной инфраструктуры, настройки параллелизма, мониторинга памяти и проверки совместимости шаблона чата, парсеров инструментов и thinking-режима.

Цена и скорость

В срезе цена составляет $0,43 за миллион входных токенов и $1,75 за миллион выходных. Вывод примерно в четыре раза дороже входа, поэтому итоговый бюджет заметно зависит от многословности ответов и скрытых промежуточных генераций конкретного режима.

Пример: запрос на 100 000 входных токенов и ответ на 20 000 токенов по паспортному тарифу обойдутся примерно в $0,078. Один миллион входных и 250 000 выходных токенов — примерно в $0,8675. Это расчёт по переданным ставкам без кэширования, пакетных скидок, наценки посредника и сопутствующей инфраструктуры.

Данных о токенах в секунду и времени до первого токена в срезе нет. Поэтому суббалл эффективности 73,0 нельзя переводить в обещание низкой задержки. Скорость зависит от API-провайдера, очереди, длины контекста, режима рассуждения, числа инструментов и конфигурации локального сервера.

Рассуждение и расхождение классификаций

В паспорте поле reasoning отмечено как false. Одновременно официальная документация GLM-4.6 показывает параметр thinking, который может быть включён или отключён, а руководство по миграции сообщает о поддержке deep thinking.

Для рейтинга нужно использовать паспортную классификацию: отдельный признак reasoning модели не засчитан. Для интеграции нужно учитывать документацию конкретного API: thinking-режим там заявлен и требует отдельного тестирования.

Это расхождение не следует скрывать или разрешать догадкой. Оно может отражать различия между редакционной таксономией, API-режимом и вариантом открытых весов. Именно поэтому уверенность профиля указана как средняя.

Ограничения

  • Нет Artificial Analysis Intelligence Index. В срезе отсутствует независимое значение этого индекса; восстанавливать его по другим тестам нельзя.
  • Нет независимых данных о задержке. Нельзя заранее оценить интерактивность длинных диалогов или агентного цикла.
  • Неровный кодовый профиль. Заявления разработчика о программировании выглядят сильнее редакционного суббалла 31,1. Это требует проверки на закрытом наборе задач.
  • Контекст не равен точности. Поддержка 204 800 токенов не гарантирует, что модель безошибочно сопоставит все удалённые фрагменты.
  • Стоимость зависит от режима. Thinking, повторные вызовы инструментов, ретраи и длинный вывод могут увеличить фактический расход.
  • Локальный запуск сложен. MIT-лицензия снижает юридические барьеры, но не требования к памяти, вычислениям и эксплуатации.
  • Фактические ответы нуждаются в проверке. Модель может уверенно дополнять отсутствующие сведения, поэтому для юридических, медицинских, финансовых и производственных решений необходим внешний контроль.

Кому подходит GLM-4.6

Модель рационально включить в шорт-лист командам, которым нужна недорогая генерация текста, длинный контекст, API с инструментами или возможность развернуть опубликованные веса. Особенно уместны пилоты в службе поддержки, корпоративном поиске, обработке документов, локализации и подготовке черновиков.

GLM-4.6 менее очевидна как основной движок автономного разработчика, если цена ошибки высока, а задачи включают многофайловые изменения, запуск тестов и восстановление после неудачных действий. Низкий кодовый суббалл не запрещает такой сценарий, но переносит доказательство пригодности на внутренний эксперимент.

Если продукт чувствителен к задержке, заранее выбрать модель по этому паспорту нельзя: отсутствуют и скорость вывода, и время до первого токена. В таком случае решение должно опираться на нагрузочный тест у того же провайдера и в том же режиме, который будет использоваться в production.

Как проверить на своей задаче

  1. Соберите 50–100 реальных примеров. Не ограничивайтесь демонстрационными запросами. Добавьте редкие случаи, длинные документы, неоднозначные инструкции и ситуации с отсутствующими данными.
  2. Зафиксируйте конфигурацию. Запишите идентификатор модели, провайдера, дату, системный промпт, температуру, лимит вывода, состояние thinking и настройки инструментов.
  3. Проведите слепое сравнение. Уберите названия моделей и предложите экспертам выбрать лучший ответ. Это ближе к логике LMArena, чем оценка заранее известного бренда.
  4. Разделите критерии. Оценивайте корректность, полноту, следование формату, стиль, число выдуманных фактов, успешность вызовов функций и потребность в ручном исправлении.
  5. Для кода запускайте тесты. Измеряйте долю задач, прошедших unit- и integration-тесты, число повторных попыток, размер ненужного diff и ошибки безопасности.
  6. Проверьте длинный контекст. Поместите контрольные факты в начало, середину и конец документа. Добавьте похожие отвлекающие фрагменты и потребуйте указать источник ответа.
  7. Измерьте эксплуатацию. Соберите медиану и 95-й перцентиль времени до первого токена, скорость вывода, частоту ошибок API и стоимость успешной задачи, а не только одного запроса.
  8. Повторите тест. Из-за стохастичности выполните каждый важный пример несколько раз. Для опасных действий добавьте подтверждение человеком и технические ограничения.

FAQ

Что означает COMRAD Score 61,1?
Это нормализованная редакционная оценка по шкале 0–100, рассчитанная из пяти суббаллов с разными весами. Она не означает 61,1% правильных ответов.

Почему GLM-4.6 занимает 90-е место при пользовательском суббалле 86,0?
Итог учитывает не только предпочтение пользователей. Качество имеет оценку 50,0, а программирование — 31,1, что заметно ограничивает общий результат.

Подходит ли GLM-4.6 для программирования?
Она поддерживает генерацию кода и инструменты, но кодовый суббалл 31,1 требует осторожности. Перед внедрением модель нужно проверить на задачах из собственного репозитория и автоматических тестах.

Есть ли у GLM-4.6 режим рассуждения?
Паспорт классифицирует модель с флагом reasoning=false, однако официальное API описывает переключаемый thinking-режим. Для рейтинга действует паспорт, а для интеграции — проверка конкретного API и конфигурации.

Можно ли запустить GLM-4.6 локально?
Да, веса опубликованы, карточка указывает MIT, а официальные материалы описывают Transformers, vLLM и SGLang. Но из-за крупного размера модели потребуется серьёзная серверная инфраструктура.

Насколько быстра GLM-4.6?
В зафиксированном срезе нет данных ни о токенах в секунду, ни о времени до первого токена. Скорость необходимо измерять у выбранного провайдера и с рабочей длиной контекста.

Сколько стоит использование модели?
В паспорте указаны $0,43 за миллион входных и $1,75 за миллион выходных токенов. Тарифы зависят от провайдера и режима и могут изменяться.

Источники

Фактический срез: 31 августа 2026 года. Рейтинговые числа в статье взяты исключительно из переданного паспорта модели. Официальные заявления Z.ai приведены отдельно от независимых измерений и редакционной интерпретации.