GLM-4.6 стоит рассматривать прежде всего как доступную универсальную модель для текста, длинных документов и управляемых рабочих процессов, а не как безусловный выбор для сложной разработки. Её главный аргумент в рейтинге — высокий суббалл пользовательских предпочтений 86,0 при умеренной цене. Главный повод для осторожности — кодовый суббалл 31,1 и неполное покрытие независимыми измерениями.
Коротко
- Место: 90-е в редакции рейтинга COMRAD404 2026 H2.
- COMRAD Score: 61,1 — нормализованная редакционная оценка по шкале 0–100, а не процент качества.
- Лучший суббалл: пользовательские предпочтения — 86,0.
- Самый слабый суббалл: программирование — 31,1.
- Контекст: 204 800 токенов в зафиксированном паспорте.
- Цена API в срезе: $0,43 за миллион входных и $1,75 за миллион выходных токенов.
- Открытые веса: да; карточка весов указывает лицензию MIT.
- Уверенность профиля: средняя: есть данные LMArena, но нет Artificial Analysis Intelligence Index и замеров скорости.
Практический вывод: GLM-4.6 заслуживает пилота, если важны стоимость, длинный ввод, возможность самостоятельного размещения и субъективно приемлемые ответы. Для репозиторной разработки, автономного исправления ошибок и задач с жёсткими требованиями к задержке сначала нужен отдельный тест.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | GLM-4.6 |
| Разработчик | Z.ai |
| Место COMRAD404 | 90 |
| COMRAD Score | 61,1 |
| LMArena Text | 1424,8; место 108; 35 066 голосов |
| LMArena Code | 1340,4; место 93 |
| Artificial Analysis Intelligence Index | Данных в срезе нет |
| Контекст | 204 800 токенов |
| Цена входа | $0,43 за 1 млн токенов |
| Цена выхода | $1,75 за 1 млн токенов |
| Скорость генерации | Данных в срезе нет |
| Время до первого токена | Данных в срезе нет |
| Открытые веса | Да |
| Лицензия | MIT |
| Статус preview | Нет |
Паспорт фиксирует состояние данных на 31 августа 2026 года. Цена относится к конкретному API-срезу и не описывает стоимость самостоятельного развёртывания. Контекст, тарифы и доступные режимы также могут различаться у посредников и после обновлений платформы.
Место в рейтинге
GLM-4.6 занимает 90-е место в рейтинге моделей ИИ COMRAD404 редакции 2026 H2, методология 1.0. Позиция отражает не одну контрольную работу, а взвешенный профиль: качество имеет вес 40%, пользовательские предпочтения — 30%, программирование — 15%, эффективность — 10%, доступ — 5%.
При переданных суббаллах расчёт даёт 61,095, округлённые до COMRAD Score 61,1. Этот балл нельзя читать как «61,1% правильных ответов». Это редакционная нормализация разных характеристик, сведённых к общей шкале для выбора модели.
90-е место объясняется не ровным профилем, а компенсацией слабых и сильных сторон. Пользовательское предпочтение и эффективность поднимают итог, тогда как качество и особенно кодовый компонент ограничивают позицию. Поэтому место модели полезнее воспринимать как указатель на необходимость сценарного выбора, а не как универсальный вердикт.
Что говорят пять суббаллов
| Суббалл | Оценка | Вес | Практическое чтение |
|---|---|---|---|
| Качество | 50,0 | 40% | Средний результат редакционной нормализации; независимого Intelligence Index в срезе нет |
| Пользовательские предпочтения | 86,0 | 30% | Самая сильная часть профиля: ответы часто выигрывают субъективное сравнение |
| Программирование | 31,1 | 15% | Код нельзя считать надёжной специализацией без проверки на собственном репозитории |
| Эффективность | 73,0 | 10% | Хорошее сочетание паспортной цены и доступного контекста, но без данных о фактической скорости |
| Доступ | 66,6 | 5% | Есть API и опубликованные веса под MIT, однако локальная эксплуатация ресурсоёмка |
Суббалл пользовательских предпочтений 86,0 согласуется с наличием крупной выборки LMArena Text: 35 066 голосов. Сам рейтинг LMArena 1424,8 — статистическая величина, рассчитанная по слепым попарным сравнениям, а не доля правильных ответов. Место 108 относится к соответствующей таблице и её составу на момент среза.
Кодовый рейтинг LMArena равен 1340,4 при месте 93, но редакционный кодовый суббалл составляет только 31,1. Это предупреждение против прямой замены одной метрики другой: рейтинг арены, позиция в таблице и нормализованный суббалл имеют разную методику и шкалу.
Возможности и сценарии
Официальные материалы Z.ai позиционируют GLM-4.6 как текстовую модель для программирования, работы с инструментами, поиска, письма, перевода и агентных процессов. Документация указывает текст на входе и выходе, поддержку вызова инструментов и потоковую передачу их аргументов. Это заявления разработчика; они описывают предусмотренные функции, но не гарантируют одинаковую надёжность в каждом приложении.
- Обработка документов. Большой контекст позволяет передавать объёмные регламенты, переписку, журналы событий и несколько связанных файлов. Модель можно использовать для навигации, извлечения требований и подготовки чернового резюме.
- Редакционные задачи. Высокий суббалл человеческих предпочтений делает GLM-4.6 кандидатом для переписывания, локализации, создания вариантов текста и приведения материала к заданному тону.
- Внутренние помощники. Вызов функций подходит для интерфейсов к базе знаний, CRM, каталогу или системе заявок. Критические действия должны подтверждаться приложением, а не исполняться только на основании текста модели.
- Перевод и многоязычные процессы. Разработчик отдельно заявляет улучшения для русского, французского, японского и корейского языков. Для закупки эту возможность следует проверять на собственной терминологии и реальных форматах.
- Программирование. Модель можно тестировать для шаблонного кода, объяснения функций, преобразования форматов и небольших правок. Профиль рейтинга не даёт оснований без проверки поручать ей сложные миграции или автономное исправление репозитория.
Контекст и длинные входы
В паспорте указан контекст 204 800 токенов; официальная документация округляет его до 200K и отдельно сообщает о максимальном выводе до 128K для API. Эти значения описывают технический предел, а не гарантированный объём полезного внимания ко всем фрагментам запроса.
При работе с длинным контекстом качество зависит от структуры входа. Документы лучше снабжать идентификаторами разделов, отделять инструкции от материалов и требовать ссылки на конкретные фрагменты. Для извлечения фактов полезно сначала построить перечень источников, затем запрашивать ответ и в последнем проходе проверять каждое утверждение.
Не стоит автоматически заполнять всё окно. Длинный запрос повышает стоимость, увеличивает время подготовки ответа и может затруднить поиск нужной детали. Для регулярно обновляемого массива документов часто практичнее retrieval-пайплайн, который передаёт модели только релевантные выдержки.
Открытые веса и развёртывание
Карточка zai-org/GLM-4.6 публикует веса и указывает лицензию MIT. В данном случае речь не только о доступе к весам: паспорт также фиксирует MIT как лицензию модели. Перед коммерческим использованием всё равно следует сохранить тексты лицензий, проверить происхождение дополнительных компонентов и отдельно оценить требования законодательства и политики организации.
Официальная карточка описывает запуск через Transformers, vLLM и SGLang. Репозиторий семейства указывает конфигурацию 355B-A32B, а интерфейс Hugging Face показывает около 357 млрд параметров в файлах. Различие связано со способом представления размера; для планирования инфраструктуры важнее проверить конкретный вариант весов, точность и требования выбранного движка.
Это крупная модель, поэтому «открытые веса» не означают простой запуск на обычной рабочей станции. Самостоятельное размещение потребует серверной инфраструктуры, настройки параллелизма, мониторинга памяти и проверки совместимости шаблона чата, парсеров инструментов и thinking-режима.
Цена и скорость
В срезе цена составляет $0,43 за миллион входных токенов и $1,75 за миллион выходных. Вывод примерно в четыре раза дороже входа, поэтому итоговый бюджет заметно зависит от многословности ответов и скрытых промежуточных генераций конкретного режима.
Пример: запрос на 100 000 входных токенов и ответ на 20 000 токенов по паспортному тарифу обойдутся примерно в $0,078. Один миллион входных и 250 000 выходных токенов — примерно в $0,8675. Это расчёт по переданным ставкам без кэширования, пакетных скидок, наценки посредника и сопутствующей инфраструктуры.
Данных о токенах в секунду и времени до первого токена в срезе нет. Поэтому суббалл эффективности 73,0 нельзя переводить в обещание низкой задержки. Скорость зависит от API-провайдера, очереди, длины контекста, режима рассуждения, числа инструментов и конфигурации локального сервера.
Рассуждение и расхождение классификаций
В паспорте поле reasoning отмечено как false. Одновременно официальная документация GLM-4.6 показывает параметр thinking, который может быть включён или отключён, а руководство по миграции сообщает о поддержке deep thinking.
Для рейтинга нужно использовать паспортную классификацию: отдельный признак reasoning модели не засчитан. Для интеграции нужно учитывать документацию конкретного API: thinking-режим там заявлен и требует отдельного тестирования.
Это расхождение не следует скрывать или разрешать догадкой. Оно может отражать различия между редакционной таксономией, API-режимом и вариантом открытых весов. Именно поэтому уверенность профиля указана как средняя.
Ограничения
- Нет Artificial Analysis Intelligence Index. В срезе отсутствует независимое значение этого индекса; восстанавливать его по другим тестам нельзя.
- Нет независимых данных о задержке. Нельзя заранее оценить интерактивность длинных диалогов или агентного цикла.
- Неровный кодовый профиль. Заявления разработчика о программировании выглядят сильнее редакционного суббалла 31,1. Это требует проверки на закрытом наборе задач.
- Контекст не равен точности. Поддержка 204 800 токенов не гарантирует, что модель безошибочно сопоставит все удалённые фрагменты.
- Стоимость зависит от режима. Thinking, повторные вызовы инструментов, ретраи и длинный вывод могут увеличить фактический расход.
- Локальный запуск сложен. MIT-лицензия снижает юридические барьеры, но не требования к памяти, вычислениям и эксплуатации.
- Фактические ответы нуждаются в проверке. Модель может уверенно дополнять отсутствующие сведения, поэтому для юридических, медицинских, финансовых и производственных решений необходим внешний контроль.
Кому подходит GLM-4.6
Модель рационально включить в шорт-лист командам, которым нужна недорогая генерация текста, длинный контекст, API с инструментами или возможность развернуть опубликованные веса. Особенно уместны пилоты в службе поддержки, корпоративном поиске, обработке документов, локализации и подготовке черновиков.
GLM-4.6 менее очевидна как основной движок автономного разработчика, если цена ошибки высока, а задачи включают многофайловые изменения, запуск тестов и восстановление после неудачных действий. Низкий кодовый суббалл не запрещает такой сценарий, но переносит доказательство пригодности на внутренний эксперимент.
Если продукт чувствителен к задержке, заранее выбрать модель по этому паспорту нельзя: отсутствуют и скорость вывода, и время до первого токена. В таком случае решение должно опираться на нагрузочный тест у того же провайдера и в том же режиме, который будет использоваться в production.
Как проверить на своей задаче
- Соберите 50–100 реальных примеров. Не ограничивайтесь демонстрационными запросами. Добавьте редкие случаи, длинные документы, неоднозначные инструкции и ситуации с отсутствующими данными.
- Зафиксируйте конфигурацию. Запишите идентификатор модели, провайдера, дату, системный промпт, температуру, лимит вывода, состояние thinking и настройки инструментов.
- Проведите слепое сравнение. Уберите названия моделей и предложите экспертам выбрать лучший ответ. Это ближе к логике LMArena, чем оценка заранее известного бренда.
- Разделите критерии. Оценивайте корректность, полноту, следование формату, стиль, число выдуманных фактов, успешность вызовов функций и потребность в ручном исправлении.
- Для кода запускайте тесты. Измеряйте долю задач, прошедших unit- и integration-тесты, число повторных попыток, размер ненужного diff и ошибки безопасности.
- Проверьте длинный контекст. Поместите контрольные факты в начало, середину и конец документа. Добавьте похожие отвлекающие фрагменты и потребуйте указать источник ответа.
- Измерьте эксплуатацию. Соберите медиану и 95-й перцентиль времени до первого токена, скорость вывода, частоту ошибок API и стоимость успешной задачи, а не только одного запроса.
- Повторите тест. Из-за стохастичности выполните каждый важный пример несколько раз. Для опасных действий добавьте подтверждение человеком и технические ограничения.
FAQ
Что означает COMRAD Score 61,1?
Это нормализованная редакционная оценка по шкале 0–100, рассчитанная из пяти суббаллов с разными весами. Она не означает 61,1% правильных ответов.
Почему GLM-4.6 занимает 90-е место при пользовательском суббалле 86,0?
Итог учитывает не только предпочтение пользователей. Качество имеет оценку 50,0, а программирование — 31,1, что заметно ограничивает общий результат.
Подходит ли GLM-4.6 для программирования?
Она поддерживает генерацию кода и инструменты, но кодовый суббалл 31,1 требует осторожности. Перед внедрением модель нужно проверить на задачах из собственного репозитория и автоматических тестах.
Есть ли у GLM-4.6 режим рассуждения?
Паспорт классифицирует модель с флагом reasoning=false, однако официальное API описывает переключаемый thinking-режим. Для рейтинга действует паспорт, а для интеграции — проверка конкретного API и конфигурации.
Можно ли запустить GLM-4.6 локально?
Да, веса опубликованы, карточка указывает MIT, а официальные материалы описывают Transformers, vLLM и SGLang. Но из-за крупного размера модели потребуется серьёзная серверная инфраструктура.
Насколько быстра GLM-4.6?
В зафиксированном срезе нет данных ни о токенах в секунду, ни о времени до первого токена. Скорость необходимо измерять у выбранного провайдера и с рабочей длиной контекста.
Сколько стоит использование модели?
В паспорте указаны $0,43 за миллион входных и $1,75 за миллион выходных токенов. Тарифы зависят от провайдера и режима и могут изменяться.
Источники
- Официальная документация GLM-4.6 — возможности, контекст, сценарии, API и thinking-параметр.
- Release notes Z.ai — запуск GLM-4.6 30 сентября 2025 года и заявленный контекст 200K.
- Руководство по миграции на GLM-4.6 — параметры вызова, инструменты и переключаемое глубокое рассуждение.
- Карточка GLM-4.6 на Hugging Face — опубликованные веса, MIT, размер файлов и способы запуска.
- Официальный репозиторий семейства GLM-4.5/4.6/4.7 — конфигурация GLM-4.6, варианты весов и инструкции по инференсу.
- Руководство Z.ai по воспроизведению оценок GLM-4.6 — локальная и облачная процедура проверки.
- LMArena Text Leaderboard — источник Text Arena rating, места и числа голосов в паспортном срезе.
- LMArena Leaderboard — источник Code Arena rating и места в паспортном срезе.
- Artificial Analysis LLM Leaderboard — проверяемый независимый источник; Intelligence Index для GLM-4.6 в переданном срезе отсутствует.
Фактический срез: 31 августа 2026 года. Рейтинговые числа в статье взяты исключительно из переданного паспорта модели. Официальные заявления Z.ai приведены отдельно от независимых измерений и редакционной интерпретации.
