Запись архива

GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8

На Reddit обсуждают релиз GLM-5.3-Flash — первую открытую модель Z.ai на новой архитектуре glm5_next. 320B параметров, 18B активируемых, гибридное внимание (линейное + sparse) и FP8 в основном репозитории.

Редакционная обложка COMRAD404: GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8
Редакционная обложка COMRAD404: GLM-5.3-Flash: Z.ai представила первую открытую версию новой архитектуры с гибридным вниманием и FP8
Редакционная тематическая обложка COMRAD404

Что произошло

На Reddit (r/LocalLLaMA) появился мегатред, посвященный релизу GLM-5.3-Flash — первой открытой модели на новой архитектуре glm5_next от Z.ai. Это первый нативно мультимодальный релиз в серии GLM-5 (текст, изображения, видео). Основной репозиторий содержит веса в FP8 (e4m3, dynamic scaling), отдельно доступен BF16.

Почему это обсуждают

Модель примечательна несколькими инженерными решениями. Во-первых, гибридная архитектура внимания: 45 слоев организованы как блоки из 3 слоев KDA линейного внимания и 1 слоя DeepSeek-style sparse attention (всего 34 линейных + 11 sparse). Sparse-слои используют lightning indexer (32 головы, dim 128) с бюджетом top-2048 токенов, что резко снижает стоимость длинного контекста.

Во-вторых, Manifold-Constrained Hyper-Connections (mHC) — расширенные residual-потоки с перемешиванием между слоями для улучшения масштабирования. В-третьих, встроенный MTP-слой (1 слой next-N prediction), который официальный рецепт vLLM использует с 5 спекулятивными токенами.

Z.ai заявляет, что GLM-5.3-Flash превосходит GLM-5.2 при одной десятой стоимости и приближается к Claude Opus 4.8 на кодинговых и агентных бенчмарках. Цифры пока не подкреплены независимыми тестами.

Ключевые характеристики

Punkt Detail
Параметры 320B всего, 18B активируемых
Архитектура 45 слоев: 34 KDA linear + 11 sparse attention
MoE 288 экспертов + 1 shared, 8 активируемых + 1 shared
Контекст 1 048 576 токенов (max), тестировано на 300K текст / 164K vision
Веса FP8 (331 GB) и BF16 (640 GB)
Лицензия MIT

Что пока неясно

Основная интрига — насколько заявленные преимущества подтвердятся на практике. Независимых бенчмарков пока нет. Формат FP8 может создавать сложности при инференсе на несовместимом железе (официальный BF16-репозиторий решает эту проблему). Детали пост-тренировки (RLHF/DPO) не раскрыты. Архитектура требует проверки на совместимость с популярными фреймворками.

Источники

Оригинальный мегатред на Reddit: https://www.reddit.com/r/LocalLLaMA/comments/1vyzzxu/megathread_glm53flash_former_oxalpha/
Верификация по Anthropic: https://www.anthropic.com/news