
Что произошло
На Reddit (r/LocalLLaMA) появился мегатред, посвященный релизу GLM-5.3-Flash — первой открытой модели на новой архитектуре glm5_next от Z.ai. Это первый нативно мультимодальный релиз в серии GLM-5 (текст, изображения, видео). Основной репозиторий содержит веса в FP8 (e4m3, dynamic scaling), отдельно доступен BF16.
Почему это обсуждают
Модель примечательна несколькими инженерными решениями. Во-первых, гибридная архитектура внимания: 45 слоев организованы как блоки из 3 слоев KDA линейного внимания и 1 слоя DeepSeek-style sparse attention (всего 34 линейных + 11 sparse). Sparse-слои используют lightning indexer (32 головы, dim 128) с бюджетом top-2048 токенов, что резко снижает стоимость длинного контекста.
Во-вторых, Manifold-Constrained Hyper-Connections (mHC) — расширенные residual-потоки с перемешиванием между слоями для улучшения масштабирования. В-третьих, встроенный MTP-слой (1 слой next-N prediction), который официальный рецепт vLLM использует с 5 спекулятивными токенами.
Z.ai заявляет, что GLM-5.3-Flash превосходит GLM-5.2 при одной десятой стоимости и приближается к Claude Opus 4.8 на кодинговых и агентных бенчмарках. Цифры пока не подкреплены независимыми тестами.
Ключевые характеристики
| Punkt | Detail |
|---|---|
| Параметры | 320B всего, 18B активируемых |
| Архитектура | 45 слоев: 34 KDA linear + 11 sparse attention |
| MoE | 288 экспертов + 1 shared, 8 активируемых + 1 shared |
| Контекст | 1 048 576 токенов (max), тестировано на 300K текст / 164K vision |
| Веса | FP8 (331 GB) и BF16 (640 GB) |
| Лицензия | MIT |
Что пока неясно
Основная интрига — насколько заявленные преимущества подтвердятся на практике. Независимых бенчмарков пока нет. Формат FP8 может создавать сложности при инференсе на несовместимом железе (официальный BF16-репозиторий решает эту проблему). Детали пост-тренировки (RLHF/DPO) не раскрыты. Архитектура требует проверки на совместимость с популярными фреймворками.
Источники
Оригинальный мегатред на Reddit: https://www.reddit.com/r/LocalLLaMA/comments/1vyzzxu/megathread_glm53flash_former_oxalpha/
Верификация по Anthropic: https://www.anthropic.com/news
