
Анонс ZGCM-1: компактная модель, которая не просто запоминает, а думает и использует инструменты
Исследователи представили ZGCM-1 — полностью открытую foundation модель размером 7B параметров, обученную «с нуля». Главная идея проекта: небольшие модели не могут пассивно запоминать содержимое открытого веба, но способны преодолеть ограничения параметрической ёмкости за счёт внутреннего рассуждения и активного использования внешних инструментов. Результаты работы доступны на arXiv (2609.13356) и сопровождаются открытым кодом, весами, датасетами и логами W&B.
Архитектура и рецепт обучения
ZGCM-1 использует гибридный механизм внимания: чередуются gated sliding-window attention и полное внимание. Это позволяет обрабатывать контекст до 256K токенов без катастрофического роста вычислительных затрат. Ключевые компоненты рецепта:
- Совместный дизайн архитектуры и системы: стабильный FP8-оптимизатор Muon, адаптированный для разреженных вычислений.
- Прогрессивный curriculum: контекст масштабируется поэтапно — 16K, 64K, 256K.
- Mid-training на основе MDP: взаимодействия переформулируются в марковские процессы принятия решений, что улучшает способность модели к долгосрочному планированию.
Разработчики внедрили AI-native R&D workflow: рои агентов автономно управляют операциями на кластере, курированием данных и быстрой диагностической оценкой.
Эффективность и сравнение с гигантами
По заявлению авторов, дизайн предобучения обеспечивает ~4,2-кратное улучшение эффективности по метрике time-to-loss на этапе 16K. На стандартных бенчмарках ZGCM-1-7B конкурентоспособна в своём классе (7B). Однако наиболее интересны результаты на сложных задачах математического рассуждения и агентного поиска: здесь модель остаётся конкурентоспособной с frontier-моделями, которые на порядки больше — Qwen3-235B-A22B и GLM-5.1.
Практические выводы и открытые компоненты
Исследователи формулируют восемь эмпирических находок, охватывающих:
- Масштабирование архитектуры.
- Прунинг качества SFT-данных.
- Генерализацию на длинные контексты.
- Динамику совместного обучения с агентами.
Для сообщества открыты:
- Веса модели на этапах pre-training, mid-training и post-training.
- Промежуточные чекпоинты.
- Код обучения.
- Датасеты и рецепты данных для каждого этапа.
- Логи W&B.
Ограничения
Важно понимать: модель продемонстрировала конкурентоспособность на специфических задачах (математика и агентный поиск). На универсальных бенчмарках ZGCM-1-7B не превосходит более крупные модели — она лишь находится на уровне других 7B-решений. Заявленная эффективность в 4,2x относится к этапу предобучения на 16K контексте, а не ко всему жизненному циклу. Кроме того, успех в агентных сценариях сильно зависит от качества инструментов и внешних API, что не всегда воспроизводимо.
Источники
- arXiv:2609.13356: ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search. https://arxiv.org/abs/2609.13356
- Verification lead: https://arxiv.org/