Запись архива

ZGCM-1: открытая 7B модель для математики и агентного поиска с радикальной эффективностью обучения

Представлена ZGCM-1 — полностью открытая 7B модель, обученная с нуля. Разработчики заявляют о 4,2-кратном ускорении предобучения за счёт гибридного внимания, прогрессивного контекста до 256K и FP8-оптимизатора Muon. Модель конкурентоспособна с Qwen3-235B и GLM-5.1 на задачах математического рассуждения и агентного поис

Архитектура и результаты ZGCM-1, открытой foundation модели для математических рассуждений и агентного поиска
Архитектура и результаты ZGCM-1, открытой foundation модели для математических рассуждений и агентного поиска
Lyrical Time Wastr : Take a Picture by Filter | by Beer30 | openverse | by

Анонс ZGCM-1: компактная модель, которая не просто запоминает, а думает и использует инструменты

Исследователи представили ZGCM-1 — полностью открытую foundation модель размером 7B параметров, обученную «с нуля». Главная идея проекта: небольшие модели не могут пассивно запоминать содержимое открытого веба, но способны преодолеть ограничения параметрической ёмкости за счёт внутреннего рассуждения и активного использования внешних инструментов. Результаты работы доступны на arXiv (2609.13356) и сопровождаются открытым кодом, весами, датасетами и логами W&B.

Архитектура и рецепт обучения

ZGCM-1 использует гибридный механизм внимания: чередуются gated sliding-window attention и полное внимание. Это позволяет обрабатывать контекст до 256K токенов без катастрофического роста вычислительных затрат. Ключевые компоненты рецепта:

  • Совместный дизайн архитектуры и системы: стабильный FP8-оптимизатор Muon, адаптированный для разреженных вычислений.
  • Прогрессивный curriculum: контекст масштабируется поэтапно — 16K, 64K, 256K.
  • Mid-training на основе MDP: взаимодействия переформулируются в марковские процессы принятия решений, что улучшает способность модели к долгосрочному планированию.

Разработчики внедрили AI-native R&D workflow: рои агентов автономно управляют операциями на кластере, курированием данных и быстрой диагностической оценкой.

Эффективность и сравнение с гигантами

По заявлению авторов, дизайн предобучения обеспечивает ~4,2-кратное улучшение эффективности по метрике time-to-loss на этапе 16K. На стандартных бенчмарках ZGCM-1-7B конкурентоспособна в своём классе (7B). Однако наиболее интересны результаты на сложных задачах математического рассуждения и агентного поиска: здесь модель остаётся конкурентоспособной с frontier-моделями, которые на порядки больше — Qwen3-235B-A22B и GLM-5.1.

Практические выводы и открытые компоненты

Исследователи формулируют восемь эмпирических находок, охватывающих:

  • Масштабирование архитектуры.
  • Прунинг качества SFT-данных.
  • Генерализацию на длинные контексты.
  • Динамику совместного обучения с агентами.

Для сообщества открыты:

  • Веса модели на этапах pre-training, mid-training и post-training.
  • Промежуточные чекпоинты.
  • Код обучения.
  • Датасеты и рецепты данных для каждого этапа.
  • Логи W&B.

Ограничения

Важно понимать: модель продемонстрировала конкурентоспособность на специфических задачах (математика и агентный поиск). На универсальных бенчмарках ZGCM-1-7B не превосходит более крупные модели — она лишь находится на уровне других 7B-решений. Заявленная эффективность в 4,2x относится к этапу предобучения на 16K контексте, а не ко всему жизненному циклу. Кроме того, успех в агентных сценариях сильно зависит от качества инструментов и внешних API, что не всегда воспроизводимо.

Источники

  • arXiv:2609.13356: ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search. https://arxiv.org/abs/2609.13356
  • Verification lead: https://arxiv.org/