Запись архива

Meta выпустила Muse Glimmer: открытая мультимодальная модель 30B для локальных агентов

Meta представила Muse Glimmer — дистиллированную до 30B параметров мультимодальную модель под лицензией Apache 2.0 для локальных агентных сценариев: код, документы, видео и персональные ассистенты. Поддержка в transformers, vLLM и llama.cpp появилась с первого дня.

Muse Glimmer — открытая мультимодальная модель Meta на 30 млрд параметров для локального запуска
Muse Glimmer — открытая мультимодальная модель Meta на 30 млрд параметров для локального запуска
Imagen destacada del articulo fuente

Meta выпустила Muse Glimmer — мультимодальную модель на 30 млрд параметров, рассчитанную на локальные агентные сценарии. Анонс опубликован в блоге Hugging Face 10 августа 2026 года; компания участвовала в подготовке интеграций и разместила модель на Hub с поддержкой с первого дня. Muse Glimmer распространяется под лицензией Apache 2.0 и позиционируется как вариант для работы с кодом, документами и видео без передачи данных во внешние API.

Что известно о модели

Muse Glimmer — дистиллят более крупной модели Muse, сжатый до 30B параметров. Это плотная (dense) модель, а не смесь экспертов. В языковой части используются три окна внимания, за которыми следует полный слой внимания, и 2D RoPE в запросах и ключах. Лицензия Apache 2.0 разрешает коммерческое использование и модификации, что отличает релиз от закрытых API. Meta называет модель предназначенной для приватных применений: локальный код, анализ документов, персональные помощники.

Архитектура и работа с видео

В отличие от многих VLM с небольшими вижн-энкодерами, Muse Glimmer использует энкодер примерно на 2 млрд параметров, построенный на базе Perception Encoder — ранее Meta представляла его как основу для пространственных и мультимодальных задач. Энкодер разбивает изображения на патчи формы 2 кадра × 3 канала × 14 × 14 и проецирует их линейным слоем, затем добавляет интерполированные абсолютные позиционные эмбеддинги. Вижн-башня состоит из 50 слоев с GELU MLP; чередование трех окон внимания и одного полного слоя повторяет паттерн языковой части. Операция pixel shuffle объединяет соседние токены в группы 2×2, сокращая количество визуальных токенов в четыре раза без потери каналов.

Видео обрабатывается тем же энкодером покадрово: процессор берет два кадра в секунду и ограничивает клип 96 кадрами, выбирая их равномерно. Кадры интерливируются с текстовыми плейсхолдерами и временными метками вида «Time: 0.0s <|video|>», которые перед финальной проекцией заменяются на эмбеддинги. Звуковая дорожка при этом не используется.

Спекулятивный драфтер для ускорения

Вместе с основной моделью поставляется опциональный драфтер спекулятивного декодирования, реализованный на DFlash. Он ускоряет генерацию ценой дополнительной памяти. По наблюдениям авторов блога, драфтер особенно хорошо подходит для структурированной генерации, в том числе для кода. Поддержка драфтера включена в transformers с первого дня, так что использовать его можно сразу после обновления библиотеки.

Поддержка в экосистеме с первого дня

Hugging Face подтверждает day-0 поддержку в transformers (для основной модели и драфтера), llama.cpp, vLLM, Inference Endpoints и других библиотеках. Модель доступна на Hub под идентификатором meta-models/Muse-Glimmer-30B

Datos clave

Punto Detalle
Fuente Hugging Face Blog
Fecha 2026-08-10T00:00:00+00:00
Tema Meta is back with Muse Glimmer: local, agentic, multimodal, and open source