Запись архива

Обновление Meta Llama 4: что изменилось в Scout и Maverick

Meta выпустила первые модели семейства Llama 4 — Scout и Maverick. Разбираемся, чем они отличаются от предшественников, какие архитектурные решения использованы и что это значит для разработчиков.

Архитектура Meta Llama 4 — Scout и Maverick
Архитектура Meta Llama 4 — Scout и Maverick
Редакционная тематическая обложка COMRAD404

Meta выпустила первые модели семейства Llama 4 — Scout и Maverick. Релиз состоялся 5 апреля 2025 года, и это первый случай, когда компания использует архитектуру смеси экспертов (MoE) для своей открытой линейки. Scout ориентирована на масштабные контекстные задачи, Maverick — на максимальную производительность при инференсе. Разбираемся, что изменилось и какие ограничения стоит учитывать.

Архитектурные изменения: MoE вместо плотных моделей

Оба релиза Llama 4 используют смесь экспертов, что принципиально отличает их от Llama 3 и 3.1. Scout содержит 17 миллиардов активных параметров из 109 миллиардов общих, Maverick — 17 миллиардов активных из 400 миллиардов общих. Это означает, что при каждом запросе активируется только часть параметров, что снижает вычислительные затраты.

Meta также внедрила раннее соединение (early fusion) для мультимодальности — текст и изображения обрабатываются на входе совместно, а не через отдельные кодировщики. В предшественниках изображения сначала проходили через внешний кодировщик, что увеличивало задержку. Теперь модель обучается на сквозном представлении визуальных и текстовых данных.

Llama 4 Scout: контекст до 10 миллионов токенов

Scout — это модель, оптимизированная для работы с длинными контекстами. Заявленная длина контекста составляет 10 миллионов токенов, что позволяет обрабатывать тысячи страниц документации, большие кодовые базы или многотомные отчёты. Для сравнения: GPT-4 Turbo поддерживает 128 тысяч токенов, а Gemini 1.5 Pro — до 2 миллионов.

Для достижения такого контекста Meta использовала архитектуру iRoPE (interleaved Rotary Position Embeddings), которая чередует позиционные кодировки между слоями. Это снижает потребление памяти при сохранении качества на длинных последовательностях. Scout также поддерживает квантование в 4 бита, что позволяет запускать модель на одной видеокарте NVIDIA H100 с 80 ГБ памяти.

На практике это означает, что разработчики могут загружать в контекст целые репозитории или библиотеки и получать ответы с учётом всего объёма данных. Однако стоит учитывать, что бенчмарки на длинных контекстах пока ограничены — Meta приводит результаты только на внутренних тестах, а не на общепринятых наборах вроде RULER или LongBench.

Llama 4 Maverick: производительность и мультимодальность

Maverick нацелена на задачи, требующие высокой скорости инференса и качества ответов. При 17 миллиардах активных параметров она использует 128 экспертов с архитектурой MoE top-2 — для каждого токена выбираются два лучших эксперта. Meta утверждает, что Maverick превосходит Llama 3.1 405B и GPT-4o на ряде бенчмарков, включая MMLU, MATH и HumanEval.

Однако при сравнении с GPT-4o важно учитывать, что Maverick оценивалась на внутренних тестах Meta, а не на стандартизированных наборах с контролируемыми условиями. Результаты на независимых бенчмарках, таких как LMSYS Chatbot Arena, пока отсутствуют.

Maverick также поддерживает мультимодальные запросы: изображения, видео (до 1 минуты) и аудио. Видео обрабатывается покадрово — модель выбирает ключевые кадры и анализирует их последовательность. Аудио преобразуется в текст через внешний распознаватель. Это делает Maverick пригодной для задач анализа видеоконтента, но не для потоковой обработки речи в реальном времени.

Лицензирование и доступность

Обе модели распространяются по лицензии Llama 4 Community License. Она разрешает коммерческое использование для большинства проектов, но накладывает ограничения для продуктов, превышающих 700 миллионов активных пользователей в месяц — в этом случае требуется отдельное разрешение Meta.

Весовая версия Scout доступна для загрузки на Hugging Face и официальном сайте Meta. Maverick пока распространяется в режиме раннего доступа — полные веса будут опубликованы позже. На данный момент Maverick можно тестировать через API на platforms.meta.com.

Практические ограничения и что стоит проверить

Прежде чем интегрировать Llama 4 в рабочие процессы, стоит учесть несколько моментов.

Критерий Llama 4 Scout Llama 4 Maverick Llama 3.1 405B
Активные параметры 17B 17B 405B (плотная)
Контекст до 10M токенов 1M токенов 128K токенов
Мультимодальность текст + изображения текст + изображения + видео только текст
Лицензия Llama 4 Community Llama 4 Community Llama 3.1 Community
Доступность весов открыто ранний доступ открыто
Квантование 4-bit 8-bit 4-bit (экспериментально)

Meta не опубликовала независимые бенчмарки на длинных контекстах для Scout — заявленные 10 миллионов токенов проверены только на внутренних тестах. Для задач, где критична точность на больших контекстах, стоит провести собственные тесты.

Maverick, несмотря на высокие результаты на MMLU и MATH, пока не подтвердила своё превосходство на открытых аренах. Отсутствие весов для самостоятельного развёртывания ограничивает возможность проверки.

Что делать дальше

Если вы работаете с большими документами или кодовыми базами — Scout стоит протестировать в своей инфраструктуре. Модель можно запустить локально на H100 с 80 ГБ, используя 4-битное квантование. Если нужна мультимодальность и высокая скорость инференса — Maverick доступна через API, но для production-нагрузок стоит дождаться публикации весов и независимых тестов.

Meta обещает выпустить Llama 4 Beast (более крупную версию) и обновлённые текстовые модели позже в этом году. Следите за официальным блогом и репозиторием на Hugging Face.