Запись архива

Llama 3.1 405B: что показала открытая модель уровня фронтира

23 июля 2024 Meta выпустила Llama 3.1 405B и назвала её моделью уровня фронтира с открыто доступными весами. Разбираем paper, model card и реальные ограничения релиза без шума вокруг бренда.

Схема пайплайна Llama 3.1 405B: dense Transformer, continued pre-training до 128K, post-training через SFT и DPO, tool use, а также таблица результатов на MMLU, GPQA, HumanEval, BFCL и MGSM.

23 июля 2024 Meta выпустила Llama 3.1 405B и одновременно обновила семейство 8B/70B: добавила длинный контекст, мультиязычность и полноценный tool use. Основа этого разбора — paper The Llama 3 Herd of Models, релизный пост Introducing Llama 3.1 и официальные model card’ы Meta. Ниже мы сознательно фиксируем историческое состояние релиза Llama 3.1, а не подменяем его более поздними моделями семейства Llama.

Почему это важно: летом 2024 года Meta попыталась впервые приблизить open-weight экосистему к закрытым фронтир-моделям не только по чат-качеству, но и по длинному контексту, вызову инструментов и роли «teacher model» для дистилляции. Именно в этом, а не только в цифре 405B, и состоит практический смысл релиза.

Коротко

  • Paper Meta датирован 23 июля 2024 года; авторы отдельно уточняют, что все результаты в статье относятся именно к Llama 3.1, хотя для краткости внутри текста они пишут просто «Llama 3».
  • Llama 3.1 405B — это dense Transformer, а не MoE. По статье Meta, флагман предобучали на 15.6T text tokens, после чего отдельным этапом расширяли поддерживаемый контекст до 128K.
  • Постобучение строится на комбинации SFT, rejection sampling и DPO; tool use добавлялся прямо в post-training, частично через синтетические данные, частично через человеческую разметку.
  • В официальных бенчмарках Meta модель 405B Instruct уверенно превосходит собственные 70B-варианты по reasoning, coding, tool use и multilingual MGSM. Сравнение с GPT-4o и Claude 3.5 Sonnet в paper выглядит близким, но оно в нашем корпусе подтверждается только одной публикацией самой Meta.
  • Главные ограничения релиза: очень дорогой инференс, зависимость от собственных evaluation pipeline Meta, кастомная community license и официальный статус «не разворачивать в изоляции без системных guardrails».

Контекст: зачем Meta понадобился Llama 3.1 405B

Чтобы не запутаться в названиях, сначала важная деталь из самого paper: авторы пишут, что все результаты в статье относятся к Llama 3.1, хотя дальше используют короткое имя «Llama 3». Это важно, потому что к моменту релиза уже существовали апрельские Llama 3 8B и 70B, но июльская линейка 3.1 — это уже другой этап семейства: длинный контекст, мультиязычность, tool use и новый флагман 405B.

В релизном посте Meta описывает 405B как модель, которая должна сократить разрыв между открыто доступными весами и закрытыми лидерами рынка. В paper эта задача формулируется технически: три главных рычага качества — data, scale и managing complexity. То есть Meta не пыталась удивить одной архитектурной хитростью; ставка была на масштаб, качество данных и управляемость всего пайплайна.

Практически это означало две вещи. Во-первых, 405B нужен был как самодостаточный флагман. Во-вторых, он нужен как источник синтетических данных и дистилляции для более компактных моделей. И paper, и релизный пост прямо связывают 405B с этим сценарием: большая модель должна помогать улучшать меньшие, а не только служить дорогим чат-API.

Метод: как устроен Llama 3.1 405B

Предобучение

Архитектурно Llama 3.1 405B — это плотный трансформер (dense Transformer). В paper Meta прямо объясняет, почему не пошла в mixture-of-experts: стандартный dense-подход с небольшими адаптациями оказался предпочтительнее с точки зрения стабильности масштабирования. Это важный инженерный сигнал: Meta выбрала не самую «модную» архитектуру, а ту, которую проще надежно обучать на экстремальном масштабе.

По данным самой статьи Meta, флагман предобучали на 15.6T text tokens с базовым окном 8K, а затем запускали continued pre-training, чтобы довести поддерживаемый контекст до 128K. В model card эта конфигурация подтверждается для релизных моделей 3.1: 128K context length, Grouped-Query Attention, официальный knowledge cutoff — December 2023, а поддерживаемые языки — English, German, French, Italian, Portuguese, Hindi, Spanish, Thai.

Важно и то, чего Meta не обещает. В model card сказано, что модель обучена на более широком языковом массиве, но официально поддерживаемыми считаются именно восемь языков. Для production это не мелочь: если вы планируете другой язык, Meta прямо перекладывает ответственность за безопасность и качество на разработчика.

Постобучение

Второй ключевой этап — post-training. В paper Meta описывает сравнительно простой, но масштабируемый рецепт: supervised fine-tuning (SFT), затем rejection sampling (RS), затем direct preference optimization (DPO). Для practitioners здесь важен не только набор аббревиатур, но и идея: Meta предпочла относительно устойчивую схему обучения вместо более сложных RL-процедур, которые труднее масштабировать и отлаживать.

Отдельно в post-training встроили tool use. По paper, для базовых навыков вызова инструментов использовались синтетические данные из предыдущих чекпоинтов Llama 3, после чего Meta добавляла человеческую разметку для более сложных сценариев: multi-turn, multi-step, работа с несколькими вызовами и анализ данных. Это объясняет, почему в июльском релизе рост заметен не только в «общем интеллекте», но и в более прикладных тестах на function calling.

Линейка как система, а не один чекпоинт

Официальные материалы Meta подчеркивают, что релиз Llama 3.1 — это не только 405B, но целая система моделей и guardrails. Вместе с моделями Meta выпускала Llama Guard 3, Prompt Guard и reference system, а в safety-материалах прямо пишет, что большие языковые модели не следует разворачивать в изоляции. Это важный сдвиг: Meta продвигала 405B не просто как «мозг», а как центральный элемент более широкого стека.

Результаты: что показала модель на бенчмарках

Ниже — таблица по Llama-only результатам. Числа совпадают в paper Meta и в официальном model card Llama 3.1 405B Instruct; конфиги shot/CoT сверены по eval_details.md.

Бенчмарк Конфиг и метрика Llama 3 70B Instruct Llama 3.1 70B Instruct Llama 3.1 405B Instruct
MMLU 5-shot, acc 82.0 83.6 87.3
MMLU 0-shot CoT, acc 80.9 86.0 88.6
GPQA 0-shot, em 39.5 46.7 50.7
HumanEval 0-shot, pass@1 81.7 80.5 89.0
GSM-8K 8-shot CoT, em_maj1@1 93.0 95.1 96.8
BFCL 0-shot, acc 83.0 84.8 88.5
API-Bank 0-shot, acc 85.1 90.0 92.0
Multilingual MGSM 0-shot CoT, em 86.9 91.6

Три вывода из этой таблицы важнее остальных. Первый: скачок между Llama 3 70B и Llama 3.1 70B заметен сам по себе — особенно на MMLU CoT, GPQA, API-Bank и multilingual MGSM. То есть июльский релиз был не просто добавлением 405B, а качественным обновлением всего post-training стека.

Второй: 405B действительно добавляет качество поверх уже сильной 70B-версии, особенно там, где нужны reasoning, coding и tool use. На HumanEval разрыв между 70B Instruct и 405B Instruct составляет 8.5 пункта pass@1; на GPQA — 4.0 пункта em; на BFCL — 3.7 пункта acc. Эти разницы подтверждаются одновременно paper и model card’ом Meta.

Третий: релиз был нацелен не только на английский. В model card Meta публикует отдельные MMLU-результаты по официально поддерживаемым языкам; для Llama 3.1 405B там указаны, в частности, 85.08 на испанском, 85.04 на итальянском, 84.66 на французском и 80.31 на хинди. Эти значения подтверждаются двумя официальными model card-источниками Meta, но всё равно относятся к лабораторной оценке, а не к независимому продакшен-аудиту.

Если смотреть шире, paper Meta также сравнивает 405B с закрытыми моделями. Здесь нужно быть аккуратным: ниже — авторское сравнение из одной публикации Meta, и второго официального источника с теми же сопоставлениями мы не нашли. В Table 2 paper Llama 3.1 405B получает 88.6 на MMLU (0-shot, CoT) против 88.7 у GPT-4o и 88.3 у Claude 3.5 Sonnet; на HumanEval — 89.0 против 90.2 и 92.0; на GPQA — 50.7 против 53.6 и 59.4; на multilingual MGSM — 91.6, то есть на уровне Claude 3.5 Sonnet и выше GPT-4o с его 90.5. Иными словами, claim «уровня фронтира» не был пустым, но и полной победы над закрытыми лидерами paper не показывает.

Интерпретация

Фактическая ценность Llama 3.1 405B не сводится к тому, что у Meta появился еще один очень большой чат-бот. По paper видно другое: компания построила референсную плотную модель, которую можно использовать как teacher для distillation, synthetic data generation и обновления меньших моделей. Для open-weight экосистемы это, возможно, важнее, чем сам факт публичной выдачи 405B-весов.

Наш комментарий

На наш взгляд, 405B был важен прежде всего как инфраструктурный и исследовательский объект, а не как массовая модель для локального запуска. Релизный пост сам это косвенно признаёт: Meta пишет, что для среднего разработчика работа с 405B затруднена и требует значительных вычислительных ресурсов и экспертизы. Поэтому главный вопрос после релиза был не «запущу ли я 405B у себя», а «какие open-weight workflow теперь становятся возможны благодаря существованию такого teacher model».

Второй вывод — термин «открытая модель уровня фронтира» нужно читать без избыточной романтики. В июле 2024 Meta действительно вывела в широкий доступ веса модели, которая в собственной оценке была близка к GPT-4o и Claude 3.5 Sonnet на ряде задач. Но practically это была не «демократизация фронтира для всех», а скорее перенос фронтир-уровня в облачные, enterprise и исследовательские сценарии, где есть деньги на инференс, оркестрацию и безопасность.

Ограничения и критика

  • Сравнения в основном принадлежат самой Meta. Самые громкие сопоставления с GPT-4o и Claude 3.5 Sonnet приходят из Table 2 paper Meta. Это полезный ориентир, но не независимый leaderboard.
  • 405B очень тяжел в эксплуатации. В релизном посте Meta прямо пишет, что среднему разработчику с моделью такого масштаба работать трудно. Если вам нужен production today, 70B или дистиллированный потомок часто практичнее.
  • Официально поддерживаются только восемь языков. Model card отдельно предупреждает, что использование за пределами этих языков — ответственность разработчика.
  • Knowledge cutoff зафиксирован декабрем 2023 года. Для свежих фактов и retrieval-heavy сценариев это означает обязательный RAG или внешние инструменты.
  • Модель не предназначена для изолированного деплоя. И safety blog Meta, и model card подчеркивают необходимость системных safeguard’ов вроде Llama Guard 3 и Prompt Guard.
  • Термин open source спорный. Meta сама использует язык open source и openly available, но лицензия — это Llama 3.1 Community License, то есть кастомный режим использования. Поэтому технически аккуратнее говорить об open-weight модели с community license, а не автоматически ставить знак равенства с классическим OSI-style open source.
  • Human evals чувствительны к субъективности. Paper Meta прямо признаёт, что оценки людей зависят от тона, структуры ответа и предпочтений аннотаторов. Это особенно важно, когда сравнение моделей идёт «на тонких гранях».

Заключение

Llama 3.1 405B была важна не только как самая большая модель в линейке Meta на июль 2024 года, а как доказательство того, что open-weight стек может приблизиться к закрытым лидерам по длинному контексту, tool use, coding и multilingual задачам. Paper показывает, что Meta добилась этого не магической архитектурой, а комбинацией масштаба, плотного трансформера, длинного continued pre-training и дисциплинированного post-training.

Запомнить стоит две вещи. Первая: по собственным данным Meta, 405B действительно оказалась фронтирно-конкурентной. Вторая: практически это была модель не для «каждого ноутбука», а для экосистемы, которая хотела строить дистилляцию, synthetic data pipeline и production-системы вокруг открыто доступных весов.

Источники

FAQ

Почему paper называется The Llama 3 Herd of Models, если статья про Llama 3.1?

Потому что авторы paper пишут: для краткости они используют имя «Llama 3», но все результаты в статье относятся к моделям Llama 3.1.

Llama 3.1 405B — это действительно open source?

Meta на релизе использовала язык open source и openly available, но юридически релиз идёт под кастомной community license. На практике корректнее говорить об открыто доступных весах, а не автоматически приравнивать релиз к классическому OSI-совместимому open source.

Чем 405B отличается от 70B на практике?

У 405B лучше результаты на reasoning, coding, multilingual MGSM и tool use, а также более сильная роль teacher model для distillation и synthetic data generation. Но стоимость инференса и сложность эксплуатации у неё несопоставимо выше.

Можно ли использовать 405B без дополнительных защитных компонентов?

Официальные материалы Meta прямо говорят, что нет: модель не предназначена для развёртывания в изоляции. Для production Meta рекомендует системные safeguard’ы, включая Llama Guard 3 и Prompt Guard.

Читайте также