23 июля 2024 года Meta выпустила Llama 3.1 405B и одновременно опубликовала paper The Llama 3 Herd of Models. Исторический вопрос был простой: может ли модель с доступными весами приблизиться к закрытому frontier-классу не только по риторике, но и по измеримым задачам. Короткий ответ: по части тестов — да, по части — нет, но именно эта смесь сильных и слабых мест и сделала релиз важным для практиков.
Ниже — разбор именно релиза Meta от 23 июля 2024 года и его исходных материалов. Мы не подменяем исторический контекст более новыми моделями и отдельно отмечаем, где речь идёт о данных из единственного публичного источника — самой статьи Meta.
Коротко
- Llama 3.1 405B — это dense decoder-only Transformer на 405 млрд параметров, а не MoE; Meta обучала его на 15.6T токенов и расширила окно контекста до 128K.
- По таблице 2 статьи Meta модель действительно подошла к frontier-уровню: на отдельных задачах она обгоняла GPT-4 (0125) и была близка к GPT-4o и Claude 3.5 Sonnet, но не становилась безусловным лидером.
- Главный практический эффект релиза — не только качество, но и доступность весов для дистилляции, синтетических данных, тонкой настройки и системных экспериментов.
- Точное определение важно: у Llama 3.1 открыты веса, но распространение идёт по кастомной Community License, поэтому в строгом смысле это не то же самое, что OSI-совместимый open source.
- Ограничения существенные: многие громкие сравнения исходят из внутренних оценок Meta, а запуск 405B даже после FP8-оптимизаций оставался инфраструктурно дорогим.
Контекст: что именно Meta показала в июле 2024 года
В двух официальных постах от 23 июля 2024 года Meta называла Llama 3.1 405B своей самой мощной на тот момент моделью и описывала её как первую открыто доступную модель уровня frontier. В том же релизе компания обновила семейство 8B и 70B, добавив 128K контекст, поддержку восьми языков и улучшения в tool use.
Для практиков важно, что релиз был не просто маркетинговым анонсом. Meta одновременно выложила веса, paper, model card, отдельный текст про безопасный релиз, а также reference-system и инструменты вроде Llama Guard 3 и Prompt Guard. То есть 405B задумывалась не как «одна большая модель», а как центральный элемент более широкой системы разработки.
Но здесь же появляется важная оговорка по теме «открытости». В постах Meta использует формулировки open source и openly available, тогда как model card и лицензионный текст прямо говорят о Llama 3.1 Community License — кастомной коммерческой лицензии. А определение Open Source Initiative требует, чтобы лицензия не ограничивала перераспределение, области применения и дополнительные права получателей. Поэтому в технически аккуратном русском описании Llama 3.1 405B точнее называть моделью с открытыми весами или публично доступной моделью, а не просто «open source» без оговорок.
Метод: как устроена Llama 3.1 405B
Архитектура и масштаб
Сильная сторона релиза не в экзотической архитектуре, а в сочетании масштаба и инженерной дисциплины. Meta подчёркивает в посте и в paper, что 405B — это стандартный плотный decoder-only Transformer с небольшими адаптациями, а не mixture-of-experts. Выбор был сделан в пользу устойчивости обучения и более прямолинейного масштабирования.
По статье Meta, флагманская модель была предобучена на 15.6 трлн текстовых токенов; в blog-post эта же история огрублена как over 15 trillion tokens. В paper сказано, что обучение шло на кластере до 16 тысяч H100, а model card отдельно фиксирует инфраструктурный след: суммарно семейство Llama 3.1 потребовало 39.3 млн GPU-часов, из которых на 405B пришлись 30.84 млн. Последняя цифра публично встречается в model card; независимой внешней сверки Meta не приводит.
Длинный контекст и многоязычность
Важное отличие именно версии 3.1 от первых Llama 3 апреля 2024 года — длинный контекст и многоязычность как штатные свойства семейства. В paper Meta пишет, что основное предобучение шло с окном 8K, а затем продолженное обучение увеличило поддерживаемое окно до 128K. Model card и анонс также фиксируют восемь поддерживаемых языков: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский.
Постобучение и tool use
Постобучение Meta описывает довольно прозрачно. Базовая схема — SFT, rejection sampling и DPO; в blog-post и в paper подчёркивается, что значительная часть SFT-данных была синтетической. В статье Meta прямо пишет, что использовала 405B для улучшения качества постобучения меньших моделей, то есть флагман работал не только как конечный продукт, но и как teacher model.
Отдельный слой — tool use. В paper перечислены интеграции с поиском, Python-интерпретатором и Wolfram Alpha API. Это важно не потому, что инструменты были уникальны сами по себе, а потому, что Meta уже в 2024 году строила вокруг Llama не только «чат-модель», но и заготовку для агентных систем и внешних вызовов.
Инференс: почему FP8 был не косметикой
Для 405B вопрос инференса был не вторичным. В blog-post Meta пишет, что перевела модель с BF16 к FP8-числам, чтобы снизить вычислительные требования и уместить запуск в один серверный узел. В самой статье формулировка точнее: BF16-версия не помещалась в память одной машины с 8 H100, поэтому BF16-инференс распараллеливали на 16 GPU и две машины; FP8 и pipeline parallelism были нужны, чтобы сделать продакшен-инференс практичнее. То есть «открытые веса догнали фронтир» не означало «каждый может легко поднять 405B локально».
Llama 3.1 405B: результаты и сравнение с frontier-моделями
Ниже — ключевые строки из Table 2 статьи Meta. Это удобный сводный источник, но важно помнить: все числа в таблице исходят из единственного публичного источника — самой статьи Meta, а протоколы местами различаются по подсказкам и API-версиям конкурентов. Поэтому таблицу стоит читать как сильный сигнал, а не как окончательный независимый вердикт.
| Бенчмарк | Llama 3.1 405B | GPT-4 (0125) | GPT-4o | Claude 3.5 Sonnet |
|---|---|---|---|---|
| MMLU (5-shot) | 87.3 | 85.1 | 89.1 | 89.9 |
| IFEval | 88.6 | 84.3 | 85.6 | 88.0 |
| HumanEval (0-shot) | 89.0 | 86.6 | 90.2 | 92.0 |
| GSM8K (8-shot, CoT) | 96.8 | 94.2 | 96.1 | 96.4 |
| MATH (0-shot, CoT) | 73.8 | 64.5 | 76.6 | 71.1 |
| ARC Challenge (0-shot) | 96.9 | 96.4 | 96.7 | 96.7 |
| GPQA (0-shot, CoT) | 51.1 | 41.4 | 53.6 | 59.4 |
| BFCL | 88.5 | 88.3 | 80.5 | 90.2 |
| Nexus | 58.7 | 50.3 | 56.1 | 45.7 |
| ZeroSCROLLS/QuALITY | 95.2 | 95.2 | 90.5 | 90.5 |
| InfiniteBench/En.MC | 83.4 | 72.1 | 82.5 | — |
| NIH/Multi-needle | 98.1 | 100.0 | 100.0 | 90.8 |
| Multilingual MGSM (0-shot, CoT) | 91.6 | 85.9 | 90.5 | 91.6 |
Если читать эту таблицу буквально, картина получается не «405B победила всех», а «405B вошла в верхний класс и местами сравнялась с ним». По данным самой Meta, модель обходит GPT-4 (0125) на ряде задач общего знания, инструктивности, математики, reasoning и multilingual reasoning. Но на задачах вроде GPQA и HumanEval она уступает лучшим закрытым конкурентам того момента — особенно Claude 3.5 Sonnet.
Интересен и блок длинного контекста. По Table 2 Llama 3.1 405B выглядит сильно на ZeroSCROLLS/QuALITY и InfiniteBench/En.MC, но не доминирует на NIH/Multi-needle, где GPT-4 и GPT-4o получают более высокие значения. Это хорошо согласуется с более осторожной инженерной интерпретацией: длинный контекст появился не как «магическое окно 128K», а как новая рабочая способность с конкретными сильными и слабыми режимами.
Есть и второй слой результатов — человеческие оценки. В разделе 5.3 paper Meta пишет, что в парных human eval Llama 3 405B была примерно на уровне GPT-4 (0125), а против GPT-4o и Claude 3.5 Sonnet показывала смешанную картину: лучше на части английских и multiturn-задач, слабее на части reasoning, coding и некоторых multilingual prompts. Это снова скорее аргумент в пользу формулировки «добралась до frontier-класса», чем «стала безусловным frontier-лидером».
Наконец, есть внешняя, пусть и не полностью сопоставимая, проверка. В посте LMSYS от 29 августа 2024 года о style-controlled Chatbot Arena команда пишет, что Llama-3.1-405B поднялась до 3-го места в подмножестве Hard Prompts после контроля длины и markdown-стиля ответа. Это не верификация всех чисел Meta, но полезный внешний сигнал: 405B действительно воспринималась как модель высшего класса и вне внутренней таблицы самой Meta.
Интерпретация
Наш комментарий
Главный смысл релиза Llama 3.1 405B был не в том, что «open победил closed». Гораздо точнее другое: впервые модель с публично доступными весами оказалась достаточно близко к верхнему закрытому эшелону, чтобы стать полноценным инструментом исследований и прикладной разработки. С этого момента открытые веса можно было обсуждать не как учебный компромисс, а как базу для серьёзных production- и research-сценариев.
Для практиков это означало минимум три вещи. Во-первых, появилась большая teacher-модель для синтетических датасетов и дистилляции, причём Meta прямо разрешила использовать outputs Llama для улучшения других моделей. Во-вторых, open-weight фронтир сделал реальнее сценарии on-prem, аудита, кастомной тонкой настройки и системного контроля, где закрытые API-модели неудобны по юридическим или инфраструктурным причинам. В-третьих, 405B ускорила всю экосистему оптимизаций — от FP8-инференса и vLLM до квантования и новых способов оценивать большие модели вне API-вендоров.
Но не менее важно то, чего релиз не доказал. Он не показал, что открытые модели уже устойчиво обгоняют закрытые. Он не снял инфраструктурный барьер. И он не решил спор об «открытости» в юридическом смысле: веса доступны, но governance, лицензия и данные остаются под контролем Meta.
Ограничения и критика
- Сильная зависимость от self-reported evals. Самая цитируемая сравнительная таблица против GPT-4o и Claude 3.5 Sonnet находится в paper Meta. Это нормальный стартовый источник, но не независимая репликация.
- Неидеальная сопоставимость протоколов. В Table 2 есть сноски о разных prompting-режимах для отдельных моделей и задач. Поэтому разрывы в несколько пунктов не всегда стоит трактовать как абсолютный порядок сил.
- Инфраструктурная цена остаётся фронтирной. По статье Meta, BF16-инференс 405B требовал 16 H100 на двух машинах, а FP8 нужен был именно для снижения этого барьера. Для большинства команд 405B оставалась скорее облачной или специализированной, чем «локальной», моделью.
- Это не классический open source. Llama 3.1 распространяется по Community License, а в лицензии есть дополнительные коммерческие условия, включая порог 700 млн MAU. Это заметно отличается от OSI-логики свободного перераспределения прав.
- Открыты веса, но не весь стек обучения. Meta не публикует полный тренировочный датасет. Для науки и воспроизводимости это важный предел «открытости».
- Языковая и безопасностная рамка уже, чем звучит в заголовках. Model card официально поддерживает восемь языков и отдельно предупреждает, что использование за пределами этого списка требует дополнительной настройки и safeguards.
- Безопасность вынесена на системный уровень. И paper, и отдельный пост Meta прямо говорят, что Llama 3.1 не должна разворачиваться изолированно; нужны Llama Guard 3, Prompt Guard и прикладные правила разработчика. Иначе «открытые веса» превращаются не в свободу, а в операционный риск.
Итог
Llama 3.1 405B стала важной не потому, что мгновенно закрыла гонку с GPT-4o и Claude 3.5 Sonnet. Она важна потому, что на дату релиза 23 июля 2024 года впервые сделала open-weight сегмент достаточно сильным, чтобы его приходилось сравнивать с закрытым frontier всерьёз, по одним и тем же задачам. Для индустрии это был не конец лидерства закрытых моделей, а начало новой фазы: открытые веса перестали быть периферией.
Источники
- Introducing Llama 3.1: Our most capable models to date
- The Llama 3 Herd of Models
- meta-llama/Llama-3.1-405B — Model card
- Expanding our open source large language models responsibly
- LLAMA 3.1 COMMUNITY LICENSE AGREEMENT
- The Open Source Definition – Open Source Initiative
- Does style matter? Disentangling style and substance in Chatbot Arena
FAQ
Это open source или open weights?
С инженерной точки зрения удобнее говорить open weights. Веса доступны, но лицензия кастомная, с дополнительными условиями, поэтому в строгом OSI-смысле это не обычный open source.
В чём Llama 3.1 405B реально догнала закрытые модели?
По данным статьи Meta — в общем знании, инструктивности, части math/reasoning, tool use и части long-context задач. Но на coding и научном reasoning, особенно по GPQA и HumanEval, лучшие закрытые модели того момента оставались впереди.
Почему релиз был важен, если модель не стала номером один?
Потому что с 405B открытые веса стали годиться не только для экспериментов на обочине, но и для дистилляции, тонкой настройки, аудита, on-prem-сценариев и системных исследований уровня frontier.
Можно ли было просто скачать и запустить 405B у себя?
Скачать — да. Но практический запуск требовал серьёзной инфраструктуры. Meta отдельно описывала FP8 и pipeline parallelism именно потому, что без таких оптимизаций модель слишком тяжела для обычного развёртывания.
