Запись архива

Llama 3.1 405B: действительно ли открытые веса догнали фронтир

23 июля 2024 года Meta выпустила Llama 3.1 405B и заявила, что открытая модель уровня frontier наконец сравнялась с закрытыми системами. Разбираем paper, model card, лицензию и внешние сигналы без пересказа хайпа.

Сравнение Llama 3.1 405B с GPT-4, GPT-4o и Claude 3.5 Sonnet по MMLU, GPQA, HumanEval и long-context тестам

23 июля 2024 года Meta выпустила Llama 3.1 405B и одновременно опубликовала paper The Llama 3 Herd of Models. Исторический вопрос был простой: может ли модель с доступными весами приблизиться к закрытому frontier-классу не только по риторике, но и по измеримым задачам. Короткий ответ: по части тестов — да, по части — нет, но именно эта смесь сильных и слабых мест и сделала релиз важным для практиков.

Ниже — разбор именно релиза Meta от 23 июля 2024 года и его исходных материалов. Мы не подменяем исторический контекст более новыми моделями и отдельно отмечаем, где речь идёт о данных из единственного публичного источника — самой статьи Meta.

Коротко

  • Llama 3.1 405B — это dense decoder-only Transformer на 405 млрд параметров, а не MoE; Meta обучала его на 15.6T токенов и расширила окно контекста до 128K.
  • По таблице 2 статьи Meta модель действительно подошла к frontier-уровню: на отдельных задачах она обгоняла GPT-4 (0125) и была близка к GPT-4o и Claude 3.5 Sonnet, но не становилась безусловным лидером.
  • Главный практический эффект релиза — не только качество, но и доступность весов для дистилляции, синтетических данных, тонкой настройки и системных экспериментов.
  • Точное определение важно: у Llama 3.1 открыты веса, но распространение идёт по кастомной Community License, поэтому в строгом смысле это не то же самое, что OSI-совместимый open source.
  • Ограничения существенные: многие громкие сравнения исходят из внутренних оценок Meta, а запуск 405B даже после FP8-оптимизаций оставался инфраструктурно дорогим.

Контекст: что именно Meta показала в июле 2024 года

В двух официальных постах от 23 июля 2024 года Meta называла Llama 3.1 405B своей самой мощной на тот момент моделью и описывала её как первую открыто доступную модель уровня frontier. В том же релизе компания обновила семейство 8B и 70B, добавив 128K контекст, поддержку восьми языков и улучшения в tool use.

Для практиков важно, что релиз был не просто маркетинговым анонсом. Meta одновременно выложила веса, paper, model card, отдельный текст про безопасный релиз, а также reference-system и инструменты вроде Llama Guard 3 и Prompt Guard. То есть 405B задумывалась не как «одна большая модель», а как центральный элемент более широкой системы разработки.

Но здесь же появляется важная оговорка по теме «открытости». В постах Meta использует формулировки open source и openly available, тогда как model card и лицензионный текст прямо говорят о Llama 3.1 Community License — кастомной коммерческой лицензии. А определение Open Source Initiative требует, чтобы лицензия не ограничивала перераспределение, области применения и дополнительные права получателей. Поэтому в технически аккуратном русском описании Llama 3.1 405B точнее называть моделью с открытыми весами или публично доступной моделью, а не просто «open source» без оговорок.

Метод: как устроена Llama 3.1 405B

Архитектура и масштаб

Сильная сторона релиза не в экзотической архитектуре, а в сочетании масштаба и инженерной дисциплины. Meta подчёркивает в посте и в paper, что 405B — это стандартный плотный decoder-only Transformer с небольшими адаптациями, а не mixture-of-experts. Выбор был сделан в пользу устойчивости обучения и более прямолинейного масштабирования.

По статье Meta, флагманская модель была предобучена на 15.6 трлн текстовых токенов; в blog-post эта же история огрублена как over 15 trillion tokens. В paper сказано, что обучение шло на кластере до 16 тысяч H100, а model card отдельно фиксирует инфраструктурный след: суммарно семейство Llama 3.1 потребовало 39.3 млн GPU-часов, из которых на 405B пришлись 30.84 млн. Последняя цифра публично встречается в model card; независимой внешней сверки Meta не приводит.

Длинный контекст и многоязычность

Важное отличие именно версии 3.1 от первых Llama 3 апреля 2024 года — длинный контекст и многоязычность как штатные свойства семейства. В paper Meta пишет, что основное предобучение шло с окном 8K, а затем продолженное обучение увеличило поддерживаемое окно до 128K. Model card и анонс также фиксируют восемь поддерживаемых языков: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский.

Постобучение и tool use

Постобучение Meta описывает довольно прозрачно. Базовая схема — SFT, rejection sampling и DPO; в blog-post и в paper подчёркивается, что значительная часть SFT-данных была синтетической. В статье Meta прямо пишет, что использовала 405B для улучшения качества постобучения меньших моделей, то есть флагман работал не только как конечный продукт, но и как teacher model.

Отдельный слой — tool use. В paper перечислены интеграции с поиском, Python-интерпретатором и Wolfram Alpha API. Это важно не потому, что инструменты были уникальны сами по себе, а потому, что Meta уже в 2024 году строила вокруг Llama не только «чат-модель», но и заготовку для агентных систем и внешних вызовов.

Инференс: почему FP8 был не косметикой

Для 405B вопрос инференса был не вторичным. В blog-post Meta пишет, что перевела модель с BF16 к FP8-числам, чтобы снизить вычислительные требования и уместить запуск в один серверный узел. В самой статье формулировка точнее: BF16-версия не помещалась в память одной машины с 8 H100, поэтому BF16-инференс распараллеливали на 16 GPU и две машины; FP8 и pipeline parallelism были нужны, чтобы сделать продакшен-инференс практичнее. То есть «открытые веса догнали фронтир» не означало «каждый может легко поднять 405B локально».

Llama 3.1 405B: результаты и сравнение с frontier-моделями

Ниже — ключевые строки из Table 2 статьи Meta. Это удобный сводный источник, но важно помнить: все числа в таблице исходят из единственного публичного источника — самой статьи Meta, а протоколы местами различаются по подсказкам и API-версиям конкурентов. Поэтому таблицу стоит читать как сильный сигнал, а не как окончательный независимый вердикт.

Бенчмарк Llama 3.1 405B GPT-4 (0125) GPT-4o Claude 3.5 Sonnet
MMLU (5-shot) 87.3 85.1 89.1 89.9
IFEval 88.6 84.3 85.6 88.0
HumanEval (0-shot) 89.0 86.6 90.2 92.0
GSM8K (8-shot, CoT) 96.8 94.2 96.1 96.4
MATH (0-shot, CoT) 73.8 64.5 76.6 71.1
ARC Challenge (0-shot) 96.9 96.4 96.7 96.7
GPQA (0-shot, CoT) 51.1 41.4 53.6 59.4
BFCL 88.5 88.3 80.5 90.2
Nexus 58.7 50.3 56.1 45.7
ZeroSCROLLS/QuALITY 95.2 95.2 90.5 90.5
InfiniteBench/En.MC 83.4 72.1 82.5
NIH/Multi-needle 98.1 100.0 100.0 90.8
Multilingual MGSM (0-shot, CoT) 91.6 85.9 90.5 91.6

Если читать эту таблицу буквально, картина получается не «405B победила всех», а «405B вошла в верхний класс и местами сравнялась с ним». По данным самой Meta, модель обходит GPT-4 (0125) на ряде задач общего знания, инструктивности, математики, reasoning и multilingual reasoning. Но на задачах вроде GPQA и HumanEval она уступает лучшим закрытым конкурентам того момента — особенно Claude 3.5 Sonnet.

Интересен и блок длинного контекста. По Table 2 Llama 3.1 405B выглядит сильно на ZeroSCROLLS/QuALITY и InfiniteBench/En.MC, но не доминирует на NIH/Multi-needle, где GPT-4 и GPT-4o получают более высокие значения. Это хорошо согласуется с более осторожной инженерной интерпретацией: длинный контекст появился не как «магическое окно 128K», а как новая рабочая способность с конкретными сильными и слабыми режимами.

Есть и второй слой результатов — человеческие оценки. В разделе 5.3 paper Meta пишет, что в парных human eval Llama 3 405B была примерно на уровне GPT-4 (0125), а против GPT-4o и Claude 3.5 Sonnet показывала смешанную картину: лучше на части английских и multiturn-задач, слабее на части reasoning, coding и некоторых multilingual prompts. Это снова скорее аргумент в пользу формулировки «добралась до frontier-класса», чем «стала безусловным frontier-лидером».

Наконец, есть внешняя, пусть и не полностью сопоставимая, проверка. В посте LMSYS от 29 августа 2024 года о style-controlled Chatbot Arena команда пишет, что Llama-3.1-405B поднялась до 3-го места в подмножестве Hard Prompts после контроля длины и markdown-стиля ответа. Это не верификация всех чисел Meta, но полезный внешний сигнал: 405B действительно воспринималась как модель высшего класса и вне внутренней таблицы самой Meta.

Интерпретация

Наш комментарий

Главный смысл релиза Llama 3.1 405B был не в том, что «open победил closed». Гораздо точнее другое: впервые модель с публично доступными весами оказалась достаточно близко к верхнему закрытому эшелону, чтобы стать полноценным инструментом исследований и прикладной разработки. С этого момента открытые веса можно было обсуждать не как учебный компромисс, а как базу для серьёзных production- и research-сценариев.

Для практиков это означало минимум три вещи. Во-первых, появилась большая teacher-модель для синтетических датасетов и дистилляции, причём Meta прямо разрешила использовать outputs Llama для улучшения других моделей. Во-вторых, open-weight фронтир сделал реальнее сценарии on-prem, аудита, кастомной тонкой настройки и системного контроля, где закрытые API-модели неудобны по юридическим или инфраструктурным причинам. В-третьих, 405B ускорила всю экосистему оптимизаций — от FP8-инференса и vLLM до квантования и новых способов оценивать большие модели вне API-вендоров.

Но не менее важно то, чего релиз не доказал. Он не показал, что открытые модели уже устойчиво обгоняют закрытые. Он не снял инфраструктурный барьер. И он не решил спор об «открытости» в юридическом смысле: веса доступны, но governance, лицензия и данные остаются под контролем Meta.

Ограничения и критика

  • Сильная зависимость от self-reported evals. Самая цитируемая сравнительная таблица против GPT-4o и Claude 3.5 Sonnet находится в paper Meta. Это нормальный стартовый источник, но не независимая репликация.
  • Неидеальная сопоставимость протоколов. В Table 2 есть сноски о разных prompting-режимах для отдельных моделей и задач. Поэтому разрывы в несколько пунктов не всегда стоит трактовать как абсолютный порядок сил.
  • Инфраструктурная цена остаётся фронтирной. По статье Meta, BF16-инференс 405B требовал 16 H100 на двух машинах, а FP8 нужен был именно для снижения этого барьера. Для большинства команд 405B оставалась скорее облачной или специализированной, чем «локальной», моделью.
  • Это не классический open source. Llama 3.1 распространяется по Community License, а в лицензии есть дополнительные коммерческие условия, включая порог 700 млн MAU. Это заметно отличается от OSI-логики свободного перераспределения прав.
  • Открыты веса, но не весь стек обучения. Meta не публикует полный тренировочный датасет. Для науки и воспроизводимости это важный предел «открытости».
  • Языковая и безопасностная рамка уже, чем звучит в заголовках. Model card официально поддерживает восемь языков и отдельно предупреждает, что использование за пределами этого списка требует дополнительной настройки и safeguards.
  • Безопасность вынесена на системный уровень. И paper, и отдельный пост Meta прямо говорят, что Llama 3.1 не должна разворачиваться изолированно; нужны Llama Guard 3, Prompt Guard и прикладные правила разработчика. Иначе «открытые веса» превращаются не в свободу, а в операционный риск.

Итог

Llama 3.1 405B стала важной не потому, что мгновенно закрыла гонку с GPT-4o и Claude 3.5 Sonnet. Она важна потому, что на дату релиза 23 июля 2024 года впервые сделала open-weight сегмент достаточно сильным, чтобы его приходилось сравнивать с закрытым frontier всерьёз, по одним и тем же задачам. Для индустрии это был не конец лидерства закрытых моделей, а начало новой фазы: открытые веса перестали быть периферией.

Источники

FAQ

Это open source или open weights?

С инженерной точки зрения удобнее говорить open weights. Веса доступны, но лицензия кастомная, с дополнительными условиями, поэтому в строгом OSI-смысле это не обычный open source.

В чём Llama 3.1 405B реально догнала закрытые модели?

По данным статьи Meta — в общем знании, инструктивности, части math/reasoning, tool use и части long-context задач. Но на coding и научном reasoning, особенно по GPQA и HumanEval, лучшие закрытые модели того момента оставались впереди.

Почему релиз был важен, если модель не стала номером один?

Потому что с 405B открытые веса стали годиться не только для экспериментов на обочине, но и для дистилляции, тонкой настройки, аудита, on-prem-сценариев и системных исследований уровня frontier.

Можно ли было просто скачать и запустить 405B у себя?

Скачать — да. Но практический запуск требовал серьёзной инфраструктуры. Meta отдельно описывала FP8 и pipeline parallelism именно потому, что без таких оптимизаций модель слишком тяжела для обычного развёртывания.

Читайте также