Версия 1 работы Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws датирована 7 апреля 2024 года и появилась на arXiv 8 апреля 2024 года; авторы — Zeyuan Allen-Zhu (Meta / FAIR) и Yuanzhi Li (MBZUAI). В 2025 году текст вышел на ICLR в формате extended abstract, но основной массив экспериментов и формулировки результатов уже был в полной версии 2024 года. Главный тезис статьи звучит резко: при достаточном обучении трансформер хранит около 2 bit/param фактических знаний. Это важно, потому что авторы пытаются измерять не loss и не бенчмарк-скор, а именно ответ на вопрос «сколько знаний в параметре».
Коротко
- Авторы определяют знание узко: как кортеж
(имя, атрибут, значение), например «человек — дата рождения — значение». - На контролируемых корпусах биографий модели GPT2-подобного типа при достаточном обучении выходят примерно на
2 bit/param; в статье это подаётся как базовый закон ёмкости знаний для их постановки. - Если ту же задачу учить заметно меньше, то ёмкость падает: в режиме
100 exposuresавторы сообщают около1 bit/param. - В их опытах пост-тренировочная квантизация до
int8почти не меняет ёмкость, аint4снижает её до примерно0.7 bit/param. - Работа говорит о хранении фактов, а не о рассуждении: другие части той же серии отдельно показывают, что сохранённое знание может плохо извлекаться и ещё хуже использоваться в задачах манипуляции знаниями.
Контекст: что значит «сколько знаний в параметре»
Классические scaling laws для LLM обычно отвечают на другой вопрос: как соотнести параметры, токены и вычисления, чтобы при фиксированном бюджете получить лучший loss. Именно так устроена, например, линия Chinchilla. Работа Allen-Zhu и Li спрашивает не «как выгоднее тренировать», а какова предельная ёмкость модели по фактам, если обучать её достаточно долго и на достаточно чистых данных.
Это важное смещение рамки. Для практики оно отделяет две разные проблемы: оптимальность тренировки и потолок памяти по знаниям. Если первая проблема отвечает за стоимость, то вторая — за то, может ли модель такого размера вообще вместить нужный объём фактов в своих весах.
Ещё один контекстный момент: статья не пытается измерить «всё знание мира». Она берёт более узкую и счётную единицу — кортеж факта. Поэтому её выводы лучше читать как исследование ёмкости для фактоидного знания, а не как общий закон для интеллекта, понимания или рассуждения.
Метод: как авторы оценивают знания в параметрах
Базовая единица знания в статье — тройка (name, attribute, value). Из таких троек авторы строят синтетические и полусинтетические биографии: один и тот же набор фактов можно переписывать шаблонами, менять порядок предложений или переписывать более «реалистично» с помощью Llama 2. В полной версии фигурируют несколько семейств данных, но логика у них одна: жёстко контролировать, какие факты попали в корпус и сколько раз модель их увидела.
Дальше авторы предобучают с нуля модели разных размеров и архитектур — GPT2, LLaMA, Mistral и варианты с изменёнными MLP-блоками. После этого они не просто смотрят на точность ответов, а переводят поведение модели в нижнюю оценку числа битов, которые она должна хранить, чтобы показывать такую точность на фактах. Затем это число делят на количество обучаемых параметров и получают capacity ratio.
кортежи фактов → тексты биографий → предобучение модели с нуля →
оценка числа сохранённых битов по loss → деление на число параметров
Ключевой технический термин статьи — exposure. Это не то же самое, что проход по датасету. Один проход по корпусу может показать один и тот же факт модели много раз; поэтому авторы считают именно число предъявлений факта. В их формулировке, чтобы выйти на базовый режим 2 bit/param, знание должно быть увидено примерно 1000 раз.
Метод важен ещё и потому, что он пытается развязать несколько факторов сразу: размер модели, длительность тренировки, качество данных, архитектуру, квантизацию и sparsity. Обычное сравнение по готовым бенчмаркам этого почти не позволяет, потому что там смешаны разные корпуса, разные рецепты обучения и разные семейства моделей.
Результаты
Ниже — результаты, которые повторяются и в полной версии от 7–8 апреля 2024 года, и в ICLR 2025 extended abstract. Там, где это важно, я сохраняю авторскую постановку, а не переношу её на все LLM вообще.
| Блок | Условие | Вывод статьи | Статус подтверждения |
|---|---|---|---|
| Базовый закон ёмкости | Контролируемые биографические датасеты, достаточное обучение | GPT2-подобные модели выходят примерно на 2 bit/param; авторы наблюдают верхнюю границу около 2.3 в своей постановке |
Полная версия 2024 + ICLR 2025 |
| Недообучение | 100 exposures вместо 1000 exposures |
Ёмкость падает примерно до 1 bit/param |
Полная версия 2024 + ICLR 2025 |
| Архитектура | GPT2, LLaMA, Mistral и варианты MLP | В режиме достаточного обучения различия малы; в режиме 100 exposures LLaMA/Mistral у авторов дают ёмкость примерно в 1.3x ниже GPT2, а виновником называют gated MLP |
Полная версия 2024 + ICLR 2025 |
| Квантизация | Пост-тренировочная квантизация GPTQ-подобным методом | int8 почти не меняет ёмкость; int4 снижает её примерно до 0.7 bit/param |
Полная версия 2024 + ICLR 2025 |
| MoE / sparsity | Mixture-of-Experts до 32 экспертов |
Падение ёмкости относительно dense-базовой линии около 1.3x, хотя на инференсе используется только 8.8% параметров |
Полная версия 2024 + ICLR 2025 |
| «Мусорные» данные | Соотношение полезных и junk-токенов 1:7 |
Потеря ёмкости для полезного знания может доходить до 20x; добавление специального токена к полезным данным улучшает этот провал до 2x в приведённом примере |
Полная версия 2024 + ICLR 2025 |
Самый обсуждаемый вывод — не только число 2 bit/param, но и авторская оценка его масштаба. В обеих версиях статьи они пишут, что достаточно обученная модель на 7B параметров может хранить около 14B бит знаний и, по их оценке, этого достаточно, чтобы превысить объём знаний английской Википедии и учебников. Здесь важно оставить формулировку именно как авторскую оценку: это не прямой аудит Википедии, а экстраполяция из их метрики.
Не менее интересен блок про junk-данные. В традиционном разговоре о scaling часто спорят о числе токенов, но эта работа показывает более жёсткую мысль: если большая часть токенов слабо полезна для фактоидного знания, реальная ёмкость для ценных фактов может проседать намного сильнее, чем подсказывает голое число параметров. И наоборот, даже простая маркировка «хороших» данных может заметно улучшить ситуацию.
Интерпретация
Наш комментарий
Для практиков главная ценность статьи не в том, чтобы запомнить магическое число 2. Ценность в другом: авторы предлагают отдельную ось анализа моделей — ёмкость хранения знаний. Она не заменяет loss, downstream-бенчмарки и стоимость обучения, но объясняет, почему иногда увеличение параметров действительно важно именно для knowledge-heavy сценариев.
Из статьи следует и менее удобный вывод: недостаточно просто «иметь много параметров». В их опытах качество корпуса и длительность обучения радикально меняют достижимую ёмкость. Если редкий факт увидели только около 100 раз, модель ведёт себя так, будто у неё вдвое меньше полезной памяти на факт, чем в насыщенном режиме. Для индустриальных пайплайнов это аргумент не только за размер модели, но и за учёт повторяемости, плотности полезных фактов и происхождения данных.
Практически интересен и результат со специальными токенами или доменными префиксами. Он не доказывает, что достаточно проставить wikipedia.org перед абзацами — и всё станет хорошо. Но он поддерживает более общую идею: метаданные источника могут быть полезным сигналом при предобучении, особенно если вы смешиваете корпуса разного качества.
Наконец, работа полезно остужает спор «dense против MoE». В авторской постановке sparse-модель теряет меньше, чем можно было бы ожидать по числу активных параметров на инференсе. Это не означает, что MoE автоматически лучше или хуже; это означает лишь, что падение качества sparse-моделей нельзя автоматически списывать на нехватку ёмкости по знаниям.
Ограничения
- Измеряется не «всё знание». Единица знания здесь — кортеж факта. Это хороший объект для подсчёта, но он уже уже, чем процедурное знание, commonsense, навыки рассуждения или мультимодальные представления.
- Корпус контролируемый, а не интернет-реальный. Синтетические и полусинтетические биографии нужны именно для чистоты измерения. Поэтому перенос числа
2 bit/paramна реальные frontier-модели нужно делать осторожно. - Число зависит от постановки и метрики. Авторы строят нижнюю оценку числа битов по loss. Это аккуратная и интересная конструкция, но всё же не прямое «считывание памяти» модели.
- Архитектурные выводы не стоит читать как абсолютный рейтинг семейств. Сама статья подчёркивает, что сильный разрыв между GPT2 и LLaMA/Mistral проявляется прежде всего в режиме недостаточного обучения
100 exposures, а при достаточном обучении различия гораздо слабее. - Результат по
int4относится к конкретной пост-тренировочной квантизации. Он не закрывает вопрос о quantization-aware training или других low-bit рецептах. - Хранение не равно извлечению. В Part 3.1 той же серии авторы отдельно показывают, что без достаточного разнообразия текста факт может быть запомнен, но плохо извлекаться через QA.
- Хранение не равно манипуляции знанием. В Part 3.2 авторы отдельно утверждают, что модели могут хорошо извлекать факт, но слабо выполнять даже простые операции над ним; в этой части серии они даже сообщают о virtually 0% на задаче inverse knowledge search в своей контролируемой постановке, и это важное предупреждение против слишком широких выводов.
Вывод
Physics of Language Models: Part 3.3 — это не универсальная теория знания в LLM, а аккуратная попытка дать измеримую единицу для памяти по фактам. В её собственной постановке главный результат прост: достаточно обученный трансформер хранит около 2 bit/param, но эта ёмкость резко зависит от качества данных и режима обучения. Для практики это, пожалуй, главный takeaway: спор о масштабировании нельзя сводить только к числу параметров — нужно отдельно думать о том, какие факты вы хотите хранить, как часто модель их видит и как помечены источники данных.
Источники
- Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws — полная версия работы от апреля 2024 года: постановка, метод и детальные результаты.
- Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws [Extended Abstract] — версия, опубликованная на ICLR 2025; подтверждает основные численные выводы и публикационный статус.
- Physics of Language Models – Part 3.3: Scaling Laws — официальный проектный сайт авторов с указанием исторического контекста версии и публикации.
- Physics of Language Models: Part 3.1, Knowledge Storage and Extraction — почему хранение факта не гарантирует его удобное извлечение после предобучения.
- Physics of Language Models: Part 3.2, Knowledge Manipulation — почему извлечённое знание не равно способности выполнять операции над ним.
- Training Compute-Optimal Large Language Models — базовый контекст для классических compute-oriented scaling laws.
- Resolving Discrepancies in Compute-Optimal Scaling of Language Models — более поздний контекст по спору о compute-optimal scaling и его воспроизводимости.
FAQ
- Это правда универсальный закон: 2 бита на параметр?
Нет, корректнее говорить так: в контролируемой постановке этой статьи авторы наблюдают около
2 bit/paramдля фактоидного знания при достаточном обучении. Это не доказанный закон для всех задач, всех данных и всех LLM. - Значит ли это, что 7B-модели достаточно для всех знаний мира?
Нет. Статья даёт только авторскую оценку для объёма знаний, представимых в их метрике, и отдельно оговаривает сравнение с английской Википедией и учебниками как оценочное.
- Почему авторы не меряют всё сразу на Википедии или Common Crawl?
Потому что тогда почти невозможно точно посчитать, сколько именно независимых фактов модель увидела и запомнила. Контролируемые биографии нужны, чтобы получить измеримую единицу ёмкости.
- Следует ли из работы, что int8-квантизация безопасна для любых downstream-задач?
Нет. Работа показывает, что в их измерении knowledge capacity пост-тренировочная квантизация до
int8почти не ухудшает хранение фактов. Это не равно гарантии по любому бенчмарку, агентной задаче или качеству рассуждения.
