Запись архива

«Physics of Language Models»: сколько знаний помещается в параметрах LLM

Разбираем работу Meta и MBZUAI о том, как измерять ёмкость знаний LLM в битах на параметр: что означает предел 2 бита, как его получили и почему это не равно «модель понимает мир».

Схема из пяти шагов: кортежи фактов, генерация биографий, предобучение моделей, оценка битовой ёмкости и деление на число параметров

Версия 1 работы Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws датирована 7 апреля 2024 года и появилась на arXiv 8 апреля 2024 года; авторы — Zeyuan Allen-Zhu (Meta / FAIR) и Yuanzhi Li (MBZUAI). В 2025 году текст вышел на ICLR в формате extended abstract, но основной массив экспериментов и формулировки результатов уже был в полной версии 2024 года. Главный тезис статьи звучит резко: при достаточном обучении трансформер хранит около 2 bit/param фактических знаний. Это важно, потому что авторы пытаются измерять не loss и не бенчмарк-скор, а именно ответ на вопрос «сколько знаний в параметре».

Коротко

  • Авторы определяют знание узко: как кортеж (имя, атрибут, значение), например «человек — дата рождения — значение».
  • На контролируемых корпусах биографий модели GPT2-подобного типа при достаточном обучении выходят примерно на 2 bit/param; в статье это подаётся как базовый закон ёмкости знаний для их постановки.
  • Если ту же задачу учить заметно меньше, то ёмкость падает: в режиме 100 exposures авторы сообщают около 1 bit/param.
  • В их опытах пост-тренировочная квантизация до int8 почти не меняет ёмкость, а int4 снижает её до примерно 0.7 bit/param.
  • Работа говорит о хранении фактов, а не о рассуждении: другие части той же серии отдельно показывают, что сохранённое знание может плохо извлекаться и ещё хуже использоваться в задачах манипуляции знаниями.

Контекст: что значит «сколько знаний в параметре»

Классические scaling laws для LLM обычно отвечают на другой вопрос: как соотнести параметры, токены и вычисления, чтобы при фиксированном бюджете получить лучший loss. Именно так устроена, например, линия Chinchilla. Работа Allen-Zhu и Li спрашивает не «как выгоднее тренировать», а какова предельная ёмкость модели по фактам, если обучать её достаточно долго и на достаточно чистых данных.

Это важное смещение рамки. Для практики оно отделяет две разные проблемы: оптимальность тренировки и потолок памяти по знаниям. Если первая проблема отвечает за стоимость, то вторая — за то, может ли модель такого размера вообще вместить нужный объём фактов в своих весах.

Ещё один контекстный момент: статья не пытается измерить «всё знание мира». Она берёт более узкую и счётную единицу — кортеж факта. Поэтому её выводы лучше читать как исследование ёмкости для фактоидного знания, а не как общий закон для интеллекта, понимания или рассуждения.

Метод: как авторы оценивают знания в параметрах

Базовая единица знания в статье — тройка (name, attribute, value). Из таких троек авторы строят синтетические и полусинтетические биографии: один и тот же набор фактов можно переписывать шаблонами, менять порядок предложений или переписывать более «реалистично» с помощью Llama 2. В полной версии фигурируют несколько семейств данных, но логика у них одна: жёстко контролировать, какие факты попали в корпус и сколько раз модель их увидела.

Дальше авторы предобучают с нуля модели разных размеров и архитектур — GPT2, LLaMA, Mistral и варианты с изменёнными MLP-блоками. После этого они не просто смотрят на точность ответов, а переводят поведение модели в нижнюю оценку числа битов, которые она должна хранить, чтобы показывать такую точность на фактах. Затем это число делят на количество обучаемых параметров и получают capacity ratio.

кортежи фактов → тексты биографий → предобучение модели с нуля →
оценка числа сохранённых битов по loss → деление на число параметров

Ключевой технический термин статьи — exposure. Это не то же самое, что проход по датасету. Один проход по корпусу может показать один и тот же факт модели много раз; поэтому авторы считают именно число предъявлений факта. В их формулировке, чтобы выйти на базовый режим 2 bit/param, знание должно быть увидено примерно 1000 раз.

Метод важен ещё и потому, что он пытается развязать несколько факторов сразу: размер модели, длительность тренировки, качество данных, архитектуру, квантизацию и sparsity. Обычное сравнение по готовым бенчмаркам этого почти не позволяет, потому что там смешаны разные корпуса, разные рецепты обучения и разные семейства моделей.

Результаты

Ниже — результаты, которые повторяются и в полной версии от 7–8 апреля 2024 года, и в ICLR 2025 extended abstract. Там, где это важно, я сохраняю авторскую постановку, а не переношу её на все LLM вообще.

Блок Условие Вывод статьи Статус подтверждения
Базовый закон ёмкости Контролируемые биографические датасеты, достаточное обучение GPT2-подобные модели выходят примерно на 2 bit/param; авторы наблюдают верхнюю границу около 2.3 в своей постановке Полная версия 2024 + ICLR 2025
Недообучение 100 exposures вместо 1000 exposures Ёмкость падает примерно до 1 bit/param Полная версия 2024 + ICLR 2025
Архитектура GPT2, LLaMA, Mistral и варианты MLP В режиме достаточного обучения различия малы; в режиме 100 exposures LLaMA/Mistral у авторов дают ёмкость примерно в 1.3x ниже GPT2, а виновником называют gated MLP Полная версия 2024 + ICLR 2025
Квантизация Пост-тренировочная квантизация GPTQ-подобным методом int8 почти не меняет ёмкость; int4 снижает её примерно до 0.7 bit/param Полная версия 2024 + ICLR 2025
MoE / sparsity Mixture-of-Experts до 32 экспертов Падение ёмкости относительно dense-базовой линии около 1.3x, хотя на инференсе используется только 8.8% параметров Полная версия 2024 + ICLR 2025
«Мусорные» данные Соотношение полезных и junk-токенов 1:7 Потеря ёмкости для полезного знания может доходить до 20x; добавление специального токена к полезным данным улучшает этот провал до 2x в приведённом примере Полная версия 2024 + ICLR 2025

Самый обсуждаемый вывод — не только число 2 bit/param, но и авторская оценка его масштаба. В обеих версиях статьи они пишут, что достаточно обученная модель на 7B параметров может хранить около 14B бит знаний и, по их оценке, этого достаточно, чтобы превысить объём знаний английской Википедии и учебников. Здесь важно оставить формулировку именно как авторскую оценку: это не прямой аудит Википедии, а экстраполяция из их метрики.

Не менее интересен блок про junk-данные. В традиционном разговоре о scaling часто спорят о числе токенов, но эта работа показывает более жёсткую мысль: если большая часть токенов слабо полезна для фактоидного знания, реальная ёмкость для ценных фактов может проседать намного сильнее, чем подсказывает голое число параметров. И наоборот, даже простая маркировка «хороших» данных может заметно улучшить ситуацию.

Интерпретация

Наш комментарий

Для практиков главная ценность статьи не в том, чтобы запомнить магическое число 2. Ценность в другом: авторы предлагают отдельную ось анализа моделей — ёмкость хранения знаний. Она не заменяет loss, downstream-бенчмарки и стоимость обучения, но объясняет, почему иногда увеличение параметров действительно важно именно для knowledge-heavy сценариев.

Из статьи следует и менее удобный вывод: недостаточно просто «иметь много параметров». В их опытах качество корпуса и длительность обучения радикально меняют достижимую ёмкость. Если редкий факт увидели только около 100 раз, модель ведёт себя так, будто у неё вдвое меньше полезной памяти на факт, чем в насыщенном режиме. Для индустриальных пайплайнов это аргумент не только за размер модели, но и за учёт повторяемости, плотности полезных фактов и происхождения данных.

Практически интересен и результат со специальными токенами или доменными префиксами. Он не доказывает, что достаточно проставить wikipedia.org перед абзацами — и всё станет хорошо. Но он поддерживает более общую идею: метаданные источника могут быть полезным сигналом при предобучении, особенно если вы смешиваете корпуса разного качества.

Наконец, работа полезно остужает спор «dense против MoE». В авторской постановке sparse-модель теряет меньше, чем можно было бы ожидать по числу активных параметров на инференсе. Это не означает, что MoE автоматически лучше или хуже; это означает лишь, что падение качества sparse-моделей нельзя автоматически списывать на нехватку ёмкости по знаниям.

Ограничения

  • Измеряется не «всё знание». Единица знания здесь — кортеж факта. Это хороший объект для подсчёта, но он уже уже, чем процедурное знание, commonsense, навыки рассуждения или мультимодальные представления.
  • Корпус контролируемый, а не интернет-реальный. Синтетические и полусинтетические биографии нужны именно для чистоты измерения. Поэтому перенос числа 2 bit/param на реальные frontier-модели нужно делать осторожно.
  • Число зависит от постановки и метрики. Авторы строят нижнюю оценку числа битов по loss. Это аккуратная и интересная конструкция, но всё же не прямое «считывание памяти» модели.
  • Архитектурные выводы не стоит читать как абсолютный рейтинг семейств. Сама статья подчёркивает, что сильный разрыв между GPT2 и LLaMA/Mistral проявляется прежде всего в режиме недостаточного обучения 100 exposures, а при достаточном обучении различия гораздо слабее.
  • Результат по int4 относится к конкретной пост-тренировочной квантизации. Он не закрывает вопрос о quantization-aware training или других low-bit рецептах.
  • Хранение не равно извлечению. В Part 3.1 той же серии авторы отдельно показывают, что без достаточного разнообразия текста факт может быть запомнен, но плохо извлекаться через QA.
  • Хранение не равно манипуляции знанием. В Part 3.2 авторы отдельно утверждают, что модели могут хорошо извлекать факт, но слабо выполнять даже простые операции над ним; в этой части серии они даже сообщают о virtually 0% на задаче inverse knowledge search в своей контролируемой постановке, и это важное предупреждение против слишком широких выводов.

Вывод

Physics of Language Models: Part 3.3 — это не универсальная теория знания в LLM, а аккуратная попытка дать измеримую единицу для памяти по фактам. В её собственной постановке главный результат прост: достаточно обученный трансформер хранит около 2 bit/param, но эта ёмкость резко зависит от качества данных и режима обучения. Для практики это, пожалуй, главный takeaway: спор о масштабировании нельзя сводить только к числу параметров — нужно отдельно думать о том, какие факты вы хотите хранить, как часто модель их видит и как помечены источники данных.

Источники

FAQ

  • Это правда универсальный закон: 2 бита на параметр?

    Нет, корректнее говорить так: в контролируемой постановке этой статьи авторы наблюдают около 2 bit/param для фактоидного знания при достаточном обучении. Это не доказанный закон для всех задач, всех данных и всех LLM.

  • Значит ли это, что 7B-модели достаточно для всех знаний мира?

    Нет. Статья даёт только авторскую оценку для объёма знаний, представимых в их метрике, и отдельно оговаривает сравнение с английской Википедией и учебниками как оценочное.

  • Почему авторы не меряют всё сразу на Википедии или Common Crawl?

    Потому что тогда почти невозможно точно посчитать, сколько именно независимых фактов модель увидела и запомнила. Контролируемые биографии нужны, чтобы получить измеримую единицу ёмкости.

  • Следует ли из работы, что int8-квантизация безопасна для любых downstream-задач?

    Нет. Работа показывает, что в их измерении knowledge capacity пост-тренировочная квантизация до int8 почти не ухудшает хранение фактов. Это не равно гарантии по любому бенчмарку, агентной задаче или качеству рассуждения.

Читайте также