Тезис о том, что большие языковые модели можно «перекормить» или, наоборот, недокормить данными, вошёл в практический словарь после работы DeepMind Training Compute-Optimal Large Language Models, выложенной 29 марта 2022 года. Хотя новый виток спора пришёлся на 2024 год, первоисточник здесь исторический: Chinchilla утверждала, что многие LLM эпохи GPT-3 и Gopher были не слишком маленькими, а скорее недообученными по числу токенов. Важно и другое: в индустрии словом «переобучение» здесь часто называют не классический overfitting, а over-training — обучение дольше compute-optimal точки ради других целей, прежде всего более дешёвого инференса.
Коротко
- Chinchilla не говорила, что «маленькие модели всегда лучше больших». Её тезис уже: при фиксированном бюджете обучения многие крупные модели 2020–2022 годов были недообучены по токенам.
- Исторический контекст важен: Kaplan et al. (2020) смещали оптимум в сторону роста параметров, а Hoffmann et al. (2022) нашли почти равный рост параметров и данных.
- «Перекорм» в современных обсуждениях обычно означает не классическое переобучение, а сознательный выход за Chinchilla-optimal режим ради более дешёвого развёртывания и лучшей downstream-полезности.
- Работы 2024 года показали, что оптимум зависит от целевой функции: если учитывать инференс и реальные продуктовые нагрузки, модель часто выгодно делать меньше и обучать дольше.
Контекст: что такое Chinchilla и откуда взялся разговор о «перекорме»
Отправная точка — работа Scaling Laws for Neural Language Models, опубликованная 23 января 2020 года. В ней Jared Kaplan и коллеги показали, что качество языковой модели подчиняется достаточно гладким законам масштабирования, а при фиксированном compute-буџете выгодно сильно увеличивать размер модели и не обязательно доводить её до минимально возможной потери. Эта логика хорошо совпала с практикой ранней эпохи сверхбольших LLM.
Дальше рынок пошёл именно в эту сторону. В GPT-3 OpenAI описывала модель на 175 млрд параметров, обученную на 300 млрд токенов; в Gopher DeepMind довела масштаб до 280 млрд параметров и тоже обучала модели семейства на 300 млрд токенов. В самой работе Chinchilla отдельно отмечено, что большая часть тогдашних крупных dense-моделей держалась примерно около планки в 300 млрд токенов.
29 марта 2022 года DeepMind опубликовала Training Compute-Optimal Large Language Models. Главный тезис был неудобным для тогдашнего консенсуса: при данном бюджете FLOPs многие большие модели получились undertrained, то есть им не хватало токенов относительно их размера. Вместо «делаем модель ещё больше» paper предлагал другой вопрос: не лучше ли сделать модель меньше, но обучать дольше.
Почему же в брифе стоит подсказка «2024»? Потому что именно в 2024 году тема вернулась уже в практической формулировке. Работы Gadre et al., Sardana et al. и Pearce и Song стали разбирать не только историческую правоту Chinchilla, но и вопрос, почему в реальных продуктах модели часто обучают дольше её compute-optimal точки.
Метод: как работает логика Chinchilla
Идея Chinchilla проще, чем кажется по формуле. Исследователь фиксирует бюджет предобучения и затем ищет, как лучше разделить его между числом параметров N и числом токенов D. В современной литературе для этого часто используют приближение C≈6ND, где C — тренировочный compute; такую запись явно обсуждают и более поздние разборы, например Reconciling Kaplan and Chinchilla Scaling Laws.
- Сначала выбирается фиксированный бюджет обучения.
- Потом обучаются серии меньших моделей и измеряется, как меняется loss при разных сочетаниях
NиD. - После этого строится «эффективная граница» — какие сочетания параметров и токенов дают минимальный loss при данном бюджете.
- Наконец, из этой границы выводится практическая рекомендация: увеличивать ли в следующем запуске прежде всего модель или прежде всего данные.
Разница между Kaplan и Chinchilla — в ответе на последний пункт. Kaplan исторически давал правило, которое сильнее толкало систему в рост параметров: в пересказе Pearce и Song это выражается как N_opt∝C^0.73 и D_opt∝C^0.27. Chinchilla же по трём своим подходам получила почти равновесный рост параметров и данных; в таблице paper DeepMind это близко к 0.50/0.50, 0.49/0.51 и 0.46/0.54.
Что здесь называют «переобучением»
Здесь важно не запутаться в терминах. В классическом ML переобучение — это ситуация, когда модель начинает слишком хорошо помнить train-распределение и хуже переносится на новые данные. В дискуссии вокруг Chinchilla под «перекормом» обычно имеют в виду другое: модель получает больше токенов, чем предписывает compute-optimal режим для минимизации pretraining loss. Это ближе к термину over-training из работ 2024 года, а не к обычному overfitting.
Результаты: что именно показала Chinchilla
Исторический сдвиг лучше всего видно на трёх знаковых моделях.
| Модель | Параметры | Токены обучения | Что это означало |
|---|---|---|---|
| GPT-3 | 175 млрд | 300 млрд | Типичная для 2020 года ставка на рост размера модели при относительно фиксированном бюджете данных. |
| Gopher | 280 млрд | 300 млрд | Ещё более крупная dense-модель, но всё ещё примерно в том же режиме по токенам. |
| Chinchilla | 70 млрд | 1,4 трлн | Меньше параметров, заметно больше токенов и сопоставимый training compute с Gopher. |
Для GPT-3 числа 175 млрд и 300 млрд подтверждаются одновременно paper OpenAI и пересказом в работе о Gopher. Для Gopher числа 280 млрд и 300 млрд совпадают между собственным paper DeepMind и таблицей 1 в paper Chinchilla. Для самой Chinchilla значение 70 млрд и 1,4 трлн есть в paper Hoffmann et al.; тот же порядок поддерживает и последующая репликация Chinchilla Scaling: A replication attempt.
Ключевой вывод был не в том, что «70B лучше 280B вообще». Вывод был точнее: при сопоставимом бюджете обучения меньшая модель, обученная намного дольше, может оказаться полезнее. В самой статье Hoffmann et al. это демонстрируется и на downstream-метриках: авторы отдельно выделяют результат около 67,5–67,6% на MMLU и прирост более чем на 7 процентных пунктов к Gopher. Это число мы приводим именно по paper Chinchilla: официальный блог DeepMind повторяет общий вывод о превосходстве, но без полной числовой таблицы.
Есть и важная редакторская деталь. В официальном блоге DeepMind написано о 1,3 трлн токенов, тогда как в самом paper и в таблице 1 фигурирует 1,4 трлн. Для технического разбора разумнее фиксировать значение из статьи, а расхождение честно отмечать.
Интерпретация
Если говорить совсем просто, Chinchilla сдвинула вопрос с «сколько параметров мы можем себе позволить» на «как правильно потратить фиксированный тренировочный бюджет». До неё многие команды фактически покупали качество в основном параметрами. После неё стало ясно, что в большом числе случаев выгоднее докупить качество токенами.
Наш комментарий
На наш взгляд, именно здесь и рождается миф о том, что современные модели «перекармливают». Chinchilla отвечает на один конкретный вопрос: как минимизировать pretraining loss при фиксированном compute предобучения. Но промышленная команда обычно решает другой вопрос: как получить лучшую модель на всём жизненном цикле, включая стоимость инференса, latency и объём пользовательских запросов.
Отсюда и сдвиг 2024 года. В аннотации Gadre et al. прямо сказано, что scaling laws чаще изучают в Chinchilla-optimal режиме, тогда как реальные модели нередко over-train, чтобы снизить стоимость инференса. А Sardana et al. формализуют ту же идею: если включить в целевую функцию инференс, оптимум может сместиться к меньшим моделям, обученным дольше. В их ICML-работе отдельно указано, что при достаточно большом ожидаемом спросе выгодно тренировать меньше и дольше, чем предписывает Chinchilla-optimal режим.
Иначе говоря, «перекорм» часто не ошибка, а смена целевой функции. Для исследователя, который оптимизирует только pretraining loss, это выход за оптимум. Для продуктовой команды это может быть рациональная экономия на каждом токене ответа.
Ограничения и критика
- Chinchilla — не универсальный закон природы. Она оптимизирует прежде всего loss следующего токена при фиксированном тренировочном compute. Это не то же самое, что оптимизация под RLHF, tool use, retrieval, мультимодальность или агентоориентированные сценарии.
- Коэффициенты масштабирования оказались чувствительны к методике. В Reconciling Kaplan and Chinchilla Scaling Laws показано, что часть расхождения между Kaplan и Chinchilla объясняется тем, считались ли embedding-параметры и на каких масштабах шёл фит. Это важное напоминание: сами коэффициенты зависят от способа измерения.
- Не вся Chinchilla equally robust в деталях. Besiroglu et al. (2024) попытались воспроизвести третий способ оценки из paper Hoffmann et al. и пришли к выводу, что именно этот параметрический фит был оценён не лучшим образом. При этом они не отменяют общий качественный вывод о важности большего числа токенов.
- Число токенов само по себе не описывает качество данных. В разделе о training details paper Chinchilla отдельно сказано, что модель обучали на том же MassiveText, что и Gopher, но с немного иным распределением подкорпусов. То есть «больше токенов» — это не просто механическое умножение объёма, а ещё и вопрос смеси данных.
- Экстраполяция за пределы типичных ratios остаётся спорной. Sardana et al. прямо предупреждают: если строить scaling laws только по данным с привычными ratios токенов к параметрам, можно переоценить отдачу от дополнительных токенов в экстремальном режиме. Поэтому правило «около 20 токенов на параметр» полезно как историческая эвристика, но не как вечная константа.
- Наконец, терминология сбивает с толку. Когда инженеры говорят, что модель «перекормили», они часто имеют в виду over-training относительно Chinchilla frontier, а не ухудшение generalization в классическом смысле. Для практики это принципиальная разница.
Вывод
Chinchilla не доказала, что большие модели бесполезны, и не ввела вечный запрет на «лишние» токены. Она показала более узкую, но очень важную вещь: для фиксированного бюджета предобучения многие LLM начала 2020-х были недообучены по данным.
Работы 2024 года добавили следующую ступень: если учитывать downstream-метрики и цену инференса, сознательное обучение дольше Chinchilla-optimal точки может быть рациональным. Поэтому вопрос сегодня звучит не «перекармливают ли модели», а «какой именно оптимум вы оптимизируете».
Источники
- Training Compute-Optimal Large Language Models — Jordan Hoffmann et al., arXiv, 29 марта 2022.
- An empirical analysis of compute-optimal large language model training — Google DeepMind Blog, 12 апреля 2022.
- Scaling Laws for Neural Language Models — Jared Kaplan et al., arXiv, 23 января 2020.
- Scaling Language Models: Methods, Analysis & Insights from Training Gopher — Jack W. Rae et al., arXiv, 8 декабря 2021.
- Language Models are Few-Shot Learners — Tom B. Brown et al., arXiv, 28 мая 2020.
- Language models scale reliably with over-training and on downstream tasks — Samir Yitzhak Gadre et al., arXiv, 13 марта 2024.
- Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws — Nikhil Sardana et al., ICML/PMLR, 2024.
- Reconciling Kaplan and Chinchilla Scaling Laws — Tim Pearce, Jinyeop Song, arXiv, 12 июня 2024.
- Chinchilla Scaling: A replication attempt — Tamay Besiroglu et al., arXiv, 15 апреля 2024.
FAQ
Chinchilla и классическое переобучение — это одно и то же?
Нет. Вокруг Chinchilla чаще обсуждают over-training относительно compute-optimal точки, а не классический overfitting с ухудшением обобщения.
Нужно ли всем моделям следовать правилу «около 20 токенов на параметр»?
Нет. Это полезная историческая эвристика из дискуссии вокруг Chinchilla, но работы 2024 года показывают, что оптимум зависит от цели: pretraining loss, downstream-задачи, инференс или суммарная стоимость владения.
Почему меньшая модель может обойти большую?
Потому что большая модель может быть недообучена по токенам. При том же тренировочном бюджете меньшая модель, обученная дольше, иногда получает лучший trade-off качества и стоимости.
Почему тема снова стала важной в 2024 году?
Потому что исследователи начали учитывать не только compute предобучения, но и инференс, а также напрямую изучать режимы over-training и их связь с downstream-метриками.
Читайте также
- Стена данных: когда закончится текст для обучения ИИ — следующий вопрос после Chinchilla: где брать токены, если обучать нужно дольше.
- Llama 3.1 405B: что показала открытая модель уровня фронтира — как тема масштабирования выглядит уже в более позднем поколении frontier-моделей.
- Как читать AI-paper и не утонуть в абстрактном хайпе — если хотите самостоятельно разбирать papers про scaling laws и не путать факт с интерпретацией.
