6 июня 2024 года Epoch AI опубликовала работу Pablo Villalobos и соавторов Will we run out of data? Limits of LLM scaling based on human-generated data; версия arXiv v2 вышла 4 июня 2024 года, а затем текст вошёл в Proceedings of ICML 2024, датированные 21-27 июля 2024 года. Работа отвечает не на широкий вопрос «закончится ли интернет», а на более узкий и технически важный: когда фронтирные LLM начнут упираться в эффективный запас публичного человеческого текста для pretraining.
Это важное уточнение. Авторы не утверждают, что текст буквально исчезнет, а оценивают момент, когда привычная схема масштабирования – больше вычислений и больше токенов – перестанет расширяться так же свободно, как раньше. Ниже разбираем именно версию оценки образца июня-июля 2024 года, а не подменяем её более поздними обсуждениями.
Коротко
- По оценке авторов работы образца июня 2024 года, эффективный запас пригодного для обучения публичного человеческого текста составляет около 300 трлн токенов; это модельная оценка, а не измеренный факт.
- В той же модели фронтирные языковые модели выходят к полному использованию этого запаса в интервале 2026-2032 годов; при сильном overtraining сроки сдвигаются раньше.
- Главная причина, почему прогноз стал позже по сравнению с версией 2022 года: фильтрованный веб-текст оказался полезнее, чем предполагалось, а повторные проходы по данным не так разрушительны, как считалось раньше.
- «Стена данных» в этой работе означает не конец прогресса, а смену узкого места: данные становятся сопоставимым ограничителем рядом с compute.
- Самые важные оговорки: работа считает только публичный человеческий текст, не включает значительную часть private/licensed data и отдельно подчёркивает неопределённость вокруг synthetic data.
Контекст: почему вообще говорят о «стене данных»
После работы DeepMind Training Compute-Optimal Large Language Models от 2022 года дискуссия о масштабировании изменилась. В упрощённом виде вывод был таким: если вы хотите тратить больше compute оптимально, вам обычно нужно наращивать не только число параметров, но и объём обучающих токенов. То есть рост вычислений автоматически тянет за собой рост спроса на данные.
Отсюда и вопрос Epoch AI. Если датасеты для языковых моделей растут экспоненциально, а объём нового человеческого текста в публичном доступе растёт намного медленнее, то рано или поздно возникает точка, где масштабирование упрётся не в GPU, а в данные. Именно эту точку авторы и называют data wall.
Важно и то, что работа 2024 года – это апдейт более ранней линии анализа. Первая версия идеи появилась в тексте, поданном на arXiv 26 октября 2022 года. Но к июню 2024 года авторы пересобрали ключевые допущения: что считать качественными веб-данными и насколько допустимо повторно прогонять один и тот же корпус через обучение.
Метод: как Epoch AI считала запас текста
Логика работы состоит из четырёх шагов.
- Сначала авторы оценивают запас публичного человеческого текста. Речь не обо всём, что теоретически существует в цифровом виде, а о публично доступном человеческом тексте, который можно рассматривать как источник pretraining-данных. В обсуждении работы авторы отдельно пишут, что сознательно выводят за скобки private data вроде личных сообщений, а также не включают в основной расчёт изображения, видео и synthetic data.
- Затем они переходят от сырого запаса к эффективному. Здесь появляются две поправки: на качество и на повторное использование. Качество нужно потому, что далеко не весь веб-текст одинаково полезен для обучения. Повторное использование нужно потому, что одни и те же данные можно прокрутить через обучение несколько раз, и это не обязательно обнуляет их ценность.
- Дальше оценивается спрос на данные. Для этого авторы используют две проекции. Первая – продолжение исторического тренда роста обучающих датасетов. Вторая – расчёт от compute через scaling laws, где размер оптимального датасета выводится из роста вычислительных бюджетов.
- Наконец, поверх этого добавляются сценарии overtraining. В терминах работы overtraining – это ситуация, когда модель обучают на большем числе токенов, чем предписывает compute-optimal режим. Авторы вводят упрощённую модель прибыли и показывают, что такой режим может быть экономически рационален, если inference-экономика важнее чистого качества на фиксированном compute.
Два внешних эмпирических аргумента особенно важны для версии 2024 года. Первый – работа The RefinedWeb Dataset for Falcon LLM, где авторы показывали, что тщательно отфильтрованный и дедуплицированный веб-текст может конкурировать с «курированными» корпусами. Второй – работа Scaling Data-Constrained Language Models, где показано, что при фиксированном compute повторение данных до нескольких эпох меняет loss куда слабее, чем можно было ожидать.
На практике это означает простой сдвиг: если веб-данные можно фильтровать лучше, а хороший корпус можно использовать не один раз, то оценка доступного «полезного текста» резко вырастает по сравнению с более консервативной версией 2022 года.
Результаты: что получилось в версии работы от июня 2024
Ключевые числа ниже стоит читать именно как оценки авторов в рамках их модели. Это не инвентаризация всего интернета и не прямое наблюдение за закрытыми датасетами лабораторий.
| Что оценивается | Что сообщает работа | При каких допущениях | Как это читать |
|---|---|---|---|
| Эффективный запас публичного человеческого текста | По оценке авторов – около 300 трлн токенов; 90% интервал: 100-1000 трлн | Учтены поправки на качество и многократные эпохи | Это не «весь текст в сети», а пригодный и повторно используемый запас для обучения |
| Момент полного использования этого запаса | По объединённой проекции авторов – в интервале 2026-2032 годов; на странице Epoch AI указан 80% интервал | Комбинируются исторический тренд роста датасетов и compute-based projection | Речь о достижении потолка для text-only scaling, а не о буквальном исчезновении новых текстов |
| Предел для compute-optimal сценария | Авторы пишут, что такого запаса хватило бы на обучение модели порядка 5e28 FLOP; в их ожиданиях этот масштаб достигался бы около 2028 года | Используется логика Chinchilla-style compute-optimal scaling | Даже без агрессивного overtraining текстовый запас становится заметным ограничителем |
| Сценарий умеренного overtraining | По модели авторов при 5x overtraining запас полностью используется к 2027 году | Экономика inference делает меньшие по параметрам модели привлекательнее | Если выгоднее экономить на inference, data wall приходит раньше |
| Сценарий сильного overtraining | По модели авторов при 100x overtraining потолок достигается уже в 2025 году | Очень агрессивное смещение в пользу inference-efficiency | Это не базовый прогноз, а чувствительный сценарий с сильными допущениями |
Отдельно важен апдейт относительно более ранней версии анализа. На странице Epoch AI авторы прямо объясняют сдвиг сроков двумя факторами. Во-первых, из-за новых результатов по фильтрованному веб-тексту их оценка качественного запаса выросла примерно в 5 раз относительно старой модели. Во-вторых, допущение о нескольких эпохах дало ещё один множитель порядка 2-5 раз. Именно поэтому ранняя тревога «данные закончатся почти сразу» в версии 2024 года стала заметно мягче.
Есть и важное календарное уточнение для читателя 2026 года. Формулировка про 2025 год в работе – это не общий дедлайн и не подтверждённый постфактум факт, а результат конкретного сценария с очень сильным overtraining. Базовая рамка самой работы – окно 2026-2032, а не одна магическая дата.
Интерпретация: что это значит для масштабирования
Самое полезное в работе – даже не конкретные годы, а смена объекта внимания. Она показывает, что в языковом pretraining узким местом может стать не только compute, но и происхождение, качество и повторная пригодность данных.
Для практиков это означает несколько вещей. Во-первых, pipeline данных перестаёт быть «грязной операционкой» и становится частью frontier-стратегии: фильтрация, дедупликация, оценка качества, лицензирование и provenance начинают влиять на итог почти так же сильно, как архитектурные решения. Во-вторых, сама ценность одной дополнительной единицы compute меняется, если ей некуда «приложиться» в виде новых токенов. В-третьих, растёт роль альтернативных осей прогресса: post-training, retrieval, multimodal learning, более эффективное использование фиксированного корпуса и inference-time strategies.
Наш комментарий
На наш взгляд, термин «стена данных» полезен ровно тогда, когда его не понимать буквально. Это не физическая стена и не момент, после которого LLM внезапно перестанут улучшаться. Скорее это переход от эпохи, где почти любой прирост качества можно было купить комбинацией «ещё больше GPU плюс ещё больше веб-текста», к эпохе, где каждая следующая ступень требует более сложной инженерии данных.
Отсюда и практический вывод для команд, которые не строят frontier model с нуля. Даже если вы не собираете сотни миллиардов токенов, тезис работы касается и прикладного уровня: выигрывать всё чаще будет не тот, у кого просто больше текста, а тот, кто лучше понимает, какой текст, в каком режиме и зачем используется.
Ограничения и критика
У этой работы есть сильный тезис, но и ограничений у неё много.
- Это оценка только для публичного человеческого текста. Авторы сами пишут, что не включают в главный расчёт private data, изображения, видео и synthetic data. Поэтому число в 300 трлн токенов нельзя читать как верхнюю границу вообще всех возможных обучающих сигналов.
- Понятие качества здесь неизбежно модельное. Работа RefinedWeb действительно поддерживает идею, что хорошо очищенный веб может быть очень сильным источником данных. Но это не значит, что любой большой веб-корпус автоматически равен качественному датасету.
- Несколько эпох – не то же самое, что бесконечная переработка одного и того же корпуса. Работа Muennighoff и соавторов показывает хорошие свойства повторения примерно до нескольких проходов, но не даёт лицензии на бесконечный reuse без деградации.
- Synthetic data не является бесплатной заменой человеческого текста. Nature-статья AI models collapse when trained on recursively generated data показывает риск рекурсивного обучения на сгенерированном контенте. При этом работа Is Model Collapse Inevitable? добавляет важный нюанс: смешивание реальных и синтетических данных может смягчать проблему. То есть ответ здесь не «synthetic data бесполезны», а «их нельзя считать простым эквивалентом нового человеческого корпуса».
- Спрос на данные зависит от экономики inference. Сценарии 5x и 100x overtraining строятся не из физики, а из поведенческой модели лабораторий. Если меняется стоимость inference, бизнес-модель API или требования к latency, сроки wall тоже сдвигаются.
- Наблюдаемость фронтирных датасетов ограничена. Публичные оценки вынуждены опираться на открытые описания, косвенные признаки и аналогии. Закрытые corpora, лицензии и внутренние фильтры крупнейших лабораторий внешнему исследователю известны лишь частично.
Есть и ещё один важный нюанс исторического масштаба. Уже 20 августа 2024 года Epoch AI выпустила более широкий отчёт Can AI scaling continue through 2030?, где отдельно обсуждаются multimodal и synthetic data как способы смягчить именно текстовую стену. Это не опровержение июньской работы, а напоминание: июньский результат лучше читать как text-only bottleneck report, а не как универсальный предел всего AI scaling.
Вывод
Отчёт Epoch AI 2024 полезен не потому, что называет одну «правильную» дату конца веб-текста, а потому, что переводит разговор о масштабировании из абстрактного «дадим больше GPU» в измеримую задачу про качество, происхождение и режим использования данных. В версии работы от июня-июля 2024 года центральный тезис звучит так: публичного человеческого текста ещё много, но уже недостаточно много, чтобы бесконечно поддерживать прежний темп text-only scaling без смены методов.
Если запомнить одну мысль, то вот она: «стена данных» – это не конец обучения, а конец наивной уверенности, что следующий скачок качества всегда можно купить просто новым куском интернета.
Источники
- Will we run out of data to train large language models? | Epoch AI
- Position: Will we run out of data? Limits of LLM scaling based on human-generated data | Proceedings of Machine Learning Research
- [2211.04325] Will we run out of data? Limits of LLM scaling based on human-generated data | arXiv
- Training Compute-Optimal Large Language Models | arXiv
- Scaling Data-Constrained Language Models | arXiv
- The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only | arXiv
- AI models collapse when trained on recursively generated data | Nature
- Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data | arXiv
- Can AI scaling continue through 2030? | Epoch AI
FAQ
Значит ли это, что текст для обучения уже «закончился»?
Нет. В работе речь идёт о полном использовании эффективного запаса публичного человеческого текста в ряде сценариев масштабирования, а не о том, что новый текст перестаёт появляться или что модели больше нельзя обучать.
Почему прогноз 2024 года мягче, чем ранняя тревога 2022 года?
Потому что в обновлённой версии авторы повысили оценку полезности фильтрованного веб-текста и допустили, что хороший корпус можно прогонять через обучение несколько раз без резкого обвала ценности.
Решают ли synthetic data проблему полностью?
Нет. Они могут помогать, особенно в узких доменах, но рекурсивное обучение на сгенерированном контенте создаёт риски деградации. Лучший вывод из литературы сегодня – synthetic data полезны как часть смеси, а не как автоматический заменитель реальных данных.
Что здесь важно для прикладных команд?
Смотреть на данные как на продукт: считать provenance, выстраивать фильтрацию и дедупликацию, учитывать лицензионные ограничения и не переоценивать идею, что любой дополнительный корпус одинаково полезен.
