Запись архива

Стена данных: когда закончится текст для обучения ИИ

Разбираем отчёт Epoch AI 2024 о «стене данных»: как авторы оценивали запас публичного человеческого текста, почему получили окно 2026-2032 и какие допущения стоят за этим прогнозом.

Схема, показывающая пересечение роста обучающих датасетов LLM с эффективным запасом публичного человеческого текста по модели Epoch AI

6 июня 2024 года Epoch AI опубликовала работу Pablo Villalobos и соавторов Will we run out of data? Limits of LLM scaling based on human-generated data; версия arXiv v2 вышла 4 июня 2024 года, а затем текст вошёл в Proceedings of ICML 2024, датированные 21-27 июля 2024 года. Работа отвечает не на широкий вопрос «закончится ли интернет», а на более узкий и технически важный: когда фронтирные LLM начнут упираться в эффективный запас публичного человеческого текста для pretraining.

Это важное уточнение. Авторы не утверждают, что текст буквально исчезнет, а оценивают момент, когда привычная схема масштабирования – больше вычислений и больше токенов – перестанет расширяться так же свободно, как раньше. Ниже разбираем именно версию оценки образца июня-июля 2024 года, а не подменяем её более поздними обсуждениями.

Коротко

  • По оценке авторов работы образца июня 2024 года, эффективный запас пригодного для обучения публичного человеческого текста составляет около 300 трлн токенов; это модельная оценка, а не измеренный факт.
  • В той же модели фронтирные языковые модели выходят к полному использованию этого запаса в интервале 2026-2032 годов; при сильном overtraining сроки сдвигаются раньше.
  • Главная причина, почему прогноз стал позже по сравнению с версией 2022 года: фильтрованный веб-текст оказался полезнее, чем предполагалось, а повторные проходы по данным не так разрушительны, как считалось раньше.
  • «Стена данных» в этой работе означает не конец прогресса, а смену узкого места: данные становятся сопоставимым ограничителем рядом с compute.
  • Самые важные оговорки: работа считает только публичный человеческий текст, не включает значительную часть private/licensed data и отдельно подчёркивает неопределённость вокруг synthetic data.

Контекст: почему вообще говорят о «стене данных»

После работы DeepMind Training Compute-Optimal Large Language Models от 2022 года дискуссия о масштабировании изменилась. В упрощённом виде вывод был таким: если вы хотите тратить больше compute оптимально, вам обычно нужно наращивать не только число параметров, но и объём обучающих токенов. То есть рост вычислений автоматически тянет за собой рост спроса на данные.

Отсюда и вопрос Epoch AI. Если датасеты для языковых моделей растут экспоненциально, а объём нового человеческого текста в публичном доступе растёт намного медленнее, то рано или поздно возникает точка, где масштабирование упрётся не в GPU, а в данные. Именно эту точку авторы и называют data wall.

Важно и то, что работа 2024 года – это апдейт более ранней линии анализа. Первая версия идеи появилась в тексте, поданном на arXiv 26 октября 2022 года. Но к июню 2024 года авторы пересобрали ключевые допущения: что считать качественными веб-данными и насколько допустимо повторно прогонять один и тот же корпус через обучение.

Метод: как Epoch AI считала запас текста

Логика работы состоит из четырёх шагов.

  1. Сначала авторы оценивают запас публичного человеческого текста. Речь не обо всём, что теоретически существует в цифровом виде, а о публично доступном человеческом тексте, который можно рассматривать как источник pretraining-данных. В обсуждении работы авторы отдельно пишут, что сознательно выводят за скобки private data вроде личных сообщений, а также не включают в основной расчёт изображения, видео и synthetic data.
  2. Затем они переходят от сырого запаса к эффективному. Здесь появляются две поправки: на качество и на повторное использование. Качество нужно потому, что далеко не весь веб-текст одинаково полезен для обучения. Повторное использование нужно потому, что одни и те же данные можно прокрутить через обучение несколько раз, и это не обязательно обнуляет их ценность.
  3. Дальше оценивается спрос на данные. Для этого авторы используют две проекции. Первая – продолжение исторического тренда роста обучающих датасетов. Вторая – расчёт от compute через scaling laws, где размер оптимального датасета выводится из роста вычислительных бюджетов.
  4. Наконец, поверх этого добавляются сценарии overtraining. В терминах работы overtraining – это ситуация, когда модель обучают на большем числе токенов, чем предписывает compute-optimal режим. Авторы вводят упрощённую модель прибыли и показывают, что такой режим может быть экономически рационален, если inference-экономика важнее чистого качества на фиксированном compute.

Два внешних эмпирических аргумента особенно важны для версии 2024 года. Первый – работа The RefinedWeb Dataset for Falcon LLM, где авторы показывали, что тщательно отфильтрованный и дедуплицированный веб-текст может конкурировать с «курированными» корпусами. Второй – работа Scaling Data-Constrained Language Models, где показано, что при фиксированном compute повторение данных до нескольких эпох меняет loss куда слабее, чем можно было ожидать.

На практике это означает простой сдвиг: если веб-данные можно фильтровать лучше, а хороший корпус можно использовать не один раз, то оценка доступного «полезного текста» резко вырастает по сравнению с более консервативной версией 2022 года.

Результаты: что получилось в версии работы от июня 2024

Ключевые числа ниже стоит читать именно как оценки авторов в рамках их модели. Это не инвентаризация всего интернета и не прямое наблюдение за закрытыми датасетами лабораторий.

Что оценивается Что сообщает работа При каких допущениях Как это читать
Эффективный запас публичного человеческого текста По оценке авторов – около 300 трлн токенов; 90% интервал: 100-1000 трлн Учтены поправки на качество и многократные эпохи Это не «весь текст в сети», а пригодный и повторно используемый запас для обучения
Момент полного использования этого запаса По объединённой проекции авторов – в интервале 2026-2032 годов; на странице Epoch AI указан 80% интервал Комбинируются исторический тренд роста датасетов и compute-based projection Речь о достижении потолка для text-only scaling, а не о буквальном исчезновении новых текстов
Предел для compute-optimal сценария Авторы пишут, что такого запаса хватило бы на обучение модели порядка 5e28 FLOP; в их ожиданиях этот масштаб достигался бы около 2028 года Используется логика Chinchilla-style compute-optimal scaling Даже без агрессивного overtraining текстовый запас становится заметным ограничителем
Сценарий умеренного overtraining По модели авторов при 5x overtraining запас полностью используется к 2027 году Экономика inference делает меньшие по параметрам модели привлекательнее Если выгоднее экономить на inference, data wall приходит раньше
Сценарий сильного overtraining По модели авторов при 100x overtraining потолок достигается уже в 2025 году Очень агрессивное смещение в пользу inference-efficiency Это не базовый прогноз, а чувствительный сценарий с сильными допущениями

Отдельно важен апдейт относительно более ранней версии анализа. На странице Epoch AI авторы прямо объясняют сдвиг сроков двумя факторами. Во-первых, из-за новых результатов по фильтрованному веб-тексту их оценка качественного запаса выросла примерно в 5 раз относительно старой модели. Во-вторых, допущение о нескольких эпохах дало ещё один множитель порядка 2-5 раз. Именно поэтому ранняя тревога «данные закончатся почти сразу» в версии 2024 года стала заметно мягче.

Есть и важное календарное уточнение для читателя 2026 года. Формулировка про 2025 год в работе – это не общий дедлайн и не подтверждённый постфактум факт, а результат конкретного сценария с очень сильным overtraining. Базовая рамка самой работы – окно 2026-2032, а не одна магическая дата.

Интерпретация: что это значит для масштабирования

Самое полезное в работе – даже не конкретные годы, а смена объекта внимания. Она показывает, что в языковом pretraining узким местом может стать не только compute, но и происхождение, качество и повторная пригодность данных.

Для практиков это означает несколько вещей. Во-первых, pipeline данных перестаёт быть «грязной операционкой» и становится частью frontier-стратегии: фильтрация, дедупликация, оценка качества, лицензирование и provenance начинают влиять на итог почти так же сильно, как архитектурные решения. Во-вторых, сама ценность одной дополнительной единицы compute меняется, если ей некуда «приложиться» в виде новых токенов. В-третьих, растёт роль альтернативных осей прогресса: post-training, retrieval, multimodal learning, более эффективное использование фиксированного корпуса и inference-time strategies.

Наш комментарий

На наш взгляд, термин «стена данных» полезен ровно тогда, когда его не понимать буквально. Это не физическая стена и не момент, после которого LLM внезапно перестанут улучшаться. Скорее это переход от эпохи, где почти любой прирост качества можно было купить комбинацией «ещё больше GPU плюс ещё больше веб-текста», к эпохе, где каждая следующая ступень требует более сложной инженерии данных.

Отсюда и практический вывод для команд, которые не строят frontier model с нуля. Даже если вы не собираете сотни миллиардов токенов, тезис работы касается и прикладного уровня: выигрывать всё чаще будет не тот, у кого просто больше текста, а тот, кто лучше понимает, какой текст, в каком режиме и зачем используется.

Ограничения и критика

У этой работы есть сильный тезис, но и ограничений у неё много.

  • Это оценка только для публичного человеческого текста. Авторы сами пишут, что не включают в главный расчёт private data, изображения, видео и synthetic data. Поэтому число в 300 трлн токенов нельзя читать как верхнюю границу вообще всех возможных обучающих сигналов.
  • Понятие качества здесь неизбежно модельное. Работа RefinedWeb действительно поддерживает идею, что хорошо очищенный веб может быть очень сильным источником данных. Но это не значит, что любой большой веб-корпус автоматически равен качественному датасету.
  • Несколько эпох – не то же самое, что бесконечная переработка одного и того же корпуса. Работа Muennighoff и соавторов показывает хорошие свойства повторения примерно до нескольких проходов, но не даёт лицензии на бесконечный reuse без деградации.
  • Synthetic data не является бесплатной заменой человеческого текста. Nature-статья AI models collapse when trained on recursively generated data показывает риск рекурсивного обучения на сгенерированном контенте. При этом работа Is Model Collapse Inevitable? добавляет важный нюанс: смешивание реальных и синтетических данных может смягчать проблему. То есть ответ здесь не «synthetic data бесполезны», а «их нельзя считать простым эквивалентом нового человеческого корпуса».
  • Спрос на данные зависит от экономики inference. Сценарии 5x и 100x overtraining строятся не из физики, а из поведенческой модели лабораторий. Если меняется стоимость inference, бизнес-модель API или требования к latency, сроки wall тоже сдвигаются.
  • Наблюдаемость фронтирных датасетов ограничена. Публичные оценки вынуждены опираться на открытые описания, косвенные признаки и аналогии. Закрытые corpora, лицензии и внутренние фильтры крупнейших лабораторий внешнему исследователю известны лишь частично.

Есть и ещё один важный нюанс исторического масштаба. Уже 20 августа 2024 года Epoch AI выпустила более широкий отчёт Can AI scaling continue through 2030?, где отдельно обсуждаются multimodal и synthetic data как способы смягчить именно текстовую стену. Это не опровержение июньской работы, а напоминание: июньский результат лучше читать как text-only bottleneck report, а не как универсальный предел всего AI scaling.

Вывод

Отчёт Epoch AI 2024 полезен не потому, что называет одну «правильную» дату конца веб-текста, а потому, что переводит разговор о масштабировании из абстрактного «дадим больше GPU» в измеримую задачу про качество, происхождение и режим использования данных. В версии работы от июня-июля 2024 года центральный тезис звучит так: публичного человеческого текста ещё много, но уже недостаточно много, чтобы бесконечно поддерживать прежний темп text-only scaling без смены методов.

Если запомнить одну мысль, то вот она: «стена данных» – это не конец обучения, а конец наивной уверенности, что следующий скачок качества всегда можно купить просто новым куском интернета.

Источники

FAQ

Значит ли это, что текст для обучения уже «закончился»?

Нет. В работе речь идёт о полном использовании эффективного запаса публичного человеческого текста в ряде сценариев масштабирования, а не о том, что новый текст перестаёт появляться или что модели больше нельзя обучать.

Почему прогноз 2024 года мягче, чем ранняя тревога 2022 года?

Потому что в обновлённой версии авторы повысили оценку полезности фильтрованного веб-текста и допустили, что хороший корпус можно прогонять через обучение несколько раз без резкого обвала ценности.

Решают ли synthetic data проблему полностью?

Нет. Они могут помогать, особенно в узких доменах, но рекурсивное обучение на сгенерированном контенте создаёт риски деградации. Лучший вывод из литературы сегодня – synthetic data полезны как часть смеси, а не как автоматический заменитель реальных данных.

Что здесь важно для прикладных команд?

Смотреть на данные как на продукт: считать provenance, выстраивать фильтрацию и дедупликацию, учитывать лицензионные ограничения и не переоценивать идею, что любой дополнительный корпус одинаково полезен.

Читайте также