Запись архива

Model collapse: что будет, если учить ИИ на ИИ

Разбор Nature-статьи Shumailov et al. о model collapse: почему рекурсивное обучение на данных от ИИ стирает хвосты распределения, что показали эксперименты на OPT-125m и где проходят границы этого вывода.

Схема model collapse: человеческие данные, модель 0, синтетические данные следующих поколений, исчезновение хвостов распределения и накопление ошибок

24 июля 2024 года в Nature вышла статья Ilia Shumailov и соавторов AI models collapse when trained on recursively generated data; позднее, 21 марта 2025 года, к ней была выпущена авторская поправка с исправлением обозначений в теоретическом разделе Author Correction. Работа ставит узкий, но практический вопрос: что будет, если новые поколения генеративных моделей всё сильнее учатся на текстах и изображениях, которые создали предыдущие модели. Главный тезис статьи: при рекурсивном обучении модель сначала теряет редкие события из «хвостов» распределения, а затем всё хуже отражает исходную реальность.

Это важно не только для академической теории. Если будущие модели продолжают собирать обучающие корпуса из веба, а веб постепенно насыщается синтетическим контентом, то петля «модель → сгенерированные данные → следующая модель» перестаёт быть мысленным экспериментом и становится инженерной проблемой Nature, arXiv.

Коротко

  • Model collapse в этой работе — это не просто «галлюцинации», а деградация распределения данных при рекурсивном обучении, когда редкие события пропадают первыми.
  • Теоретическая часть показывает: даже при очень простых генеративных процессах конечная выборка и повторный ресэмплинг уже достаточно, чтобы постепенно терять информацию об исходном распределении Nature, arXiv.
  • В языковой части статьи авторы используют OPT-125m, WikiText-2, 5-лучевой beam search, блоки по 64 токена и два режима обучения; в обоих режимах качество со временем деградирует, хотя при сохранении части реальных данных деградация мягче Nature, arXiv.
  • Важно не переобобщать результат: статья убедительно бьёт по бесконтрольной рекурсии и замещению реальных данных синтетическими, но не доказывает, что любые синтетические данные вредны всегда. Более поздние работы показывают, что режим смешивания и происхождение данных меняют картину Gerstgrasser et al., Seddik et al..

Контекст: почему вообще возник вопрос об обучении ИИ на ИИ

Исходная интуиция статьи проста. Современные генеративные модели учатся на больших корпусах текста, изображений и другого контента. Если значимая доля этого контента уже произведена предыдущими моделями, то следующее поколение начинает учиться не на мире как таковом, а на проекции мира, которую уже нарисовал предшественник Nature, arXiv.

Авторы называют это model collapse. В ранней стадии, по их определению, исчезают редкие события и «тонкие» режимы распределения; в поздней стадии модель сходится к распределению, которое всё меньше похоже на исходное и часто имеет резко сниженную вариативность Nature, arXiv.

Статья отдельно разводит model collapse, catastrophic forgetting и data poisoning. Это полезное различие. При catastrophic forgetting одна и та же модель теряет навык при последовательном обучении задачам; при model collapse проблема в другом: сами данные для следующего поколения уже искажены предшествующими моделями, поэтому ошибка начинает жить в обучающем распределении, а не только в весах одной конкретной сети Nature, arXiv.

Метод: что именно сделали Shumailov et al.

Работа устроена как связка из теории и эмпирики. Сначала авторы задают абстрактный цикл «данные поколения i → аппроксимация распределения → сэмплирование данных поколения i+1». В исправленной версии статьи важно, что для математических моделей они рассматривают режим, где в теоретическом анализе данные берутся только с одного предыдущего шага, а не накапливаются вместе с исходными; именно эту оговорку и исправила авторская поправка от 21 марта 2025 года Nature, Author Correction.

Дальше следуют три уровня анализа.

  • Дискретные распределения. Здесь авторы показывают интуицию на самом простом случае: при конечной выборке редкие состояния могут просто не попасть в очередной ресэмплинг. Если это произошло, следующее поколение уже не сможет их восстановить из воздуха.
  • Гауссово приближение. Для многомерного случая статья доказывает результат через расстояние Wasserstein-2: ожидаемое расхождение с исходным распределением растёт, а ковариация стремится к нулю, то есть распределение схлопывается.
  • Эксперименты на реальных моделях. Авторы смотрят на GMM, VAE и языковые модели, чтобы показать, что эффект не ограничивается игрушечной математикой Nature, arXiv.

Для языковой части выбран не pretraining с нуля, а более дешёвый и воспроизводимый proof of concept: fine-tuning модели OPT-125m на WikiText-2. Генерация синтетического корпуса шла через 5-лучевой beam search; текст разбивался на блоки по 64 токена, а затем для каждого блока модель предсказывала следующие 64 токена. Получившийся синтетический датасет делали того же размера, что и исходный, а каждый эксперимент повторяли 5 раз с разными сидами Nature, arXiv.

Авторы сравнивают два режима. Первый: 5 эпох и без сохранения исходных данных. Второй: 10 эпох и сохранение случайных 10% оригинального корпуса на каждом поколении. Отдельно они проверяют, не сводится ли наблюдаемый эффект лишь к банальным повторам, вводя штраф за повторение 2.0 Nature, arXiv.

Результаты: что показала статья

В теоретической части результат довольно жёсткий. Для дискретного случая редкие состояния постепенно выпадают из поддержки распределения; для гауссового приближения статья утверждает, что ожидаемое расстояние Wasserstein-2 до исходного распределения уходит вверх, а дисперсия схлопывается. На практическом языке это значит следующее: проблема начинается не тогда, когда модель внезапно начинает выдавать бессмыслицу, а раньше — когда она теряет редкие, но реальные режимы данных Nature, arXiv.

В языковом эксперименте исходная, не рекурсивная настройка действительно учит задачу: по данным самой статьи, модель на реальном WikiText-2 получает среднюю perplexity 34 против zero-shot baseline 115. После включения рекурсивного цикла качество начинает ухудшаться; в режиме без сохранения оригинальных данных авторы отдельно пишут о потере качества с 20 до 28 пунктов perplexity по мере поколений Nature, arXiv.

Самое интересное здесь — форма деградации. Масса сгенерированных последовательностей смещается к более «средним» и вероятным по оценке исходной модели примерам, но одновременно у поздних поколений появляется длинный хвост последовательностей, которые исходная модель почти не допустила бы. То есть рекурсивное обучение одновременно вымывает редкие нормальные случаи и накапливает собственные артефакты Nature, arXiv.

Блок работы Настройка Что измеряли Основной результат
Теория: дискретный случай Рекурсивный ресэмплинг конечной выборки Сохранение поддержки распределения Редкие состояния исчезают первыми; при повторении процесса распределение стремится к вырожденному состоянию Nature, arXiv.
Теория: гауссово приближение Фиксированный размер выборки, оценка среднего и ковариации Wasserstein-2 и ковариация Ожидаемое расхождение с исходным распределением растёт, а ковариация стремится к нулю Nature, arXiv.
LLM-эксперимент A OPT-125m + WikiText-2, 5 эпох, без исходных данных Perplexity на исходном тесте Авторы фиксируют деградацию качества; в тексте статьи для этого режима указана потеря с 20 до 28 пунктов perplexity Nature, arXiv.
LLM-эксперимент B OPT-125m + WikiText-2, 10 эпох, сохранение 10% исходных данных Perplexity и распределение последовательностей Деградация мягче, но признаки collapse сохраняются: хвосты растут, а поздние поколения добавляют неправдоподобные последовательности Nature, arXiv.
Абляция на повторах Штраф за повторение 2.0 Perplexity и форма распределения Устранение повторов не убирает проблему; по данным самой статьи perplexity в этом режиме удваивается относительно исходной настройки Nature, arXiv.

Практический вывод из таблицы такой: работа показывает не «магический порог», после которого всё рушится, а устойчивый механизм смещения распределения при рекурсивном обучении. Чем меньше возврат к оригинальным данным и чем длиннее цепочка поколений, тем сильнее накапливается ошибка в данных для следующей модели.

Интерпретация

Наш комментарий

Сильная сторона этой статьи — не страшный заголовок, а точное место удара. Авторы показывают, что опасность рекурсивного обучения состоит не только в появлении явного мусора. Более коварный эффект в том, что модель сначала теряет хвосты распределения: редкие факты, необычные формулировки, малочастотные режимы данных, а уже потом начинает заметно «сыпаться» на поверхности.

Для инженера это означает, что деградация может выглядеть как временное улучшение «среднего» поведения. Модель становится более гладкой, более предсказуемой, чаще выдаёт высоковероятные и шаблонные ответы — но именно в этот момент она может уже хуже покрывать реальный мир. Если система критична к исключениям, редким случаям или длинному хвосту задач, такая потеря разнообразия опаснее, чем отдельные зрелищные ошибки.

Ещё один важный вывод: статья Shumailov et al. прежде всего бьёт по бесконтрольной рекурсии и по замещению исходных данных синтетическими. Уже в 2024 году другие авторы показали, что режим имеет значение. Работа Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data утверждает, что накопление синтетических данных поверх реальных может не приводить к collapse, а How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse выводит условия, при которых смешивание real и synthetic данных может избегать collapse в пределе. В то же время A Tale of Tails и Strong Model Collapse предупреждают, что даже ограниченная синтетическая примесь способна менять scaling laws и оставлять устойчивый штраф по качеству. Это не опровержение Nature-статьи, а уточнение области применимости: всё зависит от режима подмешивания, курации и проверки данных.

Ограничения и критика

  • LLM-часть — это proof of concept, а не замер на frontier-pretraining. В статье использован OPT-125m и fine-tuning на WikiText-2, а не обучение с нуля модели масштаба GPT-4 или Llama 3. Поэтому вывод о механизме правдоподобен, но прямой перенос численного эффекта на крупнейшие закрытые модели был бы спекуляцией Nature, arXiv.
  • Режим синтетики здесь довольно узкий. Генерация шла через 5-лучевой beam search, с датасетом того же размера и на той же задаче. Работа не тестирует, например, агрессивную фильтрацию, verifier-based selection, self-training с внешней проверкой или сложные пайплайны дистилляции Nature, arXiv.
  • Позднейшая литература показывает, что «учить ИИ на ИИ» — слишком грубая формулировка. В одном режиме накопление real и synthetic данных способно стабилизировать ошибку Gerstgrasser et al.; в другом режиме небольшая доля synthetic данных всё равно меняет scaling behavior и создаёт устойчивый разрыв по качеству Dohmatob et al., Strong Model Collapse. То есть универсального простого правила пока нет.
  • Нужно читать исправленную версию. Авторская поправка от 21 марта 2025 года не отменяет основной вывод статьи, но исправляет обозначения в теоретической секции. Для технического разбора это важно: даже сильную работу стоит проверять по актуальной версии записи Author Correction, Nature.

Заключение

AI models collapse when trained on recursively generated data — это важная работа не потому, что она «запретила синтетику», а потому, что аккуратно показала конкретный механизм деградации при бесконтрольной рекурсии. Её главный вклад — идея, что модель сначала теряет хвосты распределения и только потом начинает заметно ломаться на поверхности.

Для практики это означает следующее: синтетические данные нельзя обсуждать в отрыве от происхождения, доли real-data, схемы накопления и внешней проверки. Если вы строите pipeline, в котором данные всё чаще происходят от самих моделей, вопрос уже не в том, «бывает ли model collapse», а в том, как именно ваш режим работы либо усиливает, либо сдерживает эту петлю.

Источники

FAQ

Model collapse — это просто другое название галлюцинаций?

Нет. В статье это более общий и более долгий процесс: распределение данных, на котором учится следующее поколение модели, постепенно сужается и искажается. Галлюцинации могут быть симптомом, но не исчерпывают явление.

Значит ли эта работа, что синтетические данные нельзя использовать вообще?

Нет. Nature-статья убедительно показывает риск бесконтрольной рекурсии и замещения real-data. Но последующие работы показывают, что при аккуратном смешивании, накоплении и проверке synthetic data картина может быть иной Gerstgrasser et al., Seddik et al..

Показано ли это прямо на самых больших современных LLM?

Нет. В языковой части статьи использовался OPT-125m и fine-tuning на WikiText-2. Это важный демонстрационный эксперимент, но не прямой отчёт о поведении закрытых frontier-моделей при полном pretraining.

Какой практический вывод для команд, которые строят data pipeline?

Нужны provenance, контроль доли synthetic-data, возврат к real-data и внешняя проверка качества. Сам по себе факт, что данные сгенерированы моделью, ещё не равен collapse; риск возникает, когда источник искажений перестаёт контролироваться и начинает рекурсивно усиливаться.

Читайте также