В Cyberfreek обсуждают model collapse — риск потери разнообразия, когда модели обучают на результатах предыдущих моделей. Автор поста связывает эту проблему с ростом количества сгенерированных текстов и изображений в интернете.
Интересен здесь вопрос происхождения обучающих данных: как отличать человеческий материал от генерации и сохранять разнообразие выборки. Сам пост — повод для обсуждения, а не доказательство того, что любые синтетические данные неизбежно ухудшают модель.







