Коллапс модели: что происходит, когда ИИ учится на данных, созданных ИИ
Когда языковая модель обучается на собственных выходных данных, происходит постепенное сужение распределения — дисперсия падает, редкие и разнообразные примеры исчезают. К 10-му поколению модель теряет 97,2% вероятностной массы хвостов распределения, становясь узкой и однообразной, хотя формально остаётся корректной.
Исследователям и разработчикам LLM важно понять механику деградации моделей при рекурсивном обучении и необходимость активной курации данных для предотвращения коллапса разнообразия.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Стандартное отклонение падает с 1.000 до 0.197 за 10 поколений самообучения
- Даже добавление 50% реальных данных сохраняет лишь 42,4% исходной дисперсии
- К 2025 году 15-30% английского текста в интернете создано или дополнено ИИ
- Единственное полное решение — поддержание якорного корпуса качественных человеческих текстов
Ксения Лаврова
Medium #llm
Читать оригинал
Комментарии