исследования 1 мин

Коллапс модели: что происходит, когда ИИ учится на данных, созданных ИИ

Когда языковая модель обучается на собственных выходных данных, происходит постепенное сужение распределения — дисперсия падает, редкие и разнообразные примеры исчезают. К 10-му поколению модель теряет 97,2% вероятностной массы хвостов распределения, становясь узкой и однообразной, хотя формально остаётся корректной.

Исследователям и разработчикам LLM важно понять механику деградации моделей при рекурсивном обучении и необходимость активной курации данных для предотвращения коллапса разнообразия.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Стандартное отклонение падает с 1.000 до 0.197 за 10 поколений самообучения
  • Даже добавление 50% реальных данных сохраняет лишь 42,4% исходной дисперсии
  • К 2025 году 15-30% английского текста в интернете создано или дополнено ИИ
  • Единственное полное решение — поддержание якорного корпуса качественных человеческих текстов
Ксения Лаврова Medium #llm
Читать оригинал

Ещё по теме

Комментарии