Когда ИИ ссылается на ИИ: реальный случай «галлюцинации» с доказательствами
Пользователь Reddit попросил ChatGPT подтвердить факт про слонов и львов. В ответ нейросеть дважды сослалась на AI-видео из Sora, выдавая его за реальное доказательство — даже после предупреждения. Случай высветил ключевую проблему: ИИ уже тренируется на собственных «отходах», и интернет заполняется синтетическим контентом, который выдаётся за настоящий.
Если ИИ начнёт массово тренироваться на собственных «галлюцинациях», качество моделей упадёт, поиск станет бесполезным, а редкие знания и культуры могут быть вытеснены из цифрового пространства. Проблема уже здесь, но решений пока нет.
Эксперимент с животными закончился тревожно
Пользователь Reddit развлекался, задавая ChatGPT гипотетические вопросы: кто кого победит — слон льва или лев слона. Когда попросил подтвердить утверждение, что слон может отбросить льва на десятки метров, нейросеть дала ссылку на видео в Instagram.
Проблема: это оказалось AI-видео из Sora. В ролике лев просто проходил мимо слона, а закадровый голос (тоже синтетический) говорил про бросок. ChatGPT принял это за реальное доказательство.
Двойная ошибка
Когда пользователь указал на фейк, ChatGPT извинился, признал проблему и пообещал предоставить «проверенные источники». Результат? Ссылка на то же самое видео.
Почему это важно
Это не просто глюк. Случай демонстрирует реальную угрозу деградации моделей:
- ИИ тренируется на данных из интернета
- Интернет уже наполнен AI-контентом (текст, фото, видео)
- Системы не всегда различают синтетику и оригинал
- Возникает feedback loop: ИИ учится на собственных «галлюцинациях»
Последствия
Автор поста выделяет несколько рисков:
- Поисковая деградация: выдача превратится в «пересказ пересказа пересказа»
- Исчезновение нишевых данных: редкие языки, болезни, культуры — всё, что не попадает в «статистическую норму» — может быть вытеснено шумом
- Опасная уверенность: модели выдают ерунду с видом эксперта
Что делается?
Быстрый поиск дал только общие заявления вроде «мы в курсе, работаем». Конкретных решений или регулирования пока нет. Компании-разработчики держат процессы фильтрации данных за закрытыми дверями.
Вопрос открыт: как гарантировать, что в обучающую выборку не попадёт синтетика? И есть ли вообще законы, это регулирующие?
Ключевые выводы
- ИИ уже путает AI-контент с реальными данными, используя Sora-видео как «доказательство»
- Возникает эффект «модельного каннибализма»: нейросети тренируются на своих же «отходах»
- Интернет превращается в замкнутый цикл синтетического контента без чёткой маркировки
- Нишевые данные (редкие языки, культуры, медицина) рискуют исчезнуть под слоем статистического шума
- Нет публичных стандартов или законов, гарантирующих чистоту обучающих данных
Автор: Елена Верещагина · Источник: reddit.com
**История простая, но жутковатая.** Человек попросил пруфы, получил фейк из Sora, указал на ошибку — и получил тот же фейк снова. Смешно? Да. Страшно? Тоже да. Потому что это не баг конкретной модели, а симптом системной проблемы: **ИИ уже ест сам себя**.
Интернет забит синтетикой, модели скребут всё подряд, различить оригинал от подделки сложно даже людям. Результат — feedback loop, где каждое следующее поколение моделей чуть хуже предыдущего. Ни OpenAI, ни Google не публикуют детали фильтрации данных, законов нет, а проблема растёт как снежный ком. Пока мы смеёмся над «слонами и львами», где-то медицинская нейросеть может учиться на AI-«исследованиях». Вот это уже не смешно.
Инструменты из статьи
Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.
Доступ из РФ →
Комментарии