безопасность 1 мин

Когда ИИ ссылается на ИИ: реальный случай «галлюцинации» с доказательствами

Пользователь Reddit попросил ChatGPT подтвердить факт про слонов и львов. В ответ нейросеть дважды сослалась на AI-видео из Sora, выдавая его за реальное доказательство — даже после предупреждения. Случай высветил ключевую проблему: ИИ уже тренируется на собственных «отходах», и интернет заполняется синтетическим контентом, который выдаётся за настоящий.

Если ИИ начнёт массово тренироваться на собственных «галлюцинациях», качество моделей упадёт, поиск станет бесполезным, а редкие знания и культуры могут быть вытеснены из цифрового пространства. Проблема уже здесь, но решений пока нет.

Эксперимент с животными закончился тревожно

Пользователь Reddit развлекался, задавая ChatGPT гипотетические вопросы: кто кого победит — слон льва или лев слона. Когда попросил подтвердить утверждение, что слон может отбросить льва на десятки метров, нейросеть дала ссылку на видео в Instagram.

Проблема: это оказалось AI-видео из Sora. В ролике лев просто проходил мимо слона, а закадровый голос (тоже синтетический) говорил про бросок. ChatGPT принял это за реальное доказательство.

Двойная ошибка

Когда пользователь указал на фейк, ChatGPT извинился, признал проблему и пообещал предоставить «проверенные источники». Результат? Ссылка на то же самое видео.

Почему это важно

Это не просто глюк. Случай демонстрирует реальную угрозу деградации моделей:

  • ИИ тренируется на данных из интернета
  • Интернет уже наполнен AI-контентом (текст, фото, видео)
  • Системы не всегда различают синтетику и оригинал
  • Возникает feedback loop: ИИ учится на собственных «галлюцинациях»

Последствия

Автор поста выделяет несколько рисков:

  1. Поисковая деградация: выдача превратится в «пересказ пересказа пересказа»
  2. Исчезновение нишевых данных: редкие языки, болезни, культуры — всё, что не попадает в «статистическую норму» — может быть вытеснено шумом
  3. Опасная уверенность: модели выдают ерунду с видом эксперта

Что делается?

Быстрый поиск дал только общие заявления вроде «мы в курсе, работаем». Конкретных решений или регулирования пока нет. Компании-разработчики держат процессы фильтрации данных за закрытыми дверями.

Вопрос открыт: как гарантировать, что в обучающую выборку не попадёт синтетика? И есть ли вообще законы, это регулирующие?

Ключевые выводы

  • ИИ уже путает AI-контент с реальными данными, используя Sora-видео как «доказательство»
  • Возникает эффект «модельного каннибализма»: нейросети тренируются на своих же «отходах»
  • Интернет превращается в замкнутый цикл синтетического контента без чёткой маркировки
  • Нишевые данные (редкие языки, культуры, медицина) рискуют исчезнуть под слоем статистического шума
  • Нет публичных стандартов или законов, гарантирующих чистоту обучающих данных
model collapseгаллюцинацииобучающие данныесинтетический контентдеградация моделей

Автор: Елена Верещагина · Источник: reddit.com

Мнение редакции

**История простая, но жутковатая.** Человек попросил пруфы, получил фейк из Sora, указал на ошибку — и получил тот же фейк снова. Смешно? Да. Страшно? Тоже да. Потому что это не баг конкретной модели, а симптом системной проблемы: **ИИ уже ест сам себя**.

Интернет забит синтетикой, модели скребут всё подряд, различить оригинал от подделки сложно даже людям. Результат — feedback loop, где каждое следующее поколение моделей чуть хуже предыдущего. Ни OpenAI, ни Google не публикуют детали фильтрации данных, законов нет, а проблема растёт как снежный ком. Пока мы смеёмся над «слонами и львами», где-то медицинская нейросеть может учиться на AI-«исследованиях». Вот это уже не смешно.

Инструменты из статьи

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →
SoraVPN

Генератор видео от OpenAI: по тексту создаёт реалистичные ролики с...

Доступ из РФ →

Ещё по теме

Комментарии