#обучающие данные

И инструменты ·28 июл 2026

Как AI-компании готовят данные из интернета для обучения LLM

Автор показывает на практическом примере, как веб-краулинг превращается в пригодный для обучения корпус. Из 500 скачанных страниц (33.8 MB HTML) после нормализации, извлечения текста, дедупликации и фильтрации остаётся только 286 документов (1.3 MB). Статья объясняет, почему каждый этап конвейера критически важен и почему AI-лаборатории не могут просто скармливать сырой HTML в модель.

0 127
Б безопасность ·23 июл 2026

Когда ИИ ссылается на ИИ: реальный случай «галлюцинации» с доказательствами

Пользователь Reddit попросил ChatGPT подтвердить факт про слонов и львов. В ответ нейросеть дважды сослалась на AI-видео из Sora, выдавая его за реальное доказательство — даже после предупреждения. Случай высветил ключевую проблему: ИИ уже тренируется на собственных «отходах», и интернет заполняется синтетическим контентом, который выдаётся за настоящий.

0 33