инструменты 1 мин

Как AI-компании готовят данные из интернета для обучения LLM

Автор показывает на практическом примере, как веб-краулинг превращается в пригодный для обучения корпус. Из 500 скачанных страниц (33.8 MB HTML) после нормализации, извлечения текста, дедупликации и фильтрации остаётся только 286 документов (1.3 MB). Статья объясняет, почему каждый этап конвейера критически важен и почему AI-лаборатории не могут просто скармливать сырой HTML в модель.

Полезно ML-инженерам и data-инженерам, которые строят data pipeline для обучения моделей, а также всем, кто хочет понять техническую сторону подготовки обучающих данных и связанные с ней юридические риски. Автор даёт не абстрактную схему, а рабочий код на GitHub с реальными цифрами.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • AI-компании создают «замороженный корпус» — фиксированный набор очищенных документов с чексуммами, чтобы обучение было воспроизводимым и юридически защищённым
  • Типичный конвейер включает 7+ этапов: фетчинг с fallback-цепочкой, нормализацию URL, извлечение текста, дедупликацию (точную и приближённую), фильтрацию по качеству и языку, запись манифеста
  • Основная причина не использовать сырые данные — воспроизводимость: страницы меняются, и через полгода невозможно ответить на вопрос «на чём именно обучалась модель», что критично для судебных разбирательств
  • Автор построил мини-версию такого пайплайна на примере Arch Linux Wiki, намеренно добавив дубликаты, talk-страницы, шаблоны и старые ревизии, чтобы показать работу каждого фильтра
LLMобучающие данныевеб-краулингdata engineeringдедупликацияdata pipeline
Юлия Тарасова Medium #llm
Читать оригинал

Ещё по теме

Комментарии