#качество данных

И инструменты ·10 авг 2026

Старый OCR губит обучение AI: проект FineBooks переоцифровывает 300 тысяч книг с нуля

Hugging Face и EleutherAI протестировали 14 открытых OCR-моделей на 2000+ страниц исторических книг. Лучшие показали 97% точности за $2/1000 страниц — достаточно для обучения AI, но не для научной работы. Планируют переоцифровать 300 тыс. книг из Biodiversity Heritage Library, чтобы улучшить датасеты для открытых LLM.

0 81
И исследования ·3 авг 2026

Коллапс модели: что происходит, когда ИИ учится на данных, созданных ИИ

Когда языковая модель обучается на собственных выходных данных, происходит постепенное сужение распределения — дисперсия падает, редкие и разнообразные примеры исчезают. К 10-му поколению модель теряет 97,2% вероятностной массы хвостов распределения, становясь узкой и однообразной, хотя формально остаётся корректной.

0 74
И исследования ·28 июл 2026

Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro

Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.

0 71
Б безопасность ·21 июл 2026

Может ли ИИ решить проблему фрагментированных, ошибочных и отсутствующих данных в здравоохранении?

Медицинские организации активно внедряют ИИ для улучшения диагностики и персонализации лечения, но сталкиваются с фундаментальной проблемой: данные о пациентах разрозненны, неполны, устарели и часто содержат ошибки. Автор анализирует, почему даже самые продвинутые алгоритмы не могут компенсировать слабое качество исходной информации.

0 68