Старый OCR губит обучение AI: проект FineBooks переоцифровывает 300 тысяч книг с нуля
Hugging Face и EleutherAI протестировали 14 открытых OCR-моделей на 2000+ страниц исторических книг. Лучшие показали 97% точности за $2/1000 страниц — достаточно для обучения AI, но не для научной работы. Планируют переоцифровать 300 тыс. книг из Biodiversity Heritage Library, чтобы улучшить датасеты для открытых LLM.
Старые OCR-тексты режут эффективность обучения открытых LLM втрое. Новые модели дают 97% точности за копейки — переоцифровка сотен тысяч книг становится реальной, и это меняет качество публичных датасетов. Кто сейчас займётся чисткой данных, тот выиграет в гонке моделей.
Что случилось

Проект Talkie показал жёсткую цифру: языковая модель, обученная на старых OCR-текстах, училась всего на 30% эффективнее, чем на ручных транскрипциях тех же книг. Причина — ошибки оцифровки, которые библиотеки делали 10-15 лет назад старыми инструментами.
Hugging Face и EleutherAI запустили FineBooks: прогнали 14 открытых OCR-моделей по 2165 страницам исторических книг (английский, французский, немецкий, латынь). Лидер — dots.mocr (3B параметров) — показал 97%+ точности за $2 на 1000 страниц. Второе место — OvisOCR2 (0.9B параметров) за 46 центов. Размер модели не коррелирует с качеством на старых шрифтах.
Первая цель — Biodiversity Heritage Library: 300 тысяч документов, 64 миллиона страниц. Сейчас они в Common Pile (крупнейший открытый датасет для LLM), но текст грязный. Переоцифровка одной библиотеки даст больше для качества открытых моделей, чем добавление новых источников.
Ограничения: оценка только для книжных шрифтов Antiqua, одна колонка, четыре языка. Готика (Fraktur), рукописи, не-латиница — вне теста. Модели выдают Markdown без координат слов, так что в существующую библиотечную инфраструктуру (ALTO XML) не встроишь. Для науки точность ещё слабовата — модели молча модернизируют архаичные символы вроде длинной s (ſ).
Автор: Анна Мельникова · Источник: the-decoder.com
Разработчикам. Открытые OCR-модели с весами от 0.9B до 3B параметров, запускаются локально без API, тестируются на реальных исторических книгах. Лидерборд обновляется регулярно, фреймворк оценки открыт. Если нужен чистый текст для файнтюна или датасета — берёшь dots.mocr или OvisOCR2, прогоняешь архив, получаешь качество на уровне 97%. Но вывод — только Markdown/plain text, координат слов нет.
Бизнесу. Старые OCR-тексты режут эффективность обучения LLM втрое. Переоцифровка публичных библиотек (300k+ книг) стоит копейки ($2/1000 страниц) и даёт больше пользы, чем поиск новых источников данных. Кто первым перелопатит архивы — получит конкурентное преимущество в качестве открытых моделей. Но для коммерческих библиотечных систем нужна доработка: текущие модели не выдают координаты слов (ALTO XML).
Инвесторам. Качество данных — новое узкое место в гонке LLM. Проект показал, что открытые OCR-модели уже на уровне, когда массовая переоцифровка исторических архивов реальна и дешева. Сектора роста: инструменты для чистки датасетов, OCR-as-a-service для библиотек и исследователей, специализированные модели под старые шрифты и языки. Common Pile (крупнейший открытый корпус) уже содержит 300k книг с плохим OCR — их переобработка поднимет планку для всех open-source LLM.
- Запустить OCR-as-a-service для библиотек и исследователей: прогон по архивам за центы, API с выбором модели под язык/шрифт.
- Сделать инструмент для автоматической чистки и валидации датасетов перед обучением LLM — проверка CER, исправление типичных OCR-ошибок.
- Файнтюнить OCR-модели под специфику: готика, рукописи, не-латиница, сохранение архаичных символов для научных транскрипций.
- Переобработать публичные архивы (HathiTrust, Internet Archive) и продавать чистые датасеты для обучения моделей — легальный, качественный контент.
- Создать библиотечный адаптер: обёртку над новыми OCR-моделями с выводом в ALTO XML (координаты слов) для интеграции в существующие системы.
- Модели модернизируют архаичные символы без предупреждения — для науки это баг, не фича. Нужны специализированные версии, рынок узкий.
- Координаты слов отсутствуют — библиотеки не смогут встроить эти модели без серьёзной доработки инфраструктуры.
- Оценка на 4 языках и одном типе шрифта — реальная точность на Fraktur, кириллице, арабском может быть ниже.
- Переоцифровка 300k книг — разовая задача. После неё спрос на массовую OCR-обработку упадёт, если новые архивы не открываются.
Знаете, что бесит? Когда проблема очевидна годами, но все делают вид, что норм. Открытые модели растут на текстах, которые библиотеки оцифровали 15 лет назад — с ошибками на каждой странице. И вот теперь цифра: эффективность обучения падает на 70%. Просто потому, что никто не заморочился перепрогнать архивы нормальным OCR.
FineBooks — это не прорыв, это здравый смысл. Взяли 14 открытых моделей, прогнали по реальным книгам, получили 97% точности за центы. Теперь переделывают 300 тысяч документов. Забавно, что размер модели не решает: 0.9B параметров бьют 9B на старых шрифтах. Для обучения AI — уже готово. Для науки и библиотек — пока костыли, но направление верное. Кто первым почистит публичные датасеты, тот и выиграет гонку открытых моделей.
Комментарии