#OCR

И инструменты ·10 авг 2026

Старый OCR губит обучение AI: проект FineBooks переоцифровывает 300 тысяч книг с нуля

Hugging Face и EleutherAI протестировали 14 открытых OCR-моделей на 2000+ страниц исторических книг. Лучшие показали 97% точности за $2/1000 страниц — достаточно для обучения AI, но не для научной работы. Планируют переоцифровать 300 тыс. книг из Biodiversity Heritage Library, чтобы улучшить датасеты для открытых LLM.

0 81
И инструменты ·30 июл 2026

Surya-2 против GOT-OCR 2.0: сравнение двух компактных OCR-моделей на обычном ноутбуке

Автор протестировал две небольшие (~600M параметров) open-source OCR-модели на своём ноутбуке с RTX 4070. Обе можно запускать локально, но они решают противоположные задачи: GOT-OCR устанавливается за пять строк кода и возвращает чистый текст, а Surya-2 требует настройки сервера, зато выдаёт структурированный документ с типизированными блоками и координатами.

0 91
И инструменты ·25 июл 2026

Marker 2 обошёл MinerU по точности и скорости в 5 раз — новый стандарт конвертации документов?

Datalab выпустила Marker 2 — полностью переписанный open-source конвертер PDF/DOCX/изображений в markdown. На бенчмарке olmOCR он набрал 76% точности против 72.7% у MinerU, при этом обрабатывая документы в 5 раз быстрее (2.9 страниц/сек на B200 GPU). Три режима работы: balanced для максимальной точности на GPU, fast для баланса цены-качества и disable_ocr — чистый CPU без нейросетей.

0 102
И инструменты ·21 июл 2026

Как приложение превращает фото домашки в структурированную задачу: разбор реального продакшн-пайплайна

Разработчик поделился опытом создания приложения, которое фотографирует рукописные задания и превращает их в структурированные задачи с дедлайнами. Главная проблема оказалась не в распознавании текста (Claude Vision справляется хорошо), а в интерпретации контекста: «сдать в пятницу» может означать эту или следующую пятницу, одно фото может содержать несколько заданий, а модель должна честно признаваться в неуверенности вместо тихих ошибок.

0 113
И инструменты ·4 авг 2026

Pixel-Native RAG: как индексировать документы через скриншоты вместо текста

Туториал по построению RAG-системы, которая работает не с текстом, а с изображениями страниц. Рендерит веб-страницы и PDF в картинки, нарезает на тайлы, создаёт векторные эмбеддинги через SigLIP/CLIP/Qwen3-VL, хранит в FAISS и комбинирует с OCR+BM25 для гибридного поиска. Код на Python с FastAPI, обучением адаптера и опциональной генерацией ответов через VLM.

0 22
И инструменты ·21 июл 2026

OCR-модель путает заголовки с обычным текстом — стоит ли применять CRF или есть проще решения?

Разработчик использует DeepSeek-OCR для извлечения структуры юридических PDF, но модель периодически неправильно классифицирует заголовки разделов как обычный текст. Он рассматривает применение CRF (условных случайных полей) или BiLSTM-CRF для пост-обработки результатов OCR, используя дополнительные признаки: отступы, выравнивание, паттерны нумерации и высоту строк.

0 63