#OCR

И инструменты ·21 июл 2026

Как приложение превращает фото домашки в структурированную задачу: разбор реального продакшн-пайплайна

Разработчик поделился опытом создания приложения, которое фотографирует рукописные задания и превращает их в структурированные задачи с дедлайнами. Главная проблема оказалась не в распознавании текста (Claude Vision справляется хорошо), а в интерпретации контекста: «сдать в пятницу» может означать эту или следующую пятницу, одно фото может содержать несколько заданий, а модель должна честно признаваться в неуверенности вместо тихих ошибок.

0 113
И инструменты ·21 июл 2026

OCR-модель путает заголовки с обычным текстом — стоит ли применять CRF или есть проще решения?

Разработчик использует DeepSeek-OCR для извлечения структуры юридических PDF, но модель периодически неправильно классифицирует заголовки разделов как обычный текст. Он рассматривает применение CRF (условных случайных полей) или BiLSTM-CRF для пост-обработки результатов OCR, используя дополнительные признаки: отступы, выравнивание, паттерны нумерации и высоту строк.

0 63
И инструменты ·20 июл 2026

Скрытая цена локального OCR: dots.ocr против PaddleOCR-VL на ноутбуке с 8 ГБ

Автор попытался сравнить две популярные локальные OCR vision-language модели на потребительской видеокарте RTX 4070 с 8 ГБ памяти. Вместо простого бенчмарка точности и скорости получился урок по управлению зависимостями: модели требуют несовместимые версии transformers, и реальная сложность — не в весах моделей, а в их окружении и runtime-компонентах.

0 39