инструменты 1 мин

Скрытая цена локального OCR: dots.ocr против PaddleOCR-VL на ноутбуке с 8 ГБ

Автор попытался сравнить две популярные локальные OCR vision-language модели на потребительской видеокарте RTX 4070 с 8 ГБ памяти. Вместо простого бенчмарка точности и скорости получился урок по управлению зависимостями: модели требуют несовместимые версии transformers, и реальная сложность — не в весах моделей, а в их окружении и runtime-компонентах.

Обязательно к прочтению для тех, кто планирует разворачивать open-source OCR модели локально: автор на собственном опыте показывает, что успешный запуск — это не 'pip install', а полноценная инженерная задача. Статья сэкономит часы отладки и поможет избежать типичных ловушек при работе с cutting-edge VLM.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • dots.ocr (3B параметров) требует transformers 4.51.3, PaddleOCR-VL (0.9B) — transformers 5.x, что делает невозможным их совместный запуск в одном окружении
  • Обе модели точные (100% и 98% recall соответственно) и едва помещаются в 8 ГБ VRAM (~7.9 ГБ каждая), причём меньшая модель использует столько же памяти из-за высокоразрешающих токенов изображений
  • Скорость через стандартный transformers API обманчива: PaddleOCR-VL показывает 273 с/страницу, но это артефакт неоптимизированного пути — на правильном runtime (vLLM/paddleocr) она гораздо быстрее
  • Реальная проблема локального запуска передовых OCR VLM — это dependency hell: конфликты версий библиотек, баги в загрузчиках модулей (точка в названии репозитория ломает импорт), отсутствующие пакеты
Павел Заславский Medium #llm
Читать оригинал

Ещё по теме

Комментарии