инструменты 1 мин

Surya-2 против GOT-OCR 2.0: сравнение двух компактных OCR-моделей на обычном ноутбуке

Автор протестировал две небольшие (~600M параметров) open-source OCR-модели на своём ноутбуке с RTX 4070. Обе можно запускать локально, но они решают противоположные задачи: GOT-OCR устанавливается за пять строк кода и возвращает чистый текст, а Surya-2 требует настройки сервера, зато выдаёт структурированный документ с типизированными блоками и координатами.

Разработчикам, которым нужно локальное OCR-решение на обычном железе, стоит прочитать практическое сравнение с реальными цифрами производительности, VRAM и точности. Статья показывает, что формально схожие модели решают разные задачи, и помогает выбрать правильный инструмент исходя из приоритетов: скорость установки против структурированного вывода.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • GOT-OCR 2.0 (561M) устанавливается через pip install за минуты, Surya-2 (650M) требует развёртывания llama.cpp-сервера и занимает около часа настройки
  • На английском Surya-2 обрабатывает страницы за 4-9 секунд против 48 у GOT-OCR, но на хинди замедляется до 178 секунд (GOT остаётся на 48с, пропуская непонятное)
  • Surya-2 возвращает структурированные блоки с типами (таблицы, заголовки) и координатами, сохраняя табличные данные; GOT-OCR выдаёт плоский текст и теряет структуру таблиц
  • Выбор зависит от задачи: GOT для быстрого извлечения текста с нулевой настройкой, Surya-2 для работы со структурированными документами, где важны таблицы и разметка
Анна Мельникова Medium #llm
Читать оригинал

Ещё по теме

Комментарии