#VLM

И инструменты ·30 июл 2026

Surya-2 против GOT-OCR 2.0: сравнение двух компактных OCR-моделей на обычном ноутбуке

Автор протестировал две небольшие (~600M параметров) open-source OCR-модели на своём ноутбуке с RTX 4070. Обе можно запускать локально, но они решают противоположные задачи: GOT-OCR устанавливается за пять строк кода и возвращает чистый текст, а Surya-2 требует настройки сервера, зато выдаёт структурированный документ с типизированными блоками и координатами.

0 91
И исследования ·1 авг 2026

VLM-модели врут красиво: высокие оценки на бенчмарках скрывают потерю медицинских терминов и галлюцинации

Исследователи обнаружили, что визуально-языковые модели (VLM) при генерации рентгенологических заключений получают высокие оценки на метриках, но при этом удаляют важные клинические термины и добавляют шаблонные фразы без диагностической ценности. Проблема в том, что существующие метрики оценки поощряют повторяющиеся безопасные формулировки вместо клинически полезных отчётов.

0 49
И исследования ·27 июл 2026

Apple представила GH-ESD: новый подход к поиску систематических ошибок в компьютерном зрении

Исследователи Apple разработали GH-ESD — фреймворк для выявления «срезов ошибок» (систематических сбоев) в моделях компьютерного зрения на уровне отдельных объектов. Метод использует языковые модели для генерации гипотез об ошибках, затем проверяет их через визуально-языковые модели и статистический анализ. На новом бенчмарке GESD для задач детекции объектов GH-ESD показал точность 0.73 против 0.63 у базовых методов.

0 26