Лучшие AI-модели проваливают тесты на базовое зрение — GPT-4o достигает только 60% точности
Moonshot AI выпустила PerceptionBench — бенчмарк, который изолированно тестирует визуальное восприятие мультимодальных моделей без примеси логики. Ни одна топовая модель не дотянула до 60% точности. GPT-4o показал лучший результат (59.7%), Kimi K1.5 — 58.5%, Claude Sonnet 3.5 — 57.2%. Открытые модели отстают ещё сильнее. Выяснилось: большинство «ошибок рассуждения» на самом деле происходят на этапе чтения картинки.
Если вы строите продукт на базе мультимодальных моделей, этот бенчмарк показывает: нельзя слепо доверять vision-возможностям даже топовых API. Для критичных систем нужна валидация и запасные планы.
Что произошло

Moonshot AI (команда китайского ассистента Kimi) представила PerceptionBench — бенчмарк, который впервые отделяет визуальное восприятие от логики и знаний. Традиционные тесты смешивают всё в кучу, поэтому непонятно, где именно модель факапит: не увидела или не поняла.
PerceptionBench разбивает зрение на 10 атомарных навыков: пространственные отношения, подсчёт объектов, атрибуты, глубина и 3D, локализация, сравнение, детальное распознавание, интеграция контекста, OCR и галлюцинации. Все 3000 вопросов можно решить просто глядя на картинку — никакой логики или внешних знаний не требуется.

Результаты жёсткие: GPT-4o набрал 59.7% (лучший), Kimi K1.5 — 58.5%, Claude Sonnet 3.5 — 57.2%, Gemini 2.0 Pro — 56.2%. Открытые модели типа Qwen2.5-72B-Instruct провалились с 47.5%, GLM-4V — всего 32.5%.
Самое интересное — разброс по категориям. GPT-4o лидирует в общем зачёте, но в распознавании галлюцинаций (когда нужно сказать «объектов ноль») даёт только 26.9%. Зато более слабый Gemini 2.0 Flash выдаёт там 50.6%. Модели с почти одинаковыми общими баллами радикально расходятся в конкретных навыках.
Команда подчеркивает: большинство «ошибок рассуждения» на самом деле происходят на первом шаге — модель просто неправильно считывает изображение. Если сломан ввод, логика бесполезна.
Датасет и код оценки доступны на GitHub (MoonshotAI/PerceptionBench).
Автор: Ксения Лаврова · Источник: the-decoder.com
Разработчикам. Если строите мультимодальные приложения, не полагайтесь слепо на визуальные возможности моделей — даже топовые врут в 40% случаев на базовых задачах. Используйте PerceptionBench для профилирования слабых мест конкретной модели перед выбором. Для продакшн-систем с визуальным вводом добавляйте fallback-механизмы и валидацию результатов.
Бизнесу. Если ваш продукт полагается на распознавание изображений (например, обработка документов, автомодерация, визуальный поиск), заложите в бюджет дополнительную разметку и проверку — модели ошибаются чаще, чем кажется. Продукты, которые могут работать с шумными данными или объединять несколько моделей для кросс-проверки, получат преимущество.
Инвесторам. Визуальное восприятие — явный bottleneck для мультимодальных моделей. Компании, решающие задачи распознавания на уровне восприятия (не только reasoning), или создающие специализированные модели для визуальных задач, могут занять сильную нишу. Moonshot AI (Kimi) показывает себя конкурентом западным лидерам — следите за китайскими командами, которые публикуют методологию и открытые датасеты.
- Создать специализированные модели или адаптеры для конкретных визуальных навыков (подсчёт, OCR, пространственные отношения) — продавать как плагины к GPT/Claude
- Построить сервис валидации и верификации визуальных ответов AI (ensemble из нескольких моделей + rule-based проверки) для критичных бизнес-сценариев
- Разработать инструменты для автоматического профилирования слабых мест vision-моделей в проде — аналитика и мониторинг для мультимодальных приложений
- Создать датасеты и бенчмарки для узких индустрий (медицина, производство, ритейл), где визуальное восприятие критично — лицензировать командам разработчиков
- Выпустить обучающие программы и консалтинг для компаний, внедряющих мультимодальные системы — как правильно выбирать и тестировать модели
- Бенчмарки часто не коррелируют с реальными задачами — PerceptionBench может быть академически интересным, но не предсказывать успех в проде
- Китайские модели (Kimi) показывают хорошие результаты на собственных бенчмарках — возможен overfitting или завышенная оценка
- Исправление визуального восприятия может потребовать фундаментальной переработки архитектур, а не просто больше данных — quick wins маловероятны
- Компании могут переоценить важность проблемы — для многих реальных задач текущей точности достаточно
Честно говоря, результаты не удивляют — любой, кто работал с vision API в проде, знает: модели регулярно косячат на элементарных вещах. Но PerceptionBench впервые показал масштаб проблемы количественно и разложил её по полочкам. Раньше все кивали на «reasoning» — мол, логика слабая. Оказалось, модели банально плохо видят.
Что реально интересно: китайская Kimi почти догнала западных лидеров, причём команда публикует методологию и датасеты открыто. Это здоровая конкуренция, которая двигает рынок вперёд. Для разработчиков вывод простой: тестируйте vision-возможности на своих данных, не верьте общим метрикам, и стройте fallback-механизмы. Текущая точность годится для вспомогательных задач, но не для критичных систем.
Комментарии