Лучшие AI-модели проваливают тесты на базовое зрение — GPT-4o достигает только 60% точности
Moonshot AI выпустила PerceptionBench — бенчмарк, который изолированно тестирует визуальное восприятие мультимодальных моделей без примеси логики. Ни одна топовая модель не дотянула до 60% точности. GPT-4o показал лучший результат (59.7%), Kimi K1.5 — 58.5%, Claude Sonnet 3.5 — 57.2%. Открытые модели отстают ещё сильнее. Выяснилось: большинство «ошибок рассуждения» на самом деле происходят на этапе чтения картинки.