GPT-5.5 провалил новый визуальный тест: 10,6% против 96,1% у людей
Новый бенчмарк ActiveVision показал критический провал передовых AI-моделей в задачах, требующих повторного анализа изображений. GPT-5.5 справился лишь с 10,6% заданий, Claude Fable 5 — с 3,5%, в то время как люди показали 96,1%. Ключевой момент: модели не могут исправить ситуацию даже написав собственный код для решения задач.
Провал показывает, что даже самые продвинутые AI-модели до сих пор не умеют по-настоящему «видеть» и анализировать визуальную информацию подобно человеку. Это критично для применения AI в реальных задачах — от медицины до промышленной инспекции — где требуется динамическое визуальное понимание.
Новый провал визуального AI: повторное восприятие как камень преткновения
Свежее исследование на arXiv представило бенчмарк ActiveVision — набор из 17 задач в трёх категориях, специально спроектированных так, чтобы модель не могла обойтись одним взглядом на изображение. Тест требует многократного анализа визуальной информации и сопоставления данных.
Результаты провальные даже для флагманов
GPT-5.5 на максимальном уровне reasoning-effort справился лишь с 10,6% заданий и получил ноль баллов в 11 из 17 задач. Claude Fable 5, лидирующий в большинстве рейтингов по reasoning и кодингу, показал ещё хуже — 3,5%. Для контраста: три человека-участника в среднем достигли 96,1%.
Почему это важнее очередного провала
Авторы подчёркивают: интересна не сама неудача (модели регулярно проваливают новые тесты), а характер провала. ActiveVision выявляет фундаментальный разрыв в способности к динамическому визуальному восприятию — умению возвращаться к изображению с новыми вопросами, переключать фокус внимания, строить ментальную модель.
Критично, что модели не могут компенсировать недостаток написанием кода. Даже получив возможность создать инструменты для анализа, они остаются беспомощны — проблема лежит глубже, на уровне базовой архитектуры восприятия.
Что это означает
Результаты указывают на серьёзное ограничение текущих мультимодальных систем: они обрабатывают визуальную информацию как статичное описание, а не как объект для активного исследования. Пока эта пропасть не преодолена, применение AI в задачах, требующих реального визуального понимания — от медицинской диагностики до инспекции качества — останется под вопросом.
Ключевые выводы
- Современные frontier-модели провалились в задачах, требующих многократного визуального анализа: GPT-5.5 — 10,6%, Claude Fable 5 — 3,5% против 96,1% у людей
- Ключевая проблема — модели обрабатывают изображения как статичное описание, неспособны активно «переосматривать» с новым контекстом
- Возможность писать код для решения задач не помогла — провал на архитектурном уровне восприятия
- Результаты ставят под вопрос применение текущих мультимодальных систем в критичных областях, где требуется визуальное понимание
- ActiveVision выявляет фундаментальный разрыв между статичным описанием картинки и динамическим визуальным reasoning'ом
Автор: Никита Громов · Источник: reddit.com
Этот провал честнее любой маркетинговой презентации о «человекоподобном зрении». Модели научились генерить описания картинок, но оказалось — они не умеют возвращаться к изображению с новым вопросом, переключать фокус, строить пространственную модель. Это не баг, это архитектурное ограничение.
Особенно тревожно, что даже написание кода не помогло. Представьте: модель может сгенерить Python-скрипт для анализа, но всё равно не понимает, ЧТО искать на картинке. Для потребительских фич это не критично, но для медицинской диагностики или контроля качества — это честное признание: рано. Хайп вокруг мультимодальности обогнал реальность на пару лет вперёд.
Комментарии