Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro
Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.