Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro
Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.
Если метрики, по которым оцениваются AI-модели, содержат 12% шума, вся индустрия строит продукты на ненадёжных данных. Это влияет на инвестиции, маркетинг и реальное качество AI-продуктов.
Что произошло
Независимый аудит четырёх популярных AI-бенчмарков (GPQA-Diamond, GPQA-Extended, MMLU-Pro, MMMU-Pro) выявил системную проблему: в GPQA-Extended, MMLU-Pro и MMMU-Pro около 12% вопросов оказались битыми. Проблемы включали неправильные ключи ответов, некорректные формулировки и вопросы с несколькими валидными ответами.
Исследователь потратил недели на ручную проверку каждого вопроса и выпустил чистые версии датасетов с удалёнными проблемными элементами. Результат: топовые модели, застрявшие на уровне 92-93% по GPQA-Diamond, после исправлений достигли ~98%. Все исправления задокументированы с объяснениями, опубликованы clean-версии датасетов на Hugging Face, задачи для lm-eval-harness и сравнительные скоринги оригинал/чистая версия.
Полная статья с примерами битых вопросов (стр. 28) доступна на GitHub. Автор открыт к фидбеку и планирует проверить другие бенчмарки.
Автор: Артём Ковалёв · Источник: reddit.com
Разработчикам. Теперь доступны проверенные clean-версии бенчмарков с готовыми lm-eval-harness задачами и датасетами на HF. Можно наконец получить адекватные метрики без шума от битых вопросов. Особенно критично для файнтюна и валидации — старые версии давали ложные сигналы о производительности.
Бизнесу. Если ваши AI-продукты оценивались по GPQA, MMLU-Pro или MMMU-Pro, предыдущие метрики могли быть завышены или занижены на ~12%. Переоценка на чистых датасетах даст реальную картину качества моделей и поможет корректнее позиционировать продукт.
Инвесторам. Открывается вопрос доверия к публичным метрикам AI-компаний. Если ведущие бенчмарки содержат 12% шума, заявленная точность моделей может быть переоценена. Компании, первыми переключившиеся на валидированные датасеты, получат конкурентное преимущество в прозрачности.
- Сервис автоматизированного аудита датасетов: проверка и валидация бенчмарков для компаний, строящих LLM — рынок корпоративных клиентов
- Консалтинг по пересчёту метрик: помощь AI-стартапам в переоценке производительности на чистых датасетах для fundraising и PR
- Создание premium-бенчмарков с гарантированным quality control — платная подписка для разработчиков и исследователей
- Инструмент для сравнения скоринга модели на оригинальных vs чистых датасетах — SaaS для ML-команд
- Маркетплейс верифицированных датасетов с прозрачной методологией валидации — монетизация через API и лицензии
- Исправления могут вызвать споры: удаление 12% вопросов меняет структуру датасета, результаты до и после несопоставимы напрямую
- Если индустрия не примет clean-версии, фрагментация бенчмарков усложнит сравнение моделей
- Риск переоценки: модели могли переобучиться на оригинальные версии, высокие скоры на чистых датасетах могут быть артефактом
- Небольшая команда/один автор — нужна независимая верификация аудита, чтобы исключить субъективность
Знаете, что меня больше всего зацепило? Не сами битые вопросы (любой, кто работал с датасетами, знает, что идеальных не бывает), а то, что индустрия годами сравнивала модели по кривым метрикам и никто не копал глубже. Застрявшие на 92-93% скоры казались потолком возможностей, а оказалось — просто потолок качества датасета. Это как если бы спортсмены годами бегали стометровку по кривой дорожке и думали, что 11 секунд — предел человеческих способностей.
Второй момент: один человек за несколько недель сделал то, что должны были делать команды. Выложил всё открыто, с документацией и готовыми инструментами. Это отлично для сообщества, но плохой сигнал для тех, кто публикует бенчмарки: если вы не можете гарантировать качество своих датасетов, кто-то другой это сделает за вас. И тогда вопрос: кому доверять — оригинальным авторам или независимым аудиторам? Для компаний, строящих модели, это критично: старые метрики могут быть как завышены, так и занижены. Пересчёт на чистых версиях — не опция, а необходимость, если хотите адекватной оценки продукта перед инвесторами или клиентами.
Комментарии