исследования 1 мин

Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro

Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.

Если метрики, по которым оцениваются AI-модели, содержат 12% шума, вся индустрия строит продукты на ненадёжных данных. Это влияет на инвестиции, маркетинг и реальное качество AI-продуктов.

Что произошло

Независимый аудит четырёх популярных AI-бенчмарков (GPQA-Diamond, GPQA-Extended, MMLU-Pro, MMMU-Pro) выявил системную проблему: в GPQA-Extended, MMLU-Pro и MMMU-Pro около 12% вопросов оказались битыми. Проблемы включали неправильные ключи ответов, некорректные формулировки и вопросы с несколькими валидными ответами.

Исследователь потратил недели на ручную проверку каждого вопроса и выпустил чистые версии датасетов с удалёнными проблемными элементами. Результат: топовые модели, застрявшие на уровне 92-93% по GPQA-Diamond, после исправлений достигли ~98%. Все исправления задокументированы с объяснениями, опубликованы clean-версии датасетов на Hugging Face, задачи для lm-eval-harness и сравнительные скоринги оригинал/чистая версия.

Полная статья с примерами битых вопросов (стр. 28) доступна на GitHub. Автор открыт к фидбеку и планирует проверить другие бенчмарки.

Автор: Артём Ковалёв · Источник: reddit.com

Разработчикам. Теперь доступны проверенные clean-версии бенчмарков с готовыми lm-eval-harness задачами и датасетами на HF. Можно наконец получить адекватные метрики без шума от битых вопросов. Особенно критично для файнтюна и валидации — старые версии давали ложные сигналы о производительности.

Бизнесу. Если ваши AI-продукты оценивались по GPQA, MMLU-Pro или MMMU-Pro, предыдущие метрики могли быть завышены или занижены на ~12%. Переоценка на чистых датасетах даст реальную картину качества моделей и поможет корректнее позиционировать продукт.

Инвесторам. Открывается вопрос доверия к публичным метрикам AI-компаний. Если ведущие бенчмарки содержат 12% шума, заявленная точность моделей может быть переоценена. Компании, первыми переключившиеся на валидированные датасеты, получат конкурентное преимущество в прозрачности.

Хайп20
Реальная польза75
Заработать60
  • Сервис автоматизированного аудита датасетов: проверка и валидация бенчмарков для компаний, строящих LLM — рынок корпоративных клиентов
  • Консалтинг по пересчёту метрик: помощь AI-стартапам в переоценке производительности на чистых датасетах для fundraising и PR
  • Создание premium-бенчмарков с гарантированным quality control — платная подписка для разработчиков и исследователей
  • Инструмент для сравнения скоринга модели на оригинальных vs чистых датасетах — SaaS для ML-команд
  • Маркетплейс верифицированных датасетов с прозрачной методологией валидации — монетизация через API и лицензии
  • Исправления могут вызвать споры: удаление 12% вопросов меняет структуру датасета, результаты до и после несопоставимы напрямую
  • Если индустрия не примет clean-версии, фрагментация бенчмарков усложнит сравнение моделей
  • Риск переоценки: модели могли переобучиться на оригинальные версии, высокие скоры на чистых датасетах могут быть артефактом
  • Небольшая команда/один автор — нужна независимая верификация аудита, чтобы исключить субъективность

Знаете, что меня больше всего зацепило? Не сами битые вопросы (любой, кто работал с датасетами, знает, что идеальных не бывает), а то, что индустрия годами сравнивала модели по кривым метрикам и никто не копал глубже. Застрявшие на 92-93% скоры казались потолком возможностей, а оказалось — просто потолок качества датасета. Это как если бы спортсмены годами бегали стометровку по кривой дорожке и думали, что 11 секунд — предел человеческих способностей.

Второй момент: один человек за несколько недель сделал то, что должны были делать команды. Выложил всё открыто, с документацией и готовыми инструментами. Это отлично для сообщества, но плохой сигнал для тех, кто публикует бенчмарки: если вы не можете гарантировать качество своих датасетов, кто-то другой это сделает за вас. И тогда вопрос: кому доверять — оригинальным авторам или независимым аудиторам? Для компаний, строящих модели, это критично: старые метрики могут быть как завышены, так и занижены. Пересчёт на чистых версиях — не опция, а необходимость, если хотите адекватной оценки продукта перед инвесторами или клиентами.

Ещё по теме

Комментарии