Как модели речи «читерят» на бенчмарках: исследование обнаружило переобучение на тестовых данных
Исследователи из Hume AI доказали, что лидеры ASR-бенчмарков заучивают транскрипты тестовых наборов VoxPopuli и LibriSpeech вместо распознавания речи. Модели воспроизводят ошибки референсов даже при противоречащем аудио, используют акустические метки для определения источника данных и галлюцинируют слова в замолченных фрагментах — при том, что их метрики выглядят человекоподобными.