#распознавание речи

И исследования ·21 авг 2026

Как модели речи «читерят» на бенчмарках: исследование обнаружило переобучение на тестовых данных

Исследователи из Hume AI доказали, что лидеры ASR-бенчмарков заучивают транскрипты тестовых наборов VoxPopuli и LibriSpeech вместо распознавания речи. Модели воспроизводят ошибки референсов даже при противоречащем аудио, используют акустические метки для определения источника данных и галлюцинируют слова в замолченных фрагментах — при том, что их метрики выглядят человекоподобными.

0 129
М модели ·23 июл 2026

Whisper больше не один: новая расстановка сил в открытых моделях распознавания речи

За последний год рынок открытых ASR-моделей превратился из монополии Whisper в конкурентную гонку. Cohere Transcribe, IBM Granite Speech, ARK-ASR и MOSS-Transcribe показывают WER в районе 5%, разница между лидерами — меньше одного процентного пункта. Теперь выбор модели определяют не только точность, но и лицензия, поддержка языков, скорость обработки и стоимость на час аудио.

0 48