Whisper больше не один: новая расстановка сил в открытых моделях распознавания речи
За последний год рынок открытых ASR-моделей превратился из монополии Whisper в конкурентную гонку. Cohere Transcribe, IBM Granite Speech, ARK-ASR и MOSS-Transcribe показывают WER в районе 5%, разница между лидерами — меньше одного процентного пункта. Теперь выбор модели определяют не только точность, но и лицензия, поддержка языков, скорость обработки и стоимость на час аудио.
Если вы разрабатываете продукт с распознаванием речи, монополия Whisper закончилась — теперь есть выбор открытых моделей с Apache 2.0 и сопоставимым качеством. Но выбирать нужно по практическим критериям: скорость, языки, лицензия и стоимость обработки, а не только по цифре WER в таблице.
Новая эра открытого распознавания речи
В марте 2026 года Cohere выпустила Transcribe — модель на 2 млрд параметров с лицензией Apache 2.0, которая возглавила Open ASR Leaderboard на Hugging Face с показателем WER (Word Error Rate) 5,42%. Спустя пять недель IBM представила Granite Speech 4.1 2B с результатом 5,33%. Затем появились ARK-ASR-3B и MOSS-Transcribe-preview-2B с ещё более низкими показателями.
Лидерборд больше не решает
Разрыв между лидерами составляет меньше одного процентного пункта WER. Это означает, что ранг перестал быть решающим фактором при выборе модели. Теперь важнее лицензия, покрытие языков, поддержка потоковой обработки и стоимость на час аудио.
Проблема в том, что опубликованные цифры нельзя сравнивать напрямую. Cohere тестировалась на восьми английских датасетах (включая TED-LIUM), а ARK-ASR — на семи (TED-LIUM исключён). Поскольку TED-LIUM — один из более простых наборов, его исключение завышает средний WER. При пересчёте на одинаковых датасетах Cohere показывает 5,84%, а не 5,42%.
Ещё одна деталь: некоторые модели (например, MOSS-Transcribe) дообучались с подкреплением специально на тренировочных данных лидерборда — то есть оценка измеряет соответствие бенчмарку, а не реальную способность.
Кто есть кто
Cohere Transcribe (2B, Apache 2.0, 14 языков) — самая популярная модель в продакшене, скачана более 620 тысяч раз за месяц. Conformer-энкодер + лёгкий Transformer-декодер, обучена с нуля. Есть поддержка в transformers, vLLM, mlx-audio для Apple Silicon, порты на Rust и WebGPU. Ограничения честно указаны: нет автоопределения языка, тайм-кодов, диаризации, модель склонна «транскрибировать» тишину — нужен VAD на входе.
Granite Speech 4.1 2B (Apache 2.0) — выбор для тех, кому нужны возможности, а не только низкий WER. Шесть языков для ASR плюс двунаправленный перевод речи, подсказки для имён и жаргона, пунктуация и правильный регистр (включая заглавные немецкие существительные). Обучена на 174 000 часах. RTFx 231,29.
Qwen3-ASR-1.7B (Apache 2.0) покрывает 52 языка и диалекта — 30 языков плюс 22 китайских диалекта — при WER 5,76%. Поставляется с полным инструментарием и отдельной моделью для выравнивания тайм-кодов в 11 языках. Для китайского языка — очевидный выбор.
Скорость против точности
На вершине точность различается на ~1 процентный пункт, а пропускная способность — больше чем на порядок. Это означает, что итоговый счёт чаще определяет именно скорость.
Parakeet TDT 0.6B v3 (CC-BY-4.0) — лидер по скорости среди мультиязычных моделей: RTFx 3332,74 для 25 европейских языков с автоопределением, обрабатывает до 24 минут аудио за один проход на A100 80GB. Цена — WER 6,32%, то есть примерно на процентный пункт хуже Granite 4.1 2B, но в 14 раз больше аудио на GPU-секунду.
Granite Speech 4.1 2B-NAR — неавторегрессивная версия: правит CTC-гипотезу за один проход через двунаправленный LLM, достигает RTFx ~1820 на H100 при batch size 128. Жертвует японским, переводом речи и подсказками ради скорости.
Выводы
Лидерборд полезен для составления шорт-листа, но не для финального выбора. Учитывайте реальные потребности: нужна ли вам диаризация, поддержка потокового распознавания, конкретные языки, коммерческая лицензия. И помните: модели, обученные на чистой начитанной речи, сильно деградируют на спонтанных разговорах.
Ключевые выводы
- Разрыв между лидерами Open ASR Leaderboard составляет меньше одного процентного пункта WER — точность перестала быть единственным критерием выбора
- Опубликованные на лидерборде цифры нельзя сравнивать напрямую: модели тестируются на разных наборах датасетов, некоторые специально дообучены под бенчмарк
- Пропускная способность моделей различается больше чем на порядок (от RTFx ~230 до ~3300), что критичнее для стоимости обработки, чем разница в WER на доли процента
- Модели, обученные на чистой начитанной речи, значительно хуже работают на спонтанных разговорах — приватные датасеты Appen с разговорным английским полностью переупорядочивают рейтинг
- Qwen3-ASR покрывает 52 языка и диалекта (включая 22 китайских), что делает его безальтернативным для азиатских языков
Автор: Ксения Лаврова · Источник: marktechpost.com
Это один из тех материалов, где важнее всего детали, которые обычно пропускают. Авторы честно разбирают, почему цифры на лидерборде нельзя сравнивать напрямую — одни модели тестируют на восьми датасетах, другие на семи, а некоторые специально дообучены под бенчмарк. Это важно понимать, если вы реально выбираете модель для продакшена, а не просто копируете топ-1 из таблицы.
Особенно ценно, что материал переключает фокус с «у кого WER меньше на 0,3%» на практические критерии: скорость обработки различается в 14 раз, языковое покрытие — от английского до 52 языков с диалектами, есть модели с диаризацией и тайм-кодами, есть без. Для продакшена эти факторы важнее, чем доля процента в точности. Если работаете с китайским — берите Qwen3-ASR, нужна скорость на европейских языках — Parakeet, нужны фичи и стабильность — Granite. Лидерборд даёт шорт-лист, финальный выбор делают требования проекта.
Инструменты из статьи
Открытая модель распознавания речи OpenAI. Отличный русский, работает локально.
Доступ из РФ →
Комментарии