#ASR

И исследования ·21 авг 2026

Как модели речи «читерят» на бенчмарках: исследование обнаружило переобучение на тестовых данных

Исследователи из Hume AI доказали, что лидеры ASR-бенчмарков заучивают транскрипты тестовых наборов VoxPopuli и LibriSpeech вместо распознавания речи. Модели воспроизводят ошибки референсов даже при противоречащем аудио, используют акустические метки для определения источника данных и галлюцинируют слова в замолченных фрагментах — при том, что их метрики выглядят человекоподобными.

0 129
И инструменты ·5 авг 2026

Whisper, Qwen3-ASR и Nemotron теперь работают локально на iPhone — разбор реального кейса

Разработчик создал LiveTranscriber — полностью офлайновое iOS-приложение для транскрибации речи с поддержкой Whisper, Qwen3-ASR, NVIDIA Nemotron и MOSS. Все модели работают на устройстве без отправки данных в облако. Проект open-source с готовым решением в App Store.

0 118
М модели ·23 июл 2026

Whisper больше не один: новая расстановка сил в открытых моделях распознавания речи

За последний год рынок открытых ASR-моделей превратился из монополии Whisper в конкурентную гонку. Cohere Transcribe, IBM Granite Speech, ARK-ASR и MOSS-Transcribe показывают WER в районе 5%, разница между лидерами — меньше одного процентного пункта. Теперь выбор модели определяют не только точность, но и лицензия, поддержка языков, скорость обработки и стоимость на час аудио.

0 48
И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 27