#TTS

И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 26
И инструменты ·20 июл 2026

Alibaba выпустила Qwen-Audio-3.0-TTS — многоязычный синтез речи с лидерством в рейтинге и ценой втрое ниже конкурентов

Tongyi Lab (Alibaba) запустила Qwen-Audio-3.0-TTS — облачный сервис синтеза речи в двух вариантах: Flash для реального времени (~300 мс задержка) и Plus для максимального качества. Plus занял первое место в независимом рейтинге Artificial Analysis, поддерживает 16 языков, стоит ~$27.59 за 1 млн символов (втрое дешевле ElevenLabs), но уступает в скорости генерации (~16 символов/сек против 120 у Sonic 3.5). Модель предлагает 86 встроенных тегов для контроля эмоций, смеха, дыхания и других нюансов голоса.

0 71