Alibaba выпустила Qwen-Audio-3.0-TTS — многоязычный синтез речи с лидерством в рейтинге и ценой втрое ниже конкурентов
Tongyi Lab (Alibaba) запустила Qwen-Audio-3.0-TTS — облачный сервис синтеза речи в двух вариантах: Flash для реального времени (~300 мс задержка) и Plus для максимального качества. Plus занял первое место в независимом рейтинге Artificial Analysis, поддерживает 16 языков, стоит ~$27.59 за 1 млн символов (втрое дешевле ElevenLabs), но уступает в скорости генерации (~16 символов/сек против 120 у Sonic 3.5). Модель предлагает 86 встроенных тегов для контроля эмоций, смеха, дыхания и других нюансов голоса.