Alibaba выпустила Qwen-Audio-3.0-TTS — многоязычный синтез речи с лидерством в рейтинге и ценой втрое ниже конкурентов
Tongyi Lab (Alibaba) запустила Qwen-Audio-3.0-TTS — облачный сервис синтеза речи в двух вариантах: Flash для реального времени (~300 мс задержка) и Plus для максимального качества. Plus занял первое место в независимом рейтинге Artificial Analysis, поддерживает 16 языков, стоит ~$27.59 за 1 млн символов (втрое дешевле ElevenLabs), но уступает в скорости генерации (~16 символов/сек против 120 у Sonic 3.5). Модель предлагает 86 встроенных тегов для контроля эмоций, смеха, дыхания и других нюансов голоса.
Китайский TTS впервые обошёл западных лидеров по качеству в независимом рейтинге при цене втрое ниже — это меняет расклад на рынке и даёт разработчикам экономичную альтернативу ElevenLabs и Play.ht. Низкая скорость генерации всё ещё остаётся узким местом для задач реального времени.
Два варианта для разных задач
Alibaba представила Qwen-Audio-3.0-TTS — облачную TTS-систему в двух версиях. Flash рассчитан на реальное время: первый пакет аудио приходит через ~300 миллисекунд, что критично для диалоговых ассистентов и стриминга. Plus заточен под качество: естественность интонаций и точность тембра важнее скорости.
Оба варианта доступны только через Alibaba Cloud Model Studio — скачать веса нельзя. API работает через WebSocket, поддерживает PCM, WAV, MP3, Opus до 48 кHz. В комплекте SDK для Python, Java, Go, C#, PHP, Node.js.
Техническая начинка
Два архитектурных решения определяют производительность:
- Токенизатор 12.5 Hz — низкая частота кадров сокращает количество токенов на секунду аудио, снижая нагрузку на автоагрессивную генерацию и задержки.
- Пятиступенчатое обучение — раздельная предтренировка языковой модели (LM) и flow-matching (FM), затем совместная дотренировка, reinforcement learning для LM, обучение FM на зашумлённых данных, финальное RL для FM. Результат — лучшая согласованность контента, естественность просодии, точность голоса и устойчивость к шумам на референсе.
Модель синтезирует до 3 минут за проход, справляется со сложной нормализацией текста и выдаёт 48 кHz через super-resolution вокодер.
16 языков и топ рейтинга
Qwen-Audio-3.0-TTS поддерживает 16 языков (арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский, вьетнамский) и 20 китайских диалектов. По разборчивости (WER/CER) Flash показывает лучший средний результат 3.87 в 10 из 16 языков, Plus — 3.96. По похожести голоса Plus лидирует со средним 82.75, Flash — 80.44.
Plus занял первое место в Speech Arena от Artificial Analysis с Elo ~1236 (статистическая ничья с Simba 3.2 на 1234). Цена — $27.59 за 1 млн символов, что втрое дешевле ElevenLabs и MiniMax на сопоставимом качестве. Но есть компромисс: генерация идёт со скоростью ~16 символов/сек, тогда как Simba 3.2 даёт 30.2, Gemini 3.1 Flash TTS — 27, Sonic 3.5 — 120.
Контроль через теги
Добавлено 86 встроенных тегов для точного управления:
- Управляющие теги (
[excited],[sad],[whispers],[asmr]) задают эмоцию до следующего тега. - Богатые языковые теги (
[laughing],[gasp],[clears throat]) вставляют локальный эффект без смены общего тона.
Пример: [excited]Какой сегодня прекрасный день![laughing]Давай пойдём гулять!
Ограничение: эмоциональные и языковые теги работают только в однонаправленном стриминге.
Реакция сообщества
Ранние отклики осторожно позитивные. Главный месседж: не-западная TTS обошла арену по качеству при цене втрое ниже. Основные претензии: только облако (нет весов), низкая скорость генерации, путаница с открытой линейкой Qwen3-TTS (Apache-2.0).
Ключевые выводы
- Qwen-Audio-3.0-TTS-Plus занял первое место в независимом рейтинге Artificial Analysis, обойдя западных конкурентов по качеству при цене ~$27.59 за 1 млн символов — втрое дешевле ElevenLabs
- Архитектура на токенизаторе 12.5 Hz и пятиступенчатом обучении (LM+FM) снижает задержки и улучшает устойчивость к зашумлённым референсам
- Поддержка 16 языков с лучшими WER/CER в 10 из них, 86 встроенных тегов для контроля эмоций и нюансов речи (смех, вздохи, шёпот)
- Скорость генерации ~16 символов/сек — в 2-7 раз медленнее топовых конкурентов (Simba 3.2, Sonic 3.5), что критично для highload-сценариев
- Модель доступна только как облачный сервис через Alibaba Cloud, весов в открытом доступе нет, что ограничивает on-premise внедрение
Автор: Анна Мельникова · Источник: marktechpost.com
Qwen-Audio-3.0-TTS — это момент, когда китайский AI-сервис впервые возглавил независимый рейтинг TTS, обойдя ElevenLabs, Play.ht и Google по качеству. Цена $27.59 за миллион символов против $80-100 у конкурентов — это не просто скидка, а новая ценовая планка. Плюс 16 языков, 86 тегов для контроля эмоций (смех, вздохи, шёпот) и устойчивость к зашумлённым референсам. Звучит как всё, что нужно для продакшена.
Но дьявол в деталях. Скорость генерации ~16 символов в секунду — это в 2-7 раз медленнее западных аналогов (Sonic 3.5 выдаёт 120 символов/сек). Для сценариев реального времени, где каждая миллисекунда на счету, это может стать deal-breaker'ом. Второй момент — модель живёт только в облаке Alibaba, весов нет, on-premise не завезут. Если ты в энтерпрайзе с compliance-требованиями или в стране, где Alibaba Cloud недоступен, можешь только смотреть со стороны. И да, название Qwen-Audio-3.0-TTS путается с открытой линейкой Qwen3-TTS — пиар-промах, который уже сбивает с толку разработчиков на Reddit и HN.
Инструменты из статьи
Синтез и клонирование голоса. Поддерживает русский, реалистичная интонация.
Доступ из РФ →
Комментарии