#синтез речи

М модели ·25 июл 2026

Школьник выпустил полноценную TTS-модель всего на 4 миллиона параметров

Разработчик-старшеклассник представил Inflect v2 — две сверхкомпактные модели для синтеза речи (4M и 10M параметров), которые работают полностью локально без внешних компонентов. Модели в 21-1000 раз меньше аналогов, но при этом производят вполне годную речь с качеством ~4.4 UTMOS и скоростью 6-10× реального времени на CPU.

0 105
И инструменты ·20 июл 2026

Alibaba выпустила Qwen-Audio-3.0-TTS — многоязычный синтез речи с лидерством в рейтинге и ценой втрое ниже конкурентов

Tongyi Lab (Alibaba) запустила Qwen-Audio-3.0-TTS — облачный сервис синтеза речи в двух вариантах: Flash для реального времени (~300 мс задержка) и Plus для максимального качества. Plus занял первое место в независимом рейтинге Artificial Analysis, поддерживает 16 языков, стоит ~$27.59 за 1 млн символов (втрое дешевле ElevenLabs), но уступает в скорости генерации (~16 символов/сек против 120 у Sonic 3.5). Модель предлагает 86 встроенных тегов для контроля эмоций, смеха, дыхания и других нюансов голоса.

0 71