#синтез речи

И инструменты ·18 авг 2026

Cartesia Sonic-3.6 возглавил оба рейтинга синтеза речи Artificial Analysis

Cartesia выпустила Sonic-3.6 — стриминговую TTS-модель на state space models, которая заняла первое место в обоих рейтингах Artificial Analysis (1283 и 1123 Elo). Модель показывает задержку менее 90 мс до первого аудио, поддерживает клонирование голоса за 10 секунд и доступна только как платный API.

0 99
М модели ·25 июл 2026

Школьник выпустил полноценную TTS-модель всего на 4 миллиона параметров

Разработчик-старшеклассник представил Inflect v2 — две сверхкомпактные модели для синтеза речи (4M и 10M параметров), которые работают полностью локально без внешних компонентов. Модели в 21-1000 раз меньше аналогов, но при этом производят вполне годную речь с качеством ~4.4 UTMOS и скоростью 6-10× реального времени на CPU.

0 106
М модели ·28 июл 2026

Apple показала архитектуру синтеза речи для Siri: 21 МБ памяти и в 16 раз быстрее реального времени

Apple опубликовала детали архитектуры синтеза речи для Siri Expressive Voices на базе AFM 3 Core Advanced. Новый detokenizer превращает семантические аудиотокены в речь, используя всего 21 МБ оперативной памяти и 329 МБ ассетов на устройстве. Работает в 16 раз быстрее реального времени на Apple Matrix Coprocessor (AMX), улучшает качество голоса на +0.28 MOS. Три компонента (streaming encoder, temporal decoder, depth decoder) разделяют обработку времени и глубины, один универсальный декодер заменяет кучу специализированных.

0 61