#TTS

И инструменты ·18 авг 2026

Cartesia Sonic-3.6 возглавил оба рейтинга синтеза речи Artificial Analysis

Cartesia выпустила Sonic-3.6 — стриминговую TTS-модель на state space models, которая заняла первое место в обоих рейтингах Artificial Analysis (1283 и 1123 Elo). Модель показывает задержку менее 90 мс до первого аудио, поддерживает клонирование голоса за 10 секунд и доступна только как платный API.

0 99
И инструменты ·5 авг 2026

Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки

В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.

0 105
М модели ·25 июл 2026

Школьник выпустил полноценную TTS-модель всего на 4 миллиона параметров

Разработчик-старшеклассник представил Inflect v2 — две сверхкомпактные модели для синтеза речи (4M и 10M параметров), которые работают полностью локально без внешних компонентов. Модели в 21-1000 раз меньше аналогов, но при этом производят вполне годную речь с качеством ~4.4 UTMOS и скоростью 6-10× реального времени на CPU.

0 106
И инструменты ·27 июл 2026

Локальный AI-диджей на Ollama: 9B-модель выбирает музыку и ведёт радио

Разработчик превратил простаивающий Ollama-сервер в автономную радиостанцию с AI-диджеем. Агент на базе Qwen3.5 9B с инструментами анализирует библиотеку Navidrome, смотрит историю, учитывает погоду и подбирает треки с обоснованием. Пишет анонсы, озвучивает их через Piper/Kokoro TTS, микширует с музыкой. Работает полностью локально, без API-ключей — нужны только своя фонотека и Docker.

0 86
И инструменты ·27 июл 2026

Разработчик открыл файнтюнинг крошечной TTS-модели на 4 миллиона параметров

Автор TTS-модели Inflect (4 и 9 млн параметров, 16-38 МБ) выпустил тулкит для файнтюнинга на своём голосе или языке. После релиза основной вопрос был не «звучит ли это прилично», а «можно ли обучить на своих данных». За выходные собрал рабочий пайплайн с warm-start, resume и экспортом в ONNX, но пока не уверен, насколько хорошо модель такого размера перенесётся на неанглийские языки.

0 52
И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 27