Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки
В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.
Если качество окажется сравнимым с оригиналом, порог входа для создания продуктов с клонированием голоса упадёт почти до нуля — любой разработчик на llama.cpp получит TTS одной командой.
В основную ветку llama.cpp слили поддержку Qwen3-TTS — модели, которая клонирует голос из короткого (от 3 секунд) фрагмента аудио. Несколько месяцев назад была демка, но её не принимали в мастер из-за отсутствия нужных API. Теперь всё работает из коробки.
Модель Qwen3-TTS-12Hz-1.7B-Base в формате GGUF умеет синтезировать речь на английском, китайском, немецком, итальянском, испанском, французском, португальском, русском, японском и корейском. На вход — текст и референсный MP3/WAV файл, на выходе — клонированный голос в WAV.
Команда простая: указываешь модель, текст, язык, референсный файл голоса и получаешь результат. Работает на CPU, Metal, CUDA, ROCm — везде, где крутится llama.cpp.
Важное ограничение: пока поддерживается только базовая модель 1.7B, без CustomVoice и VoiceDesign. HTTP-эндпоинт /tts для серверного режима ещё в драфте. Независимых тестов качества клонирования (насколько точно копирует голос) пока нет. Выделенные C++ реализации типа qwen3-tts.cpp могут быть быстрее, но llama.cpp выигрывает в интеграции — если проект уже на нём работает, добавить голос теперь тривиально.
Интересно сравнить производительность на разных платформах (M-серия, CPU-only, GPU), замерить real-time factor и потребление памяти. Пока никто публично не тестировал.
Автор: Павел Заславский · Источник: reddit.com
Разработчикам. Можно добавить локальное клонирование голоса в проект на llama.cpp одной командой, не меняя инфраструктуру. Работает на любом железе, поддерживает 10 языков, референс от 3 секунд. Пока без HTTP API (в драфте), только через CLI llama-tts.
Бизнесу. Локальное клонирование голоса без облака открывает возможности для персонализированных голосовых ассистентов, озвучки контента, обучающих платформ — всё с приватностью из коробки. Не нужны платные API, работает на своём железе.
Инвесторам. Интеграция TTS в llama.cpp снижает барьер для массового внедрения голосовых интерфейсов. Растёт спрос на edge-AI решения с голосом (умные дома, offline-ассистенты, корпоративные системы). Qwen Ali показывает серьёзные намерения в открытом AI.
- Персонализированные голосовые ассистенты для корпораций: клонирование голоса бренд-амбассадора для чат-ботов и IVR, всё локально
- SaaS для малого бизнеса: озвучка контента (курсы, подкасты, видео) своим голосом без студии, подписка на использование модели
- Accessibility-проекты: дешёвая озвучка книг/статей для людей с нарушениями зрения на родном языке с кастомным голосом
- Игры и VR: генерация диалогов NPC голосом игрока или кастомным голосом персонажа на лету, без предзаписи
- B2B-инструменты для разработчиков: обёртки и плагины для интеграции TTS в Electron, Tauri, мобильные приложения
- Качество клонирования не подтверждено независимыми тестами — может уступать PyTorch-оригиналу или другим реализациям
- Отсутствие HTTP API (пока драфт) ограничивает применение в веб-сервисах, нужно ждать стабильной версии
- Только базовая модель: для продакшн-качества могут понадобиться CustomVoice/VoiceDesign, которые пока не поддерживаются
- Deepfake-риски: упрощение доступа к клонированию голоса усиливает угрозу мошенничества и фейковых аудио без защитных механизмов
Это действительно заметный шаг. llama.cpp стал стандартом для запуска LLM локально, и теперь туда же встроили TTS с клонированием голоса. Для разработчиков это означает, что голосовые интерфейсы перестают быть отдельным проектом — просто ещё одна фича в уже знакомом стеке. Особенно интересно для корпоративных решений, где данные нельзя отправлять в облако.
Но есть два больших «но». Первое: никто ещё толком не протестировал, насколько хорошо клонирует голос эта реализация по сравнению с оригиналом. Может оказаться, что для серьёзного качества всё равно придётся использовать специализированные порты. Второе: отсутствие HTTP API в стабильной версии означает, что для веб-сервисов это пока полуфабрикат. Ждём бенчмарков и доработки серверного режима — вот тогда станет ясно, революция это или просто удобная интеграция.
Комментарии