инструменты 1 мин

Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки

В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.

Если качество окажется сравнимым с оригиналом, порог входа для создания продуктов с клонированием голоса упадёт почти до нуля — любой разработчик на llama.cpp получит TTS одной командой.

В основную ветку llama.cpp слили поддержку Qwen3-TTS — модели, которая клонирует голос из короткого (от 3 секунд) фрагмента аудио. Несколько месяцев назад была демка, но её не принимали в мастер из-за отсутствия нужных API. Теперь всё работает из коробки.

Модель Qwen3-TTS-12Hz-1.7B-Base в формате GGUF умеет синтезировать речь на английском, китайском, немецком, итальянском, испанском, французском, португальском, русском, японском и корейском. На вход — текст и референсный MP3/WAV файл, на выходе — клонированный голос в WAV.

Команда простая: указываешь модель, текст, язык, референсный файл голоса и получаешь результат. Работает на CPU, Metal, CUDA, ROCm — везде, где крутится llama.cpp.

Важное ограничение: пока поддерживается только базовая модель 1.7B, без CustomVoice и VoiceDesign. HTTP-эндпоинт /tts для серверного режима ещё в драфте. Независимых тестов качества клонирования (насколько точно копирует голос) пока нет. Выделенные C++ реализации типа qwen3-tts.cpp могут быть быстрее, но llama.cpp выигрывает в интеграции — если проект уже на нём работает, добавить голос теперь тривиально.

Интересно сравнить производительность на разных платформах (M-серия, CPU-only, GPU), замерить real-time factor и потребление памяти. Пока никто публично не тестировал.

Автор: Павел Заславский · Источник: reddit.com

Разработчикам. Можно добавить локальное клонирование голоса в проект на llama.cpp одной командой, не меняя инфраструктуру. Работает на любом железе, поддерживает 10 языков, референс от 3 секунд. Пока без HTTP API (в драфте), только через CLI llama-tts.

Бизнесу. Локальное клонирование голоса без облака открывает возможности для персонализированных голосовых ассистентов, озвучки контента, обучающих платформ — всё с приватностью из коробки. Не нужны платные API, работает на своём железе.

Инвесторам. Интеграция TTS в llama.cpp снижает барьер для массового внедрения голосовых интерфейсов. Растёт спрос на edge-AI решения с голосом (умные дома, offline-ассистенты, корпоративные системы). Qwen Ali показывает серьёзные намерения в открытом AI.

Хайп35
Реальная польза70
Заработать65
  • Персонализированные голосовые ассистенты для корпораций: клонирование голоса бренд-амбассадора для чат-ботов и IVR, всё локально
  • SaaS для малого бизнеса: озвучка контента (курсы, подкасты, видео) своим голосом без студии, подписка на использование модели
  • Accessibility-проекты: дешёвая озвучка книг/статей для людей с нарушениями зрения на родном языке с кастомным голосом
  • Игры и VR: генерация диалогов NPC голосом игрока или кастомным голосом персонажа на лету, без предзаписи
  • B2B-инструменты для разработчиков: обёртки и плагины для интеграции TTS в Electron, Tauri, мобильные приложения
  • Качество клонирования не подтверждено независимыми тестами — может уступать PyTorch-оригиналу или другим реализациям
  • Отсутствие HTTP API (пока драфт) ограничивает применение в веб-сервисах, нужно ждать стабильной версии
  • Только базовая модель: для продакшн-качества могут понадобиться CustomVoice/VoiceDesign, которые пока не поддерживаются
  • Deepfake-риски: упрощение доступа к клонированию голоса усиливает угрозу мошенничества и фейковых аудио без защитных механизмов

Это действительно заметный шаг. llama.cpp стал стандартом для запуска LLM локально, и теперь туда же встроили TTS с клонированием голоса. Для разработчиков это означает, что голосовые интерфейсы перестают быть отдельным проектом — просто ещё одна фича в уже знакомом стеке. Особенно интересно для корпоративных решений, где данные нельзя отправлять в облако.

Но есть два больших «но». Первое: никто ещё толком не протестировал, насколько хорошо клонирует голос эта реализация по сравнению с оригиналом. Может оказаться, что для серьёзного качества всё равно придётся использовать специализированные порты. Второе: отсутствие HTTP API в стабильной версии означает, что для веб-сервисов это пока полуфабрикат. Ждём бенчмарков и доработки серверного режима — вот тогда станет ясно, революция это или просто удобная интеграция.

Ещё по теме

Комментарии