audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени
Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.
Проект показывает, как можно выжимать кратный прирост производительности из AI-моделей через низкоуровневую оптимизацию — важно для тех, кто хочет запускать TTS/ASR локально без облачных API и задержек.
audio.cpp 0.4: производительный TTS в C++
Проект audio.cpp выпустил версию 0.4 с акцентом на высококачественный синтез речи (TTS) и полноценную поддержку формата GGUF для квантизованных моделей.
Что нового
Модели: добавлены Higgs Audio v3 TTS 4B, Fish Audio S2 Pro, Voxtral Realtime ASR и два community-проекта (OuteTTS, VieNeu-TTS-v3). Всего библиотека теперь поддерживает 35 семейств моделей, и все они работают с GGUF.
Производительность Q8 на CUDA (RTX 5090): - Higgs Audio TTS: 8.8–10.1× быстрее реального времени в режиме warmed-сессий, 8.5× на длинных текстах (6000+ символов). - Fish Audio S2 Pro: 3.1–3.4× в тёплых запросах, 3.3× на longform (реализация пока наивная, есть потенциал оптимизации). - Voxtral ASR: транскрибирует офлайн в 15.7× быстрее реального времени, time-to-first-token в стриминге ~171 мс.
Квантизация Q8: даёт до 1.5× прироста скорости и экономит до 37% VRAM по сравнению с 16-битным GGUF. Эффект зависит от модели — разработчики ведут матрицу совместимости, не обещая универсальной магии.
Что это значит
Для разработчиков: готовые GGUF-пакеты позволяют запускать качественный TTS на локальном железе без облачных API. Для экспериментаторов: появилась секция community models с более мягким ревью — можно портировать свои модели через готовые модули фреймворка.
Проект показывает, что грамотная оптимизация на уровне C++ и GGML позволяет выжимать из видеокарт кратный прирост производительности по сравнению с Python-фреймворками.
Ключевые выводы
- Квантизация Q8 в GGUF даёт измеримый прирост: до 1.5× по скорости и до 37% экономии VRAM, но не для всех моделей одинаково эффективна
- Higgs Audio v3 TTS 4B работает в 8–10 раз быстрее реального времени на RTX 5090 — достаточно для интерактивных применений
- audio.cpp поддерживает уже 35 семейств моделей с единым интерфейсом загрузки GGUF, что упрощает деплой локальных TTS/ASR
- Появление community models секции снижает порог входа для портирования новых моделей в фреймворк
- Реализация Fish Audio S2 Pro пока наивная — разработчики оставляют место для 2–3× дальнейших оптимизаций
Автор: Анна Мельникова · Источник: reddit.com
audio.cpp делает то, чего не хватает Python-фреймворкам: даёт реальный контроль над производительностью и памятью. Цифры впечатляют — 10× для TTS это уже не «едва успевает», а запас для параллельной обработки нескольких потоков. Квантизация Q8 работает не магически (1.5× прироста — это скромно), но в сочетании с C++ и GGML получается годный инструмент для продакшена на своём железе.
Осторожность нужна в оценке качества квантованных моделей: разработчики честно признают, что не все модели дружат с Q8, и ведут матрицу совместимости. Но сам факт, что community может портировать модели через готовые модули — это правильный путь развития проекта. Если нужен TTS без зависимости от OpenAI/ElevenLabs и с контролем над латентностью — стоит попробовать.
Комментарии