Школьник выпустил полноценную TTS-модель всего на 4 миллиона параметров
Разработчик-старшеклассник представил Inflect v2 — две сверхкомпактные модели для синтеза речи (4M и 10M параметров), которые работают полностью локально без внешних компонентов. Модели в 21-1000 раз меньше аналогов, но при этом производят вполне годную речь с качеством ~4.4 UTMOS и скоростью 6-10× реального времени на CPU.
Показывает, что высококачественный локальный TTS возможен на потребительском железе без облаков и гигантских моделей. Важно для приватности, офлайн-приложений и устройств с ограниченными ресурсами.
Школьник создал одну из самых компактных TTS-моделей в мире
Разработчик под ником owensong выпустил Inflect v2 — две полноценные модели для синтеза речи из текста:
- Inflect-Nano-v2: 3.96M параметров (16 МБ)
- Inflect-Micro-v2: 9.36M параметров (38 МБ)
Это полные модели — не только акустическая часть, но и обработка текста, предсказание тайминга, генерация речи и вокодер. Текст заходит, речь 24 кГц выходит. Никаких внешних API или дополнительных компонентов.
Размер имеет значение
Для сравнения, Nano:
- в 21× меньше Kokoro
- в 126× меньше Chatterbox
- в 1000+× меньше Fish Audio S2 Pro
Автор честно признаёт: это не замена многомиллиардным моделям с клонированием голоса. Вопрос в другом — сколько полезного TTS можно впихнуть в такой маленький пакет.
Качество и скорость
- Micro: UTMOS22 = 4.395, семантическая WER 3.99%, 6.28× реального времени на CPU
- Nano: UTMOS22 = 4.386, семантическая WER 4.21%, 10.72× реального времени на CPU
В слепом тестировании сообщества среди компактных TTS систем Micro и Nano заняли 2-е и 3-е места.
Ограничения
Модели говорят только по-английски, используют один фиксированный мужской голос, не поддерживают клонирование. Сложности с незнакомыми именами, аббревиатурами, числами и омографами. Nano может звучать тоньше Micro, иногда проскакивают металлические или обрезанные артефакты.
Автор — школьник с ограниченным бюджетом на обучение. Это наложило отпечаток: эффективность требовалась не только в инференсе, но и в тренировке.
V2 — серьёзная переработка первой версии (4.63M), которая вышла месяц назад. Исправлены нестабильный тайминг, металлический звук, слабая просодия, плохая обработка сложного текста.
Модели доступны на HuggingFace, есть интерактивная площадка для теста. Автор просит фидбэк с точными деталями: текст, модель, seed, что пошло не так. Если будет интерес — возможна v3 с дополнительными голосами и языками.
Ключевые выводы
- Одна из самых компактных полноценных TTS-моделей (4-10M параметров) показывает вполне годное качество (~4.4 UTMOS) и работает в 6-10× быстрее реального времени на CPU
- Модель в 21-1000 раз меньше популярных аналогов, но это узкоспециализированная система (один голос, только английский) против универсальных решений
- Проект создан школьником с ограниченным бюджетом — пример того, как архитектурные решения и фокус на эффективность могут конкурировать с большими ресурсами в определённой нише
- V2 — результат месяца переработки v1, где решены ключевые проблемы: нестабильный тайминг, металлический звук, слабая просодия
- Честная оценка ограничений (английский, один голос, артефакты на сложном тексте) и запрос на детальный фидбэк — знак зрелого подхода к разработке
Автор: Артём Ковалёв · Источник: reddit.com
**Знаете, что меня тут реально цепляет?** Не сам факт «ещё одна маленькая модель», а контекст. Парень в школе, с ограниченным бюджетом, за месяц переписал архитектуру и выкатил систему, которая в слепом тесте обошла кучу «взрослых» проектов. Модель в 4M параметров — это размер небольшого MP3-файла. А она выдаёт речь качеством ~4.4 UTMOS (для контекста: 4.0+ это уже «хорошо звучит») и делает это в 10 раз быстрее реального времени на обычном процессоре.
Да, это не замена GPT-4o или ElevenLabs. Один голос, только английский, артефакты на сложных текстах. Но это **локально**, без API, без интернета, без облаков. Для встраиваемых систем, приватных приложений, IoT — это золото. И что важно: автор не раздувает щёки, честно пишет про ограничения и просит фидбэк с конкретикой. Если v3 добавит ещё пару голосов и язык — это может стать de facto стандартом для edge TTS. Следим.
Комментарии