инструменты 1 мин

NVIDIA выпустила NemotronLabs VoiceChat 11B: открытая модель голосовых разговоров с задержкой 450 мс и вызовом инструментов на ходу

NVIDIA открыла 11B-модель для голосовых диалогов в реальном времени с задержкой переключения реплик 448 мс. Вместо связки распознавание-LLM-синтез работает одна сеть, поддерживает прерывания пользователя и вызов API-инструментов прямо во время разговора. Модель бесплатна, но пока помечена research-only из-за реальных багов: рушится через несколько реплик, забывает слова, зацикливается. Требует одну GPU с 80 ГБ памяти, облачного API нет.

Это первая открытая модель класса GPT-4o Realtime, которую можно запустить на своём железе. Если вы строите voice-продукт, теперь не обязательно платить OpenAI или Google — можно взять контроль над инфраструктурой, но за это придётся расплачиваться инженерным временем и борьбой с багами.

Что произошло

NVIDIA выпустила NemotronLabs VoiceChat 11B — первую открытую модель для полнодуплексных голосовых разговоров (full-duplex), которая умеет вызывать внешние API прямо во время диалога. Обычная схема voice-агента — распознавание речи (ASR) → текстовая модель (LLM) → синтез речи (TTS) — заменена на одну сквозную нейросеть. Измеренная задержка переключения реплик — 448 мс. Модель слушает пока говорит, пользователь может прервать её в любой момент, и агент корректно уступает слово (take-over rate 1.00 при 480 мс).

Главная фишка — вызов инструментов без паузы: модель выдаёт команду <TOOLCALL> по отдельному каналу, а пока API работает, произносит заранее заданную фразу-заполнитель (on-hold message), чтобы разговор не зависал в тишине. Например, «Минутку, уточняю цену...», пока запрашивается внешняя база.

Архитектура — гибрид Mamba/Transformer: энкодер Fast Conformer кодирует аудио 16 кГц, LLM-ядро Nemotron Nano v2 генерирует текст и токены для TTS-декодера, который рендерит речь 22.05 кГц. Обучена на ~550 тысячах часов аудио, включая синтетику.

Ограничения жёсткие: NVIDIA прямо пишет, что модель ready for research only. Контекст — максимум две минуты, после нескольких реплик начинает нести бред без возможности восстановления, может зациклиться на самоговорении, роняет слова при распознавании пользователя. Максимум пять инструментов на сессию, параллельные вызовы не работают, во время выполнения инструмента прервать агента нельзя.

Веса лежат на Hugging Face под лицензией OpenMDW-1.1 (пермиссивная). Но для запуска нужна одна GPU с минимум 80 ГБ VRAM (A100, H100, RTX 6000 Pro, B200). Облачного API нет, inference-провайдеры модель не хостят — без собственного железа не попробуешь.

голосовые моделиfull-duplex диалогиspeech-to-speechинструменты вызововоткрытые веса

Автор: Юлия Тарасова · Источник: marktechpost.com

Разработчикам. Готовый контейнер NGC, веса на HF, документация в NeMo Speech. Можно интегрировать full-duplex диалоги в свои продукты, строить голосовые фронтенды поверх внутренних API, тестировать barge-in логику. Но нужно самостоятельно обрабатывать деградацию после нескольких реплик и ограничивать длину сессий до двух минут.

Бизнесу. Открывает путь к умным голосовым агентам для колл-центров, автомобильных ассистентов, ресторанов drive-thru, IVR в телекоме, NPC в играх. Но для проде пока не годится из-за задокументированных багов — подходит для пилотов и R&D. Экономия на связке отдельных сервисов ASR-LLM-TTS, но требует GPU-инфраструктуру.

Инвесторам. Первая открытая модель такого класса с вызовом инструментов. Бенчмарки Full-Duplex-Bench 1.0: второе место среди open-моделей. Потенциальный рынок — мультимиллиардная индустрия voice AI (Gartner прогнозирует $8 млрд к 2028). Риск — модель сырая, конкуренты (GPT-4o Realtime, Gemini Live) пока проприетарны, но стабильнее. Инвестиционно интересны стартапы, строящие промежуточные слои стабилизации и оркестрации поверх таких моделей.

Хайп65
Реальная польза55
Заработать50
  • Voice-агенты для колл-центров с живым апсейлом: клиент спрашивает цену, агент на лету дёргает CRM и предлагает скидку — без тишины благодаря on-hold сообщениям.
  • Голосовые фронтенды для внутренних API: техподдержка, логистические системы, складской учёт — голосовой интерфейс вместо мобильного приложения для полевых сотрудников.
  • Автомобильные ассистенты с прерываниями: водитель может перебить навигацию, попросить изменить маршрут, система корректно уступает слово.
  • Сервис стабилизации поверх сырых моделей: обёртка для NemotronLabs, которая детектирует деградацию, рестартит сессию и склеивает контекст — B2B для тех, кто хочет использовать открытые веса, но боится багов.
  • Инструменты бенчмаркинга full-duplex задержек: платформа для тестирования voice-агентов на базе Full-Duplex-Bench, продавать доступ разработчикам голосовых систем.
  • Модель пока непригодна для прода: NVIDIA честно пишет research-only, баги критичные (деградация, зацикливание, потеря слов). Запускать в бой — репутационный риск.
  • Барьер входа высокий: нужна GPU 80 ГБ, облачного API нет. Без доступа к железу большинство не сможет даже попробовать.
  • Конкуренция сильнее: проприетарные GPT-4o Realtime и Gemini Live стабильнее и доступнее через API, хотя дороже. Открытая модель даёт контроль, но требует инженерных ресурсов.
  • Переоценка зрелости: хайп вокруг открытых весов может создать иллюзию готовности технологии, но реальное применение потребует месяцев доработки и костылей поверх.

Это именно то, чего не хватало open-source голосовым агентам: возможность прервать модель, пока она говорит, и вызывать внешние API прямо в разговоре. NVIDIA не скрывает проблем — в доке прямо перечислены баги: деградация в бред, зацикливание, потеря слов. Для пилотов и R&D это золото, для прода — пока мина. Но сам факт, что такое вообще выложили в открытый доступ, сдвигает планку — теперь у стартапов есть альтернатива проприетарным GPT-4o Realtime и Gemini Live.

Честно говоря, барьер входа — GPU на 80 ГБ — отсечёт большинство экспериментаторов. Облачного API нет, inference-провайдеры модель не подхватили, так что либо своё железо, либо никак. Зато тем, кто в теме и имеет доступ к мощности, открывается возможность строить собственные голосовые платформы без vendor lock-in. Следующий год покажет, смогут ли community и NVIDIA стабилизировать модель до production-grade, или это останется красивой исследовательской игрушкой.

Ещё по теме

Комментарии