PolyAI запустила Dialog-RSN-1: голосовую модель для call-центров с задержкой менее 300 мс
PolyAI выпустила Dialog-RSN-1 — голосовую модель для автоматизации звонков, которая работает напрямую с аудио, управляет паузами в диалоге и выдаёт ответ за 300 мс. Модель уже обслуживает реальные звонки в ресторанах и страховых компаниях, показывая +11% улучшение обработки и −37% снижение задержки.
Если вы строите голосовые AI-сервисы или автоматизируете call-центр, это конкретный пример рабочей архитектуры с измеримыми результатами в бою. Если инвестор — показатель, что рынок голосовой автоматизации переходит от экспериментов к реальным деньгам.
Что случилось
PolyAI, стартап с финансированием $86M (Series D, декабрь 2025), запустил Dialog-RSN-1 — голосовую модель для автоматизации звонков в call-центрах. Ключевое отличие: модель работает напрямую с аудио, минуя промежуточную транскрипцию в текст. Это позволяет ей улавливать интонацию, паузы и неуверенность говорящего — то, что теряется в традиционных каскадных системах (ASR → LLM → TTS).
Как работает
Модель запускается по требованию (не держит GPU постоянно занятым), первый токен ответа определяет, нужно ли агенту говорить (EMPTY / ONGOING / COMPLETE). Аудио обрабатывается на входе, но генерация голоса остаётся отдельной (TTS), что даёт контроль над произношением. Задержка ответа — менее 300 мс на A100. Используются трюки: кеширование контекста пока говорит пользователь, умная маршрутизация звонков на одну GPU, спекулятивная декодировка (в среднем 3.9 токена за раз).
Результаты в бою
У ресторанной сети: +11% улучшение обработки запросов (containment). У страховщика: −37% задержки. Модель уже работает в 2000+ развёртываниях у 100+ корпоративных клиентов PolyAI (рестораны, страховые, банки, телеком). Пока только английский.
Но есть нюанс
Модель доступна ТОЛЬКО через платформу PolyAI — никаких открытых весов, публичного API или self-serve. Это корпоративный B2B-продукт, не песочница для разработчиков.
Автор: Юлия Тарасова · Источник: marktechpost.com
Разработчикам. Архитектура интересна: модель обрабатывает аудио на входе, но TTS остаётся отдельным, управляемым компонентом. Первый токен контролирует turn-taking. Используют prefill кеша во время речи пользователя, append-only промпты, спекулятивную декодировку. Код и веса закрыты, но подход можно воспроизвести на открытых моделях вроде Qwen или Mistral 8B-30B.
Бизнесу. Если у вас call-центр с высокой нагрузкой (рестораны, страховые, финтех), технология даёт измеримый результат: −37% задержки, +11% containment. Окупаемость быстрая при объёме 10k+ звонков в месяц. Альтернативы (Gemini Live, GPT Realtime) дороже и медленнее. Но вендор-лок: переход на другую платформу проблематичен.
Инвесторам. PolyAI с $86M в кармане занимает нишу между универсальными LLM (слишком медленные) и legacy IVR (слишком тупые). 2000+ развёртываний — это доказанный product-market fit. Рынок голосовой автоматизации растёт, но конкуренция с OpenAI и Google усилится. Ставка на вертикальную интеграцию и скорость вывода в прод.
- Внедрить аудио-нативные модели в корпоративные call-центры (финтех, телеком, e-commerce) — ROI быстрый при объёме 10k+ звонков/мес
- Разработать open-source аналог Dialog-RSN-1 на базе Qwen/Mistral 8B-30B + кастомный TTS для self-hosted решений — спрос от компаний, не готовых платить PolyAI
- Создать инструменты для оценки качества голосовых агентов (Dialog-Eval пообещали открыть) — бенчмарки и аудит для корпораций
- Адаптировать подход для multilingual call-центров (русский, китайский, испанский) — PolyAI пока только английский
- Построить платформу для A/B-тестирования голосовых агентов с измерением containment, latency, sentiment — SaaS для оптимизации
- Модель закрыта, вендор-лок — если PolyAI поднимет цены или обанкротится, заказчик в ловушке
- Только английский на старте — для глобальных рынков пока не готово, конкуренты могут обогнать
- Sub-300ms — это круто, но реальная польза зависит от качества ответов, а бенчмарк Dialog-Eval внутренний и пока не открыт
- GPT Realtime 2.1 показывает схожие результаты — если OpenAI сделает API дешевле и быстрее, преимущество PolyAI может испариться
Это не очередной GPT-wrapper, а нормальный продуктовый AI: взяли Qwen/Mistral, дообучили на своих данных, выжали латентность до 300 мс и продают корпорациям за реальные деньги. +11% containment у ресторанной сети — это конкретная экономия на зарплатах операторов. −37% задержки у страховщика — клиенты меньше бесятся и не вешают трубку. Всё честно.
Но есть засада: модель полностью закрыта, никаких весов, никакого API для разработчиков. Хочешь попробовать — только через платформу PolyAI, только корпоративный контракт. Для стартапов и экспериментов это не вариант. Зато для больших компаний с потоком 10k+ звонков в месяц — готовое решение, которое можно включить завтра. Вопрос в цене и vendor lock-in: если PolyAI поднимет тарифы через год, клиент в ловушке.
Комментарии