инструменты 1 мин

Cartesia Sonic-3.6 возглавил оба рейтинга синтеза речи Artificial Analysis

Cartesia выпустила Sonic-3.6 — стриминговую TTS-модель на state space models, которая заняла первое место в обоих рейтингах Artificial Analysis (1283 и 1123 Elo). Модель показывает задержку менее 90 мс до первого аудио, поддерживает клонирование голоса за 10 секунд и доступна только как платный API.

Если вы строите голосовых агентов, IVR или автоматизацию звонков — Sonic-3.6 сейчас лучший выбор по соотношению качество/скорость. Если нужен контроль и приватность — вы заперты в API-зависимости.

Что произошло

Cartesia представила Sonic-3.6 — обновлённую модель синтеза речи в реальном времени. Через три месяца после версии 3.5 компания поднялась на первые места в обоих рейтингах Artificial Analysis: 1283 Elo в Provider Voice (где модели используют свои голоса) и 1123 Elo в Controlled Voice (все модели синтезируют речь одними и теми же восемью референсными голосами).

Второй результат важнее — он показывает качество самого движка синтеза, а не каталога голосов. Sonic-3.6 опередил собственную версию 3.5 и ElevenLabs Eleven v3.

Техническая основа

Вместо трансформеров Sonic использует state space models — это даёт задержку менее 90 мс до первого звука (по заявлениям Cartesia). Для сравнения: их же модель транскрибации Ink-2 показывает 100 мс латентности.

Модель умеет: - Клонировать голоса по 10-секундному образцу - Обрабатывать inline-теги вроде [laughter] прямо в тексте - Правильно читать номера заказов, телефоны и коды без предобработки - Переключаться между языками (демо показывают микс хинди и английского) - Настраивать произношение через IPA-словари (например, subpoena как səˈpinə)

Цены и доступность

Модель закрытая, весов нет — только платный API. Стоимость: 49 долларов за миллион символов (вдвое дешевле ElevenLabs, но втрое дороже Speechify Simba). Тариф Scale за 299 долларов включает примерно 10 667 минут TTS и 15 одновременных запросов. Голосовые агенты оплачиваются отдельно — 6 центов за минуту.

Сейчас Sonic-3.6 в бете, доступен только через API Cartesia. Партнёры и документация пока работают с версией 3.5.

TTSсинтез речиAPIголосовые агентыstate space models

Автор: Юлия Тарасова · Источник: marktechpost.com

Разработчикам. API с тонкими настройками эмоций, скорости и громкости, встроенная поддержка LiveKit Agents, клонирование голосов по короткому образцу, контроль произношения через IPA-словари. Заявленная латентность 90 мс позволяет строить живые голосовые агенты без задержек.

Бизнесу. Готовое решение для контакт-центров, IVR, напоминаний и поддержки. Цена в два раза ниже ElevenLabs при лучшем качестве по рейтингу. Подходит для финансов, логистики, ритейла, медиа-локализации, где важна естественность речи и скорость ответа.

Инвесторам. Cartesia атакует рынок корпоративных TTS-решений с архитектурным преимуществом (state space models вместо трансформеров). Первые места в независимых рейтингах снижают риски принятия, цена конкурентоспособна. Сектор голосовой автоматизации растёт, спрос на качественный TTS для агентов огромный.

Хайп35
Реальная польза70
Заработать75
  • Запустить голосовых агентов для b2b-сегмента (квалификация лидов, запись на встречи, напоминания) — минимальная задержка позволяет вести живой диалог без раздражающих пауз
  • Локализация медиа-контента: автоматическая озвучка курсов, подкастов, видео с клонированием голоса автора
  • Добавить голосовой UI в SaaS-продукты (финтех-приложения, CRM, HR-платформы) — Sonic интегрируется через API и умеет читать код подтверждения без костылей
  • Создать обучающие симуляторы для продаж или колл-центров с реалистичной речью и эмоциями
  • Построить multilingual-сервисы для регионов со смешанным языком (Индия, Латинская Америка) — модель справляется с code-switching
  • Латентность 90 мс — это model latency, не end-to-end. Реальные задержки зависят от сети и инфраструктуры клиента
  • Модель в бете, документация и партнёры пока на версии 3.5 — ранние adopters рискуют нарваться на баги
  • Закрытость API и отсутствие весов — привязка к одному вендору, нет возможности self-host в приватных контурах
  • Цена в три раза выше Speechify при сопоставимом качестве — есть риск ценовой войны снизу

Это не просто очередной релиз модели — это момент, когда альтернативная архитектура (state space models) реально обошла трансформеры в задаче, где те доминировали. Победа в Controlled Voice особенно важна: там все модели синтезируют речь одними и теми же восемью голосами, так что выигрывает именно движок, а не каталог. Раньше такое случалось редко.

Но давайте без иллюзий: Sonic-3.6 — это коммерческий API без весов, без self-host, с vendor lock-in. Если вы строите агентов для стартапа — отлично, быстро и работает. Если вы банк или страховая — придётся заключать DPA, BAA и молиться, чтобы Cartesia не обанкротилась через два года. Латентность 90 мс — это model latency, не ваш реальный round trip, так что тестируйте сами. И да, цена в три раза выше Speechify — это не мелочь.

Инструменты из статьи

ElevenLabsбез VPN

Синтез и клонирование голоса. Поддерживает русский, реалистичная интонация.

Доступ из РФ →

Ещё по теме

Комментарии