модели 1 мин

ByteDance выпустил SeedRealtime: первую полнодуплексную мультимодальную модель, которая видит, слушает и говорит одновременно

ByteDance представил SeedRealtime — audio-visual LLM, работающую в режиме реального времени без промежуточных звеньев вроде ASR и TTS. Модель умеет распознавать лица, прерывать пользователя при ошибках, проактивно напоминать о чём-то на экране и поддерживать естественный разговор с видеопотока. Уже работает в приложении Doubao, но без открытых весов и API для сторонних разработчиков.

Это первая публичная демонстрация полностью интегрированной мультимодальной модели, которая работает в режиме реального времени и управляет диалогом изнутри. Если технология масштабируется, это меняет стандарт для голосовых ассистентов, EdTech и промышленного AI.

Что произошло

ByteДance представил SeedRealtime — первую LLM, объединяющую аудио, видео и текст в одной сквозной архитектуре без каскадных модулей (ASR → VLM → TTS). Модель обрабатывает мультимодальные потоки параллельно: восприятие, понимание, принятие решений и генерация речи идут одновременно. Управление очередностью реплик встроено внутрь модели, без внешнего voice-activity detector.

Среди демо: модель запоминает имена и лица на шумном ужине, отслеживает быстро листаемую PDF-ку и останавливается на нужном разделе, прерывает пользователя, когда тот засыпает кофейные зёрна в портафильтр вместо молотых, и предлагает сократить экстракцию на 2-3 секунды по цвету крема. В аэропорту модель отвечает на вопрос о рейсе по информации с табло, которое уже ушло за кадр, и лезет в интернет за номером багажной ленты.

Модель живёт в приложении Doubao. Технического отчёта, количества параметров, весов и API ByteDance не опубликовал. Интеграция сторонними командами невозможна.

мультимодальные моделиreal-time AIfull-duplexaudio-visual LLMByteDance

Автор: Ксения Лаврова · Источник: marktechpost.com

Разработчикам. Новая референсная архитектура для real-time мультимодальных продуктов: сквозная модель вместо связки ASR-VLM-TTS, встроенное управление очередностью реплик без внешнего VAD, параллельная обработка аудио, видео и текста. Пока без открытых весов и API, но идея проверена в проде.

Бизнесу. Возможность строить голосовых ассистентов с камерой, которые сами прерывают, напоминают и адаптируются к контексту в реальном времени — для EdTech, розницы, медицины, производства. ByteDance показал work case в своём приложении Doubao, но API не открыл, что оставляет окно для конкурентов.

Инвесторам. ByteDance двигает планку для омни-модальных LLM: проактивное взаимодействие, memory через модальности, встроенная очерёдность реплик. Сегмент real-time мультимодальных продуктов (EdTech, healthcare, retail AI) получает новый стандарт, но ByteDance держит API закрытым — пространство для стартапов, которые первыми откроют аналог.

Хайп65
Реальная польза70
Заработать75
  • Сделать open-source клон SeedRealtime: сквозная мультимодальная модель с full-duplex для разработчиков, которым ByteDance не дал API — EdTech, телемедицина, production quality control.
  • Адаптировать архитектуру для нишевых вертикалей: real-time обучение языкам с коррекцией произношения по видео губ, ассистент для удалённых экспертиз (страховка, диагностика оборудования), AI-тренер для продаж с анализом жестов.
  • Построить инфраструктурный продукт: managed API для full-duplex мультимодальных интерфейсов — аналог Twilio/Agora, но с встроенным AI-восприятием и генерацией.
  • Создать вертикальное решение для производства: AI-супервайзер на линии, который смотрит через камеру и прерывает оператора при ошибках в реальном времени (food safety, сборка электроники).
  • Разработать платформу для создателей: no-code конструктор мультимодальных AI-персонажей для стримеров, виртуальных консультантов, interactive storytelling.
  • ByteDance не публикует технический отчёт, веса и API — может оказаться, что модель работает только на узких сценариях с хард-кодом, а в реальных условиях ломается.
  • Нет бенчмарков и чисел латентности — только человеческая оценка «в два раза меньше проблем с темпом». Сравнивать с конкурентами невозможно, заявления на веру.
  • Проактивность и прерывания — зона высокого UX-риска: если модель будет говорить невпопад или молчать, когда нужно, продукт мгновенно раздражает. Демо != production.
  • Вычислительная сложность сквозной мультимодальной модели может быть запретительной для edge-устройств и малого бизнеса — без API и открытых весов оценить нельзя.

SeedRealtime — это действительно круто с точки зрения архитектуры: убрали каскад ASR-VLM-TTS, запихнули управление очередностью внутрь модели, добавили проактивность и memory через модальности. Демо впечатляют: модель помнит лица и голоса, прерывает при ошибках на видео, сама напоминает о нужном моменте. Но ByteDance ведёт себя как Apple — показал будущее, но ни строчки кода, ни одной цифры латентности, ни бенчмарка. Это не релиз продукта, а демонстрация концепта для собственного Doubao.

Для разработчиков это moved goalpost: теперь понятно, что можно сделать и куда двигаться. Для стартапов — окно возможностей: кто первым откроет аналог с API, заберёт сегмент real-time мультимодальных интерфейсов (EdTech, телемедицина, промышленный AI). ByteDance показал, что технология работает в проде, но оставил рынок без инструмента. Если у вас есть ресурсы на обучение таких моделей — сейчас самое время.

Инструменты из статьи

Udioбез VPN

Генерация музыки с вокалом, альтернатива Suno с другим характером звука.

Доступ из РФ →

Ещё по теме

Комментарии