ByteDance выпустил SeedRealtime: первую полнодуплексную мультимодальную модель, которая видит, слушает и говорит одновременно
ByteDance представил SeedRealtime — audio-visual LLM, работающую в режиме реального времени без промежуточных звеньев вроде ASR и TTS. Модель умеет распознавать лица, прерывать пользователя при ошибках, проактивно напоминать о чём-то на экране и поддерживать естественный разговор с видеопотока. Уже работает в приложении Doubao, но без открытых весов и API для сторонних разработчиков.