#мультимодальные модели

М модели ·21 июл 2026

NVIDIA выпустила Cosmos 3 Edge — мировую модель на 4 млрд параметров для роботов без облака

NVIDIA представила Cosmos 3 Edge — компактную 4B-параметровую модель, которая работает локально на GPU и позволяет роботам понимать окружение, предсказывать результаты действий и генерировать команды управления в реальном времени. Модель объединяет два трансформера (для рассуждений и генерации) и поддерживает разные типы роботов — от манипуляторов до гуманоидов.

0 96
И исследования ·20 июл 2026

Apple представила LVSum — бенчмарк для проверки, умеют ли AI-модели понимать длинные видео с привязкой ко времени

Исследователи Apple создали LVSum — датасет из 72 длинных видео (в среднем по 16 минут) с человеческими аннотациями, чтобы проверить, насколько хорошо мультимодальные языковые модели справляются с саммаризацией видео и пониманием временных связей. Тесты показали: модели сильно зависят от текстовых транскриптов, уступают людям и плохо понимают, что и когда происходит на экране.

0 92