Apple представила LVSum — бенчмарк для проверки, умеют ли AI-модели понимать длинные видео с привязкой ко времени
Исследователи Apple создали LVSum — датасет из 72 длинных видео (в среднем по 16 минут) с человеческими аннотациями, чтобы проверить, насколько хорошо мультимодальные языковые модели справляются с саммаризацией видео и пониманием временных связей. Тесты показали: модели сильно зависят от текстовых транскриптов, уступают людям и плохо понимают, что и когда происходит на экране.
Это критично для развития AI-ассистентов, которые должны понимать не только «что», но и «когда» — от анализа видеоконференций до систем безопасности. Бенчмарк показывает, что даже топовые модели пока далеки от человеческого понимания видео.
Apple тестирует AI на понимание длинных роликов
Исследователи из Apple выпустили LVSum — новый бенчмарк для оценки того, насколько хорошо мультимодальные языковые модели (MLLM) справляются с задачей суммаризации длинных видео с точной временной привязкой.
Что в датасете
- 72 видео из 13 категорий
- Средняя длина — 16 минут
- До 10 человеческих аннотаций на каждое видео с временными метками
- Оценка через специальные LLM-метрики: релевантность контента и согласованность между модальностями
Главные выводы
Тестирование ведущих проприетарных и открытых моделей показало три критических проблемы:
-
Текст важнее картинки: транскрипты вносят значительно больший вклад в качество саммаризации, чем визуальные кадры. Модели по сути «читают», а не «смотрят».
-
Люди всё ещё лучше: разрыв между машинными и человеческими резюме остаётся существенным.
-
Временная слепота: модели систематически ошибаются в понимании временных связей (что и когда произошло), плохо следуют инструкциям и испытывают трудности с согласованностью между видео и текстом.
Контекст исследования
Apple параллельно работает над другими бенчмарками для проверки темпорального понимания — например, NarrativeTrack (кто, что, когда и где делает в видео). Это часть более широкой программы по развитию мультимодальных моделей, способных не просто распознавать объекты на кадрах, а понимать развитие событий во времени.
Бенчмарк уже опубликован на сайте Apple Machine Learning Research.
Ключевые выводы
- Мультимодальные модели пока полагаются на текстовые транскрипты больше, чем на визуальную информацию — по сути они «читают», а не «смотрят» видео
- Существенный разрыв между качеством машинных и человеческих саммари длинных видео сохраняется
- Системная слабость современных MLLM — неспособность понимать временные связи и последовательность событий
- Обучающие задачи для моделей не стимулируют развитие темпорального мышления, модели полагаются на «пространственные шорткаты» в отдельных кадрах
- Apple активно развивает инфраструктуру для тестирования мультимодальных моделей на понимание нарративов и времени
Автор: Сергей Ефимов · Источник: machinelearning.apple.com
Это один из тех случаев, когда крупная компания не просто выпускает продукт, а публично признаёт проблему. Apple по сути говорит: да, наши (и чужие) мультимодальные модели не умеют нормально работать с видео — они жульничают, опираясь на текстовые транскрипты, и теряются во времени.
Особенно показательно, что даже GPT-4V и аналоги не понимают базовой вещи: последовательности событий. Модель может узнать, что на экране кошка и человек, но не уловит, кто на кого прыгнул первым. Для корпоративных приложений — анализа совещаний, обучающих видео, систем безопасности — это фундаментальная проблема. Пока что лучшая стратегия для разработчиков: если нужно резюме видео, сначала прогоните его через Whisper, а потом скормите текст обычной LLM. Грустно, но честно.
Комментарии