исследования 1 мин

Apple представила LVSum — бенчмарк для проверки, умеют ли AI-модели понимать длинные видео с привязкой ко времени

Исследователи Apple создали LVSum — датасет из 72 длинных видео (в среднем по 16 минут) с человеческими аннотациями, чтобы проверить, насколько хорошо мультимодальные языковые модели справляются с саммаризацией видео и пониманием временных связей. Тесты показали: модели сильно зависят от текстовых транскриптов, уступают людям и плохо понимают, что и когда происходит на экране.

Это критично для развития AI-ассистентов, которые должны понимать не только «что», но и «когда» — от анализа видеоконференций до систем безопасности. Бенчмарк показывает, что даже топовые модели пока далеки от человеческого понимания видео.

Apple тестирует AI на понимание длинных роликов

Исследователи из Apple выпустили LVSum — новый бенчмарк для оценки того, насколько хорошо мультимодальные языковые модели (MLLM) справляются с задачей суммаризации длинных видео с точной временной привязкой.

Что в датасете

  • 72 видео из 13 категорий
  • Средняя длина — 16 минут
  • До 10 человеческих аннотаций на каждое видео с временными метками
  • Оценка через специальные LLM-метрики: релевантность контента и согласованность между модальностями

Главные выводы

Тестирование ведущих проприетарных и открытых моделей показало три критических проблемы:

  1. Текст важнее картинки: транскрипты вносят значительно больший вклад в качество саммаризации, чем визуальные кадры. Модели по сути «читают», а не «смотрят».

  2. Люди всё ещё лучше: разрыв между машинными и человеческими резюме остаётся существенным.

  3. Временная слепота: модели систематически ошибаются в понимании временных связей (что и когда произошло), плохо следуют инструкциям и испытывают трудности с согласованностью между видео и текстом.

Контекст исследования

Apple параллельно работает над другими бенчмарками для проверки темпорального понимания — например, NarrativeTrack (кто, что, когда и где делает в видео). Это часть более широкой программы по развитию мультимодальных моделей, способных не просто распознавать объекты на кадрах, а понимать развитие событий во времени.

Бенчмарк уже опубликован на сайте Apple Machine Learning Research.

Ключевые выводы

  • Мультимодальные модели пока полагаются на текстовые транскрипты больше, чем на визуальную информацию — по сути они «читают», а не «смотрят» видео
  • Существенный разрыв между качеством машинных и человеческих саммари длинных видео сохраняется
  • Системная слабость современных MLLM — неспособность понимать временные связи и последовательность событий
  • Обучающие задачи для моделей не стимулируют развитие темпорального мышления, модели полагаются на «пространственные шорткаты» в отдельных кадрах
  • Apple активно развивает инфраструктуру для тестирования мультимодальных моделей на понимание нарративов и времени

Автор: Сергей Ефимов · Источник: machinelearning.apple.com

Мнение редакции

Это один из тех случаев, когда крупная компания не просто выпускает продукт, а публично признаёт проблему. Apple по сути говорит: да, наши (и чужие) мультимодальные модели не умеют нормально работать с видео — они жульничают, опираясь на текстовые транскрипты, и теряются во времени.

Особенно показательно, что даже GPT-4V и аналоги не понимают базовой вещи: последовательности событий. Модель может узнать, что на экране кошка и человек, но не уловит, кто на кого прыгнул первым. Для корпоративных приложений — анализа совещаний, обучающих видео, систем безопасности — это фундаментальная проблема. Пока что лучшая стратегия для разработчиков: если нужно резюме видео, сначала прогоните его через Whisper, а потом скормите текст обычной LLM. Грустно, но честно.

Ещё по теме

Комментарии