исследования 1 мин

Google DeepMind превращает видеогенераторы в универсальную основу для компьютерного зрения

Исследователи DeepMind создали GenCeption — модель, которая использует предобученный видеогенератор для классических задач компьютерного зрения (определение глубины, сегментация, 3D-поза). Она достигает уровня специализированных моделей, обучаясь всего на 7500 синтетических видео вместо миллионов реальных.

Если видеогенераторы действительно содержат универсальные представления о мире, это может упростить разработку систем компьютерного зрения — одна модель вместо десятков специализированных. Но споры о том, понимают ли эти модели физику или просто имитируют её визуально, напрямую влияют на будущие инвестиции и архитектурные решения в AI.

Видеогенераторы как основа компьютерного зрения

Google DeepMind представила GenCeption — экспериментальную модель, доказывающую: большие текст-видео генераторы уже содержат то, чего не хватает компьютерному зрению — универсальную модель мира.

Один фундамент для всех задач

В отличие от языковых моделей, которые стали универсальными инструментами почти случайно (научившись предсказывать следующее слово), компьютерное зрение всё ещё фрагментировано. Для каждой задачи — свой специализированный алгоритм: Segment Anything для сегментации, Depth Anything для глубины. GenCeption меняет подход.

Основа — открытая модель Wan2.1 от Alibaba, упрощённая для быстрой работы. Главный трюк: все задачи представлены единообразно — как RGB-изображения. Карты глубины, нормалей поверхности, маски сегментации — всё кодируется одинаково. Текстовая инструкция (как промпт в чат-боте) указывает, что именно нужно сделать.

Синтетика против больших данных

Обучение прошло почти полностью на синтетике: 7500 видео, созданных в Blender из 800 цифровых людей и 200 захватов движения. Это в 7–500 раз меньше, чем у конкурентов вроде D4RT (миллионы видео).

Результат? GenCeption сравнялась с DepthAnything v3 по глубине, обошла NormalCrafter по нормалям поверхности и Genmo по 3D-позам. В сложной языковой сегментации догнала связку SAM 2 + Gemini 1.5 Flash.

Модель, тренированная только на одиночных синтетических людях, работает с реальными видео: несколько человек в кадре, животные, роботы. Детализация порой превосходит исходные 3D-рендеры — сохраняются усы кота и отдельные волоски.

Спор о «моделях мира»

Авторы утверждают: видеогенераторы — это уже готовые «модели мира», понимающие геометрию, физику движения и связь языка с визуальным контентом. Они могут стать фундаментом для компьютерного зрения, как LLM для текста.

Но не все согласны. Ян Лекун (экс-главный AI-учёный Meta) называет генеративные видеомодели тупиком. Бенчмарки показывают: Sora, Veo и другие проваливают базовые тесты на физику, даже если картинка убедительна. Проект OpenWorldLib вообще исключил text-to-video из определения «модели мира» из-за отсутствия обратной связи с реальностью.

GenCeption использует генерацию иначе — не для предсказания физики, а для извлечения признаков. Это узкая, но практичная цель.

Ключевые выводы

  • Видеогенераторы можно использовать как универсальную основу для задач компьютерного зрения, а не только для создания контента
  • Синтетические данные (7500 видео) дают результаты сопоставимые с обучением на миллионах реальных роликов
  • Единая архитектура с текстовыми инструкциями позволяет одной модели решать разные задачи (глубина, сегментация, 3D-позы) без специализации
  • Модели, обученные на генерации, извлекают полезные представления о пространстве и движении лучше, чем методы вроде V-JEPA
  • Дебаты о «моделях мира» продолжаются: генеративные видеомодели впечатляют визуально, но проваливают тесты на физику и логику
компьютерное зрениевидеогенерациясинтетические данныемодели мирамультизадачность

Автор: Никита Громов · Источник: the-decoder.com

Мнение редакции

Это классный пример того, как побочный продукт одной задачи (генерация видео) может решить проблему другой области (компьютерное зрение). GenCeption показывает: модели, научившиеся создавать реалистичные ролики, попутно усвоили геометрию, движение и физику — хотя бы на уровне, достаточном для практических задач. 7500 синтетических видео против миллионов реальных — это не просто экономия, это сигнал, что качество обучающей задачи важнее объёма данных.

Но давайте без иллюзий: визуально убедительное видео ≠ понимание физики. Sora и Veo проваливают элементарные тесты на логику, даже если картинка огонь. GenCeption умнее: она не претендует на роль оракула, а просто извлекает полезные признаки из предобученной модели. Спор с Лекуном и критиками «моделей мира» тут принципиальный — это не философия, а вопрос архитектурной стратегии на годы вперёд. Пока GenCeption доказала одно: видеогенераторы — это не только развлечение, но и недооценённый инструмент для серьёзных задач.

Инструменты из статьи

SoraVPN

Генератор видео от OpenAI: по тексту создаёт реалистичные ролики с...

Доступ из РФ →

Ещё по теме

Комментарии