Google DeepMind превращает видеогенераторы в универсальную основу для компьютерного зрения
Исследователи DeepMind создали GenCeption — модель, которая использует предобученный видеогенератор для классических задач компьютерного зрения (определение глубины, сегментация, 3D-поза). Она достигает уровня специализированных моделей, обучаясь всего на 7500 синтетических видео вместо миллионов реальных.
Если видеогенераторы действительно содержат универсальные представления о мире, это может упростить разработку систем компьютерного зрения — одна модель вместо десятков специализированных. Но споры о том, понимают ли эти модели физику или просто имитируют её визуально, напрямую влияют на будущие инвестиции и архитектурные решения в AI.
Видеогенераторы как основа компьютерного зрения
Google DeepMind представила GenCeption — экспериментальную модель, доказывающую: большие текст-видео генераторы уже содержат то, чего не хватает компьютерному зрению — универсальную модель мира.
Один фундамент для всех задач
В отличие от языковых моделей, которые стали универсальными инструментами почти случайно (научившись предсказывать следующее слово), компьютерное зрение всё ещё фрагментировано. Для каждой задачи — свой специализированный алгоритм: Segment Anything для сегментации, Depth Anything для глубины. GenCeption меняет подход.
Основа — открытая модель Wan2.1 от Alibaba, упрощённая для быстрой работы. Главный трюк: все задачи представлены единообразно — как RGB-изображения. Карты глубины, нормалей поверхности, маски сегментации — всё кодируется одинаково. Текстовая инструкция (как промпт в чат-боте) указывает, что именно нужно сделать.
Синтетика против больших данных
Обучение прошло почти полностью на синтетике: 7500 видео, созданных в Blender из 800 цифровых людей и 200 захватов движения. Это в 7–500 раз меньше, чем у конкурентов вроде D4RT (миллионы видео).
Результат? GenCeption сравнялась с DepthAnything v3 по глубине, обошла NormalCrafter по нормалям поверхности и Genmo по 3D-позам. В сложной языковой сегментации догнала связку SAM 2 + Gemini 1.5 Flash.
Модель, тренированная только на одиночных синтетических людях, работает с реальными видео: несколько человек в кадре, животные, роботы. Детализация порой превосходит исходные 3D-рендеры — сохраняются усы кота и отдельные волоски.
Спор о «моделях мира»
Авторы утверждают: видеогенераторы — это уже готовые «модели мира», понимающие геометрию, физику движения и связь языка с визуальным контентом. Они могут стать фундаментом для компьютерного зрения, как LLM для текста.
Но не все согласны. Ян Лекун (экс-главный AI-учёный Meta) называет генеративные видеомодели тупиком. Бенчмарки показывают: Sora, Veo и другие проваливают базовые тесты на физику, даже если картинка убедительна. Проект OpenWorldLib вообще исключил text-to-video из определения «модели мира» из-за отсутствия обратной связи с реальностью.
GenCeption использует генерацию иначе — не для предсказания физики, а для извлечения признаков. Это узкая, но практичная цель.
Ключевые выводы
- Видеогенераторы можно использовать как универсальную основу для задач компьютерного зрения, а не только для создания контента
- Синтетические данные (7500 видео) дают результаты сопоставимые с обучением на миллионах реальных роликов
- Единая архитектура с текстовыми инструкциями позволяет одной модели решать разные задачи (глубина, сегментация, 3D-позы) без специализации
- Модели, обученные на генерации, извлекают полезные представления о пространстве и движении лучше, чем методы вроде V-JEPA
- Дебаты о «моделях мира» продолжаются: генеративные видеомодели впечатляют визуально, но проваливают тесты на физику и логику
Автор: Никита Громов · Источник: the-decoder.com
Это классный пример того, как побочный продукт одной задачи (генерация видео) может решить проблему другой области (компьютерное зрение). GenCeption показывает: модели, научившиеся создавать реалистичные ролики, попутно усвоили геометрию, движение и физику — хотя бы на уровне, достаточном для практических задач. 7500 синтетических видео против миллионов реальных — это не просто экономия, это сигнал, что качество обучающей задачи важнее объёма данных.
Но давайте без иллюзий: визуально убедительное видео ≠ понимание физики. Sora и Veo проваливают элементарные тесты на логику, даже если картинка огонь. GenCeption умнее: она не претендует на роль оракула, а просто извлекает полезные признаки из предобученной модели. Спор с Лекуном и критиками «моделей мира» тут принципиальный — это не философия, а вопрос архитектурной стратегии на годы вперёд. Пока GenCeption доказала одно: видеогенераторы — это не только развлечение, но и недооценённый инструмент для серьёзных задач.
Комментарии