Видеогенераторы назвали world models, но проверяют их по принципу «нравится — не нравится»
Термин «world model» незаметно сменил значение: раньше так называли системы, понимающие физику мира, теперь — любой видеогенератор с хорошим маркетингом. Вендоры вроде Black Forest Labs публикуют внутренние тесты предпочтений (77% пользователей выбрали наше видео против Runway), но эти цифры невоспроизводимы, непроверяемы и ничего не говорят о реальном понимании физики. Когда такие модели подключат к роботам или беспилотникам, процент «красивых» видео не предскажет, как система поведёт себя в реальности.
Если мы называем видеогенераторы «world models» только потому, что картинка красивая — мы обманываем себя и инвесторов. Когда эти системы попадут в реальный мир (роботы, беспилотники), выяснится, что процент «красивых видео» не имел отношения к пониманию физики.
Как маркетинговая метка превратилась в научное заявление
За последний год термин «world model» незаметно сменил определение. Раньше так называли системы, способные моделировать поведение объектов в физическом мире — предсказывать, что произойдёт, если толкнуть стакан со стола. Теперь это просто красивое название для любого видеогенератора с хорошим PR-отделом.
Проблема не в словах, а в том, что доказательная база осталась прежней — поверхностной и непроверяемой.
Пример: запуск FLUX 3
На прошлой неделе Black Forest Labs представила FLUX 3. Главный аргумент превосходства — внутренний тест предпочтений: 77% пользователей выбрали их видео против Runway Gen-4.5, 93% против Luma Ray 3.2.
Что не так с этими цифрами?
- Методология не раскрыта: нет данных о размере выборки, пуле оценщиков, наборе промптов
- Тест проводила сама компания — на выбранных ею примерах
- Результаты невоспроизводимы: никто извне не может перезапустить эксперимент и проверить, улучшилась ли модель или просто повезло с сэмплингом
- Оценка вкуса ≠ понимание физики: пользователь выбирает «какое видео красивее» за 5 секунд, а не проверяет, соблюдаются ли законы гравитации
Почему это важно
Публичный бенчмарк можно атаковать — перезапустить на своих промптах, получить другой результат, начать научную дискуссию. Тест предпочтений перезапустить нельзя.
Когда одну из этих моделей подключат к роботу-манипулятору или автопилоту, цифра «77% пользователей выбрали наше видео» не предскажет ничего о том, как система поведёт себя в реальности. Понимает ли она инерцию? Трение? Столкновения?
Мы подменили требование физической адекватности на субъективную эстетику — и теперь называем это прогрессом в моделировании мира.
Ключевые выводы
- Термин «world model» сместился от физического понимания к маркетинговому лейблу для видеогенераторов
- Внутренние тесты предпочтений невоспроизводимы и непроверяемы — в отличие от публичных бенчмарков
- Оценка «красивости» видео не измеряет способность модели понимать законы физики
- Когда такие модели используют в робототехнике, процент «выигрышей во вкусе» не предскажет реальное поведение
- Индустрия подменила требование научной валидности на субъективные A/B-тесты
Автор: Артём Ковалёв · Источник: reddit.com
Это классическая история про то, как маркетинг съедает науку. Год назад world model — это серьёзная заявка на моделирование физики мира, сейчас — просто бейджик для любого видеогенератора. И всё бы ничего, если бы компании хотя бы пытались доказать физическое понимание. Но нет: вместо воспроизводимых экспериментов мы получаем «77% пользователей выбрали наше видео красивее». Без методологии, без возможности перепроверить, без связи с реальным поведением в мире.
Самое опасное здесь — не подмена понятий, а что индустрия всерьёз готовится использовать эти модели в робототехнике и автопилотах. И когда это произойдёт, выяснится, что все эти проценты «вкусовых побед» вообще ничего не говорили о том, понимает ли система инерцию, трение или столкновения. Мы строим критическую инфраструктуру на фундаменте из A/B-тестов красоты — и делаем вид, что это нормально.
Инструменты из статьи
Профессиональная генерация и редактирование видео: text-to-video, инпейнтинг, motion.
Доступ из РФ →
Комментарии