модели 1 мин

Open Dreamer: полная открытая реализация Dreamer 4 с рецептом обучения мировых моделей

Команда Reactor выложила полный код Dreamer 4 — системы, которая строит виртуальную модель игрового мира и умеет генерировать кадры игры, предсказывая физику и действия. Вместо закрытого исследования Google — рабочий пайплайн на JAX с конфигами, демо в браузере и честным разбором проблем обучения.

Это первая полная открытая реализация state-of-the-art мировой модели с честным разбором проблем и решений. Для исследователей и инженеров — готовая база для экспериментов с генеративными моделями физики и симуляций.

Что выпустили

Команда Reactor опубликовала Open Dreamer — открытую реализацию Dreamer 4, исследовательского проекта Google по мировым моделям. В репозиториях выложен полный пайплайн обучения: видеотокенизатор, модель латентной динамики, генерация роллаутов и метрики FVD. Плюс браузерное демо, где можно переключаться между реальной игрой в Minecraft и сгенерированным моделью миром в реальном времени.

Архитектура

Оба ключевых блока — токенизатор и модель динамики — построены на едином блочно-каузальном трансформере. Пространственные слои обрабатывают один кадр, временные связывают кадры между собой.

Токенизатор — не VAE, а Masked Autoencoder на трансформерах. Сжимает кадр в ~100 раз, не требует KL-дивергенции или GAN-лоссов. Маскирование делает латентное пространство удобнее для диффузии.

Модель динамики (1,6 млрд параметров) предсказывает следующий кадр через диффузию и flow matching. Важный момент: токены мира не видят токен агента — задача и политика влияют на будущее только через выбранное действие.

Рецепт обучения

Конфиг для Minecraft: - 30 слоёв, 1920 скрытых единиц, 30 голов внимания - 200k шагов с оптимизатором Muon, пик LR 3e-4 - 512 латентных токенов на кадр, батчи по 256 кадров на GPU - Предобработка всего датасета в .arrayrecord с GPU-буферизацией — ffmpeg не справлялся

Утилизация FLOPs: 57–58% против эталонных 60% для трансформеров. На B200 узкое место — память, а не вычисления. Выбрали data parallelism + activation checkpointing.

Главное: стабильность

Команда честно признаёт: большая часть времени ушла на борьбу со стабильностью. Ключевая проблема: MSE-лосс падает, но качество генерации деградирует.

Шесть фиксов: - Muon вместо LaProp (тот случайно взрывался) - EMA-веса обязательны для инференса - Смешанная точность: параметры float32, активации BF16, нормализация и выходной слой float32 - x-prediction с v-space loss - Minibatch barycentric OT между шумом и латентами - μ-parametrization не понадобилась

В фазе CoinRun нашли compute-optimal scaling: N ∝ C^0.56, D ∝ C^0.44.

Чего нет

Нет behaviour-cloning и RL-цикла из полного Dreamer 4 — это в роадмапе. FVD-скоры не опубликованы, хотя скрипты оценки есть.

Ключевые выводы

  • Открытая реализация Dreamer 4 с полным кодом, конфигами и демо — редкость в области world models
  • Главное узкое место в обучении больших моделей на видео — не вычисления, а память под активации
  • Стабильность обучения не коррелирует с MSE-лоссом: метрика падает, а качество генерации может деградировать
  • Предобработка датасета критична: ffmpeg-декодирование на лету не успевает кормить GPU
  • Токенизатор на MAE эффективнее VAE для world models: сжатие в 100× без KL-потерь и GAN-стабилизации

Автор: Ксения Лаврова · Источник: marktechpost.com

Мнение редакции

Вот это редкость: не просто «мы сделали крутую модель», а полный рецепт с граблями, на которые наступили. Команда Reactor по сути переоткрыла Dreamer 4 с нуля — взяли статью Google, собрали свою версию и честно рассказали, где что ломалось. Особенно ценно, что они признают: метрики врут, стабильность — это половина работы, а большая модель упирается не в вычисления, а в память.

Практически это значит две вещи. Первая: любой с доступом к GPU теперь может воспроизвести state-of-the-art world model и начать экспериментировать. Вторая: это шаблон для обучения больших моделей на видео — конфиги, шардинг, препроцессинг. Да, это не полный Dreamer 4 (нет RL-части), но это рабочая основа, а не бумажная архитектура. Если хотите строить AI, который понимает физику игр или видео — стартуйте отсюда.

Ещё по теме

Комментарии