исследования 1 мин

Doom на трансформере: инженер скомпилировал игровой движок в 21 миллиард весов модели без обучения

Разработчик портировал рендерер Doom в веса трансформера, написав для этого собственный компилятор. Модель не обучалась — каждый вес вычислен. Промпт содержит геометрию уровня и позицию игрока, генерация выдаёт команды отрисовки. Версия 320x200 — 21B параметров, рендерит кадр за 40 минут на B200. Доступна облегчённая версия 80x50 на 34 ГБ.

Это редкий пример радикального подхода к использованию нейросетей — не обучение, а прямая компиляция логики. Показывает теоретические границы архитектур и вдохновляет на новые эксперименты, даже если практической ценности ноль.

Что произошло

Разработчик physicsrob портировал рендерер классического Doom в архитектуру трансформера Phi3, используя самописный компилятор torchwright. Ключевое отличие от всех AI-экспериментов с играми: здесь нет обучения. Каждый вес модели вычислен математически — алгоритм рендеринга скомпилирован напрямую в параметры нейросети.

Модель работает так: промпт (3614 токенов) содержит геометрию уровня E1M1, координаты игрока и направление взгляда. Генерация выдаёт 53 747 токенов — команды отрисовки, которые хост-программа из 43 строк превращает в пиксели. Версия с разрешением 320x200 весит 85,87 ГБ (21B параметров), рендерит один кадр за ~40 минут на NVIDIA B200. Облегчённая версия 80x50 — 34 ГБ, требует 64-80 ГБ видеопамяти.

Используется стандартная архитектура Phi3ForCausalLM, загружается через transformers без trust_remote_code. Компилятор требует fp32-точности, квантизация пока не исследована. Автор тестировал только на облачных GPU (B200, A100-80).

Это proof-of-concept радикального подхода: игровая логика как веса модели, а не как обучаемая имитация.

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Появился компилятор torchwright, превращающий произвольный код в веса трансформера. Можно экспериментировать с компиляцией алгоритмов в нейросети, обходя обучение. Код открыт, но требует 64-80 ГБ VRAM и fp32. Практической ценности для игр нет — скорее исследование границ архитектур.

Бизнесу. Демонстрация того, что трансформеры — универсальные вычислители, а не только языковые модели. Открывает вопрос: можно ли компилировать бизнес-логику в веса для специфичных задач. Пока абсолютно непрактично из-за гигантских размеров и скорости (40 минут на кадр), но направление интересное для hardware-специфичных оптимизаций.

Инвесторам. Академический эксперимент без коммерческого потенциала. Подтверждает теоретическую универсальность трансформеров, но практическая эффективность отрицательная. Может быть интересен для фундаментальных исследований архитектур и hardware-компиляторов, но не для продуктовых инвестиций.

Хайп75
Реальная польза15
Заработать5
  • Развивать компиляторы алгоритмов в веса моделей для аппаратных акселераторов (ASIC, специализированные чипы под трансформеры)
  • Исследовать компиляцию бизнес-логики и правил в веса для специализированных inference-систем, где классические вычисления невозможны
  • Экспериментировать с квантизацией и оптимизацией подобных скомпилированных моделей для уменьшения размера и ускорения
  • Создавать образовательные проекты и курсы по внутренностям трансформеров через подобные эксперименты
  • Полная непрактичность: 40 минут на кадр против микросекунд обычного рендеринга — это миллионократное замедление
  • Гигантские требования к памяти (85 ГБ для низкого разрешения) делают подход неприменимым даже для исследований на типичном железе
  • Отсутствие квантизации и зависимость от fp32 ограничивают масштабирование
  • Чистая демонстрация принципа без пути к практическому применению — риск растраты ресурсов на развитие направления

Это один из тех проектов, где хочется аплодировать стоя — не за практическую пользу, а за чистую инженерную наглость. Портировать рендерер Doom в веса трансформера через самописный компилятор — это как забить гвоздь микроскопом: технически возможно, но зачем? Правильный ответ: чтобы доказать, что можно. И вот оно, доказано.

В практическом смысле это тупик: 40 минут на кадр против микросекунд обычного GPU — смешно даже обсуждать. Но интеллектуально это золото. Показывает, что трансформеры — не магия, а универсальные вычислители, которые можно программировать напрямую. Ценность для тех, кто копает в архитектуры и думает о будущем компиляторов под AI-железо. Остальным — красивая картинка в портфолио автора.

Ещё по теме

Комментарии