исследования 1 мин

Программист скомпилировал рендерер Doom в трансформер на 21 миллиард параметров — без обучения

Разработчик создал компилятор, который превращает вычислительные графы в веса трансформера, и портировал алгоритм рендеринга Doom напрямую в архитектуру модели. Результат — трансформер на 21B параметров, который генерирует пиксельные команды для отрисовки кадра из Doom. Оригинальный Doom выдавал 35 FPS на 486-м процессоре, эта версия — 35 кадров в день на B200.

Это крайний пример гибкости трансформеров и доказательство концепции компиляции алгоритмов в нейросети. Для практики бесполезно, но открывает вопросы о гибридных подходах и интерпретируемости моделей.

Что произошло

Разработчик под ником physicsrob собрал Doom-рендерер прямо внутри трансформера на 21 миллиард параметров. Фокус в том, что модель не обучалась: вместо этого он написал компилятор, который преобразует вычислительные графы (описание алгоритма) в веса нейросети.

Процесс такой: подаёшь модели промпт с данными сцены (3614 токенов), она генерирует последовательность из 53747 токенов с командами рисования (двигать курсор, рисовать пиксель), и из этого получается готовый кадр из знаменитого уровня E1M1.

Чекпойнт загружается в Hugging Face как обычная модель — никакого trust_remote_code, всё стандартное. Хост-программа на Python, которая всё это запускает и парсит, — 43 строки кода. Сам граф вычислений описан гораздо длиннее, но он компилируется прямо в веса трансформера.

Производительность: Оригинальный Doom крутился на 486-м процессоре с 35 FPS. Эта версия на B200 выдаёт 35 кадров в день — один кадр рендерится 40 минут.

Веса выложены на Hugging Face, исходный код — на GitHub.

Автор: Артём Ковалёв · Источник: reddit.com

Разработчикам. Демонстрация компилятора вычислительных графов в трансформеры открывает путь к «программированию» нейросетей без обучения: можно встраивать готовые алгоритмы прямо в архитектуру. Возможность загружать результаты как стандартные чекпойнты Hugging Face упрощает интеграцию. Это экспериментальная техника, но показывает границы гибкости трансформеров.

Бизнесу. Пока никакого бизнес-применения — чисто исследовательская игра. Однако идея компиляции алгоритмов в нейросети может пригодиться для задач, где нужна интерпретируемость или гарантированная логика работы вместо вероятностного обучения. Например, встраивание правил в модели для регулируемых отраслей.

Инвесторам. Чистый R&D-эксперимент, коммерческого потенциала ноль. Интересно как proof-of-concept для фундаментальных исследований трансформеров, но текущая производительность (40 минут на кадр) делает его бесполезным на практике. Следите за развитием компиляторных подходов к нейросетям — если метод масштабируется, появятся новые инструменты.

Хайп75
Реальная польза15
Заработать5
  • Инструменты для компиляции алгоритмов в нейросети — новая ниша для разработчиков фреймворков (аналог TorchScript, но для трансформеров)
  • Применение в задачах, где нужна интерпретируемость: вшить бизнес-логику в модель вместо обучения на данных
  • Образовательные проекты: наглядная демонстрация работы трансформеров через знакомые алгоритмы (Doom, игры, графика)
  • Исследования гибридных архитектур: часть модели обучается, часть компилируется из кода
  • Производительность катастрофически низкая — 40 минут на кадр против миллисекунд в обычном рендеринге, практического смысла ноль
  • Размер модели (21B параметров) для простейшего рендерера показывает чудовищную неэффективность подхода
  • Это proof-of-concept, переоценка возможностей: компилировать алгоритмы в нейросети круто, но зачем?
  • Никакого коммерческого применения на горизонте, чисто академический интерес

Это один из тех экспериментов, где результат впечатляет технически, но бесполезен практически. Парень доказал, что трансформеры могут эмулировать вообще любой алгоритм — не через обучение, а через прямую компиляцию кода в веса. Это красиво и умно, но 40 минут на кадр против миллисекунд в обычном коде говорят сами за себя.

Интересно другое: идея компиляции алгоритмов в модели может пригодиться там, где важна интерпретируемость или встраивание гарантированных правил. Например, в медицине или финансах, где нельзя полагаться на вероятностные предсказания. Но пока это proof-of-concept, и реальных инструментов на его основе нет. Следите за развитием, но не ждите революции — это фундаментальное исследование, а не прорыв.

Ещё по теме

Комментарии