инструменты 1 мин

TRELLIS.2 INT8 теперь работает нативно на AMD-картах через ComfyUI

Энтузиаст выпустил патч для запуска 3D-модели TRELLIS.2 в INT8-квантизации напрямую на видеокартах AMD (ROCm) через ComfyUI. Используя оптимизированные Triton-ядра вместо GGUF-весов, он добился ускорения в 2.7–3× на холодном старте и 1.27× общего прироста по времени генерации на RX 7900 XTX. Доступен готовый workflow для создания 3D-моделей разрешением до 1024.

Это прокладывает путь для работы с 3D-генерацией на AMD-картах без костылей GGUF, что важно для тех, кто не использует NVIDIA. Ускорение в 2–3 раза на холодном старте делает итерации быстрее, хотя общий выигрыш пока скромный.

TRELLIS.2 INT8 на AMD: нативная поддержка ROCm в ComfyUI

Энтузиаст DrBearJ3w опубликовал патч-кит для TRELLIS.2, позволяющий запускать 3D-генеративную модель в INT8-квантизации напрямую на AMD-картах через ROCm и ComfyUI.

Техническая суть

Вместо распаковки GGUF-весов при каждом forward-проходе используются fused W8A8 Triton-ядра, оптимизированные под архитектуру gfx1100. Чекпоинт хранится в формате .safetensors, а не GGUF. Поддержка GGUF-идентификаторов оставлена только для совместимости со старыми workflow.

Результаты на RX 7900 XTX

  • Cold structure: 4.9 с → 1.6 с (3.08×)
  • Cold shape: 5.8 с → 2.1 с (2.70×)
  • Warm structure: 0.34 с → 0.24 с (1.40×)
  • Warm shape: 0.79 с → 0.68 с (1.16×)

Полный 512-workflow ускорился со 131.67 до 104.04 секунд (1.27×). Рендер 1024 занял 127 секунд, создав GLB-модель весом 30.47 МБ (819k вершин, 1.7М граней).

Что внутри

  • Нативная загрузка INT8 ConvRot-чекпоинтов
  • Роутинг для 512, 1024 и 1024-cascade
  • Выделенная нода ComfyUI для загрузки модели
  • Готовый drag-and-drop workflow для 1024
  • Скрипты проверки чекпоинтов и воспроизводимой локальной сборки

Тестовый стек

  • PyTorch 2.14 dev
  • ROCm 7.15
  • Triton 3.8
  • Python 3.12

Версии указаны как валидированные, не как жёсткие требования. Более новые релизы ROCm/PyTorch могут работать, но нативные расширения придётся пересобрать под точное окружение. Основная зона риска — совместимость Triton.

Важно: workflow пока нацелен на shape-only GLB. Экспорт с текстурами автор завершённым не считает.

Ключевые выводы

  • INT8-квантизация с fused Triton-ядрами даёт 2.7–3× ускорение на холодном старте против GGUF Q4_K_M на AMD ROCm
  • Общий wall-clock прирост 1.27× на полном 512-workflow, что ощутимо при генерации 3D-моделей
  • Решение требует точного совпадения версий PyTorch, ROCm и Triton — основная зона хрупкости в совместимости Triton
  • Формат .safetensors + W8A8 Triton заменяет распаковку GGUF, уменьшая латентность и упрощая интеграцию в ComfyUI
  • Workflow для 1024 генерирует валидные GLB-модели (30+ МБ, 800k+ вершин), но текстурирование пока не production-ready

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

**Это инженерный подвиг энтузиаста, а не официальный релиз.** DrBearJ3w по сути портировал 3D-генератор TRELLIS.2 на AMD ROCm с нормальной оптимизацией — используя fused Triton-ядра вместо деквантизации GGUF-весов на лету. Результат — в 2.7–3 раза быстрее на «холодных» проходах, что критично при экспериментах. Общий прирост 1.27× скромнее, но для генерации 3D это ощутимо.

**Ложка дёгтя:** setup хрупкий (PyTorch dev, ROCm 7.15, Triton 3.8), а текстурирование пока не работает как надо. Если вы не сидите на NVIDIA и готовы возиться с окружением — это отличная точка входа в 3D-генерацию на AMD. Но ожидать plug-and-play не стоит: патч-кит, скрипты сборки, валидация стека — всё руками. Зато код открытый, результаты воспроизводимы.

Ещё по теме

Комментарии