TRELLIS.2 INT8 теперь работает нативно на AMD-картах через ComfyUI
Энтузиаст выпустил патч для запуска 3D-модели TRELLIS.2 в INT8-квантизации напрямую на видеокартах AMD (ROCm) через ComfyUI. Используя оптимизированные Triton-ядра вместо GGUF-весов, он добился ускорения в 2.7–3× на холодном старте и 1.27× общего прироста по времени генерации на RX 7900 XTX. Доступен готовый workflow для создания 3D-моделей разрешением до 1024.
Это прокладывает путь для работы с 3D-генерацией на AMD-картах без костылей GGUF, что важно для тех, кто не использует NVIDIA. Ускорение в 2–3 раза на холодном старте делает итерации быстрее, хотя общий выигрыш пока скромный.
TRELLIS.2 INT8 на AMD: нативная поддержка ROCm в ComfyUI
Энтузиаст DrBearJ3w опубликовал патч-кит для TRELLIS.2, позволяющий запускать 3D-генеративную модель в INT8-квантизации напрямую на AMD-картах через ROCm и ComfyUI.
Техническая суть
Вместо распаковки GGUF-весов при каждом forward-проходе используются fused W8A8 Triton-ядра, оптимизированные под архитектуру gfx1100. Чекпоинт хранится в формате .safetensors, а не GGUF. Поддержка GGUF-идентификаторов оставлена только для совместимости со старыми workflow.
Результаты на RX 7900 XTX
- Cold structure: 4.9 с → 1.6 с (3.08×)
- Cold shape: 5.8 с → 2.1 с (2.70×)
- Warm structure: 0.34 с → 0.24 с (1.40×)
- Warm shape: 0.79 с → 0.68 с (1.16×)
Полный 512-workflow ускорился со 131.67 до 104.04 секунд (1.27×). Рендер 1024 занял 127 секунд, создав GLB-модель весом 30.47 МБ (819k вершин, 1.7М граней).
Что внутри
- Нативная загрузка INT8 ConvRot-чекпоинтов
- Роутинг для 512, 1024 и 1024-cascade
- Выделенная нода ComfyUI для загрузки модели
- Готовый drag-and-drop workflow для 1024
- Скрипты проверки чекпоинтов и воспроизводимой локальной сборки
Тестовый стек
- PyTorch 2.14 dev
- ROCm 7.15
- Triton 3.8
- Python 3.12
Версии указаны как валидированные, не как жёсткие требования. Более новые релизы ROCm/PyTorch могут работать, но нативные расширения придётся пересобрать под точное окружение. Основная зона риска — совместимость Triton.
Важно: workflow пока нацелен на shape-only GLB. Экспорт с текстурами автор завершённым не считает.
Ключевые выводы
- INT8-квантизация с fused Triton-ядрами даёт 2.7–3× ускорение на холодном старте против GGUF Q4_K_M на AMD ROCm
- Общий wall-clock прирост 1.27× на полном 512-workflow, что ощутимо при генерации 3D-моделей
- Решение требует точного совпадения версий PyTorch, ROCm и Triton — основная зона хрупкости в совместимости Triton
- Формат .safetensors + W8A8 Triton заменяет распаковку GGUF, уменьшая латентность и упрощая интеграцию в ComfyUI
- Workflow для 1024 генерирует валидные GLB-модели (30+ МБ, 800k+ вершин), но текстурирование пока не production-ready
Автор: Никита Громов · Источник: reddit.com
**Это инженерный подвиг энтузиаста, а не официальный релиз.** DrBearJ3w по сути портировал 3D-генератор TRELLIS.2 на AMD ROCm с нормальной оптимизацией — используя fused Triton-ядра вместо деквантизации GGUF-весов на лету. Результат — в 2.7–3 раза быстрее на «холодных» проходах, что критично при экспериментах. Общий прирост 1.27× скромнее, но для генерации 3D это ощутимо.
**Ложка дёгтя:** setup хрупкий (PyTorch dev, ROCm 7.15, Triton 3.8), а текстурирование пока не работает как надо. Если вы не сидите на NVIDIA и готовы возиться с окружением — это отличная точка входа в 3D-генерацию на AMD. Но ожидать plug-and-play не стоит: патч-кит, скрипты сборки, валидация стека — всё руками. Зато код открытый, результаты воспроизводимы.
Комментарии