#ROCm

И инструменты ·23 июл 2026

FLUX.2 32B на AMD 7900 XTX: как обучить гигантскую модель на 24 ГБ под Windows

Энтузиаст из Reddit обучил 32-миллиардную LoRA для FLUX.2 на потребительской видеокарте AMD с 24 ГБ памяти под нативным ROCm на Windows — на грани возможного. Пришлось преодолеть 14 багов: от крашей при загрузке 64 ГБ весов до мистических замедлений в 10 раз, которые лечились запуском второго процесса с GEMM-вычислениями. В итоге — 9–10 секунд на итерацию при разрешении 448×448.

0 131
И инструменты ·18 июл 2026

AMD ROCm: как заставить INT8 работать быстрее FP8 в Krea2 через точечный Triton

Пользователь на AMD RX 9070 XT разогнал INT8-инференс модели Krea2 Turbo в 6–7 раз и на 17% обошёл FP8, выборочно включив Triton только для ConvRot операций вместо глобальной активации, которая крашит систему. Весь трюк — в обходе нестабильного ROCm-стека через локальный патч.

0 21