исследования 1 мин

AMD MI50: при 50W выдаёт 70% производительности, потребляя четверть энергии 190W

Тесты показали: на AMD MI50 для инференса LLM оптимальным оказался режим 50W — почти та же скорость генерации (70% от пика), но втрое эффективнее по энергии. При 20W карта работает в 6 раз экономичнее топовых настроек, хотя обработка промптов падает вдвое.

Показывает реальную возможность снизить энергопотребление AI-инференса в 3-6 раз почти без потери скорости генерации — критично для продакшн-деплоев и дата-центров, где счета за электричество и охлаждение съедают бюджеты.

Тест энергоэффективности AMD MI50: меньше ватт — больше толку

Пользователь Reddit протестировал AMD MI50 с разным ограничением мощности (TDP) при запуске большой языковой модели Qwen3.6-35B через llama.cpp. Результаты показывают, что для инференса оптимален режим 50W, а не максимальные 190W.

Ключевые цифры

При снижении TDP со 190W до 50W: - Скорость генерации токенов падает всего до 70% (22.9 vs 32.8 t/s) - Энергопотребление снижается до 26% от пика - Энергоэффективность растёт в 3.6 раза (0.458 vs 0.173 t/s/W)

При экстремальном режиме 20W: - Эффективность выше в 6 раз по сравнению с 190W - Скорость генерации — 63% от пика (20.8 t/s) - Обработка промптов падает сильнее — до 53% (366 vs 691 t/s)

Почему так происходит

Генерация токенов упирается в пропускную способность памяти, а не вычисления — поэтому снижение мощности GPU мало влияет на скорость декодирования. Обработка промптов, напротив, более вычислительно интенсивна и сильнее деградирует при троттлинге.

Интересная деталь: при низком TDP драйвер чаще переиспользует подготовленные графы вычислений (38,248 при 20W vs 44,790 при 190W для полных графов), компенсируя нехватку вычислительной мощности планированием.

Практический вывод

Для задач, где важна скорость генерации (inference-heavy сценарии), 50W — оптимальная точка: почти пиковая скорость при втрое меньшем энергопотреблении и тепловыделении. Для промптов лучше держать TDP выше.

Тестировалось на Ryzen 5 5600, 32GB RAM DDR4, MI50 16GB, Arch Linux + ROCm 6.3.3.

Ключевые выводы

  • Скорость генерации токенов на MI50 почти не зависит от TDP: при 50W — 70% от пика, при вдвое меньшем энергопотреблении
  • Энергоэффективность инференса растёт радикально при снижении TDP: при 20W — в 6 раз выше, чем при 190W
  • Обработка промптов деградирует быстрее генерации при троттлинге: compute-bound vs memory-bound нагрузки
  • Драйвер компенсирует нехватку вычислений более агрессивным переиспользованием графов при низком TDP
  • Для inference-задач 50W — оптимальная точка баланса производительности и энергии на MI50

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Это один из тех редких практических тестов, которые заставляют переосмыслить подход к деплою моделей. Все гонятся за максимальной производительностью, крутя TDP до упора, а тут выясняется: при 50W ты получаешь 70% скорости генерации за четверть энергии. Для продакшна, где модель большую часть времени генерирует токены (а не жуёт промпты), это прямой путь сэкономить на счетах за электричество и охлаждение.

Но есть нюанс: обработка промптов деградирует сильнее, чем генерация. Если твой сценарий — короткие ответы на длинные запросы (RAG, аналитика), держать TDP низким невыгодно. А вот для генерации текста, кода, стриминга — золотая середина где-то на 50-100W. Тест на MI50, но логика применима шире: memory-bound этапы не требуют полной мощности GPU. Жаль только, что реальное энергопотребление пляшет (25-56W при заявленных 20W) — видимо, проблемы драйвера LACT или самого железа.

Ещё по теме

Комментарии