Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD: тесты показали, почему MoE — это будущее локальных LLM
Энтузиаст протестировал новые модели Gemma 4 и Qwen 3.6 MoE на мини-ПК с APU AMD 6800H (встроенная графика Radeon 680M). Главный вывод: Mixture of Experts (MoE) модели дают скорость маленькой модели при интеллекте большой — Qwen 3.6 35B в 6,5 раз быстрее обычной 31B модели. Квантизация Q4 оптимальна для APU, Q8 убивает производительность, а новые форматы FP4 пока работают хуже обычных.
Исследование показывает практический путь к запуску мощных LLM на массовом железе без дискретных видеокарт. Для миллионов пользователей ноутбуков и мини-ПК это означает доступ к локальным AI без апгрейда — достаточно выбрать правильную архитектуру модели.
Тесты Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD
Энтузиаст провёл серию бенчмарков на мини-ПК с AMD Ryzen 7 6800H, используя llama.cpp с Vulkan-бэкендом. Главная особенность setup — полная зависимость от встроенной графики Radeon 680M и общей системной памяти (UMA), без выделенной видеопамяти.
Ключевые результаты
MoE-эффект: Qwen 3.6 35B MoE показал 15.05 токенов/сек при генерации, в то время как обычная 31B Q8_0 модель выдавала всего 2.30 т/с. Это 6,5-кратное преимущество при большем количестве параметров доказывает эффективность архитектуры Mixture of Experts для слабого железа — вы получаете знания большой модели со скоростью маленькой.
Квантизация решает: Переход от Q4_0 к Q8_0 обваливает производительность. Q4_0 даёт комфортные ~18 т/с, Q8_0 на 31B модели — неюзабельные 2.3 т/с. На APU с ограниченной пропускной способностью памяти компактность модели критична.
Новые форматы сыроваты: NVFP4/MXFP4 форматы пока разочаровывают — Gemma 4 26B NVFP4 оказалась медленнее стандартной Q4_0. Видимо, драйвера AMD и Vulkan-стек требуют дополнительной оптимизации для этих форматов.
Практические выводы
Для пользователей APU (6800H и подобных): - Избегайте Q8 для моделей >20B параметров - Ставьте на MoE-модели — high-intelligence при приемлемой скорости - 4-битная квантизация (Q4_K/Q4_0) — оптимальный баланс
Тесты подтверждают: локальные LLM на встроенной графике — реальность, если правильно выбрать архитектуру и квантизацию.
Ключевые выводы
- MoE-архитектура даёт 6,5-кратный прирост скорости по сравнению с обычными моделями аналогичного размера на слабом железе
- На APU с UMA критична не столько выделенная память под модель, сколько её размер — пропускная способность RAM становится узким местом
- Квантизация Q8 практически убивает производительность на встроенной графике для моделей >20B параметров
- Новые форматы NVFP4/MXFP4 пока не дают обещанного выигрыша на AMD Vulkan-стеке — требуют оптимизации драйверов
- Порог «читабельной» скорости генерации (~15+ т/с) достижим даже на бюджетных APU при правильном выборе модели
Автор: Ксения Лаврова · Источник: reddit.com
**Это один из тех тестов, которые реально двигают индустрию вперёд.** Пока все гонятся за H100 и A100, энтузиасты доказывают: интеллект не обязательно должен стоить как подержанная Tesla. MoE-архитектура в действии — это не абстрактная концепция из академических paper'ов, а конкретная шестикратная разница в скорости на железе, которое уже лежит в вашем рюкзаке.
Особенно ценно, что автор честно показал провал новомодных FP4-форматов на AMD. Индустрия любит хайпить «прорывные» форматы квантизации, но на практике старый добрый Q4_K пока рулит. Вывод простой: если делаете локальное решение на APU — ставьте на MoE + 4-bit, остальное пока маркетинг. И да, пора перестать стесняться встроенной графики — правильно настроенная, она тянет то, что ещё пару лет назад требовало серверной фермы.
Комментарии