DeepSeek V4 Flash на AMD Ryzen AI MAX+ 395: 32 токена/сек на одном чипе с 128 ГБ памяти
Команда Lucebox запустила 284-миллиардный DeepSeek V4 Flash на единственном AMD Ryzen AI MAX+ 395 с 128 ГБ unified memory, достигнув 32 tok/s при декодировании и ~250 tok/s при префилле — это на 68.5% быстрее предыдущего лидера. Ключ к успеху — ROCmFPX (семейство 2–4-битных форматов квантизации под ROCm/HIP) и DSpark draft-модель для спекулятивного декодинга. Код открыт, результат подан на LocalMaxxing.
Это демонстрирует возможность запуска frontier-моделей на edge-устройствах без облака — открывает новые бизнес-модели (on-prem enterprise AI) и снижает зависимость от NVIDIA. Для разработчиков — готовый рецепт, как уместить 284B в один чип; для бизнеса — путь к приватному AI без подписок.
Что сделали
Команда Lucebox научила AMD Ryzen AI MAX+ 395 (процессор с интегрированной Radeon 8060S и 128 ГБ LPDDR5X) запускать DeepSeek V4 Flash — модель на 284 миллиарда параметров — локально, без сервера. Результат: 32 токена в секунду при генерации (decode) и ~250 tok/s при обработке входного контекста (prefill). Это в 1.68× быстрее предыдущего рекорда на бенчмарке LocalMaxxing и в 2.05× быстрее лучшего результата на том же железе.
Как это работает
ROCmFPX — не один формат, а семейство блочных квантизаций под AMD ROCm: - ROCmFP2 (2.5 бит/вес): для огромных матриц экспертов (gate, up проекции) - ROCmFP3 (3.5 бит): для down-проекций - ROCmFP4 (4.25 бит) и выше: для чувствительных слоёв
В среднем модель сжата до ~2.88 бит/параметр — всего 102.3 ГБ для основных весов + 11.3 ГБ для draft-модели.
DSpark draft: маленькая 3-слойная нейросеть предсказывает следующие 3 токена; большая модель проверяет 4 позиции за один проход (включая текущую). Если черновик угадал — принимаем сразу всю цепочку; если нет — главная модель сама дописывает правильный токен. Это даёт +26% к скорости относительно autoregressive inference (25.31 tok/s → 32 tok/s).
Sparse prefill: модель использует собственный «компрессор истории» DeepSeek V4 (learned indexer), чтобы обрабатывать длинные промпты быстрее — до 255.9 tok/s на контекстах ~8K токенов.
Почему это важно
Раньше модели такого масштаба требовали GPU-серверов или кластера. Теперь один чип с унифицированной памятью справляется с 284B параметрами на скорости, достаточной для интерактивной работы. Код опубликован под Apache-2.0, веса доступны на Hugging Face — каждый может повторить.
Почему это важно
Открытый стек ROCm/HIP + агрессивная квантизация (2–4 бит) + спекулятивное декодирование с DSpark. Можно взять код с GitHub, собрать под свой gfx1151 (Strix Halo) и запустить 284B модель на одном ноутбуке. Префилл ~250 tok/s, декодирование 32 tok/s — достаточно для RAG, агентов, локального поиска.
Возможность развернуть SOTA-модель уровня GPT-4 на edge-устройствах без облака — нишевые приложения: медицина, финансы, государственные системы с требованиями конфиденциальности. AMD получает демо-кейс для Ryzen AI MAX+; стартапы могут предлагать on-prem решения за фиксированную стоимость, без подписки на API.
Серверные AI-чипы (NVDA, AMD) остаются основным рынком, но edge-inference на мощных ноутбуках открывает новый сегмент: локальные AI-ассистенты, персональные агенты, корпоративные решения с полной приватностью. AMD активно развивает unified memory + ROCm — альтернатива CUDA для локальных LLM. Смотреть на стартапы, строящие инфраструктуру под квантизацию и on-device inference (Lucebox, llama.cpp, GGML).
Возможности
- Создать SaaS для корпоративных клиентов: «приватный ChatGPT на вашем сервере» — продавать on-prem инсталляции DeepSeek V4 на AMD Ryzen AI MAX+ за фиксированную лицензию, без облака и утечек данных
- Разработать специализированные квантизаторы и inference-движки под AMD ROCm (альтернатива llama.cpp) — монетизация через enterprise-поддержку и custom quantization pipelines для клиентов с моделями 100B+
- Запустить маркетплейс моделей с тегом «runs on Strix Halo» — курировать и дистрибутировать ROCmFPX-модели для edge-устройств (медтех, финтех, legal) с гарантией качества и бенчмарками
- Создать фреймворк для автоматической генерации draft-моделей (DSpark-like) под любую LLM — продавать как enterprise-инструмент для ускорения inference на 20–40% без потери качества
- Консалтинг по переходу enterprise с NVIDIA на AMD: миграция CUDA → ROCm, квантизация моделей, оптимизация под unified memory — для компаний, которые хотят снизить капзатраты на серверы
Риски
- Ryzen AI MAX+ 395 — нишевое железо (дорого, малый объём выпуска); масштабирование на массовый рынок под вопросом — большинство ноутбуков не имеют 128 ГБ unified memory
- Sparse prefill даёт другой порядок вычислений (не byte-identical с точным prefill) — может привести к тонким регрессиям качества на некоторых задачах, авторы ещё не провели broad evaluation
- Квантизация до ~2.88 бит — граница, за которой модель может терять способность рассуждать; на узких enterprise-задачах это не проблема, но на общих бенчмарках результаты могут сильно падать
- ROCm экосистема всё ещё отстаёт от CUDA по зрелости — меньше готовых решений, больше ручной отладки, меньше сообщество. Ускорение на 68% может быть не универсальным, а специфичным для этой связки Strix Halo + DeepSeek V4
Оценка
Это важный технический прорыв для edge AI: впервые модель масштаба GPT-4 работает на одном чипе с потребительской памятью на скорости, пригодной для продакшена. Но пока это proof-of-concept для узкого железа — массовый рынок требует либо удешевления Ryzen AI MAX+, либо портирования ROCmFPX на менее мощные чипы. Главная возможность — enterprise-сегмент с требованиями конфиденциальности: медицина, финансы, госсектор готовы платить за on-prem решения без облака.
Ключевые выводы
- 284B модель умещается в 102 ГБ благодаря смешанной квантизации 2–4 бит под AMD ROCm — код открыт, повторяемо
- Спекулятивное декодирование с draft-моделью ускоряет генерацию на 26%, достигая 32 tok/s на одном чипе
- Sparse prefill (до 255 tok/s) использует родной механизм DeepSeek V4 для сжатия истории — не byte-identical, качество требует проверки
- Ryzen AI MAX+ 395 с 128 ГБ unified memory становится альтернативой серверным GPU для локальных LLM — open-source стек, без lock-in
- Результат на 68.5% быстрее лидера LocalMaxxing — но только на специфичном железе Strix Halo, не универсально масштабируемо пока
Автор: Павел Заславский · Источник: reddit.com
**Редакция ainews.so:** Это не просто бенчмарк — это заявка AMD на edge AI. Ryzen AI MAX+ 395 с 128 ГБ unified memory пока дорогой и нишевый, но принцип работает: квантизация до ~3 бит + спекулятивное декодирование превращают серверную модель в локальную. Код открыт, веса доступны — кто угодно может повторить. Вопрос в том, насколько хорошо модель сохраняет качество при такой агрессивной компрессии: авторы честно признают, что sparse prefill меняет порядок вычислений и может влиять на результаты, а широкая оценка качества ещё не проведена.
Реальная возможность — enterprise-кейсы с требованиями приватности: медицинские системы, финансы, госсектор готовы платить за on-prem AI без облака. Но массовый рынок требует либо удешевления железа, либо портирования на менее мощные чипы. Следите за развитием ROCm экосистемы и стартапами, которые строят инфраструктуру под AMD — CUDA больше не монополист в локальном AI.
Комментарии