инструменты 1 мин

DeepSeek V4 Flash на AMD Ryzen AI MAX+ 395: 32 токена/сек на одном чипе с 128 ГБ памяти

Команда Lucebox запустила 284-миллиардный DeepSeek V4 Flash на единственном AMD Ryzen AI MAX+ 395 с 128 ГБ unified memory, достигнув 32 tok/s при декодировании и ~250 tok/s при префилле — это на 68.5% быстрее предыдущего лидера. Ключ к успеху — ROCmFPX (семейство 2–4-битных форматов квантизации под ROCm/HIP) и DSpark draft-модель для спекулятивного декодинга. Код открыт, результат подан на LocalMaxxing.

Это демонстрирует возможность запуска frontier-моделей на edge-устройствах без облака — открывает новые бизнес-модели (on-prem enterprise AI) и снижает зависимость от NVIDIA. Для разработчиков — готовый рецепт, как уместить 284B в один чип; для бизнеса — путь к приватному AI без подписок.

Что сделали

Команда Lucebox научила AMD Ryzen AI MAX+ 395 (процессор с интегрированной Radeon 8060S и 128 ГБ LPDDR5X) запускать DeepSeek V4 Flash — модель на 284 миллиарда параметров — локально, без сервера. Результат: 32 токена в секунду при генерации (decode) и ~250 tok/s при обработке входного контекста (prefill). Это в 1.68× быстрее предыдущего рекорда на бенчмарке LocalMaxxing и в 2.05× быстрее лучшего результата на том же железе.

Как это работает

ROCmFPX — не один формат, а семейство блочных квантизаций под AMD ROCm: - ROCmFP2 (2.5 бит/вес): для огромных матриц экспертов (gate, up проекции) - ROCmFP3 (3.5 бит): для down-проекций - ROCmFP4 (4.25 бит) и выше: для чувствительных слоёв

В среднем модель сжата до ~2.88 бит/параметр — всего 102.3 ГБ для основных весов + 11.3 ГБ для draft-модели.

DSpark draft: маленькая 3-слойная нейросеть предсказывает следующие 3 токена; большая модель проверяет 4 позиции за один проход (включая текущую). Если черновик угадал — принимаем сразу всю цепочку; если нет — главная модель сама дописывает правильный токен. Это даёт +26% к скорости относительно autoregressive inference (25.31 tok/s → 32 tok/s).

Sparse prefill: модель использует собственный «компрессор истории» DeepSeek V4 (learned indexer), чтобы обрабатывать длинные промпты быстрее — до 255.9 tok/s на контекстах ~8K токенов.

Почему это важно

Раньше модели такого масштаба требовали GPU-серверов или кластера. Теперь один чип с унифицированной памятью справляется с 284B параметрами на скорости, достаточной для интерактивной работы. Код опубликован под Apache-2.0, веса доступны на Hugging Face — каждый может повторить.

Почему это важно

👨‍💻 Разработчикам

Открытый стек ROCm/HIP + агрессивная квантизация (2–4 бит) + спекулятивное декодирование с DSpark. Можно взять код с GitHub, собрать под свой gfx1151 (Strix Halo) и запустить 284B модель на одном ноутбуке. Префилл ~250 tok/s, декодирование 32 tok/s — достаточно для RAG, агентов, локального поиска.

🧑‍💼 Бизнесу

Возможность развернуть SOTA-модель уровня GPT-4 на edge-устройствах без облака — нишевые приложения: медицина, финансы, государственные системы с требованиями конфиденциальности. AMD получает демо-кейс для Ryzen AI MAX+; стартапы могут предлагать on-prem решения за фиксированную стоимость, без подписки на API.

💰 Инвесторам

Серверные AI-чипы (NVDA, AMD) остаются основным рынком, но edge-inference на мощных ноутбуках открывает новый сегмент: локальные AI-ассистенты, персональные агенты, корпоративные решения с полной приватностью. AMD активно развивает unified memory + ROCm — альтернатива CUDA для локальных LLM. Смотреть на стартапы, строящие инфраструктуру под квантизацию и on-device inference (Lucebox, llama.cpp, GGML).

Возможности

  • Создать SaaS для корпоративных клиентов: «приватный ChatGPT на вашем сервере» — продавать on-prem инсталляции DeepSeek V4 на AMD Ryzen AI MAX+ за фиксированную лицензию, без облака и утечек данных
  • Разработать специализированные квантизаторы и inference-движки под AMD ROCm (альтернатива llama.cpp) — монетизация через enterprise-поддержку и custom quantization pipelines для клиентов с моделями 100B+
  • Запустить маркетплейс моделей с тегом «runs on Strix Halo» — курировать и дистрибутировать ROCmFPX-модели для edge-устройств (медтех, финтех, legal) с гарантией качества и бенчмарками
  • Создать фреймворк для автоматической генерации draft-моделей (DSpark-like) под любую LLM — продавать как enterprise-инструмент для ускорения inference на 20–40% без потери качества
  • Консалтинг по переходу enterprise с NVIDIA на AMD: миграция CUDA → ROCm, квантизация моделей, оптимизация под unified memory — для компаний, которые хотят снизить капзатраты на серверы

Риски

  • Ryzen AI MAX+ 395 — нишевое железо (дорого, малый объём выпуска); масштабирование на массовый рынок под вопросом — большинство ноутбуков не имеют 128 ГБ unified memory
  • Sparse prefill даёт другой порядок вычислений (не byte-identical с точным prefill) — может привести к тонким регрессиям качества на некоторых задачах, авторы ещё не провели broad evaluation
  • Квантизация до ~2.88 бит — граница, за которой модель может терять способность рассуждать; на узких enterprise-задачах это не проблема, но на общих бенчмарках результаты могут сильно падать
  • ROCm экосистема всё ещё отстаёт от CUDA по зрелости — меньше готовых решений, больше ручной отладки, меньше сообщество. Ускорение на 68% может быть не универсальным, а специфичным для этой связки Strix Halo + DeepSeek V4

Оценка

Хайп35
Реальный impact72
Денежный потенциал68
Вывод

Это важный технический прорыв для edge AI: впервые модель масштаба GPT-4 работает на одном чипе с потребительской памятью на скорости, пригодной для продакшена. Но пока это proof-of-concept для узкого железа — массовый рынок требует либо удешевления Ryzen AI MAX+, либо портирования ROCmFPX на менее мощные чипы. Главная возможность — enterprise-сегмент с требованиями конфиденциальности: медицина, финансы, госсектор готовы платить за on-prem решения без облака.

Ключевые выводы

  • 284B модель умещается в 102 ГБ благодаря смешанной квантизации 2–4 бит под AMD ROCm — код открыт, повторяемо
  • Спекулятивное декодирование с draft-моделью ускоряет генерацию на 26%, достигая 32 tok/s на одном чипе
  • Sparse prefill (до 255 tok/s) использует родной механизм DeepSeek V4 для сжатия истории — не byte-identical, качество требует проверки
  • Ryzen AI MAX+ 395 с 128 ГБ unified memory становится альтернативой серверным GPU для локальных LLM — open-source стек, без lock-in
  • Результат на 68.5% быстрее лидера LocalMaxxing — но только на специфичном железе Strix Halo, не универсально масштабируемо пока

Автор: Павел Заславский · Источник: reddit.com

Мнение редакции

**Редакция ainews.so:** Это не просто бенчмарк — это заявка AMD на edge AI. Ryzen AI MAX+ 395 с 128 ГБ unified memory пока дорогой и нишевый, но принцип работает: квантизация до ~3 бит + спекулятивное декодирование превращают серверную модель в локальную. Код открыт, веса доступны — кто угодно может повторить. Вопрос в том, насколько хорошо модель сохраняет качество при такой агрессивной компрессии: авторы честно признают, что sparse prefill меняет порядок вычислений и может влиять на результаты, а широкая оценка качества ещё не проведена.

Реальная возможность — enterprise-кейсы с требованиями приватности: медицинские системы, финансы, госсектор готовы платить за on-prem AI без облака. Но массовый рынок требует либо удешевления железа, либо портирования на менее мощные чипы. Следите за развитием ROCm экосистемы и стартапами, которые строят инфраструктуру под AMD — CUDA больше не монополист в локальном AI.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии