инструменты 1 мин

DeepSeek V4 0731: квантизация до 104 ГБ с 83.6% точностью на RTX 5090

Команда AtomicChat квантизовала DeepSeek V4 0731, выявив критические баги в llama.cpp (NaN-значения и потерю точности при конвертации FP8). Создали 13 квантов с imatrix на 1.87M токенах, оптимизированных под RTX 5090. Лучший результат: 104 ГБ (AD-IQ2_M) с 83.6% точностью top-1, что обходит публичные кванты по PPL при одинаковом размере.

Потому что вы, возможно, уже используете сломанные веса DeepSeek V4, не зная об этом. И потому что можно запускать frontier-модель на потребительском железе с минимальной потерей качества, если знать, где копать.

Что произошло

Команда AtomicChat (разработчики одноимённого open-source клиента) провела детальную квантизацию DeepSeek V4 0731 и обнаружила критические проблемы в стандартном пайплайне llama.cpp:

Баг 1: без флага --no-lazy веса token_embd.weight превращаются в NaN, ломая всю квантизацию.

Баг 2: конвертер по умолчанию даункастит FP8-тензоры в Q8_0 (хардкод в conversion/deepseek.py), что даёт отклонение KLD 0.219 от оригинала ещё ДО квантизации. Для сравнения: их 3-битный квант имеет KLD 0.2065, то есть «lossless» базовая модель в 162 ГБ на самом деле дальше от оригинала, чем сжатая версия. Фикс: заменили проблемные тензоры на BF16, получив побайтово идентичную базу.

Построили 13 квантов с per-tensor overrides, подбирая битность экспертов по измеренной энергии активации каждого слоя. Использовали imatrix на 1.87M токенах (блоки по 8192).

Проблема бенчмаркинга: одинаковые файлы дают разные PPL на разных GPU — llama.cpp использует fast path для MXFP4 только на consumer Blackwell (RTX 5090), но не на H100. Пример: 4.5381 PPL на 5090 vs 4.3406 на H100. Из-за этого публичные бенчмарки несопоставимы.

Решение: измерили все 38 файлов (свои + публичные кванты) на одной системе (8× RTX 5090, wikitext-2, ctx 5632). Результаты показали, что в диапазоне 85-135 ГБ их кванты дают меньший дрифт от полной модели, чем публичные (prometheusAIR и bullerwins превзошли в нескольких точках).

Лучший квант для 128 ГБ VRAM: AD-IQ2_M (104 ГБ, 2.79 bpw), 83.6% top-1 accuracy.

Все файлы и методология — на Hugging Face.

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Критические баги llama.cpp при конвертации DeepSeek V4: обязателен флаг --no-lazy и замена FP8→BF16 вместо дефолтного Q8_0. Imatrix с per-tensor override даёт лучшие результаты, чем стандартная квантизация. Готовые кванты с инструкциями доступны на HF.

Бизнесу. Возможность запускать DeepSeek V4 на 128 ГБ с минимальной потерей качества (83.6% точности) вместо 160+ ГБ открывает развёртывание на потребительском железе (8× RTX 5090). Снижение порога входа для запуска frontier-моделей инхаус.

Инвесторам. Квантизация снижает капзатраты на инфраструктуру для MoE-моделей в 1.5 раза без критической деградации. Рост спроса на Blackwell-поколение (RTX 5090) для продакшн-развёртывания LLM. Показывает слабость стандартизации инструментов (llama.cpp) — возможность для инфраструктурных стартапов.

Хайп25
Реальная польза70
Заработать60
  • Сервис оптимизированных квантов под конкретное железо (RTX 5090, H100) с гарантией top-1 accuracy — подписочная модель для ML-команд
  • Консалтинг по оптимизации MoE-моделей для энтерпрайза: аудит пайплайнов квантизации, выявление скрытых багов конвертации
  • Tooling для автоматического per-tensor profiling и квантизации с imatrix — продукт для MLOps-инженеров
  • Специализированная облачная инфраструктура с pre-квантованными моделями под 128 ГБ VRAM: хост DeepSeek V4 as a Service
  • Аудит и стандартизация naming conventions для квантов на Hugging Face — платформа для верификации качества квантов
  • Баги специфичны для llama.cpp + DeepSeek V4 — на других моделях могут не проявляться, ограничивает применимость
  • Разница PPL между 5090 и H100 намекает на недетерминизм hardware-ускорений — проблемы с воспроизводимостью в проде
  • Per-tensor override требует дорогого profiling (1.87M токенов) — не масштабируется на множество моделей без автоматизации
  • Отсутствие стандартов naming делает HF-экосистему квантов хаотичной — риск использовать неоптимальные веса

Это тот редкий случай, когда пост на Reddit важнее официального релиза. Ребята не просто сжали модель — они вскрыли системную проблему инструментария, которым пользуются тысячи разработчиков. Дефолтная конвертация FP8→Q8_0 тихо убивает точность ещё до квантизации, а отсутствие флага `--no-lazy` даёт NaN в весах. Если вы деплоили DeepSeek V4 через llama.cpp без этих фиксов — у вас сейчас работает не то, что вы думаете.

Второй момент — это конец эпохи «просто скачал квант с HF». Оказалось, что одинаковые файлы дают разные PPL на RTX 5090 и H100 из-за hardware-специфичных fast path. Публичные бенчмарки теперь нерелевантны, если не указано железо. Практически: если у вас 128 ГБ VRAM, их AD-IQ2_M на 104 ГБ с 83.6% top-1 — реальная альтернатива аренде H100. Если у вас production — проверьте свой пайплайн квантизации, возможно, вы теряете качество на ровном месте.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии