инструменты 1 мин

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

Показывает реальный путь к доступному запуску больших моделей без облака — критично для разработчиков и компаний, которые не хотят зависеть от OpenAI/Azure и хотят контролировать инфраструктуру.

Что произошло

Пользователь TacoTakumi опубликовал экспериментальную квантизацию DeepSeek-V4-Flash-0731, где применил выборочное сжатие: только 129 экспертных тензоров упаковал в 3-битный формат IQ3_XXS/IQ3_S, а остальные части модели (attention, shared experts, маршрутизатор) оставил в исходном высоком разрешении Q8_0/BF16/F32.

Результат занимает 111,37 ГБ против ~140 ГБ оригинала и ~109 ГБ у полной IQ3_S-квантизации от unsloth. Замеры на wikitext-2 показали среднее KLD-отклонение 0,2386 против 0,2936 у конкурента, точность совпадения top-1 токенов 84,65% vs 82,78%. На миксе из пяти разных GPU (96 ГБ VRAM общего) с переливом экспертов в оперативку скорость выросла с 9,88 до 13,91 токенов/сек — в 1,4 раза. Для сравнения полная Q2-квантизация даёт 30 токенов/сек, но проседает по качеству.

Автор предупреждает: DeepSeek-V4-Flash имеет известные баги с SWA и откатами в llama.cpp на длинных контекстах, нужен патченный билд. Исходники и логи перплексии выложены на HuggingFace.

Автор: Павел Заславский · Источник: reddit.com

Разработчикам. Открывает путь к выборочной квантизации MoE-архитектур: сжимаешь только экспертные слои, остальное держишь в высоком разрешении. Работает на llama.cpp, нужен патч для стабильности на длинных контекстах. Годится для домашних риггов с миксом GPU и RAM-спиллом.

Бизнесу. Снижает барьер входа для запуска 600B+-параметровых моделей: вместо аренды облака или покупки топовых GPU можно собрать гибрид из б/у железа. Позволяет держать качество на уровне 3 бит вместо скатывания до 2, что критично для продуктовых сценариев.

Инвесторам. Показывает, что инфраструктурный разрыв между облаком и on-premise сужается: энтузиасты находят способы гонять frontier-модели на потребительском железе. Снижает монополию облачных провайдеров, усиливает тренд на open-weights и локальный инференс.

Хайп15
Реальная польза60
Заработать55
  • Сервис автоматической выборочной квантизации MoE-моделей: загружаешь чекпоинт, получаешь оптимизированный GGUF под твоё железо и требования по качеству
  • Платформа-маркетплейс кастомных GGUF-квантов с бенчмарками KLD/PPL/скорости под разные конфигурации GPU
  • Консалтинг по сборке гибридных риггов для AI-агентств: подбор б/у GPU, настройка llama.cpp, оптимизация под конкретные модели
  • Патченные форки llama.cpp с фиксами для конкретных семейств моделей, продажа через GitHub Sponsors или support-контракты
  • Инструмент мониторинга RAM-спилла и автоматической балансировки нагрузки между GPU и CPU для максимизации t/s
  • Выборочная квантизация — это dance on the edge: малейший промах в выборе слоёв даёт деградацию качества, нет универсального рецепта
  • Баги в llama.cpp для DeepSeek-V4 не пофикшены upstream — зависимость от патчей энтузиастов, риск для продакшена
  • Выигрыш в скорости привязан к конкретной конфигурации железа и паттерну спилла, результаты не масштабируются линейно
  • Рост популярности on-premise инференса может привести к дефициту б/у GPU и росту цен на вторичке

Это классический пример того, как энтузиасты обгоняют крупные компании в оптимизации под реальные условия. TacoTakumi не изобрёл велосипед — он просто понял, что в MoE-архитектуре можно сжимать выборочно, и применил здравый смысл вместо слепого прогона через llama-quantize. Результат: качество выше, скорость выше, размер меньше. Типичный open source момент.

С другой стороны, это решение для узкого круга: нужна конкретная конфигурация железа, патченный билд llama.cpp, понимание метрик KLD и готовность экспериментировать. Для продакшена это пока too edgy — баги в llama.cpp для DeepSeek-V4 никуда не делись, а зависимость от патчей из форков — это риск. Но как proof-of-concept это сигнал: барьер входа в большие модели падает, и скоро любая команда сможет гонять frontier-модели на своём железе без облачных счетов. Главное — не забывать про тесты качества перед продакшеном.

Инструменты из статьи

Высокопроизводительная языковая модель с агентными возможностями по цене...

Доступ из РФ →
DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии