#on-premise

И инструменты ·2 авг 2026

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

0 128
И инструменты ·4 авг 2026

DeepSeek V4 Flash в 2-битной квантизации первым справился с SQL-тестами на локальной машине

Энтузиаст запустил DeepSeek V4 Flash в агрессивной 2-битной квантизации на двух RTX 3080 и получил 100% на SQL-бенчмарке — то, что раньше удавалось только Claude Opus 4.7 и GPT-5.5 в облаке. Кастомная сборка GGUF с допиленным движком antirez выдала 300 токенов/сек промпта и 11-12 токенов/сек генерации.

0 80