инструменты 1 мин

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

Квантизация KV Cache — ключевая техника для удешевления работы больших моделей в проде. Этот тест показывает, что для DS4F она не работает, что влияет на TCO проектов и выбор архитектуры.

Что произошло

Пользователь Reddit провёл сравнительные бенчмарки квантизации KV Cache (перехода с BF16 на Q8_0) для DeepSeek V4 Flash и Qwen 397B. Тесты замеряли три метрики: perplexity (показатель качества предсказаний), KL divergence (расхождение распределений вероятностей) и точность совпадения топ-токенов.

Для DeepSeek V4 Flash квантизация дала: - Mean KL divergence: 0.146 (против 0.0036 у Qwen — в 40 раз хуже) - Same top p: 87.2% (против 97.9% у Qwen) - Средний рост perplexity: 0.64% (против 0.03% у Qwen)

На практике: каждый восьмой токен у квантизованной DS4F выбирается иначе, чем у оригинала. У Qwen квантизация почти незаметна — только каждый 50-й токен меняется.

Квантизация KV Cache популярна для экономии памяти при длинных контекстах (10-100x сжатие), но для DeepSeek V4 Flash архитектура оказалась чувствительной к потере точности в кэше.

Автор: Анна Мельникова · Источник: reddit.com

Разработчикам. Если разворачиваете DS4F в продакшене с длинными контекстами, лучше держать KV Cache в BF16 или использовать альтернативные методы компрессии (например, PagedAttention без квантизации). Для Qwen 397B Q8 KV безопасен.

Бизнесу. Проекты на DS4F потребуют больше видеопамяти, чем ожидалось — квантизация не спасёт. Если бюджет железа критичен, альтернативы вроде Qwen дадут лучшее соотношение качество/ресурсы при сжатии.

Инвесторам. DeepSeek показывает интересную архитектуру, но требует дорогого железа для работы на полную мощность. Проекты вокруг оптимизации inference (Flash Attention, альтернативные квантизаторы) получат спрос — рынок ищет способы удешевить деплой больших моделей.

Хайп15
Реальная польза60
Заработать55
  • Разработка специализированных quantization-схем для DeepSeek (адаптивная квантизация только для менее критичных слоёв KV)
  • Сервисы managed inference для DS4F с гарантией полной точности — ниша для облачных провайдеров
  • Консалтинг по выбору модели под железо: Qwen для бюджетных сетапов, DS4F для топовых
  • Инструменты A/B-тестирования квантизованных vs неквантизованных версий моделей для конкретных задач
  • Open-source библиотеки для автоматического бенчмаркинга качества KV Cache quantization
  • Результаты получены одним энтузиастом на неизвестном датасете — нужна репликация на разных задачах
  • Возможно, проблема решается другими методами сжатия (mixed precision, sparse attention), но тесты их не покрывают
  • DeepSeek может выпустить обновлённую версию, где эта проблема исправлена — выводы устареют
  • Для задач, где топ-токен не критичен (creative writing), 87% может быть достаточно — паника преждевременна

Это ценное напоминание, что маркетинговые обещания про «лёгкую оптимизацию» моделей стоит проверять на реальных данных. Один энтузиаст с бенчмарками сделал больше для понимания DS4F, чем пресс-релизы.

На практике это значит: если собираетесь разворачивать DeepSeek V4 Flash с длинными контекстами (а там как раз главная фишка), закладывайте полный объём видеопамяти без расчёта на сжатие KV. Или выбирайте Qwen — там квантизация работает почти без потерь. Да, железо дороже, но это всё равно дешевле, чем отлаживать баги от деградации качества в проде.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии