#KV-cache

И инструменты ·26 июл 2026

BeeLlama.cpp v0.4.1: новые способы сжатия KV-кэша для LLM без потери точности

Вышла версия форка llama.cpp с улучшенными алгоритмами квантизации KV-кэша: KVarN (нормализация по дисперсии), precision tail (хранение последних токенов в высоком качестве) и дополнительные типы сжатия q2_0-q6_1. Бенчмарки показывают, что хранение последних 1024 токенов в полной точности позволяет kvarn5 и q6_0 достичь качества q8_0 при меньшем расходе видеопамяти.

0 56
И исследования ·19 июл 2026

Почему «идеальное сжатие» AI-моделей может проваливать задачу — исследование 12 доменов с предсказаниями против реальности

Исследователь показал на 12 доменах (от радаров до языковых моделей): алгоритм сжатия, оптимальный по метрике восстановления данных, может проигрывать на реальной задаче другому методу с «худшим» восстановлением — потому что задача чувствительна к другим измерениям данных. Когда меняешь задачу — победитель меняется местами. Все предсказания зарегистрированы заранее, включая провалы.

0 19