#KV-cache

И инструменты ·26 июл 2026

BeeLlama.cpp v0.4.1: новые способы сжатия KV-кэша для LLM без потери точности

Вышла версия форка llama.cpp с улучшенными алгоритмами квантизации KV-кэша: KVarN (нормализация по дисперсии), precision tail (хранение последних токенов в высоком качестве) и дополнительные типы сжатия q2_0-q6_1. Бенчмарки показывают, что хранение последних 1024 токенов в полной точности позволяет kvarn5 и q6_0 достичь качества q8_0 при меньшем расходе видеопамяти.

0 56
И инструменты ·31 июл 2026

Архитектура инференса LLM: батчинг, KV-кеш и мультиарендность

Статья объясняет, как устроены системы инференса больших языковых моделей изнутри. Автор разбирает, почему наивный подход тратит ресурсы GPU впустую, как работают современные техники оптимизации (continuous batching, PagedAttention) и что происходит, когда нужно обслуживать множество пользователей одновременно на одном железе.

0 25