инструменты 1 мин

Сжатие KV-кеша LLM в 8 раз на CPU: инженерия за AdapTQ

Автор создал AdapTQ — открытую C++ библиотеку, которая сжимает KV-кеш больших языковых моделей в 8 раз при работе на обычных CPU (MacBook, Raspberry Pi). Это решает проблему нехватки оперативной памяти при длинных контекстах и ускоряет генерацию токенов благодаря снижению потребности в пропускной способности памяти.

Разработчикам, запускающим LLM на потребительском железе без GPU, и всем, кто сталкивается с ограничениями памяти при длинных контекстах. Показывает конкретные низкоуровневые техники оптимизации и предлагает готовое решение с интеграцией в Hugging Face.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Узким местом при длинных контекстах (>2000 токенов) становится не вычисления, а скорость памяти — CPU ждёт данных из RAM
  • Прямое квантование разрушает модель из-за выбросов; автор использует Fast Walsh-Hadamard Transform для «размазывания» выбросов перед сжатием до 4 бит
  • Вместо декомпрессии при каждом умножении создаётся lookup table (LUT) с предвычисленными значениями, что позволяет работать напрямую со сжатыми данными через AVX2 SIMD
  • Адаптивный подход: на коротких контекстах (<256 токенов) работает обычный FP32, на длинных автоматически переключается на квантованный режим без копирования данных
Юлия Тарасова Medium #llm
Читать оригинал

Инструменты из статьи

Open-source рабочее пространство для создания и управления AI-агентами и...

Доступ из РФ →

Ещё по теме

Комментарии