инструменты 1 мин

KLQ: квантизация LLM без обучения через измерение геометрии пространства — бьёт SpinQuant на 4 битах

Новый метод квантизации KLQ измеряет важность направлений в пространстве эмбеддингов LLM и распределяет биты неравномерно — даёт больше битов важным направлениям, меньше — второстепенным. На Llama 3.2 1B в режиме W4A4KV4 обходит SpinQuant и почти догоняет ReSpinQuant, при этом не требует дообучения (только проходы по модели для измерений).

Показывает, что можно квантовать модели до 4 бит без дообучения и получать результаты уровня обучаемых методов — если готов платить временем на измерения. Открывает путь к более дешёвой кастомной квантизации.

Что произошло

Энтузиаст-исследователь выложил KLQ — метод квантизации весов, активаций и KV-кэша LLM до 4 бит без градиентного дообучения. В отличие от rotation-based методов (QuaRot, SpinQuant), которые выравнивают пространство эмбеддингов вращением и потом квантуют равномерно, KLQ идёт наоборот: измеряет, насколько важно каждое направление, и выделяет биты неравномерно — больше битов туда, где больше информации.

Как работает: для каждого направления (eigenbasis) делается возмущение, прогон модели на нескольких тысячах токенов и замер KL-дивергенции с оригиналом. Полученные оценки ранжируются, и через алгоритм waterfilling (из теории информации) распределяется бюджет битов. Вместо вариации (как в CoQuant) используется реальный эмпирический урон от квантизации.

Результаты: на Llama 3.2 1B (W4A4KV4) perplexity 13.36 против 14.59 у QuaRot и 13.52 у SpinQuant (с дообучением + GPTQ). Почти догоняет ReSpinQuant (13.09), но без обучения.

Минусы: нужно сотни тысяч forward passes — Llama 1B квантовалась 10 часов на 3090, Qwen 0.5B — 5 часов. Пока нет продакшн-ядер, только "фейковая" квантизация для экспериментов.

Автор: Марина Соколова · Источник: reddit.com

Разработчикам. Новый способ квантизовать модели до 4 бит без дообучения: измеряешь важность направлений через KL-дивергенцию, распределяешь биты неравномерно. Можно встроить в свои пайплайны, но пока нет реальных ядер — только proof of concept. Код на GitHub, есть разбор методологии и экспериментов.

Бизнесу. Квантизация до 4 бит без дообучения может удешевить инференс в 4+ раза, но KLQ требует 5-10 часов препроцессинга на GPU — окупится только для долгоживущих сервисов. Пока не production-ready, но показывает, что можно обойтись без дорогих SpinQuant/ReSpinQuant и их градиентных оптимизаций.

Инвесторам. Rotation-based квантизация — один из главных трендов для удешевления LLM-инференса. KLQ показывает, что training-free методы могут конкурировать с обучаемыми — если подход масштабируется, это снизит барьер для кастомной квантизации. Пока это исследовательский проект энтузиаста, но идея измерения геометрии может повлиять на новые коммерческие решения.

Хайп35
Реальная польза55
Заработать50
  • Встроить KLQ в CI/CD для квантизации кастомных fine-tune моделей без дообучения — ускорить деплой и снизить latency
  • Портировать алгоритм waterfilling на более быстрые измерения (меньше forward passes) и упаковать в SaaS для квантизации моделей on-demand
  • Комбинировать KLQ с GPTQ/AWQ для гибридной схемы: неравномерное распределение битов + продвинутый rounding — получить новое качество W4A4
  • Продать услуги по квантизации энтерпрайзам, которым нужны кастомные модели с минимальным качественным уроном, но без затрат на SpinQuant
  • Разработать real kernels для KLQ и предложить как альтернативу llama.cpp/vLLM — захватить нишу training-free квантизации
  • Препроцессинг 10+ часов на GPU делает метод неприменимым для быстрых итераций и CI/CD — коммерчески выгоден только для крупных долгоживущих моделей
  • Без продакшн-ядер это академический proof of concept — реальной пользы пока нет, нужны месяцы разработки для внедрения
  • SpinQuant/ReSpinQuant уже обучены и интегрированы в экосистему, переход на training-free метод может не окупиться для тех, кто уже инвестировал в обучаемые ротации
  • Автор — соло-исследователь без лаборатории, нет гарантий поддержки и масштабирования, проект может заглохнуть без комьюнити

KLQ — это красивая идея: вместо того чтобы крутить модель ротациями и квантовать равномерно, измерить реальный урон от квантизации каждого направления и дать битов туда, где они нужнее. На бумаге работает — Llama 1B в W4A4KV4 почти догнала ReSpinQuant, но без градиентного спуска. Вопрос в том, насколько это жизнеспособно: 10 часов препроцессинга на 3090 для 1B модели — это дорого. Для долгоживущих продакшн-моделей может окупиться, но для быстрых итераций и экспериментов SpinQuant/AWQ по-прежнему удобнее.

Вторая проблема — это proof of concept без реальных ядер. Пока что это академический эксперимент, и чтобы стать альтернативой llama.cpp или vLLM, нужно ещё месяцы разработки. Но сама идея измерения через KL-дивергенцию вместо вариации — сильная, и если комьюнити подхватит, может родиться новый стандарт training-free квантизации. Следить стоит, использовать в проде — рано.

Ещё по теме

Комментарии