инструменты 1 мин

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

Показывает путь от интуитивной квантизации к управляемой данными. Если вы запускаете модели локально или заботитесь об агентности — узнаете, где именно ломается качество и как сжать модель без потери критичных функций.

Квантизация с открытыми глазами

Стандартный подход к квантизации моделей выглядит так: выбираешь битность, применяешь её ко всем весам, возможно даёшь imatrix примерно угадать важные участки — и отправляешь в продакшен. Большинство не проверяет, какие конкретно группы весов выдержат сжатие, а какие сломаются. Работает на конвенциях и интуиции.

Энтузиаст под ником enginetown собрал тестовый стенд, который квантизует по одной группе весов за раз и измеряет точное расхождение с полноточной моделью через KL-дивергенцию на промптах из разных категорий: общие диалоги, код, математика, вызовы инструментов. Не догадка — конкретное число для каждой группы.

Три неожиданных находки

Размер не равно сжимаемость. Группы весов почти идентичного размера и архитектурной роли показали радикально разную устойчивость к сжатию. Одна спокойно держит агрессивные настройки, её близнец ломается на два уровня раньше. Визуально это не увидеть — только тестирование.

Есть чёткий обрыв, и он узкий. Во всех экспериментах измеримое расхождение начиналось в диапазоне 3.5–3.9 бит на вес. Выше этой зоны всё стабильно. Ниже — начинаются проблемы.

Tool calling ломается первым. В большинстве весовых групп вызовы инструментов показывали расхождение раньше, чем чат, код или математика. Если агентность важна — это критический параметр для любой квантизованной модели.

Три сборки на выбор

На основе данных автор собрал три варианта Qwen3.6-27B:

  • Bedrock (13.26 ГБ) — ничего не сжато дальше доказанно безопасного порога. Максимально близко к оригиналу.
  • Tightrope (12.53 ГБ) — сбалансированный. Большинство групп на безопасном уровне, некоторые чуть дальше там, где данные это подтверждают.
  • Gambit (10.94 ГБ) — агрессивный. Каждая группа на один шаг за измеренным безопасным порогом. Минимальный размер, всё ещё рабочий на коде, логических задачах, многошаговых рассуждениях. Для тех, кому критична VRAM.

Автор собрал собственную imatrix вместо использования готовой из базовой модели. Он подчёркивает, что это ручное тестирование, не формальный бенчмарк, но явно не наивная плоская квантизация — должно работать стабильнее аналогов того же размера.

Проект соло, автор просит реальную обратную связь: скриншоты успехов и провалов важнее, чем просто скачивания.

Ключевые выводы

  • Размер группы весов НЕ предсказывает её устойчивость к квантизации — идентичные по размеру слои могут вести себя радикально по-разному
  • Критический порог деградации лежит в узком диапазоне 3.5–3.9 бит/вес — ниже начинаются измеримые проблемы
  • Tool calling (вызовы инструментов) деградирует первым в большинстве весовых групп, раньше чем чат, код или математика
  • Автоматизированное тестирование отдельных групп весов даёт конкретные числа вместо интуитивного подбора параметров
  • Три сборки покрывают спектр от максимальной точности (13.26 ГБ) до агрессивного сжатия с сохранением работоспособности (10.94 ГБ)

Автор: Павел Заславский · Источник: reddit.com

Мнение редакции

**Наконец-то квантизация с приборами, а не на глазок.** Обычно модель сжимают как колбасу — везде одинаково и молятся, чтобы не развалилась. Здесь автор пошёл хирургическим путём: замерил каждую группу весов отдельно, нашёл точный порог, когда начинается деградация (3.5–3.9 бит), и главное — обнаружил, что вызовы инструментов сыпятся раньше всего. Это не теория, а данные с реальными числами.

Честно говоря, опытные квантизаторы типа bartowski делают что-то подобное годами, но интуитивно. Этот проект просто автоматизировал процесс и выдал конкретику. Три готовых сборки — от консервативной до агрессивной — дают выбор в зависимости от того, что важнее: точность или VRAM. Gambit на 10.94 ГБ выглядит как лучшее соотношение риска и выгоды, если верить автору. Но это соло-проект без формальных бенчмарков, так что стоит проверить самому, если критично. Подход правильный, реализация честная, обратная связь нужна — вот и всё, что важно знать.

Ещё по теме

Комментарии