#оптимизация моделей

М модели ·31 июл 2026

Квантизация Qwen3.6-27B до 3.33 BPW без потери качества: проверено на реальной модели, а не на бумаге

Разработчик сжал файнтюн Qwen3.6-27B до 10.4 ГБ (3.33 бита на вес) методом покомпонентной квантизации с KLD-контролем. Главное: на этот раз проверил не отдельные слои, а собранную модель целиком — и нашёл реальную деградацию, которую пришлось чинить вручную. Модуль внимания сжимается почти даром, основная цена качества — в FFN.

0 116
М модели ·30 июл 2026

Как Google запустила генеративную AI на смарт-часах

Google встроила локальную языковую модель в Pixel Watch, хотя часы имеют в сотни раз меньше памяти, чем телефон, и физически не могут долго работать на полной мощности из-за перегрева. Статья объясняет, какие три технических компромисса позволили уместить AI в столь ограниченное устройство.

0 73
И инструменты ·28 июл 2026

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

0 121