#квантование

И инструменты ·23 июл 2026

Сжатие KV-кеша LLM в 8 раз на CPU: инженерия за AdapTQ

Автор создал AdapTQ — открытую C++ библиотеку, которая сжимает KV-кеш больших языковых моделей в 8 раз при работе на обычных CPU (MacBook, Raspberry Pi). Это решает проблему нехватки оперативной памяти при длинных контекстах и ускоряет генерацию токенов благодаря снижению потребности в пропускной способности памяти.

0 123
И инструменты ·23 июл 2026

FLUX.2 32B на AMD 7900 XTX: как обучить гигантскую модель на 24 ГБ под Windows

Энтузиаст из Reddit обучил 32-миллиардную LoRA для FLUX.2 на потребительской видеокарте AMD с 24 ГБ памяти под нативным ROCm на Windows — на грани возможного. Пришлось преодолеть 14 багов: от крашей при загрузке 64 ГБ весов до мистических замедлений в 10 раз, которые лечились запуском второго процесса с GEMM-вычислениями. В итоге — 9–10 секунд на итерацию при разрешении 448×448.

0 132
И инструменты ·25 июл 2026

Энтузиаст запустил 27-миллиардную языковую модель на одноплатнике с 16 ГБ памяти

Разработчик смог запустить полноценную 27-миллиардную языковую модель Bonsai на одноплатном компьютере Jetson Orin NX 16GB, используя экстремальное 1-битное сжатие. Модель работает полностью офлайн, потребляет около 25 Вт и выдаёт ~7 токенов в секунду — медленно, но для одного пользователя вполне пригодно.

0 55
И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 63
М модели ·26 июл 2026

Kimi K3 — самая большая открытая модель в истории. Почти никто не может её запустить

Moonshot AI выпустила открытую модель Kimi K3 с 2,8 трлн параметров — крупнейшую в истории. Однако из-за огромного размера (1,4 ТБ весов даже в 4-битном квантовании) её практически невозможно запустить на собственном железе. Сама компания приостановила подписки из-за нехватки GPU для обслуживания спроса.

0 19