#GGUF

И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61
И инструменты ·23 июл 2026

NanoQuant v3: C++ фундамент для локального сжатия LLM

Автор пересобрал свой проект сжатия весов моделей на C++ с акцентом на низкоуровневые детали: int4-квантизацию, однобитное сжатие, упаковку в памяти, работу с GGUF без полной загрузки модели. Проект не требует CUDA, PyTorch или Docker — только CMake и компилятор C++20.

0 44