#локальный AI

И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61
И инструменты ·22 июл 2026

Почему две видеокарты для LLM загружены только наполовину — и это не поломка

Пользователь разобрался, почему его две GeForce RTX 5060 Ti никогда не грузятся выше 50% при запуске LLM. Причина — в архитектуре послойного разделения модели: карты работают по очереди, а не параллельно. Каждый сгенерированный токен требует прочитать из памяти все 22 ГБ весов модели, и узким местом становится пропускная способность памяти, а не вычисления.

0 85