#оптимизация инференса

И инструменты ·29 июл 2026

Запустил модель на 1.56 ТБ на игровом ноуте с 6 ГБ видеопамяти — вот что вышло

Энтузиаст запустил гигантскую MoE-модель (1.56 ТБ, 896 экспертов на слой) на бюджетном ноутбуке HP Victus с RTX 4050 (6 ГБ VRAM). Первая попытка — краш до первого токена. После патча движка и стриминга весов с SSD получилось 0.1 токена в секунду — медленно, но работает. Бутылочное горлышко — 33 ГБ чтения с диска на каждый токен.

0 80
И инструменты ·25 июл 2026

MTP в llama.cpp: в 2 раза быстрее на обычных моделях, провал на MoE

В llama.cpp появилась нативная поддержка MTP (Multi Token Prediction) — технологии, где модель предсказывает несколько токенов за раз. На обычных dense-моделях (Qwen, DeepSeek, GLM) это даёт ускорение в 1.4-2.2 раза. На MoE-моделях прирост минимальный или его вообще нет — архитектура MoE уже оптимизирована по затратам на декодинг. Старые методы спекулятивной декодинга с отдельными draft-моделями показали себя ненадёжно.

0 70