#оптимизация инференса

И инструменты ·17 авг 2026

Адаптивный MTP в llama.cpp: автоматическая оптимизация скорости генерации

В llama.cpp появился PR с адаптивным режимом MTP (Multi-Token Prediction), который динамически подбирает глубину предсказания токенов. При генерации кода скорость растёт на 10-15%, а при воспоминании кода из контекста — до 50-100% быстрее против статического MTP=3. Для прозы прирост скромнее: 3% хуже на плотных текстах, +20-30% при воспоминании.

0 126
И инструменты ·30 июл 2026

MindControl для Llama.cpp: как сократить токены вдвое без потери точности в рассуждениях LLM

Разработчик протестировал MindControl — метод контроля «бюджета рассуждений» для llama.cpp через самоинструкции модели вместо жёсткой обрезки. Результат: снижение потребления токенов на 50% без потери точности на HumanEval+ и LiveCodeBench. Лучший результат (95.7%) получен при максимальных ограничениях — модель не зацикливается на простых задачах.

0 136
И инструменты ·29 июл 2026

Запустил модель на 1.56 ТБ на игровом ноуте с 6 ГБ видеопамяти — вот что вышло

Энтузиаст запустил гигантскую MoE-модель (1.56 ТБ, 896 экспертов на слой) на бюджетном ноутбуке HP Victus с RTX 4050 (6 ГБ VRAM). Первая попытка — краш до первого токена. После патча движка и стриминга весов с SSD получилось 0.1 токена в секунду — медленно, но работает. Бутылочное горлышко — 33 ГБ чтения с диска на каждый токен.

0 80
И инструменты ·25 июл 2026

MTP в llama.cpp: в 2 раза быстрее на обычных моделях, провал на MoE

В llama.cpp появилась нативная поддержка MTP (Multi Token Prediction) — технологии, где модель предсказывает несколько токенов за раз. На обычных dense-моделях (Qwen, DeepSeek, GLM) это даёт ускорение в 1.4-2.2 раза. На MoE-моделях прирост минимальный или его вообще нет — архитектура MoE уже оптимизирована по затратам на декодинг. Старые методы спекулятивной декодинга с отдельными draft-моделями показали себя ненадёжно.

0 71