Адаптивный MTP в llama.cpp: автоматическая оптимизация скорости генерации
В llama.cpp появился PR с адаптивным режимом MTP (Multi-Token Prediction), который динамически подбирает глубину предсказания токенов. При генерации кода скорость растёт на 10-15%, а при воспоминании кода из контекста — до 50-100% быстрее против статического MTP=3. Для прозы прирост скромнее: 3% хуже на плотных текстах, +20-30% при воспоминании.