MindControl для Llama.cpp: как сократить токены вдвое без потери точности в рассуждениях LLM
Разработчик протестировал MindControl — метод контроля «бюджета рассуждений» для llama.cpp через самоинструкции модели вместо жёсткой обрезки. Результат: снижение потребления токенов на 50% без потери точности на HumanEval+ и LiveCodeBench. Лучший результат (95.7%) получен при максимальных ограничениях — модель не зацикливается на простых задачах.