Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости
Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.