#speculative-decoding

И инструменты ·27 июл 2026

Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости

Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.

0 117
И инструменты ·23 июл 2026

DFlash превратил 118B-модель на двух RTX 5090 в тормоз: как вернуть скорость или забить на спекуляцию

Энтузиаст запустил огромную MoE-модель Laguna S 2.1 (118B параметров, 71 ГБ) на двух RTX 5090 с технологией DFlash speculative decoding — и она замедлила генерацию в 2,5 раза вместо ускорения. Причина: дефолтные настройки llama.cpp заставляли драфтер генерировать слишком много токенов без уверенности, а верификация каждого токена обходилась дорого из-за оффлоада экспертов в CPU RAM. После тюнинга (ограничение длины драфта, порог уверенности 0.6, квантизация драфтера в Q8) скорость выросла с 23 до 64 tok/s — но это всё равно примерно как без драфта (62 tok/s), так что вывод: на такой конфигурации спекулятивная генерация бесполезна.

0 85