Speculative decoding на Qwen3.6-27B: DFlash даёт 3.3× ускорение против базы
Энтузиаст протестировал четыре метода speculative decoding (DFlash, MTP, EAGLE3, ngram) на модели Qwen3.6-27B в SGLang и vLLM на одной видеокарте RTX PRO 6000. DFlash показал лучший результат — ускорение в 3.3 раза, MTP/NEXTN — до 2.8×, EAGLE3 — 1.9×, ngram — 1.1–1.3×. Попутно обнаружил несовместимости и баги в обоих фреймворках.
Показывает реальную производительность методов ускорения инференса на актуальной модели и типовом железе, с честными цифрами и описанием подводных камней — полезно для тех, кто выбирает стек для production или экспериментов.
Speculative decoding на Qwen3.6-27B: битва методов
Энтузиаст u/thavoc77 провёл детальный бенчмарк четырёх методов speculative decoding на модели Qwen3.6-27B (27 млрд параметров, квантизация NVFP4) на одной видеокарте RTX PRO 6000 Max-Q. Цель — найти, какой способ ускорения инференса даёт лучший прирост на практике в фреймворках vLLM и SGLang.
Результаты (ускорение против собственного базового сценария без spec-decode):
- DFlash: лидер с большим отрывом. 3.3× на SGLang, 2.5× на vLLM, а на задачах математического рассуждения (math_reasoning) — до 4.6×.
- MTP / NEXTN: стабильные 2.2–2.8×, причём ускорение растёт с глубиной draft-декодирования.
- EAGLE3: ~1.9×, пик на K=3, дальше выходит на плато. Паттерн противоположен NEXTN — неожиданно.
- ngram: слабый результат, 1.1–1.3×, почти не стоит усилий.
Тестирование проходило на бенчмарке Spec-Bench (greedy, batch 1, усреднение по шести категориям), с тремя перезапусками на каждую точку измерения.
Технические подводные камни
- EAGLE3 вообще не запустился на vLLM: валидатор head_dim в hf_hub отвергает голову модели. Работает только в SGLang, и то нужен пропатченный билд.
- DFlash на SGLang падал на первом токене: сэмплер делает matmul напрямую на lm_head, который квантован в NVFP4, из-за чего ломаются размерности. Фикс — деквантизация головы в 15 строк кода. Плюс пришлось ограничить max-running-requests, чтобы кэш mamba/GDN не выбивал OOM.
Автор потратил целый вечер на отладку, но получил рабочие цифры и поделился патчами.
Ключевые выводы
- DFlash показывает лучший результат среди всех методов speculative decoding на Qwen3.6-27B — до 4.6× на математических задачах
- MTP/NEXTN ускоряется с ростом глубины draft, EAGLE3 выходит на плато после K=3 — противоположная динамика
- ngram практически бесполезен для этой модели (1.1–1.3×)
- Ни vLLM, ни SGLang не работают с EAGLE3/DFlash из коробки на квантованных моделях — нужны патчи
- Speculative decoding на одной потребительской видеокарте даёт реальное ускорение, но требует ручной доводки фреймворков
Автор: Павел Заславский · Источник: reddit.com
**Редакция:** Это редкий случай, когда кто-то не просто «попробовал разные методы», а методично измерил их на одной модели, одном железе, с контролем переменных и перезапусками. Цифры можно брать в работу. DFlash действительно впечатляет, особенно на математике — 4.6× это серьёзно. Но история с патчами показывает, что speculative decoding всё ещё в стадии «собери сам»: ни один из популярных фреймворков не работает из коробки с квантованными моделями. Если вы планируете spec-decode в production, закладывайте время на допиливание. ngram можно сразу вычёркивать, EAGLE3 интересен, но капризен, MTP — золотая середина.
Комментарии