инструменты 1 мин

Speculative decoding на Qwen3.6-27B: DFlash даёт 3.3× ускорение против базы

Энтузиаст протестировал четыре метода speculative decoding (DFlash, MTP, EAGLE3, ngram) на модели Qwen3.6-27B в SGLang и vLLM на одной видеокарте RTX PRO 6000. DFlash показал лучший результат — ускорение в 3.3 раза, MTP/NEXTN — до 2.8×, EAGLE3 — 1.9×, ngram — 1.1–1.3×. Попутно обнаружил несовместимости и баги в обоих фреймворках.

Показывает реальную производительность методов ускорения инференса на актуальной модели и типовом железе, с честными цифрами и описанием подводных камней — полезно для тех, кто выбирает стек для production или экспериментов.

Speculative decoding на Qwen3.6-27B: битва методов

Энтузиаст u/thavoc77 провёл детальный бенчмарк четырёх методов speculative decoding на модели Qwen3.6-27B (27 млрд параметров, квантизация NVFP4) на одной видеокарте RTX PRO 6000 Max-Q. Цель — найти, какой способ ускорения инференса даёт лучший прирост на практике в фреймворках vLLM и SGLang.

Результаты (ускорение против собственного базового сценария без spec-decode):

  • DFlash: лидер с большим отрывом. 3.3× на SGLang, 2.5× на vLLM, а на задачах математического рассуждения (math_reasoning) — до 4.6×.
  • MTP / NEXTN: стабильные 2.2–2.8×, причём ускорение растёт с глубиной draft-декодирования.
  • EAGLE3: ~1.9×, пик на K=3, дальше выходит на плато. Паттерн противоположен NEXTN — неожиданно.
  • ngram: слабый результат, 1.1–1.3×, почти не стоит усилий.

Тестирование проходило на бенчмарке Spec-Bench (greedy, batch 1, усреднение по шести категориям), с тремя перезапусками на каждую точку измерения.

Технические подводные камни

  • EAGLE3 вообще не запустился на vLLM: валидатор head_dim в hf_hub отвергает голову модели. Работает только в SGLang, и то нужен пропатченный билд.
  • DFlash на SGLang падал на первом токене: сэмплер делает matmul напрямую на lm_head, который квантован в NVFP4, из-за чего ломаются размерности. Фикс — деквантизация головы в 15 строк кода. Плюс пришлось ограничить max-running-requests, чтобы кэш mamba/GDN не выбивал OOM.

Автор потратил целый вечер на отладку, но получил рабочие цифры и поделился патчами.

Ключевые выводы

  • DFlash показывает лучший результат среди всех методов speculative decoding на Qwen3.6-27B — до 4.6× на математических задачах
  • MTP/NEXTN ускоряется с ростом глубины draft, EAGLE3 выходит на плато после K=3 — противоположная динамика
  • ngram практически бесполезен для этой модели (1.1–1.3×)
  • Ни vLLM, ни SGLang не работают с EAGLE3/DFlash из коробки на квантованных моделях — нужны патчи
  • Speculative decoding на одной потребительской видеокарте даёт реальное ускорение, но требует ручной доводки фреймворков

Автор: Павел Заславский · Источник: reddit.com

Мнение редакции

**Редакция:** Это редкий случай, когда кто-то не просто «попробовал разные методы», а методично измерил их на одной модели, одном железе, с контролем переменных и перезапусками. Цифры можно брать в работу. DFlash действительно впечатляет, особенно на математике — 4.6× это серьёзно. Но история с патчами показывает, что speculative decoding всё ещё в стадии «собери сам»: ни один из популярных фреймворков не работает из коробки с квантованными моделями. Если вы планируете spec-decode в production, закладывайте время на допиливание. ngram можно сразу вычёркивать, EAGLE3 интересен, но капризен, MTP — золотая середина.

Ещё по теме

Комментарии