#vLLM

И инструменты ·21 июл 2026

Speculative decoding на Qwen3.6-27B: DFlash даёт 3.3× ускорение против базы

Энтузиаст протестировал четыре метода speculative decoding (DFlash, MTP, EAGLE3, ngram) на модели Qwen3.6-27B в SGLang и vLLM на одной видеокарте RTX PRO 6000. DFlash показал лучший результат — ускорение в 3.3 раза, MTP/NEXTN — до 2.8×, EAGLE3 — 1.9×, ngram — 1.1–1.3×. Попутно обнаружил несовместимости и баги в обоих фреймворках.

0 119
И инструменты ·16 июл 2026

Энтузиаст запустил 75B-модель Nemotron на двух RTX 3090 с полным контекстом 262K токенов

Пользователь Reddit смог запустить 75-миллиардную модель NVIDIA Nemotron-Labs-3-Puzzle на двух видеокартах RTX 3090 с полным контекстным окном 262K токенов. Ключ успеха — W4A16-квантизация (4-битные эксперты, 16-битная активация), правильная настройка аллокатора памяти CUDA и использование PIECEWISE-графов. Достигнута скорость ~94 токена/сек для одного запроса и 255 токенов/сек суммарно для четырёх параллельных.

0 117