#Qwen

И инструменты ·21 июл 2026

Speculative decoding на Qwen3.6-27B: DFlash даёт 3.3× ускорение против базы

Энтузиаст протестировал четыре метода speculative decoding (DFlash, MTP, EAGLE3, ngram) на модели Qwen3.6-27B в SGLang и vLLM на одной видеокарте RTX PRO 6000. DFlash показал лучший результат — ускорение в 3.3 раза, MTP/NEXTN — до 2.8×, EAGLE3 — 1.9×, ngram — 1.1–1.3×. Попутно обнаружил несовместимости и баги в обоих фреймворках.

0 119
И инструменты ·20 июл 2026

Разработчик выжал 543 токена в секунду из Qwen-35B на одной RTX 5090

Энтузиаст собрал с нуля свой inference-движок NInfer, специально заточенный под Qwen3.6-35B-A3B, и добился ~543 токенов/сек на одной RTX 5090 при генерации 65K токенов. Это достигнуто кастомной квантизацией (~5 bpw), ручной оптимизацией ядер CUDA, fusion'ом операций и draft-механизмом для LM head. Код и веса открыты, но движок работает только с двумя точными чекпоинтами Qwen и только на RTX 5090.

0 40
И инструменты ·27 июн 2026

Как собрать локального AI-кодера: полностью ваш, без подписок и утечек

Себастьян Рашка показывает, как настроить полноценного AI-агента для кодинга на собственном железе с open-weight моделями (Qwen, DeepSeek и др.) и открытыми харнесами (Qwen-Coder, Codex, Cline). Локальный стек даёт контроль, предсказуемые расходы и приватность — всё работает без отправки кода в облако, а производительность топовых open-weight моделей уже близка к проприетарным сервисам.

0 102