#RTX 5090

И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 62
И инструменты ·20 июл 2026

Разработчик выжал 543 токена в секунду из Qwen-35B на одной RTX 5090

Энтузиаст собрал с нуля свой inference-движок NInfer, специально заточенный под Qwen3.6-35B-A3B, и добился ~543 токенов/сек на одной RTX 5090 при генерации 65K токенов. Это достигнуто кастомной квантизацией (~5 bpw), ручной оптимизацией ядер CUDA, fusion'ом операций и draft-механизмом для LM head. Код и веса открыты, но движок работает только с двумя точными чекпоинтами Qwen и только на RTX 5090.

0 40