#квантование

И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 62
М модели ·20 июл 2026

Тест Bonsai-27B: 1-битная модель провалилась на агентских задачах, 2-битная уступила обычной 9B

Энтузиаст протестировал сверхсжатые модели Bonsai-27B (1-бит и 2-бит) на агентском бенчмарке Terminal-Bench 2.0 в видеокарте с 8GB VRAM. 2-битная версия показала 7.9% успешности — хуже обычной Qwen 9B (9.2%) при схожих требованиях к памяти. 1-битная модель вообще не справилась с агентскими задачами, зацикливаясь на бесконечной генерации текста.

0 45