#RTX 5090

И инструменты ·11 авг 2026

DeepSeek V4 0731: квантизация до 104 ГБ с 83.6% точностью на RTX 5090

Команда AtomicChat квантизовала DeepSeek V4 0731, выявив критические баги в llama.cpp (NaN-значения и потерю точности при конвертации FP8). Создали 13 квантов с imatrix на 1.87M токенах, оптимизированных под RTX 5090. Лучший результат: 104 ГБ (AD-IQ2_M) с 83.6% точностью top-1, что обходит публичные кванты по PPL при одинаковом размере.

0 70
И инструменты ·21 июл 2026

Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается

Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.

0 63