Когда ускорение AI замедляет: бенчмарки Qwen3.6-27B NVFP4 на RTX 5090 показали, где MTP ломается
Энтузиаст протестировал квантованную модель Qwen3.6-27B NVFP4 от Unsloth на одной и двух видеокартах RTX 5090. Выяснилось: технология ускорения MTP (Medusa Tree-based Prediction) даёт +80% скорости на одном запросе с коротким контекстом, но при многопользовательской нагрузке или длинных промптах (32k+ токенов) превращается в тормоз, замедляя генерацию на 20–44%.
Этот тест показывает реальные пределы спекулятивных методов ускорения на потребительском железе. Для тех, кто разворачивает LLM-сервисы, это прямая инструкция: копировать чужие рецепты «включи MTP везде» — путь к деградации производительности.
Медуза, которая ускоряет или душит
Редакция AI-издания наткнулась на детальный бенчмарк 27-миллиардной модели Qwen3.6 в квантовании NVFP4 от Unsloth. Автор теста хотел понять, насколько полезна технология MTP (Medusa Tree-based Prediction) — метод спекулятивной генерации, когда модель пытается угадать несколько следующих токенов за раз.
Главная находка: MTP не панацея. Она отлично работает в идеальных условиях (один пользователь, короткий промпт), но резко теряет эффективность под нагрузкой.
Железо и условия
- Модель: Unsloth Qwen3.6-27B-NVFP4 (MLP в формате NVFP4, внимание в FP8)
- Железо: RTX 5090 (32 ГБ) — одна или две в tensor-parallel режиме
- Движок: vLLM 0.25.1, PyTorch 2.11.0, CUDA 13.0
- Тесты: от одиночных запросов до 16 одновременных, контекст от 2k до 60k токенов
Результаты: когда больше — не лучше
Одиночный пользователь: - 1 GPU без MTP: 66 tok/s - 1 GPU с MTP (nspec=3): 120 tok/s (+82%) - 2 GPU с MTP: 108 tok/s
Парадокс: одна видеокарта с MTP обогнала две. Автор предполагает, что накладные расходы на синхронизацию между GPU съедают преимущество MTP.
Многопользовательская нагрузка (одна GPU): - 1 запрос: +87% от MTP - 8 запросов: +5% - 16 запросов: -37% (MTP замедляет!)
Принятие предсказаний оставалось стабильным (~71–73%), но GPU была загружена обычным батчингом, и спекулятивная верификация стала лишней работой.
Длинный контекст: - 1 GPU, 60k токенов: -20% от MTP - 2 GPU, 60k токенов: -44%
С ростом KV-кеша каждая проверка предсказаний дорожает, а acceptance rate падает с 71% (8k) до 60% (60k).
Практические выводы автора
- Один пользователь, короткий контекст:
num_speculative_tokens=3— must have - 8+ одновременных запросов: тестировать оба варианта
- 12+ запросов или 32k+ контекст с TP=2: MTP выключать
- 60k контекст: MTP выключать всегда
Бонус: при высокой нагрузке (TP=2, nspec=8, 16 запросов) vLLM дважды крашнулся с ошибкой CUDA illegal memory access.
Ключевые выводы
- MTP даёт +82% скорости на одной GPU при одиночном запросе с коротким контекстом, но превращается в тормоз (-37%) при многопользовательской нагрузке
- Две RTX 5090 медленнее одной с MTP для одиночных запросов (108 vs 120 tok/s), вероятно из-за накладных расходов tensor-parallel синхронизации
- При контексте 60k токенов MTP замедляет генерацию на 20–44% из-за падения acceptance rate и роста стоимости верификации KV-кеша
- Оптимальная стратегия: использовать MTP только для одиночных пользователей с контекстом до 8–32k токенов, в остальных случаях отключать
- vLLM нестабильна при экстремальных настройках MTP: nspec=8 с TP=2 и высокой нагрузкой вызывает крэши
Автор: Анна Мельникова · Источник: reddit.com
Это один из тех редких материалов, где энтузиаст не просто гоняет бенчмарки, а честно показывает границы применимости технологии. Unsloth MTP — не волшебная таблетка, а инструмент с чёткими условиями работы. Автор тестировал на свои деньги, на реальном железе, с разными сценариями — и вышел материал, который стоит сохранить.
Особенно ценно, что он не ограничился синтетикой вроде "считай до 100", а взял промпты из Spec-Bench. И нашёл то, что маркетинг обычно не рассказывает: при батчинге и длинном контексте MTP не просто бесполезна — она вредна. Если разворачиваете vLLM на 5090, этот материал сэкономит вам дни экспериментов. Единственный минус — малая выборка на длинных контекстах, но автор сам это оговорил.
Комментарии