#VRAM

И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
И инструменты ·20 июл 2026

Какие большие языковые модели реально запустить на одной видеокарте с 24 ГБ в 2026-м

Обзор шести open-source LLM (Qwen, Gemma, Mistral, DeepSeek и другие), которые умещаются в память одной потребительской видеокарты RTX 3090/4090. Автор разбирает, как правильно посчитать расход VRAM, почему современные 20–35B-модели удобнее старых сжатых 70B-квантов, и какую модель выбрать под конкретную задачу — от агентного кодинга до мультимодальности.

0 113