#мульти-GPU

И инструменты ·18 авг 2026

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

0 22
И инструменты ·8 авг 2026

Как разблокировать PCI-E P2P на потребительских Nvidia картах и получить +25% скорости в VLLM бесплатно

Разработчик включил PCI-E peer-to-peer на 4 картах RTX 5060Ti через патченные драйверы и ReBAR, получив ~25% прирост скорости prompt processing в VLLM при tensor parallelism. Работает на потребительских картах, несмотря на официальные ограничения Nvidia.

0 95