#vLLM

И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112
И инструменты ·21 июл 2026

DeepSeek V4 на одной B300: всего 770 токенов/сек в vLLM — что не так?

Разработчик получает всего 770 токенов/сек при batch-обработке на DeepSeek V4-Flash с одной GPU B300 через vLLM, хотя ожидал несколько тысяч. Выяснилось, что быстрое MoE-ядро требует несколько GPU, а спекулятивное декодирование DSpark на насыщенном батче снижает производительность вдвое. Ищет советы по оптимизации конфигурации.

0 78