Трёхуровневый KV-кеш для LLM на AWS SageMaker HyperPod: как снизить расходы на инференс без потери скорости
AWS представил архитектуру трёхуровневого KV-кеша для больших языковых моделей на SageMaker HyperPod с распределённой файловой системой Curvine. Решение позволяет переиспользовать кеш между репликами vLLM через общий пул NVMe-дисков, ускоряя time-to-first-token до 2.7 раз и достигая 100% попаданий в кеш. Это позволяет запускать тяжёлые модели на дешёвых G6e-инстансах вместо дорогих P5.