#LLM inference

И инструменты ·12 авг 2026

Трёхуровневый KV-кеш для LLM на AWS SageMaker HyperPod: как снизить расходы на инференс без потери скорости

AWS представил архитектуру трёхуровневого KV-кеша для больших языковых моделей на SageMaker HyperPod с распределённой файловой системой Curvine. Решение позволяет переиспользовать кеш между репликами vLLM через общий пул NVMe-дисков, ускоряя time-to-first-token до 2.7 раз и достигая 100% попаданий в кеш. Это позволяет запускать тяжёлые модели на дешёвых G6e-инстансах вместо дорогих P5.

0 17
М модели ·28 июл 2026

Алгоритмы спекулятивной генерации: DSpark, DFlash и Multi-Token Prediction

Автогрессивная генерация текста в LLM медленна, потому что каждый токен требует отдельного прохода через модель. Спекулятивная декодировка решает эту проблему: быстрый механизм предлагает несколько токенов-кандидатов, которые основная модель проверяет параллельно за один проход. Статья разбирает три современных подхода к спекулятивной генерации.

0 42
И инструменты ·29 июл 2026

Что 68 266 запросов к Claude Code раскрывают о реальных нагрузках агентных систем

Автор разобрал публичный датасет из 393 реальных сессий Claude Code (68 тысяч запросов, 6,89 млрд входных токенов) и обнаружил, что паттерны трафика агентных систем радикально отличаются от типичных бенчмарков для LLM-инференса. Вместо простых пар «вопрос-ответ» здесь длинные сессии с растущим контекстом, периодической компактификацией истории и залпами параллельных субагентов.

0 18
И инструменты ·24 июл 2026

Core ML vs. Core AI: Кто управляет циклом генерации?

Apple выпустила Core AI (iOS/macOS 27+) — преемника Core ML для запуска LLM на устройствах. Главное отличие не в возможностях моделей, а в том, кто управляет циклом генерации токенов: приложение (CPU) или системная среда выполнения (runtime). Это даёт измеримое ускорение в 3,5 раза на идентичной модели.

0 20