#architecture

И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112
И инструменты ·24 июл 2026

Выбор RAG-фреймворка под задачу, а не по инерции: разбор альтернатив LangChain

Автор делится опытом аварийного отказа системы на LangChain из-за транзитивных зависимостей и непрозрачности абстракций. Главная мысль: не бывает «одного фреймворка для всего» — выбирать нужно под конкретную нагрузку, а не по популярности.

0 108