#optimization

И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112
И исследования ·13 авг 2026

Apple показала, как удалять данные из моделей в 2 раза быстрее — новый подход к machine unlearning

Исследователи Apple нашли способ удалять данные из обученных моделей вдвое быстрее. Суть: не все данные одинаково влияют на модель, поэтому можно пропускать точки с низким влиянием и экономить до 50% вычислений. Работает на задачах компьютерного зрения и NLP.

0 18