Почему быстрый запуск AI-моделей на Mac — это боль: разбор инструментов для Apple Silicon
Разработчик потратил 2 недели, чтобы понять, как оптимально запускать LLM на Mac. Вывод: софт для Apple Silicon — хаос. Нет единого фреймворка с полным набором оптимизаций (prefix caching, speculative decoding и т.д.), в отличие от NVIDIA/CUDA. Новые модели типа Qwen используют гибридный KV-кэш, который ломает привычные подходы. Лучший вариант сейчас — vllm-metal, но и он неполон.