В macOS-виртуалках можно запускать LLM в 16 раз быстрее: патч для Llama.cpp раскрывает Metal на Apple Silicon
Команда Cua выпустила патч для macOS-виртуалок на Virtualization.framework, который разблокирует современные Metal-ядра для Llama.cpp. Результат: скорость инференса LLM вырастает в 11–16 раз, почти догоняя bare-metal. Проблема в том, что виртуальная GPU Apple по умолчанию притворяется устаревшей (Apple 5 family), хотя способна исполнять новые инструкции. Авторы написали shim-слой, который подменяет ответы на capability-запросы, заставляя llama.cpp использовать SIMD-группы, матричные умножения и bfloat16. Код открыт под пермиссивной лицензией.