Core ML vs. Core AI: Кто управляет циклом генерации?
Apple выпустила Core AI (iOS/macOS 27+) — преемника Core ML для запуска LLM на устройствах. Главное отличие не в возможностях моделей, а в том, кто управляет циклом генерации токенов: приложение (CPU) или системная среда выполнения (runtime). Это даёт измеримое ускорение в 3,5 раза на идентичной модели.
Разработчикам iOS/macOS приложений с LLM стоит понять архитектурную разницу между Core ML и Core AI, чтобы оценить, когда переход на новый фреймворк даст реальное ускорение и почему управление циклом на стороне runtime критично для производительности on-device inference.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Core ML с MLState технически может держать KV-кэш и генерировать токены, но цикл управляется кодом приложения — GPU ждёт CPU между токенами, используя ~11% теоретического потолка скорости чтения памяти
- Core AI владеет циклом генерации: runtime объединяет сотни операций в несколько ядер, выполняет итерации цепочкой на GPU без возврата на CPU, делает сэмплинг внутри движка
- Состояние (state) в Core AI стало частью IR (промежуточного представления), что позволяет компилятору видеть весь цикл и конвейеризировать его — в отличие от непрозрачного буфера MLState
- На одной модели qwen3.5 автор получил рост с 58,5 до 204 токенов/сек (3,5×) без изменения весов или квантизации — только за счёт смены владельца цикла
Никита Громов
Medium #llm
Читать оригинал
Комментарии