инструменты 1 мин

Почему быстрый запуск AI-моделей на Mac — это боль: разбор инструментов для Apple Silicon

Разработчик потратил 2 недели, чтобы понять, как оптимально запускать LLM на Mac. Вывод: софт для Apple Silicon — хаос. Нет единого фреймворка с полным набором оптимизаций (prefix caching, speculative decoding и т.д.), в отличие от NVIDIA/CUDA. Новые модели типа Qwen используют гибридный KV-кэш, который ломает привычные подходы. Лучший вариант сейчас — vllm-metal, но и он неполон.

Миллионы разработчиков на маках хотят запускать AI локально, но софт сырой. Кто решит эту проблему, получит огромный рынок, а разработчики — понимание, почему их модели на маке тормозят и как это исправить.

Автор поста на Reddit потратил 2 недели фултайма, разбираясь, как добиться быстрой работы LLM на Apple Silicon. Итог неутешителен: софт для локального инференса на маках — месиво. На CUDA/NVIDIA давно есть зрелые стеки с полным набором оптимизаций: prefix caching (переиспользование контекста), speculative decoding (ускорение генерации токенов), paged KV cache, continuous batching, flash attention. На Apple Silicon всё это разбросано по mlx-lm, vllm-metal, форкам и кастомным конвертерам моделей, и ни один фреймворк не даёт весь набор.

Главная боль — новые модели типа Qwen3.8 используют гибридный KV-кэш (Gated DeltaNet), где к обычному кэшу добавлен рекуррентный стейт. Это ломает привычные механизмы prefix caching: рекуррентный стейт перезаписывает предыдущее состояние, поэтому нельзя просто сохранить и переиспользовать кэш, как в классических трансформерах. В итоге даже если фреймворк заявляет поддержку prefix caching, он может не работать с этими моделями.

Добавляет проблем mlx-lm: он отбрасывает встроенные MTP-головы при конвертации модели, убивая встроенную поддержку speculative decoding. В результате даже модели, которые умеют ускорять инференс из коробки, на маке работают медленнее.

Автор считает vllm-metal наиболее близким к адекватному стеку, но рекомендует сообществу прекратить плодить форки и сфокусироваться на доработке одного-двух проектов, а затем влить изменения в mlx-lm и vllm.

Автор: Марина Соколова · Источник: reddit.com

Разработчикам. Если работаешь с локальными LLM на маке, готовься собирать пазл из mlx-lm, vllm-metal и форков. Поддержка новых моделей типа Qwen с гибридным кэшем неполная, и даже базовые оптимизации (prefix caching, speculative decoding) реализованы частично или не работают из-за особенностей конвертации.

Бизнесу. Разворачивать AI-агентов на локальных Mac-серверах пока рискованно: софт незрелый, производительность непредсказуема, особенно на новых моделях. Если нужна стабильность, пока проще идти на NVIDIA или облачные API.

Инвесторам. Рынок инструментов для локального инференса на Apple Silicon фрагментирован. Нет явного лидера, много дублирующихся проектов, но огромный спрос: миллионы маков у разработчиков, которым нужен быстрый локальный AI. Кто первым сделает нормальный стек, получит рынок.

Хайп20
Реальная польза70
Заработать75
  • Создать единый полнофункциональный стек инференса для Apple Silicon с поддержкой всех оптимизаций — OpenAI/Ollama для маков
  • Сделать сервис/SaaS для автоматической конвертации и оптимизации моделей под Apple Silicon с сохранением всех фич (MTP-головы, speculative decoding)
  • Разработать профилировщик/бенчмарк-тулзу, которая покажет разработчику, какие оптимизации работают (или не работают) на его модели и железе
  • Консалтинг/поддержка для компаний, которые хотят деплоить AI на Mac-инфраструктуре (Mac mini, Mac Studio) — помощь с настройкой, кастомизация стека
  • Open-source проект: унификация mlx-lm, vllm-metal и llama.cpp для маков — потенциальный GitHub-хит с монетизацией через enterprise-поддержку
  • Apple может выпустить официальный inference framework и убить весь сторонний рынок (как сделала с Core ML, но пока он отстаёт)
  • Новые архитектуры моделей (Gated DeltaNet, гибридные кэши) постоянно ломают существующие оптимизации — вечная гонка за SOTA
  • Рынок может скукожиться, если облачные API станут настолько дешёвыми и быстрыми, что локальный инференс потеряет смысл для большинства
  • Фрагментация усилится: вместо единого стека появится ещё больше форков, и проблема только усугубится

Пост редкий по честности: автор не продаёт курс и не рекламирует проект, а просто выкладывает опыт 2 недель боли. И это ценно. Софт для локального AI на маках правда сырой: куча форков, ни один не даёт полный стек оптимизаций, а новые архитектуры моделей ломают привычные подходы.

Что это значит? Если ты разработчик и хочешь запускать LLM локально на маке, готовься копаться в документации и тестировать фреймворки вручную. Если предприниматель — это шанс: рынок созрел для нормального продукта, который соберёт всё в одном месте. Если инвестор — смотри на стартапы, которые делают инфраструктуру для локального AI: фрагментация рынка и спрос от миллионов маков создают окно возможностей на ближайшие 1-2 года.

Инструменты из статьи

LM Studioбез VPN

Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.

Доступ из РФ →

Ещё по теме

Комментарии