#Apple Silicon

И инструменты ·15 авг 2026

Почему быстрый запуск AI-моделей на Mac — это боль: разбор инструментов для Apple Silicon

Разработчик потратил 2 недели, чтобы понять, как оптимально запускать LLM на Mac. Вывод: софт для Apple Silicon — хаос. Нет единого фреймворка с полным набором оптимизаций (prefix caching, speculative decoding и т.д.), в отличие от NVIDIA/CUDA. Новые модели типа Qwen используют гибридный KV-кэш, который ломает привычные подходы. Лучший вариант сейчас — vllm-metal, но и он неполон.

0 42
И инструменты ·11 авг 2026

В macOS-виртуалках можно запускать LLM в 16 раз быстрее: патч для Llama.cpp раскрывает Metal на Apple Silicon

Команда Cua выпустила патч для macOS-виртуалок на Virtualization.framework, который разблокирует современные Metal-ядра для Llama.cpp. Результат: скорость инференса LLM вырастает в 11–16 раз, почти догоняя bare-metal. Проблема в том, что виртуальная GPU Apple по умолчанию притворяется устаревшей (Apple 5 family), хотя способна исполнять новые инструкции. Авторы написали shim-слой, который подменяет ответы на capability-запросы, заставляя llama.cpp использовать SIMD-группы, матричные умножения и bfloat16. Код открыт под пермиссивной лицензией.

0 46
И инструменты ·4 авг 2026

MiniMax-H3 на Apple Silicon: генерация видео за 45 минут на MacBook — первый опыт

MiniMax выпустили H3 — мультимодальную модель для генерации 15-секундных видеороликов со звуком из текста, картинок, аудио и видео. Вышел порт для MLX, позволяющий запускать модель на Apple Silicon. На MacBook Pro M5 Max генерация видео заняла 45 минут, потребовалось 115 ГБ под модель. Качество видео впечатляет, но аудио без промпт-указаний получается невнятным.

0 118
М модели ·1 авг 2026

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

0 127
И инструменты ·2 авг 2026

WinterMix: новый метод квантизации MLX побил 6-битные сборки при меньшем весе — 82 ГБ против 95 ГБ

Разработчик создал новый метод квантизации для MLX-моделей на Apple Silicon, который даёт лучший результат для Qwen3.5-122B: сборка на 82 ГБ обгоняет 6-битные на 94-95 ГБ, а версия на 68 ГБ позволяет держать 5-8 агентов с контекстом 100К токенов одновременно на Mac с 128 ГБ RAM. Перплексия всего на 0.3-0.7% хуже исходного GGUF, при этом MLX даёт 9x быстрее prefill и на 20% быстрее генерацию токенов на M5 Max.

0 47
И инструменты ·25 июл 2026

Как запустить 480-миллиардную модель на MacBook с 36 ГБ памяти — стриминг экспертов MoE с SSD

Разработчик форкнул llama.cpp, чтобы запускать огромные MoE-модели (до 480B параметров) на обычном MacBook, подгружая веса экспертов с SSD по требованию вместо загрузки всей модели в RAM. Qwen 35B выдаёт ~13-19 tok/s, даже 118B-модель работает на устройстве с 36 ГБ памяти. Приложение доступно как готовый .dmg для macOS, код открыт (MIT), все бенчмарки — включая провалившиеся эксперименты — опубликованы.

0 20