#Apple Silicon

И инструменты ·25 июл 2026

Как запустить 480-миллиардную модель на MacBook с 36 ГБ памяти — стриминг экспертов MoE с SSD

Разработчик форкнул llama.cpp, чтобы запускать огромные MoE-модели (до 480B параметров) на обычном MacBook, подгружая веса экспертов с SSD по требованию вместо загрузки всей модели в RAM. Qwen 35B выдаёт ~13-19 tok/s, даже 118B-модель работает на устройстве с 36 ГБ памяти. Приложение доступно как готовый .dmg для macOS, код открыт (MIT), все бенчмарки — включая провалившиеся эксперименты — опубликованы.

0 20
И инструменты ·16 июл 2026

Почему я удалил LM Studio после недели с omlx

Разработчик столкнулся с проблемой утери KV-кэша в LM Studio при работе с локальными LLM-моделями — система заново обрабатывала 70K токенов контекста, теряя минуты на каждый запрос. Это привело к поиску альтернативы и переходу на omlx — открытый LLM-сервер для Apple Silicon на базе MLX.

0 127