инструменты 1 мин

WinterMix: новый метод квантизации MLX побил 6-битные сборки при меньшем весе — 82 ГБ против 95 ГБ

Разработчик создал новый метод квантизации для MLX-моделей на Apple Silicon, который даёт лучший результат для Qwen3.5-122B: сборка на 82 ГБ обгоняет 6-битные на 94-95 ГБ, а версия на 68 ГБ позволяет держать 5-8 агентов с контекстом 100К токенов одновременно на Mac с 128 ГБ RAM. Перплексия всего на 0.3-0.7% хуже исходного GGUF, при этом MLX даёт 9x быстрее prefill и на 20% быстрее генерацию токенов на M5 Max.

Показывает, что для agentic AI не обязательно арендовать серверные GPU — можно делать на MacBook, сохраняя приватность и скорость. Для разработчиков на Apple Silicon это прямой путь к production-ready решениям с большими моделями.

Что произошло

Разработчик под ником WinterMix выпустил новый метод квантизации для MLX — нативного фреймворка машинного обучения Apple для их чипов. Объект эксперимента — Qwen3.5-122B-A10B, одна из самых мощных открытых MoE-моделей.

Проблема: стандартные MLX-кванты ниже 6 бит сильно деградируют — теряют 3.8-4.2% по перплексии, модели начинают галлюцинировать на длинных контекстах. GGUF-кванты точнее, но llama.cpp на Apple Silicon работает в 9 раз медленнее на prefill и на 20% медленнее при генерации.

Решение: автор разработал метод чувствительной смешанной квантизации — критичные тензоры (роутеры MoE) держит в BF16, остальные квантует с компенсацией ошибок по алгоритму семейства GPTQ, адаптированному под MLX. Калибровка на разнообразном длинном контексте, включая мультиязычный, чтобы все эксперты в MoE получили данные.

Результат: WinterMix58 (82 ГБ, ~6 bpw) обгоняет 6-битные oMLX (94-95 ГБ) по перплексии на коротких и длинных контекстах. WinterMix48 (68 ГБ, ~5 bpw) оставляет 35-40 ГБ свободной памяти на Mac с 128 ГБ — хватает на 5-8 параллельных агентов с контекстом 100К токенов каждый. Обе сборки нативны для MLX, без кастомных ядер, работают из коробки в LM Studio.

Автор провёл 18 вариантов тестирования, включая adversarial state-tracking на 30 шагов и чтение reasoning traces вручную — обнаружил, что перплексия не коррелирует с реальным качеством рассуждений. Например, одна сборка с лучшей перплексией чаще делала паузы для самопроверки и находила ошибки базовой модели.

Веса открыты под Apache 2.0, код метода остаётся приватным. Автор готов делать кванты других моделей по запросу.

Автор: Марина Соколова · Источник: reddit.com

Разработчикам. Нативная поддержка MLX без кастомных ядер — сборки грузятся в LM Studio, mlx-vlm и другие инструменты без патчей. Можно запускать agentic workflows на MacBook: 68 ГБ квант оставляет место для 5-8 агентов с контекстом 100К токенов одновременно. Скорость prefill в 9 раз выше, чем llama.cpp, генерация на 20% быстрее — критично для многоходовых диалогов и длинных контекстов.

Бизнесу. Локальный запуск мощных MoE-моделей на Apple Silicon становится реальным для продуктовых команд: можно разворачивать агентные системы на MacBook без облака, сохраняя приватность данных. Потенциал для B2B-решений, где критична конфиденциальность (юридика, медицина, финансы), и нужны многоагентные workflows с длинной памятью.

Инвесторам. Демонстрация того, что Apple Silicon может конкурировать с серверными GPU для inference-задач — рынок локальных AI-решений для Mac растёт. Открытые веса и метод квантизации снижают барьер входа для стартапов, работающих с большими моделями на устройствах. Сегмент Edge AI и приватных AI-ассистентов на потребительском железе получает новый импульс.

Хайп35
Реальная польза65
Заработать55
  • Создать SaaS для автоматической квантизации кастомных моделей под MLX — запрос автора на кванты других моделей показывает спрос
  • Разработать agentic framework для MacBook с поддержкой нескольких резидентных агентов — ниша для продуктовых решений на Apple Silicon
  • Сделать B2B-продукт для юридических/медицинских компаний: локальный AI с длинной памятью на Mac без передачи данных в облако
  • Консалтинг по оптимизации inference на Apple Silicon — помощь командам в переходе с облачных GPU на локальные Mac-кластеры
  • Создать маркетплейс квантованных MLX-моделей с гарантией качества — аналог Hugging Face, заточенный под Apple Silicon
  • Код метода квантизации закрыт — конкурентное преимущество временное, пока Apple или сообщество не реализуют аналог
  • Зависимость от Apple Silicon и MLX — экосистема узкая, если Apple изменит приоритеты или API, инвестиции могут обесцениться
  • Ручная оценка reasoning traces — субъективна, не масштабируется, возможна переоценка реального качества модели
  • 128 ГБ RAM на Mac — барьер входа высокий, большинство пользователей не смогут воспроизвести результаты, ограниченная аудитория

Это тот случай, когда один человек с MacBook Pro решает проблему, которую крупные лаборатории игнорируют. Apple Silicon для inference — не мем, а реальность: 9x по prefill против llama.cpp — это разница между «ждать минуту» и «ответ через секунды». Для agentic систем с длинным контекстом это критично.

Главный инсайт — перплексия врёт. Автор показал, что сборка с худшей перплексией на самом деле делала дисциплинированные audit passes и ловила баги базовой модели. Это ставит под вопрос всю индустрию бенчмарков. Да, код метода закрыт, и это раздражает. Но веса открыты, работает из коробки, и для команд на Mac это прямо сейчас лучший вариант. Если у вас MacBook с 128 ГБ и задачи с длинными контекстами — попробуйте, это не хайп.

Инструменты из статьи

LM Studioбез VPN

Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.

Доступ из РФ →

Ещё по теме

Комментарии