#MLX

И инструменты ·4 авг 2026

MiniMax-H3 на Apple Silicon: генерация видео за 45 минут на MacBook — первый опыт

MiniMax выпустили H3 — мультимодальную модель для генерации 15-секундных видеороликов со звуком из текста, картинок, аудио и видео. Вышел порт для MLX, позволяющий запускать модель на Apple Silicon. На MacBook Pro M5 Max генерация видео заняла 45 минут, потребовалось 115 ГБ под модель. Качество видео впечатляет, но аудио без промпт-указаний получается невнятным.

0 118
И инструменты ·2 авг 2026

WinterMix: новый метод квантизации MLX побил 6-битные сборки при меньшем весе — 82 ГБ против 95 ГБ

Разработчик создал новый метод квантизации для MLX-моделей на Apple Silicon, который даёт лучший результат для Qwen3.5-122B: сборка на 82 ГБ обгоняет 6-битные на 94-95 ГБ, а версия на 68 ГБ позволяет держать 5-8 агентов с контекстом 100К токенов одновременно на Mac с 128 ГБ RAM. Перплексия всего на 0.3-0.7% хуже исходного GGUF, при этом MLX даёт 9x быстрее prefill и на 20% быстрее генерацию токенов на M5 Max.

0 47
И инструменты ·2 авг 2026

DeepSeek V4 Flash локально: три подводных камня с tool calls и кэшем

Пользователь потратил кучу времени на локальный запуск DeepSeek V4 Flash и нашёл три критичных проблемы: GGUF от Unsloth падает на CPU (4-7 tok/s вместо GPU), tool calls молча ломаются из-за бага в Unsloth Studio, а после 130K токенов cache invalidation убивает производительность из-за лимита в 30GB. Решение — перейти на MLX-версию и переключиться с Unsloth на Hermes Agent.

0 48
И инструменты ·3 авг 2026

Как мы исправили тихого убийцу в нашем LLM-кластере на Mac Studio

Команда столкнулась с регулярными падениями распределённого LLM-кластера из пяти Mac Studio (96 ГБ памяти), связанных через Thunderbolt 5. Проблема оказалась многослойной: баг в mlx.launch не убивал удалённые процессы при сбое, orphan-процессы в состоянии Us+ накапливались сотнями и истощали пул RDMA protection domains, что приводило к RuntimeError при инициализации новых задач.

0 30