инструменты 1 мин

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

Это доказательство, что мощные AI-модели могут работать локально на обычных компьютерах, без дорогих GPU и облачных подписок. Для разработчиков и бизнеса это означает новые возможности создавать приватные AI-решения с минимальными затратами.

Что произошло

Разработчик под ником Blahblahblakha создал движок Mference, который запускает огромные MoE-модели на обычном железе. DeepSeek-V4-Flash (284B параметров) работает на MacBook M5 Pro с 24 ГБ памяти, потребляя всего 5,3 ГБ оперативки — в десятки раз меньше стандартных требований.

Как работает: MoE-архитектуры активируют лишь часть параметров на каждый токен (у DSv4-Flash ~13B из 284B). Движок держит в памяти общее ядро и KV-кэш, а нужных экспертов подгружает с SSD на лету. Используется 2-битный динамический квант, на диске модель занимает 91 ГБ.

Что уже работает: Gemma 4 (26B) — 31-35 токенов/сек на 2 ГБ памяти, Qwen 3.6 (35B) — 19-23 ток/сек на 1,45 ГБ, DeepSeek-V4-Flash — до 4,8 ток/сек на 5,3 ГБ. В комплекте нативный Mac-клиент с мультитёрн чатом, OpenAI-совместимый сервер и поддержка локальных PDF/DOCX/XLSX.

Ограничения: пока контекст до 4K токенов, ~53% времени уходит на ожидание чтения с диска. Автор обещает расширять список моделей и оптимизировать загрузку экспертов.

Автор: Павел Заславский · Источник: reddit.com

Разработчикам. Появился новый подход к инференсу больших MoE-моделей на обычных машинах — можно экспериментировать с DSv4-Flash/Qwen/Gemma локально без аренды серверов. Движок открыт, есть OpenAI-совместимый API для интеграции, поддержка локальных файлов. Основной узкое место — I/O (53% времени), есть куда оптимизировать.

Бизнесу. Локальный инференс больших моделей становится реальностью для малого бизнеса — не нужны дорогие GPU-серверы или облачные подписки. Можно развернуть AI-ассистента на Mac Mini за 1000 долларов вместо аренды cloud API. Ограничения по контексту (4K) и скорости пока делают это демонстратором, не prod-решением.

Инвесторам. Растёт экосистема инструментов для эффективного инференса — тренд на локальные AI-приложения набирает обороты. Снижение барьера входа для запуска больших моделей открывает нишу для enterprise-софта, который работает полностью on-premise. Возможный рост спроса на высокоскоростные SSD и энергоэффективные процессоры для AI.

Хайп45
Реальная польза60
Заработать55
  • Упаковать Mference в десктопное приложение для Mac/Windows с GUI — продавать как альтернативу ChatGPT Pro для тех, кто хочет приватности ($20-30/мес подписка без неё vs $200-400 за софт с вечной лицензией)
  • Enterprise-решение для компаний с требованиями к конфиденциальности: AI-ассистент на локальных машинах сотрудников без отправки данных в облако
  • Консалтинг по оптимизации инференса для стартапов — помогать перевести прототипы с OpenAI API на локальные модели, экономя деньги на масштабе
  • Разработка специализированных SSD-контроллеров или PCIe-карт для ускорения потоковой загрузки AI-экспертов — хардверная ниша под новую парадигму
  • Облачный сервис аренды виртуальных Mac с предустановленным Mference — дешевле GPU-инстансов AWS, удобнее для пользователей Mac
  • Пока это proof-of-concept — 4K контекста и ~5 токенов/сек далеки от production-уровня, особенно для задач с большими документами
  • Зависимость от скорости SSD создаёт узкое место: обычные пользователи не готовы покупать топовые NVMe ради AI. Может остаться игрушкой энтузиастов
  • Облачные API дешевеют и ускоряются быстрее, чем улучшается локальное железо. Может не хватить времени захватить рынок до того, как GPT-5-турбо за копейки убьёт интерес к локальным решениям
  • Качество 2-битного кванта модели — большой вопрос. Если точность страдает, бизнес предпочтёт стабильные облачные версии

Это один из тех моментов, когда видишь будущее своими глазами. Год назад идея запустить модель уровня DSv4-Flash на обычном MacBook казалась фантастикой — нужны были серверы с сотнями гигабайт VRAM. Сейчас энтузиаст в одиночку сделал движок, который ломает эту логику. Да, пока это не готовый продукт: 5 токенов в секунду и 4K контекста годятся для экспериментов, но не для серьёзной работы. Но тренд налицо — если через полгода появится версия с 10K контекста и 20 токенов/сек, облачные API почувствуют конкуренцию.

Что меня зацепило: это не просто оптимизация, а смена парадигмы. Раньше AI требовал GPU, теперь ключ — скорость SSD. Завтра может оказаться, что твой Mac M-серии — лучшая платформа для локального AI, чем условная Nvidia за 5000 долларов. Для бизнеса это открывает нишу приватных решений без облака. Для разработчиков — повод пересмотреть архитектуру: зачем платить OpenAI, если можно крутить модель локально? Риски есть — качество 2-битного кванта и узкое место I/O могут убить идею. Но если автор доведёт до ума, это будет game changer.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии