модели 1 мин

Как модель на 1,6 триллиона параметров работает на ноутбуке: C-код, который вы можете запустить

Автор показывает, как запустить гигантские MoE-модели вроде DeepSeek V4 на обычном ноутбуке. Ключ — в том, что Mixture-of-Experts активирует только ~3% параметров за раз, остальные 97% можно держать на диске и подгружать по требованию. Статья объясняет математику разреженности и предлагает полный рабочий стриминговый движок на C.

Разработчикам и энтузиастам AI, которые хотят понять устройство MoE «изнутри» и экспериментировать с огромными моделями на обычном железе. Статья даёт не только теорию, но и рабочий код для практики.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • DeepSeek V4-Pro с 1.6 трлн параметров активирует лишь 49 млрд (~3%) за токен, остальное можно держать на диске
  • Один эксперт занимает ~21 MiB в 4-битном формате; при кешировании недавно использованных экспертов резидентная память остаётся малой
  • Автор написал минималистичный MoE-движок на C с int4-квантизацией, pread и posix_fadvise для демонстрации работы механизма
  • Роутинг в MoE достаточно скошен, чтобы небольшой LRU-кеш перехватывал большинство запросов к экспертам
Ксения Лаврова Medium #artificial-intelligence
Читать оригинал

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии