Как модель на 1,6 триллиона параметров работает на ноутбуке: C-код, который вы можете запустить
Автор показывает, как запустить гигантские MoE-модели вроде DeepSeek V4 на обычном ноутбуке. Ключ — в том, что Mixture-of-Experts активирует только ~3% параметров за раз, остальные 97% можно держать на диске и подгружать по требованию. Статья объясняет математику разреженности и предлагает полный рабочий стриминговый движок на C.
Разработчикам и энтузиастам AI, которые хотят понять устройство MoE «изнутри» и экспериментировать с огромными моделями на обычном железе. Статья даёт не только теорию, но и рабочий код для практики.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- DeepSeek V4-Pro с 1.6 трлн параметров активирует лишь 49 млрд (~3%) за токен, остальное можно держать на диске
- Один эксперт занимает ~21 MiB в 4-битном формате; при кешировании недавно использованных экспертов резидентная память остаётся малой
- Автор написал минималистичный MoE-движок на C с int4-квантизацией, pread и posix_fadvise для демонстрации работы механизма
- Роутинг в MoE достаточно скошен, чтобы небольшой LRU-кеш перехватывал большинство запросов к экспертам
Ксения Лаврова
Medium #artificial-intelligence
Читать оригинал
Комментарии