Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение
Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.
Обязательно для тех, кто оценивает feasibility локального запуска больших MoE-моделей: статья показывает реальные компромиссы (память vs. SSD I/O vs. скорость) и развенчивает миф о «2 ГБ достаточно». Полезно инженерам, выбирающим между self-hosted и API, и всем, кто хочет понять технику за громкими заголовками.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- 2 ГБ — это объём резидентной памяти (веса ядра + 4K FP16 KV-кеш), а не полная модель; остальные 14.3 ГБ лежат на SSD и подгружаются по требованию
- MoE-архитектура Gemma 4 (128 экспертов, 8 активных на токен) позволяет кэшировать только нужные эксперты и стримить остальные, что невозможно для плотных моделей
- Скорость генерации на M2 MacBook Air 8GB составляет ~5–6 tok/s, что даёт ~13 млн токенов/месяц при 100% загрузке — жёсткий лимит пропускной способности
- Бесплатный API Gemini для Gemma 4 часто экономичнее локального инференса, если учесть амортизацию железа, электроэнергию и ограниченную производительность
Комментарии