модели 1 мин

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

Обязательно для тех, кто оценивает feasibility локального запуска больших MoE-моделей: статья показывает реальные компромиссы (память vs. SSD I/O vs. скорость) и развенчивает миф о «2 ГБ достаточно». Полезно инженерам, выбирающим между self-hosted и API, и всем, кто хочет понять технику за громкими заголовками.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • 2 ГБ — это объём резидентной памяти (веса ядра + 4K FP16 KV-кеш), а не полная модель; остальные 14.3 ГБ лежат на SSD и подгружаются по требованию
  • MoE-архитектура Gemma 4 (128 экспертов, 8 активных на токен) позволяет кэшировать только нужные эксперты и стримить остальные, что невозможно для плотных моделей
  • Скорость генерации на M2 MacBook Air 8GB составляет ~5–6 tok/s, что даёт ~13 млн токенов/месяц при 100% загрузке — жёсткий лимит пропускной способности
  • Бесплатный API Gemini для Gemma 4 часто экономичнее локального инференса, если учесть амортизацию железа, электроэнергию и ограниченную производительность
Ксения Лаврова Medium #llm
Читать оригинал

Ещё по теме

Комментарии