Почему AI-моделям нужно так много RAM и VRAM
Статья объясняет, почему память — главное узкое место при работе с AI-моделями, а не процессорная мощность. Автор разбирает, сколько памяти требуется для хранения параметров моделей, в чём разница между RAM и VRAM, и почему GPU не может работать с данными, не помещающимися в его видеопамять.
Объясняет фундаментальную причину, почему большинство мощных моделей живут в облаке, а не на локальных устройствах. Полезно всем, кто хочет понять реальные технические ограничения AI и почему «железо» играет решающую роль в доступности моделей.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- 7-миллиардная модель занимает ~14 ГБ памяти (по 2 байта на параметр в формате FP16/BF16) — это только для хранения весов, без учёта вычислений
- VRAM — это «рабочий стол» GPU: если модель не влезает целиком, происходит постоянная перекачка данных из RAM, что резко замедляет работу
- Обучение модели требует в ~4+ раза больше памяти, чем инференс — нужно хранить градиенты, промежуточные активации и копии весов для оптимизатора
- Ограничения по памяти определяют, где может работать модель: на телефоне, игровом ПК или только в облачном кластере
Юлия Тарасова
Medium #llm
Читать оригинал
Комментарии