Какие большие языковые модели реально запустить на одной видеокарте с 24 ГБ в 2026-м
Обзор шести open-source LLM (Qwen, Gemma, Mistral, DeepSeek и другие), которые умещаются в память одной потребительской видеокарты RTX 3090/4090. Автор разбирает, как правильно посчитать расход VRAM, почему современные 20–35B-модели удобнее старых сжатых 70B-квантов, и какую модель выбрать под конкретную задачу — от агентного кодинга до мультимодальности.
Если ты крутишь LLM локально (для приватности, экспериментов или экономии на API), этот гайд поможет выжать максимум из RTX 3090/4090, не переплачивая за сервера и не тратя время на модели, которые всё равно не влезут.
Почему 24 ГБ — это всё ещё актуально
Видеокарта с 24 ГБ VRAM (RTX 3090, RTX 4090) остаётся практичным минимумом для серьёзного локального inference. Старая стратегия энтузиастов — втиснуть в память сжатую 70B-модель — больше не работает. В 2026-м выигрывают современные модели класса 20–35B: они умещаются целиком, оставляют запас под контекст и отвечают достаточно быстро для кода, чата и агентов.
Как тратится память
Три фактора съедают VRAM: веса модели (зависят от числа параметров и квантизации), KV-кэш (растёт с длиной контекста) и runtime-накладные расходы (~1–2 ГБ). Квантизация Q4_K_M — стандартный компромисс: каждый параметр стоит ~0,58 байта, так что 32B-модель займёт 18–20 ГБ. Ловушка — MoE-архитектуры: все эксперты сидят в памяти, даже если активны только два на токен, поэтому считать надо по общему числу параметров.
Шесть лучших моделей
- Qwen3.6-27B (Apache 2.0) — универсал и лидер для агентного кодинга, ~16 ГБ.
- Qwen3.6-35B-A3B (MoE, 35B всего / 3B активных) — самый быстрый в декодинге, ~20 ГБ.
- Gemma 4 26B (MoE, Apache 2.0) — мультимодальность + 140 языков, ~20 ГБ.
- Mistral Small 3.2 24B — отполированный ассистент с низкой задержкой, ~14 ГБ.
- gpt-oss-20b (MoE от OpenAI, Apache 2.0) — structured reasoning, ~14 ГБ.
- DeepSeek-R1-Distill-Qwen-32B (MIT) — самый глубокий reasoning, самая плотная упаковка (~18–20 ГБ), chain-of-thought видим.
Что не влезет
Фронтирные MoE-2026 (GLM-5.2 ~753B, Kimi K2.7 ~1T, DeepSeek V4-Pro ~1.6T, Qwen3.5-397B, Mistral Large 3) требуют multi-GPU или серверной памяти. Их стоит знать как API-опции, но на одну карту не поместятся.
Как запустить
Ollama — проще всего, автоподбор квантизации, OpenAI-совместимый API. llama.cpp — для тонкой настройки GGUF. vLLM — для высокой пропускной способности. Начинай с модели под свою задачу, а не с самого большого файла.
Ключевые выводы
- Современные 20–35B-модели эффективнее старых сжатых 70B: они быстрее, оставляют запас под контекст и умнее благодаря свежим архитектурам.
- Mixture-of-Experts (MoE) ускоряют инференс, но жрут память по *общему* числу параметров — это частая ловушка при подборе модели.
- Q4_K_M квантизация (~0,58 байта/параметр) — золотая середина для 24 ГБ; Q8/BF16 обычно не влезают в 30B-класс.
- Qwen3.6-27B — универсальный лидер для агентного кодинга; DeepSeek-R1-Distill-Qwen-32B — для медленного, глубокого reasoning с видимым chain-of-thought.
- Фронтирные open MoE 2026-го (GLM-5.2, Kimi K2.7, DeepSeek V4-Pro) требуют multi-GPU; одна 24GB-карта для них не опция.
Автор: Никита Громов · Источник: marktechpost.com
Статья попала в точку: в 2026-м погоня за самой большой моделью на одной карте — это прошлый век. Qwen3.6, Gemma 4, DeepSeek-R1-Distill умнее и быстрее раздутых квантов благодаря свежим архитектурам и дистилляции reasoning-трейсов. Особенно ценен практический подход к подсчёту VRAM: автор честно показывает, что MoE-модели жрут память по *общему* числу параметров, а не активных — это ловушка, в которую многие попадают.
Но есть нюанс: обзор сфокусирован на hobbyist-сценарии («coding, chat, agents») и обходит вопросы production-нагрузки, файн-тюнинга и реальной точности квантизации на разных задачах. Если ты выбираешь модель для серьёзного проекта, не ограничивайся одной статьёй — прогони бенчмарки на своих данных.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии