инструменты 1 мин

Какие большие языковые модели реально запустить на одной видеокарте с 24 ГБ в 2026-м

Обзор шести open-source LLM (Qwen, Gemma, Mistral, DeepSeek и другие), которые умещаются в память одной потребительской видеокарты RTX 3090/4090. Автор разбирает, как правильно посчитать расход VRAM, почему современные 20–35B-модели удобнее старых сжатых 70B-квантов, и какую модель выбрать под конкретную задачу — от агентного кодинга до мультимодальности.

Если ты крутишь LLM локально (для приватности, экспериментов или экономии на API), этот гайд поможет выжать максимум из RTX 3090/4090, не переплачивая за сервера и не тратя время на модели, которые всё равно не влезут.

Почему 24 ГБ — это всё ещё актуально

Видеокарта с 24 ГБ VRAM (RTX 3090, RTX 4090) остаётся практичным минимумом для серьёзного локального inference. Старая стратегия энтузиастов — втиснуть в память сжатую 70B-модель — больше не работает. В 2026-м выигрывают современные модели класса 20–35B: они умещаются целиком, оставляют запас под контекст и отвечают достаточно быстро для кода, чата и агентов.

Как тратится память

Три фактора съедают VRAM: веса модели (зависят от числа параметров и квантизации), KV-кэш (растёт с длиной контекста) и runtime-накладные расходы (~1–2 ГБ). Квантизация Q4_K_M — стандартный компромисс: каждый параметр стоит ~0,58 байта, так что 32B-модель займёт 18–20 ГБ. Ловушка — MoE-архитектуры: все эксперты сидят в памяти, даже если активны только два на токен, поэтому считать надо по общему числу параметров.

Шесть лучших моделей

  1. Qwen3.6-27B (Apache 2.0) — универсал и лидер для агентного кодинга, ~16 ГБ.
  2. Qwen3.6-35B-A3B (MoE, 35B всего / 3B активных) — самый быстрый в декодинге, ~20 ГБ.
  3. Gemma 4 26B (MoE, Apache 2.0) — мультимодальность + 140 языков, ~20 ГБ.
  4. Mistral Small 3.2 24B — отполированный ассистент с низкой задержкой, ~14 ГБ.
  5. gpt-oss-20b (MoE от OpenAI, Apache 2.0) — structured reasoning, ~14 ГБ.
  6. DeepSeek-R1-Distill-Qwen-32B (MIT) — самый глубокий reasoning, самая плотная упаковка (~18–20 ГБ), chain-of-thought видим.

Что не влезет

Фронтирные MoE-2026 (GLM-5.2 ~753B, Kimi K2.7 ~1T, DeepSeek V4-Pro ~1.6T, Qwen3.5-397B, Mistral Large 3) требуют multi-GPU или серверной памяти. Их стоит знать как API-опции, но на одну карту не поместятся.

Как запустить

Ollama — проще всего, автоподбор квантизации, OpenAI-совместимый API. llama.cpp — для тонкой настройки GGUF. vLLM — для высокой пропускной способности. Начинай с модели под свою задачу, а не с самого большого файла.

Ключевые выводы

  • Современные 20–35B-модели эффективнее старых сжатых 70B: они быстрее, оставляют запас под контекст и умнее благодаря свежим архитектурам.
  • Mixture-of-Experts (MoE) ускоряют инференс, но жрут память по *общему* числу параметров — это частая ловушка при подборе модели.
  • Q4_K_M квантизация (~0,58 байта/параметр) — золотая середина для 24 ГБ; Q8/BF16 обычно не влезают в 30B-класс.
  • Qwen3.6-27B — универсальный лидер для агентного кодинга; DeepSeek-R1-Distill-Qwen-32B — для медленного, глубокого reasoning с видимым chain-of-thought.
  • Фронтирные open MoE 2026-го (GLM-5.2, Kimi K2.7, DeepSeek V4-Pro) требуют multi-GPU; одна 24GB-карта для них не опция.

Автор: Никита Громов · Источник: marktechpost.com

Мнение редакции

Статья попала в точку: в 2026-м погоня за самой большой моделью на одной карте — это прошлый век. Qwen3.6, Gemma 4, DeepSeek-R1-Distill умнее и быстрее раздутых квантов благодаря свежим архитектурам и дистилляции reasoning-трейсов. Особенно ценен практический подход к подсчёту VRAM: автор честно показывает, что MoE-модели жрут память по *общему* числу параметров, а не активных — это ловушка, в которую многие попадают.

Но есть нюанс: обзор сфокусирован на hobbyist-сценарии («coding, chat, agents») и обходит вопросы production-нагрузки, файн-тюнинга и реальной точности квантизации на разных задачах. Если ты выбираешь модель для серьёзного проекта, не ограничивайся одной статьёй — прогони бенчмарки на своих данных.

Инструменты из статьи

Ollamaбез VPN

Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...

Доступ из РФ →
DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии