инструменты 1 мин

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

Показывает, что передовые AI-модели перестают быть монополией облачных провайдеров. Технологии локального запуска догоняют API, открывая возможности для приватного AI, автономных систем и конкуренции с облаками.

Что произошло

Пользователь Reddit собрал систему из четырёх потребительских RTX 3060 12GB (48 GB суммарной VRAM) и запустил модель DeepSeek V4 Flash размером 144 ГБ с квантизацией Q4_K_XL. Основная часть модели — в системной RAM (128 GB DDR4-3200), а GPU используются для критичных вычислений.

Ключевые решения:

Распределение экспертов MoE: Параметр -ncmoe 34 оставляет первые 34 слоя экспертов в оперативке, а оставшиеся 9 слоёв вручную размещены на трёх GPU через флаг -ot. Это нестандартный подход — обычно такие модели пытаются распределить равномерно.

Экстремальный split тензоров: Конфигурация -ts 100,1,1,1 загружает почти все не-экспертные тензоры (attention, KV-cache) на GPU0, освобождая место на остальных GPU для тяжёлых экспертных слоёв.

Размер микробатчей: Увеличение с 1024 до 2048 (-ub 2048) подняло скорость обработки промпта с 63 до 99 tok/s. При этом генерация осталась на уровне ~10 tok/s.

Результаты на промпте в 20.5k токенов: - Контекст: 368,640 токенов (360k) - Обработка промпта: 99.4 tok/s - Генерация: 10.1 tok/s - Свободная VRAM под нагрузкой: от 671 MB до 1395 MB на разных картах

Пользователь подчёркивает, что аналитический расчёт не сработал — конфигурацию подбирал эмпирически, измеряя каждый вариант. Quad-channel память критична: модель в основном в RAM, и пропускная способность памяти напрямую влияет на скорость.

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Готовый рецепт запуска огромных MoE-моделей на потребительских GPU через llama.cpp. Важные флаги: -ncmoe для контроля размещения экспертов, -ot для явного маппинга слоёв, -ub для контроля микробатчей. Q8_0 для KV-cache экономит VRAM без сильной потери качества. Показывает, что агрессивный тюнинг даёт 50% прирост скорости.

Бизнесу. Доказательство, что большие модели можно крутить на доступном железе без облаков и A100. Сборка из четырёх RTX 3060 (~$1200 б/у) обрабатывает контексты в 360k токенов — достаточно для анализа больших документов, технической поддержки, RAG-систем. Альтернатива облачным API за $0.002–0.01 за 1k токенов.

Инвесторам. Тренд на локальный инференс MoE-моделей на потребительском железе снижает зависимость от облачных провайдеров. DeepSeek V4 Flash (~400B параметров) на $1200 железа конкурирует с GPT-4 Turbo по контексту. Рынок энтузиастов и малого бизнеса, который не хочет платить за API, растёт. Потенциал для SaaS-оболочек над такими сетапами.

Хайп30
Реальная польза65
Заработать55
  • SaaS-сервис «AI на своём железе»: продавать готовые конфигурации серверов + софт для запуска DeepSeek/Llama на мульти-GPU за фиксированную плату вместо API-подписки
  • Консалтинг по оптимизации локальных AI-деплоев для компаний, которые не хотят отправлять данные в облако (финтех, медтех, госсектор)
  • Железные бандлы «AI Workstation» на базе б/у RTX 3060/4060: собирать, тюнить, продавать с pre-configured llama.cpp под ключ
  • Платформа для аренды вычислительных мощностей на потребительских GPU (аналог Vast.ai, но с фокусом на MoE-модели и готовыми конфигами)
  • Образовательные курсы и гайды по тюнингу больших моделей на доступном железе — рынок растёт, официальной документации мало
  • Скорость генерации ~10 tok/s низкая для продакшен-приложений — годится для батчевой обработки, но не для чатов
  • Хрупкость настройки: малейшая ошибка в -ncmoe или -ot ломает весь процесс. Требует глубокого понимания llama.cpp и замеров
  • Модель 144 ГБ — это огромный размер, обновления и переквантизация займут часы. Не подходит для быстрой итерации
  • Зависимость от RAM и её пропускной способности — узкое место. При недостатке памяти производительность рухнет

Это один из тех кейсов, которые показывают реальный сдвиг: большие модели перестают быть привилегией дата-центров. Чувак взял железо за $1200 б/у и запустил модель, которая по контексту конкурирует с GPT-4 Turbo. Да, 10 tok/s генерации — это не блеск, но для батчевой обработки документов, анализа логов, RAG-систем — более чем достаточно. И главное — всё локально, без утечек данных в облако.

Но давайте честно: это геройство энтузиаста, а не готовое решение для продакшена. Настройка llama.cpp с -ncmoe и -ot требует глубокого понимания архитектуры модели и часов замеров. Один неверный флаг — и система падает. Плюс зависимость от RAM и quad-channel памяти делает эту сборку специфичной. Но тренд налицо: локальные AI-деплои будут расти, и кто первым упакует это в user-friendly продукт — сорвёт банк.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии