Запустили DeepSeek V4-Flash (284B) на паре RTX 3090 и подержанном сервере за $6K — 33 токена в секунду
Энтузиаст развернул официальный чекпоинт DeepSeek V4-Flash (284B параметров, 156 ГБ) на железе с eBay: серверная тачка Dell R940 с 4 процессорами Xeon и 768 ГБ DDR4 + две RTX 3090. Выхлоп: 33 токена/сек одному пользователю, 68 в агрегате для четверых. Главная находка — 95% работы делает процессор с памятью, видеокарты задействованы на 25%. Итого реальная альтернатива облакам за ~$6000 на подержанном железе, если вам нужна полная модель, а не перепаковка.
Показывает, что барьер входа для запуска больших моделей упал до уровня $5–10K на подержанном железе — это открывает путь к приватным AI-решениям для малого бизнеса и компаний с compliance-требованиями.
Что произошло
Редактор развернул полный официальный чекпоинт DeepSeek V4-Flash (284B параметров, 156 ГБ весом) на железе, купленном на вторичке. Сервер Dell PowerEdge R940 2018 года с четырьмя Xeon Platinum 8268 (96 ядер) и 768 ГБ DDR4 стоил ~$7600, пара RTX 3090 — ~$2200. Итого за ~$6K на руки полноценная платформа для запуска frontier-моделей.
Модель натренирована с учётом квантизации — эксперты в natively MXFP4, финальные линейные слои FP8. Для запуска на Ampere (RTX 3090 — поколение 2020 года, где нет FP8/FP4 железно) используется форк vLLM с lk_moe — движком, который гоняет MoE-эксперты через системную оперативку и AVX512-VNNI ядра на процессоре. Speculative decoding (5 draft-токенов, встроенное в чекпоинт) добавляет скорости.
Результат: 33 токена/сек для одного юзера, 68 в агрегате для четверых параллельных запросов. Для сравнения — та же модель на llama.cpp даёт 12 токенов/сек на том же сервере, то есть ускорение в 2.6–3 раза. Видеокарты загружены на 25%, основная нагрузка — на DRAM bandwidth (141 ГБ/с на NUMA-ноду). Энергопотребление ~1000 Вт под нагрузкой, при этом лимит на 3090 можно опустить до 250 Вт без потери скорости — процессор жрёт львиную долю.
Автор подробно разбирает, почему унифицированная память Apple Silicon или DGX Spark с их 96–128 ГБ не подходят — модель 156 ГБ просто не влезает. Дешёвый путь — взять старый четырёхпроцессорный сервер с 512–768 ГБ DDR4 и парой видеокарт, параллелить память по четырём NUMA-нодам.
Автор: Марина Соколова · Источник: reddit.com
Разработчикам. Появился рабочий рецепт запуска больших MoE-моделей на Ampere через Marlin weight-only kernels и CPU-GPU гибридный движок lk_moe. Форк vLLM yhfgyyf/vllm-deepseek-v4-sm89 позволяет гонять эксперты через DRAM с помощью AVX512-VNNI, обходя нехватку FP8/FP4 на старых GPU. Основное узкое место — пропускная способность оперативки, не GPU, поэтому дополнительные видеокарты не помогают. Есть несколько подводных камней с CUDA-версиями и JIT-компиляцией TileLang, всё решаемо через pip-пакеты.
Бизнесу. Для задач, где нужны собственные большие модели без облаков, серверы на вторичке с многопроцессорной архитектурой и DDR4 дают вход за ~$6K вместо $10–15K за новое железо. Рабочая лошадка для privacy-sensitive сценариев, локального RAG, корпоративных ассистентов — без отправки данных в чужие API. Энергопотребление ~$100/месяц 24/7 при $0.13/кВт·ч, на практике меньше. Окупается быстрее, чем аренда GPU-инстансов с такой же пропускной способностью.
Инвесторам. Демонстрация того, как быстро коммодитизируется inference больших моделей — то, что год назад требовало H100, теперь идёт на подержанных серверах 2018 года + RTX 3090. Барьер входа в private AI-инфраструктуру падает с десятков тысяч долларов до $5–10K. Релевантно для секторов с compliance (медицина, финтех, гос), где облачные API неприменимы. Рынок серверов на вторичке может получить импульс от таких кейсов — спрос на многопроцессорные платформы с большим объёмом оперативки.
- Сборка и продажа готовых AI-серверов под ключ на базе подержанного железа — настроенная платформа для запуска DeepSeek/Llama за фиксированную цену, нацеленная на малый и средний бизнес
- Консалтинг и интеграция локальных LLM-решений для компаний с требованиями к приватности (медицина, legal, финансы) — помощь с развёртыванием, настройкой, обслуживанием
- Создание SaaS-платформы для аренды мощностей на децентрализованной сети таких серверов — аналог RunPod, но на подержанном железе с более низкими ценами
- Разработка оптимизированных форков vLLM / inference-движков под конкретные архитектуры (Ampere, старые Xeon) — продажа лицензий и поддержки для энтерпрайза
- Маркетплейс готовых конфигов и tuned-моделей для популярных серверных платформ (Dell R940, HP DL580) — подписка на обновления и поддержку
- Подержанное железо — лотерея: отказы DIMM, деградация процессоров, проблемы с охлаждением. Скрытые расходы на ремонт и замену могут съесть экономию
- Энергопотребление ~1000 Вт = ~$100/месяц при полной нагрузке, в масштабе быстро становится дороже облачных spot-инстансов с низким duty cycle
- Обновления моделей и софта могут сломать хрупкие связки (CUDA версии, TileLang JIT, специфичные форки). Поддержка потребует времени и экспертизы
- Для большинства бизнес-сценариев облачный API дешевле и проще — кейс актуален только при высоких volumes или строгих privacy-требованиях
Это важный сигнал: технология inference развивается так быстро, что то, что год назад требовало десятков тысяч долларов и новейшего железа, теперь работает на серверах 2018 года с парой видеокарт на $2К. Особенно интересно, что узкое место сместилось из GPU в оперативку — значит, рецепты под конкретные workloads будут всё сильнее отличаться от универсальных облачных решений.
С другой стороны, это классический энтузиастский кейс: человек потратил часы на debugging CUDA-версий, JIT-компиляцию, несовместимые pip-пакеты. Для бизнеса это рабочий путь только если у вас есть DevOps, который понимает, что делает, и сценарий использования оправдывает капекс и возню. Для большинства задач облачный API всё ещё проще и дешевле — но если вам нужен контроль над данными, постоянная нагрузка или вы готовы поддерживать софт своими руками, путь открыт.
Комментарии