Разработчик разогнал Qwen3.8-27B до 138 токенов/сек на RTX 3090 — новый рекорд локального инференса
Независимый разработчик выжал из Qwen3.8-27B (27 млрд параметров) 138 токенов в секунду на одной RTX 3090, используя квантизацию W4A16, speculative decoding через DFlash2 и самописный lookup-поиск в истории токенов. Это в 3-4 раза быстрее стандартного инференса, при сохранении точности на уровне оригинальной модели.
Показывает, что запуск production-grade LLM локально уже не требует дата-центров. Для разработчиков — это шанс конкурировать с облаками по цене и приватности, для бизнеса — радикальное снижение расходов на AI.
Что произошло
Независимый разработчик (Reddit: u/iamMess) довёл скорость инференса Qwen3.8-27B до 138 токенов/сек на одной RTX 3090 24GB. Это в 3-4 раза быстрее стокового vLLM и позволяет запускать модель с 27 миллиардами параметров локально с производительностью, близкой к облачным API.
Ключевые улучшения:
DFlash2 drafter: Подключил блочный драфтер от Inco (5 слоёв, предсказывает 7 токенов за проход), перепортировал в vLLM 0.27.1, квантизовал в W4A16 через GPTQ — получил 3.3 токена за шаг вместо 1. Размер драфтера упал с 3.85 до 1.19 ГБ.
Lookup-augmented drafting (своя разработка): Ядро на Triton сканирует историю запроса, находит последние 6-12 сгенерированных токенов и предлагает, что шло дальше. Особенно эффективно, когда модель цитирует документ или повторяет команды (+29% токенов/шаг, 105→131 tps на таких задачах).
Prefix caching для гибридных моделей: Включил кеширование префиксов для Mamba/GDN. Повторный ход в диалоге с 24k токенов теперь занимает 1 секунду вместо 23. Батч из 64 запросов с общим промптом (5.8k токенов): с 222 до 16.9 сек.
Оптимизация под 64k контекст: Исправил баг в аллокаторе vLLM, который резервировал на 25% больше памяти из-за паддинга слоёв. Расход упал с 105 до 78 КБ на токен.
Точность не пострадала: perplexity 8.09, GSM8K 96.5%. Speculative decoding математически точен. Код опубликован в открытом доступе с Docker-образом и скриптами проверки.
Автор: Юлия Тарасова · Источник: reddit.com
Разработчикам. Готовая сборка vLLM 0.27.1 с патчами, Docker-контейнер, скрипты квантизации и два режима драфтинга (DFlash2 для 1-4 юзеров, MTP для батчей). Можно форкнуть и адаптировать под свои модели — все ключевые трюки (lookup drafting, prefix caching, оптимизация аллокатора) применимы к другим hybrid-архитектурам.
Бизнесу. Возможность запускать качественные LLM локально на доступном железе (б/у RTX 3090 — 700-900 долларов) вместо платных API. Особенно выигрывают задачи с повторяющимся контекстом (анализ документов, кодогенерация, техподдержка) — там lookup drafting даёт прирост до 30%.
Инвесторам. Независимые разработчики обгоняют корпоративные решения в оптимизации инференса. Спрос на edge-деплоймент и приватные LLM растёт — компании, которые упростят эти трюки в продакшен-инструменты (managed edge inference, auto-quantization), захватят рынок SMB.
- SaaS для авто-квантизации и деплоя LLM на edge: загружаешь модель, получаешь оптимизированный Docker-образ под конкретное железо
- Консалтинг по переводу компаний с OpenAI API на локальные инстансы — экономия 70-90% на больших объёмах
- Дистрибуция готовых quantized-моделей под популярные задачи (юридический анализ, медицина) с гарантией приватности
- Managed inference-as-a-service на клиентском железе: ты предоставляешь ПО и апдейты, клиент — GPU
- Обучающие курсы и гайды по оптимизации LLM для разработчиков — тема взрывается, спрос огромный
- Это handcrafted решение под одну модель и одну карту — scaling на другие архитектуры потребует серьёзных инженерных ресурсов
- vLLM и драфтеры быстро обновляются — поддерживать форк дорого, а upstream может в любой момент сломать патчи
- Lookup drafting эффективен только на задачах с повторами; на creative writing или reasoning выигрыш минимален
- Квантизация в W4A16 может показать деградацию качества на edge-кейсах, которые не покрывает GSM8K
Это один из тех моментов, когда один человек с RTX 3090 делает то, что корпорации продают за сотни тысяч долларов в год. Lookup drafting — настолько очевидная в ретроспективе идея, что удивительно, почему её нет в vLLM из коробки. Сканируешь историю токенов, находишь совпадения, предлагаешь продолжение — элегантно и эффективно.
Реальная ценность здесь не в рекордных цифрах, а в том, что теперь можно запустить качественный AI-ассистент локально на б/у игровой карте и получить скорость, сравнимую с платными API. Для компаний, работающих с чувствительными данными (медицина, юриспруденция, финансы), это прямой путь к соответствию регуляциям без компромисса по производительности. Код опубликован, Docker работает из коробки — можно разворачивать прямо сейчас.
Комментарии