Инженер разогнал GPU 2017 года до уровня RTX 5090 на Qwen 3.8 — софтом против железа
Разработчик написал софтверный эмулятор FP4/FP8 (форматы для новейших Blackwell GPU) для старых Tesla V100 2017 года. Четыре V100 выдали те же 219 tok/s на Qwen 3.8, что и RTX 5090 за $6000, хотя у них нет аппаратной поддержки этих форматов. Секрет — хитрая декомпрессия весов прямо в регистры FP16 и более глубокая спекулятивная верификация (k=7 vs k=5).
Если вы разрабатываете AI-сервисы или управляете GPU-инфраструктурой, это показывает, что можно сэкономить десятки тысяч долларов на апгрейде, просто переписав софт. И это не синтетический бенчмарк — это работающий сервер с OpenAI-совместимым API.
Что произошло
Инженер под ником dnv2003 написал библиотеку v100-skinny, которая позволяет старым GPU Tesla V100 (2017) запускать Qwen 3.8 в нативном формате NVFP4/FP8 — несмотря на то, что эти форматы разработаны под Blackwell-архитектуру и требуют аппаратной поддержки. Четыре V100 показали 219 tok/s против 215 tok/s у RTX 5090 при инференсе с встроенной спекулятивной декодировкой (MTP).
Суть трюка — ядро QPN (Quantized Precision Native). Оно держит модель сжатой в HBM, а при чтении мгновенно транслирует FP4/FP8 блоки в FP16 регистры, с которыми умеют работать Tensor Cores Volta. Нет промежуточного шага "распаковать всю модель в FP16". При этом достигается 77% от теоретического потолка пропускной способности памяти (879 GB/s) на реальных формах Qwen 3.8.
Второй фокус — V100 естественно работает с 8-строчными тайлами, и автор смапил k=7 спекулятивных токенов ровно на эти 8 строк. Получилось, что V100 проверяет больше кандидатов за раунд (5.89 vs 4.27 токенов), компенсируя медленный раунд (27 мс vs 20 мс у 5090). В итоге пропускная способность сравнялась.
В версии 1.1 автор добавил полную поддержку оригинальных весов: FP4 регионы остаются FP4, FP8 — FP8, активации — FP16. Раньше приходилось конвертировать всё в FP4, что портило качество (на одном тесте модель генерировала 4 уникальных названия из 50 вместо 50).
Автор: Никита Громов · Источник: reddit.com
Разработчикам. Библиотека v100-skinny показывает, как обходить отсутствие аппаратных инструкций FP4/FP8 на Volta через умную транскодировку в FP16 прямо в регистры. QPN-ядро даёт 77% от потолка HBM, а адаптация под 8-строчные тайлы позволяет эффективно запускать глубокую спекулятивную верификацию (k=7). Код открыт на GitHub.
Бизнесу. Старые дата-центровые GPU (V100, Pascal) можно использовать для современных моделей вместо дорогих 5090/H100. Если у компании есть legacy-парк V100 — вместо списания можно получить пропускную способность на уровне новых карт, просто обновив софт. Амортизация железа растягивается на годы.
Инвесторам. Показано, что софтверные оптимизации могут перевернуть экономику инференса: вместо апгрейда на Blackwell можно выжать из Volta тот же результат. Это снижает барьеры входа в AI-инфраструктуру и смещает ценность с железа на софт, что выгодно для облачных провайдеров и GPU-as-a-Service.
- Сервис GPU-as-a-Service на базе дешёвых б/у V100 (цена ~$500-800 vs $6000 за 5090) с v100-skinny — конкурентная цена за тот же tok/s
- Консалтинг для компаний с парком Volta/Pascal: миграция моделей на NVFP4 без замены железа, экономия капекса
- Open-source инструмент для автоматической оптимизации глубины спекулятивной декодировки (k) в зависимости от длины контекста — платная SaaS-надстройка
- Продажа готовых inference-серверов на V100 с предустановленным v100-skinny для edge/локальных деплоев (юрлица, госсектор)
- Форк под другие архитектуры (Pascal, Turing) — расширение рынка на другие legacy GPU
- Масштабирование на длинный контекст (>65K) требует динамической подстройки глубины k — пока не автоматизировано
- Результат привязан к Qwen 3.8 и специфике MTP; на других моделях/движках может не дать такого эффекта
- V100 всё равно проигрывают в latency-чувствительных сценариях (batch, многопоточность), где важна пропускная способность чипа, а не только tok/s на одном запросе
- Поддержка и развитие ложатся на одного автора — риск забросить проект
Это один из тех случаев, когда инженерный фокус меняет экономику целой индустрии. v100-skinny показывает, что барьер входа в AI-инференс — не в железе, а в умении его готовить. Если у вас в дата-центре пылятся V100 или вы присматриваетесь к б/у GPU на вторичке, вместо списания можно получить конкурентную производительность на современных моделях. Главное — понимать границы: это работает на single-request decode с MTP, но не решает проблему батчинга и длинных контекстов без доработок.
Что особенно ценно — автор не остановился на синтетическом tok/s, а построил полноценный сервер с OpenAI-совместимым API и разобрался с реальными проблемами (качество на смешанных весах, адаптация k под длину контекста). Это не демка для GitHub-звёзд, а рабочий инструмент. Если вы делаете AI-инфру или SaaS на GPU — изучите код, там куча идей для оптимизации.
Комментарии