Eider: новый inference-runtime для NVIDIA DGX Spark с нативной поддержкой FP4
Разработчик с ником Comrade-Porcupine выпустил на GitHub собственный inference-движок Eider для новых GPU NVIDIA Grace Blackwell (GB10). Написан с нуля на Rust и CUDA, заточен под NVFP4-квантизацию, умеет подгружать экспертов MoE-моделей с диска и работает с Qwen 3.6, Step 3.7 Flash, Gemma 4 26B и другими моделями — быстрее и эффективнее, чем llama.cpp и vLLM на этом железе.
Показывает, что энтузиасты могут выжать из нового железа больше, чем мейнстримные инструменты, и что AI-ассистенты уже пишут низкоуровневый GPU-код. Если у вас есть доступ к новым NVIDIA GB10 — Eider может стать практичной альтернативой vLLM/llama.cpp.
Eider: самописный движок для новых GPU NVIDIA
Разработчик под ником Comrade-Porcupine представил на Reddit собственный inference-runtime Eider, заточенный под NVIDIA DGX Spark (архитектура Grace Blackwell, GB10). Проект написан полностью с нуля на Rust и CUDA — без использования популярных библиотек вроде llama.cpp или vLLM.
Зачем нужен ещё один движок?
Главная цель — максимально использовать возможности NVFP4 (4-битной квантизации) на GPU SM121, которую стандартные инструменты пока не поддерживают или делают это неэффективно. Автор утверждает, что Eider способен запускать большие модели вроде Step 3.7 Flash в памяти там, где vLLM упирается в лимиты, а llama.cpp вынужден использовать квантизацию худшего качества.
Технические особенности
- Paging экспертов MoE: подгружает части Mixture-of-Experts моделей с диска по требованию, экономя GPU-память
- Компактный KV-кэш в NVFP4 для Qwen, Step и Gemma
- OpenAI-совместимый API с мультисессионной шедулингом
- Поддержка гибридных моделей вроде NVIDIA Nemotron 3 Puzzle (attention + Mamba)
Поддерживаются модели: Qwen 3.6 (dense и MoE), Agents-A1, Step 3.7 Flash, Gemma 4 26B-A4B, Nemotron 3 Puzzle.
Контекст
Автор честно признаётся, что большая часть кода на уровне ядер написана AI-агентами ("я не настолько умён и не силён в математике"), но проект уже работает и движется в сторону production. Основная мотивация — быстрый старт для локальной разработки без ожидания, пока крупные фреймворки допилят поддержку новых GPU.
Проект доступен на GitHub: rdaum/eider. Автор призывает сообщество тестировать и репортить баги.
Ключевые выводы
- Появление специализированных inference-движков под конкретное железо (GB10/SM121) — признак фрагментации экосистемы и отставания популярных фреймворков
- NVFP4-квантизация на новых GPU даёт реальное преимущество в memory efficiency, но требует переписывания кода с нуля
- Paging экспертов MoE с диска — практичное решение для запуска огромных моделей на ограниченной VRAM
- AI-ассистированная разработка low-level кода (CUDA-ядра) уже работает на практике, хоть и с оговорками
- Малые независимые проекты могут опережать крупные фреймворки в поддержке новейшего железа
Автор: Никита Громов · Источник: reddit.com
Это классический пример того, как один мотивированный разработчик с доступом к новому железу может обогнать целые команды. NVIDIA выкатила Grace Blackwell с поддержкой FP4, а llama.cpp и vLLM всё ещё не допилили — так что появляются такие проекты-затычки.
Интересно другое: автор прямо говорит, что CUDA-ядра писали AI-агенты, а он сам "не силён в математике". Это уже не теория — AI-ассистированная разработка работает даже на уровне low-level GPU-программирования. Правда, фраза "работает. Большую часть времени" намекает, что production-ready это пока с натяжкой. Но для экспериментов с GB10 и запуска Step 3.7 Flash — вполне годный инструмент.
Комментарии