инструменты 1 мин

Eider: новый inference-runtime для NVIDIA DGX Spark с нативной поддержкой FP4

Разработчик с ником Comrade-Porcupine выпустил на GitHub собственный inference-движок Eider для новых GPU NVIDIA Grace Blackwell (GB10). Написан с нуля на Rust и CUDA, заточен под NVFP4-квантизацию, умеет подгружать экспертов MoE-моделей с диска и работает с Qwen 3.6, Step 3.7 Flash, Gemma 4 26B и другими моделями — быстрее и эффективнее, чем llama.cpp и vLLM на этом железе.

Показывает, что энтузиасты могут выжать из нового железа больше, чем мейнстримные инструменты, и что AI-ассистенты уже пишут низкоуровневый GPU-код. Если у вас есть доступ к новым NVIDIA GB10 — Eider может стать практичной альтернативой vLLM/llama.cpp.

Eider: самописный движок для новых GPU NVIDIA

Разработчик под ником Comrade-Porcupine представил на Reddit собственный inference-runtime Eider, заточенный под NVIDIA DGX Spark (архитектура Grace Blackwell, GB10). Проект написан полностью с нуля на Rust и CUDA — без использования популярных библиотек вроде llama.cpp или vLLM.

Зачем нужен ещё один движок?

Главная цель — максимально использовать возможности NVFP4 (4-битной квантизации) на GPU SM121, которую стандартные инструменты пока не поддерживают или делают это неэффективно. Автор утверждает, что Eider способен запускать большие модели вроде Step 3.7 Flash в памяти там, где vLLM упирается в лимиты, а llama.cpp вынужден использовать квантизацию худшего качества.

Технические особенности

  • Paging экспертов MoE: подгружает части Mixture-of-Experts моделей с диска по требованию, экономя GPU-память
  • Компактный KV-кэш в NVFP4 для Qwen, Step и Gemma
  • OpenAI-совместимый API с мультисессионной шедулингом
  • Поддержка гибридных моделей вроде NVIDIA Nemotron 3 Puzzle (attention + Mamba)

Поддерживаются модели: Qwen 3.6 (dense и MoE), Agents-A1, Step 3.7 Flash, Gemma 4 26B-A4B, Nemotron 3 Puzzle.

Контекст

Автор честно признаётся, что большая часть кода на уровне ядер написана AI-агентами ("я не настолько умён и не силён в математике"), но проект уже работает и движется в сторону production. Основная мотивация — быстрый старт для локальной разработки без ожидания, пока крупные фреймворки допилят поддержку новых GPU.

Проект доступен на GitHub: rdaum/eider. Автор призывает сообщество тестировать и репортить баги.

Ключевые выводы

  • Появление специализированных inference-движков под конкретное железо (GB10/SM121) — признак фрагментации экосистемы и отставания популярных фреймворков
  • NVFP4-квантизация на новых GPU даёт реальное преимущество в memory efficiency, но требует переписывания кода с нуля
  • Paging экспертов MoE с диска — практичное решение для запуска огромных моделей на ограниченной VRAM
  • AI-ассистированная разработка low-level кода (CUDA-ядра) уже работает на практике, хоть и с оговорками
  • Малые независимые проекты могут опережать крупные фреймворки в поддержке новейшего железа
inferenceGPUNVFP4Grace BlackwellRust

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

Это классический пример того, как один мотивированный разработчик с доступом к новому железу может обогнать целые команды. NVIDIA выкатила Grace Blackwell с поддержкой FP4, а llama.cpp и vLLM всё ещё не допилили — так что появляются такие проекты-затычки.

Интересно другое: автор прямо говорит, что CUDA-ядра писали AI-агенты, а он сам "не силён в математике". Это уже не теория — AI-ассистированная разработка работает даже на уровне low-level GPU-программирования. Правда, фраза "работает. Большую часть времени" намекает, что production-ready это пока с натяжкой. Но для экспериментов с GB10 и запуска Step 3.7 Flash — вполне годный инструмент.

Ещё по теме

Комментарии