NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B с 3B активных параметров и роутер NeMo Switchyard
NVIDIA представила Nemotron 3.5 Lightning — легковесную MoE-модель для агентов (30B параметров, активно 3B) с контекстом 1M токенов и скоростью в 4 раза выше аналогов. В комплекте роутер NeMo Switchyard, который снижает расходы на 74% за счёт умной маршрутизации между моделями. Работает на одной GPU, открытые веса, коммерческая лицензия.
Если вы строите AI-продукт с агентами, Lightning даёт возможность снизить расходы в 3-4 раза и ускорить ответы без потери качества на рутинных операциях. Для разработчиков это шанс развернуть production-систему на одной GPU вместо аренды кластера.
Что произошло
NVIDIA выпустила два открытых инструмента для построения AI-агентов: модель Nemotron 3.5 Lightning и библиотеку-роутер NeMo Switchyard.
Lightning — это MoE-модель на 30B параметров (активно только 3B), гибридная архитектура Mamba-2 + MoE + Attention с окном контекста на 1M токенов. Обучена на 20 триллионах токенов. Генерирует текст до 4х раз быстрее аналогов благодаря multi-token prediction и двум draft-моделям (DSpark и DFlash). На бенчмарке PinchBench обработала 10 000 задач на 30% быстрее Qwen3.6 35B при сопоставимой точности.
Запускается на одной GPU (H100 или DGX Spark), весит 3B в активном состоянии. Поставляется с открытыми весами, данными и рецептами под лицензией OpenMDW-1.1 — разрешено коммерческое использование. Уже используют CrowdStrike, Harvey, CodeRabbit в киберзащите, юриспруденции, ревью кода.
NeMo Switchyard — библиотека для маршрутизации запросов между моделями. Умеет отправлять простые задачи на Lightning, сложные — на Claude Opus или другие frontier-модели. В тестах LangChain на 145 задачах это снизило расходы на 74% (только 7% запросов улетают на дорогую модель), потеря точности ~6 пунктов. Cognition интегрировал в Devin Desktop и снизил средний чек на 28% при минус 2.8 пункта точности.
Цель обоих инструментов — решить проблему расходов в AI-агентах: большинство времени агент вызывает инструменты, проверяет результаты, делегирует задачи. Слать каждый такой шаг на GPT-4 дорого и медленно. Lightning обрабатывает рутину, frontier-модели — планирование.
Автор: Артём Ковалёв · Источник: marktechpost.com
Разработчикам. Запуск на одной H100, поддержка llama.cpp, Ollama, LM Studio, Unsloth. Контекст 1M токенов для работы с кодом и логами. Роутер NeMo Switchyard из коробки с примерами на LangChain. Специализация под tool calling и делегирование субагентов. Готовые квантизованные чекпоинты NVFP4 для Hopper и Blackwell.
Бизнесу. Себестоимость агентов падает на 74% при потере 6% точности — подходит для массовых операций (триаж тикетов, парсинг контрактов, ревью кода). Коммерческая лицензия без ограничений. Уже работает в юридических сервисах (Harvey), кибербезопасности (CrowdStrike), медицине (Lila Sciences). Можно развернуть on-premise или через Baseten/Together AI.
Инвесторам. Прямой выход на рынок AI-агентов с фокусом на сегмент execution layer — десятки миллиардов запросов в день. Снижение барьера входа для стартапов (одна GPU вместо кластера). Партнёры из регулируемых индустрий (финансы, медицина, киберзащита) сигналят о готовности платить за кастомизацию. Рост спроса на инфраструктуру роутинга между моделями — новая ниша после эпохи monolithic LLM.
- Запустить сервис-агрегатор для малого бизнеса: подключить Lightning + Switchyard для триажа обращений, парсинга документов, ревью кода — продавать подписку от $99/мес.
- Сделать вертикальное решение для юристов или финансистов: кастомизировать Lightning на отраслевых данных, встроить в CRM/ERP, продавать как white-label (CrowdStrike и Harvey уже идут этим путём).
- Построить платформу managed routing для DevOps/SRE: автоматический роутинг логов и инцидентов между моделями, экономия до 70% на операционке, монетизация через volume-based pricing.
- Запустить marketplace fine-tuned версий Lightning под конкретные задачи: медицинская диагностика, финансовый анализ, code review — продавать доступ к весам за $500-5000.
- Создать конструктор no-code агентов на базе Lightning + Switchyard: дать возможность бизнесу собирать workflow без кода, брать revenue share или фиксированную плату за runtime.
- Качество на сложных задачах: потеря 6 пунктов точности может быть критичной для регулируемых индустрий — нужна осторожность в медицине и финансах.
- Конкуренция с закрытыми моделями: Claude и GPT-4 Turbo продолжают лидировать по абсолютной точности, а цены снижаются — окно для open-source может сузиться.
- Сложность кастомизации: обещание лёгкой настройки не всегда совпадает с реальностью — нужны компетенции в MLOps и GPU-инфраструктуре.
- Зависимость от железа NVIDIA: модель оптимизирована под Hopper/Blackwell, на AMD/Gaudi эффективность может упасть, а это vendor lock-in.
Это важная точка в переходе от monolithic LLM к специализированным AI-системам. NVIDIA понимает, что будущее за композицией моделей: одна планирует, другая исполняет, третья проверяет. Lightning — первая действительно production-ready открытая модель для execution layer с готовой инфраструктурой роутинга. Цифры реальные: 74% экономии у LangChain, 28% у Cognition — это уже не бенчмарки, а боевая статистика.
Но есть нюанс: потеря 6 пунктов точности может быть критичной для регулируемых индустрий. Если вы в медицине или финансах — тестируйте дважды. Для остального рынка (SaaS, DevOps, поддержка, маркетинг) это золотая жила. Особенно с учётом того, что модель запускается на одной H100 — barrier to entry упал до уровня обычного стартапа. Если вы до сих пор платите OpenAI за каждый tool call — пора пересмотреть архитектуру.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.
Доступ из РФ →
Комментарии