инструменты 1 мин

NVIDIA выпустила Molt — фреймворк для обучения AI-агентов с подкреплением на 8600 строк кода

NVIDIA NeMo выпустила Molt — компактный RL-фреймворк для обучения AI-агентов. 8,6K строк против 62K у конкурентов, работает на PyTorch нативно, использует vLLM и Ray без форков. Требует 2 ноды с 8 H100 GPU каждая, запускается одним флагом от 4B до 700B параметров. Apache 2.0, готов к использованию.

Если у вас есть H100 и задача обучить агента на своих данных — Molt сэкономит месяцы на разработке инфраструктуры. Если нет железа — это сигнал, что порог входа в frontier post-training остаётся запредельно высоким.

NVIDIA NeMo выпустила Molt — фреймворк для обучения агентных систем с подкреплением (agentic RL). Главная фишка — радикальная простота: весь код умещается в 8600 строк, что в 7 раз меньше verl (62K) и в 3 раза меньше slime (25K). Цель — чтобы исследователь держал архитектуру в голове целиком, а AI-ассистент мог прочитать и понять весь код.

Architecture построена на композиции: Ray для распределения, vLLM для инференса, AutoModel с FSDP2 для обучения. Ничего не форкается — обновления приходят простой сменой контейнера. Агент пишется обычным Python-кодом, можно использовать SDK OpenAI или Anthropic напрямую через loopback-сервер.

Особенность: частичный rollout — движок vLLM не сбрасывает контекст при обновлении весов, а ставит запросы на паузу и продолжает после синхронизации через NCCL. Для MoE-моделей реализован rollout routing replay — эксперты выбираются детерминировано.

Требования жёсткие: 2 ноды по 8 H100 (16 GPU на rollout и training). Это доступно крупным лабам, well-funded стартапам и корпоративным AI-группам. Применения: мультитурновые агенты с инструментами, code execution, vision-language задачи, дистилляция через LLM-as-judge.

Автор: Юлия Тарасова · Источник: marktechpost.com

Разработчикам. Компактная кодовая база (8.6K строк) — можно быстро разобраться и кастомизировать под свою задачу. Нативная интеграция с PyTorch, vLLM, Ray без форков. Агенты пишутся обычным Python с OpenAI/Anthropic SDK. Встроенная поддержка MoE-моделей с детерминированной маршрутизацией экспертов. Масштабирование одним флагом от 4B до 700B параметров.

Бизнесу. Открывает возможность обучать продвинутых AI-агентов без разработки инфраструктуры с нуля. Подходит для автоматизации сложных задач: code execution, работа с инструментами, мультиэтапные диалоги. Барьер входа — наличие 16 H100 GPU, что реально для финтеха, медтеха, робототехники с собственными датасетами и средами.

Инвесторам. Снижение порога входа в post-training агентов на 3-7х по сложности кода. Открывает нишу для средних AI-лабораторий без ресурсов на поддержку кастомных RL-стеков. Потенциал в вертикалях с proprietary окружениями (финансы, здравоохранение, промышленность), где нужны агенты под специфичные процессы. Риск — зависимость от дорогого железа ограничивает массовое применение.

Хайп35
Реальная польза65
Заработать55
  • Обучение специализированных агентов для корпоративных задач: автоматизация финансовой аналитики, медицинская диагностика, управление роботами — на своих данных без вендор-локина
  • Платформа для post-training агентов как услуга: предоставлять инфраструктуру Molt стартапам без собственных H100 кластеров
  • Дистилляция больших моделей в маленькие агенты: обучить 700B MoE, дистиллировать знания в 4B модель для edge-устройств или дешёвого деплоя
  • Агенты с инструментами для разработчиков: code execution, автотесты, рефакторинг — обучить на репозиториях компании
  • LLM-as-judge для обучения: создавать synthetic reward loops для кастомных KPI в бизнес-процессах (качество ответов клиентам, комплаенс)
  • Железный барьер: 16 H100 — это ~$500K капекс или ~$30-40K/месяц в облаке, отсекает 95% команд
  • Disclaimer про MoE-mismatch: авторы сами признают caveat в throughput для MoE-моделей — возможны неочевидные баги в проде
  • Позиционирование как research infrastructure, а не production-ready: нет гарантий SLA, мониторинга, enterprise-поддержки
  • Зависимость от NVIDIA-экосистемы: vLLM, AutoModel, NCCL — vendor lock-in, хотя всё под Apache 2.0

Molt — это честный ответ на вопрос, почему обучение агентов до сих пор остаётся уделом избранных. NVIDIA не продаёт волшебную кнопку, а даёт инструмент тем, у кого уже есть железо и задача. Компактность кода — это не маркетинг: когда весь стек умещается в голове одного человека, скорость итераций растёт в разы. Мы в редакции видим здесь два сигнала. Первый — положительный: если у вас есть специфичная среда (свои данные, свои метрики, свои ограничения), Molt экономит месяцы на костылях поверх универсальных фреймворков. Второй — реалистичный: барьер в 16 H100 означает, что обучение агентов с подкреплением всё ещё не про стартапы в гараже. Это про команды с бюджетом от $500K на железо или контрактом с облачным провайдером. Практический вывод: если у вас есть задача, где GPT-4 с RAG не справляется, и есть доступ к H100 — попробуйте Molt. Если железа нет — берите код как референс-архитектуру и ждите, когда облачные провайдеры упакуют это в managed-сервис. А пока это инструмент для тех, кто играет в высшей лиге.

Ещё по теме

Комментарии