Kimi AI открыла AgentENV — систему для обучения AI-агентов на тысячах виртуальных машин
Moonshot AI (создатели Kimi) и kvcache-ai выпустили в открытый доступ AgentENV — распределённую платформу для обучения AI-агентов методом подкрепления. Система запускает каждого агента в изолированной микро-виртуальной машине Firecracker, умеет мгновенно сохранять состояние (снепшоты за 50 мс), клонировать окружения на лету и масштабироваться на кластеры. Используется для тренировки модели Kimi K3 с 2,8 триллионами параметров.
Это первая open-source система уровня production для массового обучения AI-агентов на реальных окружениях. Раньше такую инфраструктуру держали в секрете крупные лаборатории — теперь любая команда может повторить подход Kimi без миллионов на DevOps.
Инфраструктура для армий AI-агентов
Moonshot AI (разработчики ассистента Kimi) и команда kvcache-ai открыли исходный код AgentENV — платформы, которая решает ключевую проблему обучения AI-агентов: как дать каждому агенту настоящий компьютер, не потратив при этом состояние на железо.
Система используется для тренировки Kimi K3 — модели с 2,8 триллионами параметров по архитектуре Mixture-of-Experts. Код выпущен под лицензией MIT.
Почему контейнеры не подходят
Агенты с подкреплением (Reinforcement Learning) не просто генерируют текст — они выполняют реальные команды в Linux: пишут файлы, запускают процессы, работают с сетью. Каждому нужна изоляция.
Контейнеры быстро стартуют, но делят ядро хоста — опасно для кода, написанного моделью. Полноценные виртуальные машины изолируют надёжно, но грузятся медленно и жрут память в простое.
AgentENV использует Firecracker — микро-VM с собственным ядром Linux, файловой системой и сетью. Фокус — на скорости и плотности размещения.
Магия снепшотов и клонирования
Ключевые возможности:
- Старт/возобновление за <50 мс из сохранённого состояния
- Пауза за <100 мс с инкрементальным снепшотом
- Fork: одна VM клонируется в до 16 независимых копий на том же хосте
На практике это значит: можно один раз установить зависимости, склонировать репозиторий, довести агента до нужного состояния — и размножить это состояние на тысячи параллельных экспериментов.
Снепшоты хранятся в S3-совместимом хранилище или распределённой ФС. Образы загружаются по требованию через overlaybd — слоёный формат, где базовые слои общие, а каждая VM пишет в свой верхний слой. Локальный диск работает как кэш.
Совместимость с E2B — хитрый ход
AgentENV реализует HTTP API, совместимый с E2B — популярным облачным сервисом для запуска агентов. Команды, уже использующие E2B SDK (Python/TypeScript), могут переключиться на self-hosted инфраструктуру без переписывания кода — достаточно изменить переменную E2B_API_URL.
Требования и развёртывание
- Минимум: Linux kernel 6.8+, доступ к
/dev/kvm - Варианты: systemd-сервис, Docker-образ, Docker Compose, Kubernetes
- Многоузловой режим: шлюз (порт 8080), планировщик (9090), DaemonSet на нодах
Документация помечает multi-node контрольную плоскость как прототип.
Зачем это нужно
Без такой системы обучение агентов упирается в инфраструктуру: слишком долго, слишком дорого, слишком сложно управлять тысячами окружений. AgentENV делает это технически возможным — и теперь любая команда может повторить подход Moonshot AI.
Ключевые выводы
- Обучение AI-агентов требует изоляции на уровне VM, но традиционные виртуалки слишком медленные — AgentENV решает это через Firecracker с мгновенными снепшотами
- Клонирование окружений (fork до 16 копий) позволяет один раз выполнить дорогую настройку, затем размножить состояние на тысячи параллельных экспериментов
- Совместимость с E2B API — стратегический ход для адопции: команды могут мигрировать с облака на self-hosted без рефакторинга кода
- Layered storage (overlaybd) с общими базовыми слоями и on-demand загрузкой позволяет масштабировать fleet за пределы локального диска каждого хоста
- Проект выпущен под MIT и используется для тренировки Kimi K3 (2.8T параметров) — редкий случай, когда китайская лаборатория открывает production-инфраструктуру
Автор: Юлия Тарасова · Источник: marktechpost.com
**Это действительно важный релиз.** Обучение агентов на реальных окружениях — это не toy problem: нужна изоляция, скорость, масштаб. Раньше каждая лаборатория изобретала велосипед или платила облачным сервисам вроде E2B. Теперь есть готовое решение под MIT — и это код, на котором тренируют модель в 2.8 триллиона параметров.
Совместимость с E2B API — особенно хитрый ход. Moonshot не просто выкладывает код, а даёт команды путь миграции с коммерческого сервиса на self-hosted. Правда, стоит помнить: multi-node режим пока прототип, а требования к сети (1-10 Гбит) и ядру (6.8+) отсекают легковесные сетапы. Но если вы всерьёз занимаетесь агентами — это первый инструмент, который стоит попробовать.
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии