#reinforcement-learning

И исследования ·28 июл 2026

PIRL/PIPO: как научить ИИ проверять, помогло ли ему последнее обновление

Исследователи предложили PIRL — подход к обучению с подкреплением, при котором модель после каждого обновления проверяет, стала ли она реально лучше. Практическая реализация PIPO добавляет двухфазный цикл: сначала обновление по стандартному алгоритму (PPO, GRPO и др.), затем ретроспективная проверка — если шаг помог, его закрепляют, если навредил — корректируют. Эксперименты показали рост точности и стабильности на задачах математики, кода и использования инструментов.

0 126
И инструменты ·27 июл 2026

Kimi AI открыла AgentENV — систему для обучения AI-агентов на тысячах виртуальных машин

Moonshot AI (создатели Kimi) и kvcache-ai выпустили в открытый доступ AgentENV — распределённую платформу для обучения AI-агентов методом подкрепления. Система запускает каждого агента в изолированной микро-виртуальной машине Firecracker, умеет мгновенно сохранять состояние (снепшоты за 50 мс), клонировать окружения на лету и масштабироваться на кластеры. Используется для тренировки модели Kimi K3 с 2,8 триллионами параметров.

0 95