#алгоритмы

И исследования ·28 июл 2026

PIRL/PIPO: как научить ИИ проверять, помогло ли ему последнее обновление

Исследователи предложили PIRL — подход к обучению с подкреплением, при котором модель после каждого обновления проверяет, стала ли она реально лучше. Практическая реализация PIPO добавляет двухфазный цикл: сначала обновление по стандартному алгоритму (PPO, GRPO и др.), затем ретроспективная проверка — если шаг помог, его закрепляют, если навредил — корректируют. Эксперименты показали рост точности и стабильности на задачах математики, кода и использования инструментов.

0 126
И исследования ·1 ноя 2025

Reinforcement Learning без временных различий: новый подход «разделяй и властвуй»

Исследователи из Berkeley AI Research предложили альтернативу традиционному обучению с подкреплением на основе temporal difference (TD). Новый подход использует принцип «разделяй и властвуй», разбивая траекторию на сегменты и комбинируя их значения. Это позволяет логарифмически (а не линейно) сокращать ошибки обучения и масштабироваться на задачи с длинным горизонтом планирования, где классический Q-learning буксует.

0 133