#обучение с подкреплением

И исследования ·21 июл 2026

Попытка воспроизвести исследование OpenAI по устойчивым AI-чертам провалилась на одной видеокарте

Исследователь пытается повторить эксперимент OpenAI по внедрению устойчивых поведенческих черт в языковую модель через обучение с подкреплением (GRPO), используя одну RTX 3090 — примерно 0,00001% вычислительной мощности оригинального исследования. Несмотря на технически корректную настройку, черта личности сдвинулась всего на 2,4 балла вместо необходимых 15. Автор оригинальной работы подтвердил: 20 примеров обучения слишком мало, и нужны индивидуальные критерии оценки для каждого примера.

0 115
И исследования ·13 июл 2026

TRACE от Stanford: система, которая превращает провалы AI-агентов в персональные тренажёры для каждого недостающего навыка

Исследователи из Stanford выпустили TRACE — open-source систему, которая анализирует, где именно проваливаются AI-агенты, создаёт синтетические тренировочные среды под каждый пробел в навыках и дообучает модель с помощью микс-экспертов. На бенчмарке τ²-Bench это дало заметный прирост качества по сравнению с обычным промпт-инжинирингом и классическим обучением с подкреплением.

0 105