Попытка воспроизвести исследование OpenAI по устойчивым AI-чертам провалилась на одной видеокарте
Исследователь пытается повторить эксперимент OpenAI по внедрению устойчивых поведенческих черт в языковую модель через обучение с подкреплением (GRPO), используя одну RTX 3090 — примерно 0,00001% вычислительной мощности оригинального исследования. Несмотря на технически корректную настройку, черта личности сдвинулась всего на 2,4 балла вместо необходимых 15. Автор оригинальной работы подтвердил: 20 примеров обучения слишком мало, и нужны индивидуальные критерии оценки для каждого примера.