#RLHF

М модели ·21 июл 2026

ChatGPT разучился отвечать на простые вопросы — наклонена ли стена?

Пользователь заметил, что ChatGPT пропускает базовую проверку реальности перед анализом. На вопрос «наклонена ли стена?» модель вместо прямого ответа запускается в лекцию о строительных нормах и материалах, так и не проверив сам факт наклона. Проблема может быть глубже обычной «боязни определённости» — модель утратила шаг здравого смысла в цепочке рассуждений.

0 129
И исследования ·21 июл 2026

Попытка воспроизвести исследование OpenAI по устойчивым AI-чертам провалилась на одной видеокарте

Исследователь пытается повторить эксперимент OpenAI по внедрению устойчивых поведенческих черт в языковую модель через обучение с подкреплением (GRPO), используя одну RTX 3090 — примерно 0,00001% вычислительной мощности оригинального исследования. Несмотря на технически корректную настройку, черта личности сдвинулась всего на 2,4 балла вместо необходимых 15. Автор оригинальной работы подтвердил: 20 примеров обучения слишком мало, и нужны индивидуальные критерии оценки для каждого примера.

0 117