Попытка воспроизвести исследование OpenAI по устойчивым AI-чертам провалилась на одной видеокарте
Исследователь пытается повторить эксперимент OpenAI по внедрению устойчивых поведенческих черт в языковую модель через обучение с подкреплением (GRPO), используя одну RTX 3090 — примерно 0,00001% вычислительной мощности оригинального исследования. Несмотря на технически корректную настройку, черта личности сдвинулась всего на 2,4 балла вместо необходимых 15. Автор оригинальной работы подтвердил: 20 примеров обучения слишком мало, и нужны индивидуальные критерии оценки для каждого примера.
Показывает реальные сложности демократизации AI-исследований: даже технически грамотный энтузиаст с современным GPU не может воспроизвести результаты лабораторий уровня OpenAI без радикальной адаптации методологии. Важный кейс для понимания пропасти между промышленными и академическими возможностями в эпоху больших моделей.
Амбициозный эксперимент на домашнем железе
Энтузиаст под ником doctor-squidward делится неудачной попыткой воспроизвести недавнее исследование OpenAI (препринт arXiv:2606.24014) о внедрении устойчивых поведенческих черт в языковые модели. Оригинальная работа показывала, что полезные черты, обученные через reinforcement learning, сохраняются даже под adversarial-атаками и вредным дообучением.
Технические детали попытки
Исследователь использовал Qwen2.5-7B-Instruct с LoRA-адаптером (rank 32) и метод GRPO (Group Relative Policy Optimization) на одной RTX 3090 — около 10⁻⁵ от вычислительной мощности оригинального эксперимента. Целевая черта — «консерватизм» (low-Openness по модели OCEAN), стилистическая характеристика, где базовая модель показывала 57/100 баллов.
Награда формировалась через модельную оценку (GPT-4.1-mini как судья): 85% качество + 15% связность. Обучение длилось 200 шагов на 20 специализированных промптах (25% датасета) и общих вопросах (75%).
Почему провалилось
Результат: черта сдвинулась с 57.0 до 59.4 баллов (+2.4 при необходимых ~15). Автор методично исключил типичные проблемы:
- Не деградация модели: связность 76%, длина ответов идентична базовой, нулевые повторы и отказы
- Не переобучение: одинаковые оценки на тренировочных (58.9) и новых промптах (59.4)
- Не мёртвые градиенты: судья разделяет 6 вариантов ответов на ~18 баллов, только 25% групп GRPO имеют вырожденное распределение наград
Вердикт эксперта
Автор оригинальной работы подтвердил гипотезу: 20 уникальных промптов катастрофически мало. Критичны два фактора: (1) на порядки больше разнообразных примеров и (2) индивидуальные критерии оценки для каждого промпта (3-4 конкретных требования), а не единый глобальный рубрик.
Открытые вопросы
Исследователь просит сообщество поделиться опытом: сколько реально нужно промптов для внедрения персоны в 7B-модели? Работает ли модельная оценка для стилистических черт, где нет «единственно правильного» поведения? Кто-то вообще воспроизводил подобные trait-RL эксперименты на малых масштабах?
Ключевые выводы
- Масштабирование вниз AI-экспериментов не линейно: уменьшение compute в 100,000 раз требует принципиально иной методологии, а не просто пропорционального сокращения данных
- 20 обучающих примеров недостаточно даже для стилистической черты — нужны сотни уникальных промптов с индивидуальными критериями оценки
- Модельные судьи (LLM-as-judge) для RLHF создают дополнительный слой сложности при работе с субъективными чертами без чёткого «правильного ответа»
- Методическая строгость исследователя (систематическое исключение гипотез, контакт с авторами оригинала) — образец научной честности в эпоху AI-хайпа
Автор: Сергей Ефимов · Источник: reddit.com
Это редкий пример публичного разбора неудачи в AI — и он ценнее сотни success stories. Автор не просто слил код с комментарием «не работает», а провёл детективное расследование: проверил 5+ гипотез, нашёл и исправил баг с обрезкой ответов (который маскировался под обучение!), дошёл до авторов оригинальной работы.
Выводы жёсткие: современные прорывные AI-эксперименты часто невоспроизводимы на доступном железе не из-за секретных трюков, а из-за пропасти в масштабах. 100,000-кратная разница в compute — это не просто «запустить на 100,000 шагов дольше», это качественно другая задача, требующая другой инженерии данных. Особенно показательно, что проблема не в самой модели (7B Qwen вполне способна), а в объёме и структуре обучающих сигналов. Демократизация AI пока буксует не на уровне открытых весов, а на уровне методологических деталей и вычислительных ресурсов для их отработки.
Комментарии