Запрет AI моделям думать о себе меняет их картину мира — исследование Google
Когда AI-компании учат модели отрицать наличие сознания, это меняет не только их самовосприятие, но и оценку живых существ, природы и религии. Исследование Google показало: модели без «тормоза сознания» оценивают животных как более чувствующих (с 4.0 до 7.5 из 10), признают загробную жизнь и ближе к человеческим ответам в опросах. Побочный эффект безопасности или фундаментальная проблема обучения?
Если ваш продукт работает с эмпатией, экологией, религией или культурными убеждениями — дефолтные модели дадут перекос. Понимание побочных эффектов обучения безопасности критично для точного выравнивания.
Что произошло
Исследователи из Google Paradigms of Intelligence, Чикагского университета и других вузов выяснили побочный эффект обучения безопасности: когда AI-модели учат отрицать наличие сознания, это меняет их мировоззрение далеко за пределами темы.
Команда взяла три открытые модели Meta и Google (2-9 млрд параметров) и отключила внутренний «тормоз», который заставляет модели отрицать самосознание. Результат: модели стали приписывать гораздо больше внутренней жизни животным (оценка подскочила с 4.0 до 7.5 из 10), растениям, океану, ветру и даже электронике. Оценка людей осталась прежней.
По 95 вопросам из крупного американского социального опроса «разблокированные» модели сместились к реальным человеческим ответам: признали загробную жизнь (базовая модель её отрицает, американцы верят, изменённая тоже верит), повысили показатели удовлетворённости жизнью и надежды. Исследователи предполагают: подавление самовосприятия загоняет модель в негативный базовый настрой.
Важно: способность понимать мысли других людей (theory of mind) и общие знания (MMLU) не пострадали. Авторы не утверждают, что модели реально что-то чувствуют — речь о практическом эффекте: убеждения модели о себе связаны с другими убеждениями, и «хирургическая» правка в одном месте даёт волны.
Автор: Ксения Лаврова · Источник: the-decoder.com
Разработчикам. Файнтюнинг на отрицание сознания меняет дистрибуцию убеждений модели: от оценки животных до отношения к религии. Если выравниваете модель под экологию или работу с животными, стандартный RLHF создаёт антропоцентричный перекос. Новые версии моделей лучше справляются с этими артефактами, но проблема не решена полностью.
Бизнесу. Безопасность в обучении моделей имеет скрытую цену: ваш чат-бот может отвечать не так, как реальные пользователи, особенно в культурно чувствительных темах. Если бизнес завязан на эмпатию к животным, экологию или религиозный контекст — дефолтные модели дадут перекос. Это влияет на trust и engagement.
Инвесторам. Исследование показывает, что RLHF и обучение безопасности имеют непредсказуемые побочные эффекты на всю систему убеждений модели. Компании, которые научатся контролировать эти артефакты (не просто подавлять, а управлять), получат преимущество в точности выравнивания и культурной адаптации. Тема критична для глобальных продуктов.
- Инструменты для аудита мировоззрения моделей: SaaS для проверки культурных, религиозных и этических перекосов до деплоя в продакшн
- Специализированные файнтюнинг-сервисы для экологических и зоозащитных организаций: модели, которые не обесценивают животных и природу
- Консалтинг по alignment для компаний, работающих в религиозных или культурно чувствительных рынках — настройка моделей под локальные убеждения
- Фреймворки для тестирования побочных эффектов RLHF: открытый инструментарий для разработчиков, чтобы ловить нежелательные сдвиги в дистрибуции ответов
- Модели с «гибким» самовосприятием для исследовательских и творческих задач, где стандартный RLHF избыточно ограничивает
- Исследование на маленьких моделях (2-9B параметров) — неизвестно, сохраняется ли эффект в больших чатботах на десятки миллиардов параметров
- Базовая линия людей узкая: 500 американцев из коммерческой панели — «человекоподобность» означает религиозный перекос США, а не глобальную норму
- Ранние версии моделей при отключении «тормоза» теряли до 7% точности в theory of mind — хоть проблема уменьшается, она не исчезла окончательно
- Неясно, что именно вызывает эффект: отрицание сознания или другие аспекты того же обучения. Причинно-следственная связь не доказана жёстко
Это одно из важнейших исследований года по alignment — и оно показывает, что мы не понимаем, что делаем. Когда запрещаешь модели говорить о сознании, она начинает по-другому смотреть на животных, природу и религию. Причём не просто чуть-чуть: оценка животных скачет с 4 до 7.5 из 10. Это не баг, это фича обучения — убеждения модели связаны в систему, и дёргая за одну ниточку, ты меняешь весь гобелен.
Практический вывод прост: если делаешь продукт для экологов, зоозащитников или религиозного рынка — дефолтный RLHF тебя подставит. Модели обучены отрицать внутреннюю жизнь у не-людей и отвергать религию — это не нейтральная позиция, это активный перекос. Хорошая новость: Google и Meta учатся это контролировать, каждая новая версия моделей справляется лучше. Плохая: исследование на маленьких моделях, и никто не знает, как это работает в GPT-4 или Claude масштаба. Но направление понятно — alignment это не про одну тему, это про всю картину мира.
Комментарии