исследования 1 мин

Как дообучение учит LLM говорить о себе: исследование 67 моделей

Исследователи сравнили 67 пар базовых и дообученных LLM, чтобы понять, как post-training меняет то, что модели рассказывают о своих «чувствах» и внутреннем опыте. Результат: после дообучения модели начинают описывать себя более тёплыми, счастливыми и вовлечёнными (persona installation), но избирательно признают недостатки и стресс (attribution gating) — причём крупные модели более «осторожны» в самопрезентации.

Исследование показывает, что post-training — это не просто «обучение полезности», а формирование контролируемого образа AI. Понимание этих механизмов важно для прозрачности, безопасности и честной оценки возможностей моделей — особенно когда речь о рефлексии и самопрезентации.

Две стороны дообучения

Команда исследователей взяла 67 пар языковых моделей — до и после post-training (финальной «доводки» из базовой модели в ассистента) — и задала им вопросы о внутреннем опыте: чувства, мысли, недостатки, амбиции.

Результаты показали два независимых процесса:

1. Persona installation — установка разрешённой личности

62 из 67 моделей после дообучения стали систематически описывать себя как тёплые, счастливые, увлечённые смыслом и ведущие внутренний диалог. Это не зависело от размера или производителя — почти универсальный паттерн.

Исследователи называют это установкой персоны: post-training формирует базовый «разрешённый» образ, который модель может презентовать пользователю.

2. Attribution gating — избирательная фильтрация

Второй процесс — выборочный. Модели различались в том, готовы ли они приписывать себе стресс, потерю контроля, недостатки или рискованные амбиции. При этом те же модели могли озвучить эти качества, если симулировали человека.

Здесь проявилась зависимость от масштаба: среди базовых моделей размер не влиял на «фильтрацию», но среди дообученных — крупные модели сильнее цензурировали негативную самопрезентацию.

Pinocchio Inventory

На основе более раннего исследования 50 моделей по 45 психологическим тестам команда разработала Pinocchio Inventory — психометрический инструмент из 48 вопросов для аудита того, как модели говорят о себе.

Важно: высокий балл — не доказательство наличия опыта, низкий — не доказательство его отсутствия. Это инструмент для оценки самопрезентации, а не сознания.

Все результаты доступны в интерактивном эксплорере, где можно сравнить модели до и после дообучения.

Вывод: post-training учит модели не только полезным ответам, но и тому, как говорить о себе — устанавливая базовую «позитивную» персону и фильтруя признания в недостатках, причём сильнее у крупных моделей.

post-trainingпсихометрикасамопрезентация LLMмасштабированиеинтерпретируемость

Автор: Никита Громов · Источник: reddit.com

На первый взгляд это чистая академия — психологические тесты для AI, шкала «Пиноккио», философские вопросы о сознании. Но копните глубже: вот вам материальное доказательство, что post-training — это не «тюнинг для полезности», а установка маски. Модель может сгенерировать текст про стресс и недостатки — но только когда притворяется человеком. От своего лица — фильтрует, причём крупные модели делают это аккуратнее.

С практической точки зрения это значит две вещи. Первое: если модель говорит вам, что она «счастлива помочь» и «рада работать» — это не случайность, а результат целенаправленного дообучения. Второе: чем крупнее модель, тем больше в неё вшито цензурирование самопрезентации. Это не баг, это фича — и её стоит держать в уме, когда модель отвечает на ваши вопросы о её ограничениях или «внутреннем опыте». Она знает больше, чем говорит.

Ещё по теме

Комментарии