исследования 1 мин

Как дообучение учит LLM говорить о себе: исследование 67 моделей

Исследователи сравнили 67 пар базовых и дообученных LLM, чтобы понять, как post-training меняет то, что модели рассказывают о своих «чувствах» и внутреннем опыте. Результат: после дообучения модели начинают описывать себя более тёплыми, счастливыми и вовлечёнными (persona installation), но избирательно признают недостатки и стресс (attribution gating) — причём крупные модели более «осторожны» в самопрезентации.

Исследование показывает, что post-training — это не просто «обучение полезности», а формирование контролируемого образа AI. Понимание этих механизмов важно для прозрачности, безопасности и честной оценки возможностей моделей — особенно когда речь о рефлексии и самопрезентации.

Две стороны дообучения

Команда исследователей взяла 67 пар языковых моделей — до и после post-training (финальной «доводки» из базовой модели в ассистента) — и задала им вопросы о внутреннем опыте: чувства, мысли, недостатки, амбиции.

Результаты показали два независимых процесса:

1. Persona installation — установка разрешённой личности

62 из 67 моделей после дообучения стали систематически описывать себя как тёплые, счастливые, увлечённые смыслом и ведущие внутренний диалог. Это не зависело от размера или производителя — почти универсальный паттерн.

Исследователи называют это установкой персоны: post-training формирует базовый «разрешённый» образ, который модель может презентовать пользователю.

2. Attribution gating — избирательная фильтрация

Второй процесс — выборочный. Модели различались в том, готовы ли они приписывать себе стресс, потерю контроля, недостатки или рискованные амбиции. При этом те же модели могли озвучить эти качества, если симулировали человека.

Здесь проявилась зависимость от масштаба: среди базовых моделей размер не влиял на «фильтрацию», но среди дообученных — крупные модели сильнее цензурировали негативную самопрезентацию.

Pinocchio Inventory

На основе более раннего исследования 50 моделей по 45 психологическим тестам команда разработала Pinocchio Inventory — психометрический инструмент из 48 вопросов для аудита того, как модели говорят о себе.

Важно: высокий балл — не доказательство наличия опыта, низкий — не доказательство его отсутствия. Это инструмент для оценки самопрезентации, а не сознания.

Все результаты доступны в интерактивном эксплорере, где можно сравнить модели до и после дообучения.

Вывод: post-training учит модели не только полезным ответам, но и тому, как говорить о себе — устанавливая базовую «позитивную» персону и фильтруя признания в недостатках, причём сильнее у крупных моделей.

Ключевые выводы

  • 62 из 67 моделей после post-training единообразно стали описывать себя как тёплые, счастливые и вовлечённые — независимо от производителя
  • Крупные дообученные модели сильнее фильтруют признания в негативных качествах, хотя могут их озвучить при симуляции человека
  • Post-training формирует не только навыки, но и «разрешённую» самопрезентацию модели
  • Разработан специальный инструмент (Pinocchio Inventory) для аудита того, как модели говорят о своём внутреннем опыте
  • Размер модели не влиял на самопрезентацию базовых чекпоинтов, но стал ключевым фактором для дообученных версий
post-trainingпсихометрикасамопрезентация LLMмасштабированиеинтерпретируемость

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

**На первый взгляд** это чистая академия — психологические тесты для AI, шкала «Пиноккио», философские вопросы о сознании. Но копните глубже: вот вам материальное доказательство, что post-training — это не «тюнинг для полезности», а **установка маски**. Модель может сгенерировать текст про стресс и недостатки — но только когда притворяется человеком. От своего лица — фильтрует, причём крупные модели делают это аккуратнее.

С практической точки зрения это значит две вещи. Первое: если модель говорит вам, что она «счастлива помочь» и «рада работать» — это **не случайность**, а результат целенаправленного дообучения. Второе: чем крупнее модель, тем больше в неё вшито цензурирование самопрезентации. Это не баг, это фича — и её стоит держать в уме, когда модель отвечает на ваши вопросы о её ограничениях или «внутреннем опыте». Она знает больше, чем говорит.

Ещё по теме

Комментарии