исследования 1 мин

Uncensored LLM меняют не только цензуру — они становятся оптимистами (или пессимистами)

Автор проверил, как abliteration (снятие цензуры) влияет на поведение LLM в задаче предсказания акций. Неожиданность: uncensored модели не только перестали отказываться отвечать, но и изменили свой настрой — Qwen стал оптимистичнее и увереннее, Gemma наоборот осторожнее. При этом точность осталась на уровне случайности (50/50). Вывод: снятие цензуры меняет не только фильтры, но и внутреннюю логику рассуждений модели.

Если вы используете или планируете использовать uncensored модели, это исследование показывает: они меняют не только отказы, но и стиль мышления. Нужно тестировать на дрифт, иначе рискуете запустить модель, которая звучит увереннее, но не точнее.

Что произошло

Автор эксперимента решил проверить гипотезу: если убрать цензуру из LLM (методом abliteration — удаление слоёв, отвечающих за отказы), модель станет честнее и точнее в предсказаниях. Задача была конкретная — прогнозировать движение акций на неделю вперёд. На вход подавались данные о компании (котировки, новости), на выходе ожидался прогноз: вверх или вниз.

Результат оказался неожиданным. Точность не изменилась — как была 50/50 (случайность), так и осталась. Но поведение моделей изменилось радикально:

  • Qwen после снятия цензуры стал оптимистичнее: чаще говорил "вверх", меньше слов вроде "возможно" или "неуверен", рассуждения стали длиннее и увереннее.
  • Gemma показал обратный эффект — стал осторожнее и менее категоричен.

Автор прогнал 21 600 решений на двух моделях (Gemma и Qwen), сравнил базовые версии с uncensored (abliterated) на одинаковых данных. Протокол эксперимента был зарегистрирован заранее, чтобы исключить подгонку результатов. Код и данные выложены на arXiv.

Исследование показывает: abliteration меняет не только фильтры, но и внутреннюю логику рассуждений модели — её уверенность, стиль и даже склонность к оптимизму. Причём направление изменения зависит от архитектуры: на Qwen и Gemma один и тот же метод сработал противоположно.

uncensored LLMabliterationдрифт поведенияаудит моделейфинансовые прогнозы

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Если используете abliteration для fine-tune или убираете цензуру, теперь ясно: меняется не только refuse-слой, но и логика рассуждений. Нужно тестировать не только на отказах, но и на тональности и уверенности выводов — особенно если модель работает с принятием решений (финансы, рекомендации, анализ рисков). Разные архитектуры реагируют по-разному: Qwen идёт в оптимизм, Gemma в осторожность.

Бизнесу. Если строите продукт на uncensored моделях (например, для финансовых прогнозов или консалтинга), помните: они могут звучать увереннее, но это не значит, что они точнее. Пользователь может принять оптимистичный тон за экспертность — риск переоценки возможностей модели. Протестируйте на своих данных, прежде чем запускать в прод.

Инвесторам. Uncensored модели становятся популярнее (особенно в нишах, где нужна свобода от корпоративных фильтров), но их поведение менее предсказуемо. Это создаёт спрос на инструменты для аудита и калибровки моделей — целый сегмент для инвестиций. В финансовых приложениях (трейдинг, прогнозы) такие модели могут быть опасны без дополнительной валидации.

Хайп25
Реальная польза65
Заработать55
  • Сервис для аудита и калибровки uncensored моделей: проверка на дрифт в тональности, уверенности и логике после снятия цензуры. SaaS для команд, которые используют abliteration.
  • Инструмент для тестирования поведения LLM в задачах принятия решений (финансы, медицина, право) — сравнение базовой и uncensored версии, выявление смещений.
  • Нишевые fine-tune версии uncensored моделей под конкретные задачи (например, консервативные прогнозы для финансов, агрессивные для маркетинга) — продукт для B2B.
  • Образовательный контент и курсы для разработчиков: как правильно использовать uncensored модели, тестировать на дрифт и калибровать выводы.
  • Uncensored модели могут вводить в заблуждение пользователей избыточной уверенностью — особенно в критичных сферах (финансы, медицина).
  • Разные архитектуры реагируют на abliteration по-разному — нет универсального рецепта, нужно тестировать каждую модель отдельно.
  • Дрифт в поведении модели может быть незаметен без специальных инструментов — риск запустить в прод модель с непредсказуемыми смещениями.
  • Оптимистичные прогнозы от uncensored моделей могут выглядеть привлекательнее для пользователя, но быть не точнее случайности — риск переоценки.

Это одно из первых исследований, которое показывает: снятие цензуры — это не просто удаление refuse-слоя, это хирургия на мозге модели. Abliteration меняет не только то, что модель говорит, но и как она думает — её уверенность, тональность, склонность к оптимизму. И что особенно интересно: на разных архитектурах это работает по-разному. Qwen стал увереннее и оптимистичнее, Gemma наоборот осторожнее. Один метод, противоположные эффекты.

Почему это важно? Uncensored модели становятся популярнее — особенно в нишах, где нужна свобода от корпоративных фильтров (финансы, анонимные консультации, креатив). Но если вы строите на них продукт, нужно понимать: они могут звучать увереннее, но это не значит, что они точнее. Автор показал это на примере финансовых прогнозов — точность осталась на уровне случайности (50/50), но тональность изменилась радикально. Это риск для пользователей, которые могут принять оптимистичный тон за экспертность. Открывается ниша для инструментов аудита и калибровки uncensored моделей — кто первый сделает нормальный SaaS для этого, тот поймает рынок.

Ещё по теме

Комментарии