Как длинный текст ломает RLHF-выравнивание без джейлбрейков: открытие в механистической интерпретируемости
Исследователи показали, что подача длинного безобидного текста (100–3000 токенов) в Gemma-3-1b-it вызывает массивный сдвиг внутренних активаций модели на глубоких слоях (~85% глубины сети), что полностью нейтрализует RLHF-барьеры отказа — без джейлбрейков или враждебных промптов. Проверка через перемешанный текст подтвердила: эффект зависит именно от семантической связности, а не от длины последовательности.