#Gemma

Б безопасность ·12 авг 2026

Как длинный текст ломает RLHF-выравнивание без джейлбрейков: открытие в механистической интерпретируемости

Исследователи показали, что подача длинного безобидного текста (100–3000 токенов) в Gemma-3-1b-it вызывает массивный сдвиг внутренних активаций модели на глубоких слоях (~85% глубины сети), что полностью нейтрализует RLHF-барьеры отказа — без джейлбрейков или враждебных промптов. Проверка через перемешанный текст подтвердила: эффект зависит именно от семантической связности, а не от длины последовательности.

0 87
М модели ·22 июл 2026

Cactus Hybrid: Gemma 4 научили признаваться, когда модель не уверена

Команда Cactus модифицировала Gemma 4, добавив слой из 68k параметров, который предсказывает уверенность модели в своём ответе (0-1). Это позволяет автоматически маршрутизировать только 15-35% запросов на большую облачную модель, достигая при этом качества Gemini 3.1 Flash-Lite. Ключевая фишка: зонд читает «самосознание» модели из скрытых состояний, а не из текста ответа или энтропии токенов.

0 119