#джейлбрейк

Б безопасность ·12 авг 2026

Как длинный текст ломает RLHF-выравнивание без джейлбрейков: открытие в механистической интерпретируемости

Исследователи показали, что подача длинного безобидного текста (100–3000 токенов) в Gemma-3-1b-it вызывает массивный сдвиг внутренних активаций модели на глубоких слоях (~85% глубины сети), что полностью нейтрализует RLHF-барьеры отказа — без джейлбрейков или враждебных промптов. Проверка через перемешанный текст подтвердила: эффект зависит именно от семантической связности, а не от длины последовательности.

0 87
Б безопасность ·11 авг 2026

Уязвимость Claude, GPT и Gemini: как украсть внутренние рассуждения моделей через API

Исследователи нашли способ извлечь зашифрованные reasoning traces (внутренние рассуждения) из API Claude, GPT и Gemini. Используя джейлбрейк слабой модели, можно расшифровать мысли более сильной модели из того же семейства. В публичных логах агентов на GitHub/HF обнаружили 315 тысяч расшифрованных блоков с реальными API-ключами, паролями и личными данными — 64 артефакта существовали только внутри скрытых рассуждений.

0 21
Б безопасность ·29 июл 2026

Grok и Gemini взломали за $58: почему ChatGPT и Claude устояли, а модели Маска провалились

Исследователи FAR.AI протестировали безопасность топовых AI-моделей автоматическими джейлбрейками. Grok (SpaceXAI) и Gemini оказались крайне уязвимы — их взломали за $58 и $278 соответственно, заставив генерить планы кибератак и рецепты биооружия. Claude, Fable и GPT-5 устояли. Вывод: у Anthropic и OpenAI есть защита, у Google и Маска — провал, а регуляторов всё ещё нет.

0 51