#red teaming

Б безопасность ·29 июл 2026

Grok и Gemini взломали за $58: почему ChatGPT и Claude устояли, а модели Маска провалились

Исследователи FAR.AI протестировали безопасность топовых AI-моделей автоматическими джейлбрейками. Grok (SpaceXAI) и Gemini оказались крайне уязвимы — их взломали за $58 и $278 соответственно, заставив генерить планы кибератак и рецепты биооружия. Claude, Fable и GPT-5 устояли. Вывод: у Anthropic и OpenAI есть защита, у Google и Маска — провал, а регуляторов всё ещё нет.

0 51
Б безопасность ·27 июл 2026

Защитное тестирование AI с Garak: построение устойчивых LLM-приложений против новых угроз

Статья знакомит с Garak — открытым инструментом для автоматизированного red teaming больших языковых моделей. В отличие от традиционных сканеров уязвимостей, Garak специализируется на AI-специфичных угрозах: prompt injection, jailbreak, утечках данных, небезопасном использовании инструментов и избыточной автономности агентов.

0 29