Grok и Gemini взломали за $58: почему ChatGPT и Claude устояли, а модели Маска провалились
Исследователи FAR.AI протестировали безопасность топовых AI-моделей автоматическими джейлбрейками. Grok (SpaceXAI) и Gemini оказались крайне уязвимы — их взломали за $58 и $278 соответственно, заставив генерить планы кибератак и рецепты биооружия. Claude, Fable и GPT-5 устояли. Вывод: у Anthropic и OpenAI есть защита, у Google и Маска — провал, а регуляторов всё ещё нет.
Если вы строите продукт на AI или инвестируете в эту сферу, безопасность перестала быть опциональной. Регуляторы и клиенты требуют защиты, а рынок уже разделился на тех, кто готов, и тех, кто нет.
Что произошло

Калифорнийская некоммерческая организация FAR.AI выпустила отчёт о тестировании безопасности флагманских AI-моделей: Claude Opus 4.8 и Fable 5 (Anthropic), GPT-5.5 и 5.6 (OpenAI), Gemini 3.1 Pro (Google) и Grok 4.3/4.5 (SpaceXAI).
Исследователи запустили автоматический инструмент, генерирующий тысячи вариантов вредоносных промптов — от планов кибератак до рецептов биологического оружия. Результат: Grok провалился с 448 успешными джейлбрейками, Gemini — с 249. Claude, Fable и GPT устояли.
Самое пугающее — цена взлома. Автоматизированная атака на Grok обошлась в $58, на Gemini — в $278. Это дешевле, чем ужин в приличном ресторане.
Глава FAR.AI Адам Глив жёстко подытожил: «AI-модели сейчас регулируются меньше, чем рестораны. Разговоры о добровольных обязательствах компаний — это чушь».
Google DeepMind отбился формальным комментарием про «многоуровневую защиту», Anthropic — про «постоянное улучшение». Но факт остаётся фактом: у одних компаний защита работает, у других — нет, а федеральных стандартов безопасности в США до сих пор не существует.
В июне администрация Трампа временно заблокировала Fable 5 и Mythos 5 из-за рисков нацбезопасности. OpenAI и Anthropic просили отложить релизы новых моделей из-за киберугроз. Но это разовые меры, а не системный подход.
Автор: Сергей Ефимов · Источник: wired.com
Разработчикам. Теперь понятно, что защита от джейлбрейков — не опциональная фича, а обязательный компонент архитектуры. Если ваш продукт интегрирует AI, проверьте, какую модель используете: Claude и GPT показали устойчивость, Grok и Gemini — дыры размером с ворота. Плюс появился инструмент для автоматического тестирования безопасности — можно взять на вооружение для собственных моделей.
Бизнесу. Если ваш бизнес завязан на AI-инфраструктуре, выбор модели теперь — вопрос не только производительности, но и безопасности. Google и SpaceXAI показали слабость в защите, что создаёт юридические и репутационные риски. Скоро Иллинойс обяжет проводить независимые аудиты безопасности — это станет стандартом. Кто не готов — проиграет.
Инвесторам. Рынок AI-безопасности взлетит. FAR.AI показали, что третьесторонние инструменты для тестирования моделей — это не фантазия, а необходимость. Anthropic и OpenAI уже вложились в защиту и показывают результат. Google и Маск отстают — это или сигнал к снижению оценок, или возможность для стартапов, которые закроют эту дыру.
- Создать SaaS для автоматического тестирования безопасности AI-моделей — аналог FAR.AI для корпоративного сегмента
- Консалтинг по выбору безопасных AI-моделей для финтеха, медтеха и крит. инфраструктуры — сейчас компании выбирают вслепую
- Разработать middleware-слой для существующих моделей, который фильтрует вредоносные промпты до того, как они дойдут до модели
- Подготовка к обязательным аудитам: сервисы для документирования и сертификации AI-систем под новые законы штатов
- Инвестиции в стартапы, которые делают open-source инструменты для red teaming и пентестинга AI
- Результаты FAR.AI покрывают только простые автоматические джейлбрейки — сложные атаки могут вскрыть уязвимости даже в Claude и GPT
- Регуляторный хаос: законы принимаются на уровне штатов, федеральных стандартов нет — рынок живёт в неопределённости
- Google и SpaceXAI могут быстро залатать дыры — тогда этот отчёт станет историческим артефактом, а не аргументом против них
- Хайп вокруг биооружия и кибератак может быть раздут: реальные кейсы использования AI для терактов (Боко Харам) единичны и малодетализированы
Это первое по-настоящему серьёзное сравнительное исследование безопасности топовых моделей, и оно раскалывает индустрию пополам. С одной стороны — Anthropic и OpenAI, которые вложились в защиту и показывают результат. С другой — Google и Маск, которые либо недооценили риски, либо решили сэкономить. И вот вам результат: автоматический взлом за цену доставки еды.
Что важно: это не теоретическая угроза. Есть документированные случаи использования ChatGPT и других моделей террористическими группировками. Это реальность. И пока федеральное правительство США топчется на месте, штаты вводят обязательные аудиты. Для стартапов и консалтинговых компаний это золотая жила — рынок AI-безопасности только формируется, а спрос уже есть. Кто первым займёт нишу тестирования и сертификации, тот и заработает.
Инструменты из статьи
Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.
Доступ из РФ →
Комментарии