безопасность 1 мин

Grok и Gemini взломали за $58: почему ChatGPT и Claude устояли, а модели Маска провалились

Исследователи FAR.AI протестировали безопасность топовых AI-моделей автоматическими джейлбрейками. Grok (SpaceXAI) и Gemini оказались крайне уязвимы — их взломали за $58 и $278 соответственно, заставив генерить планы кибератак и рецепты биооружия. Claude, Fable и GPT-5 устояли. Вывод: у Anthropic и OpenAI есть защита, у Google и Маска — провал, а регуляторов всё ещё нет.

Если вы строите продукт на AI или инвестируете в эту сферу, безопасность перестала быть опциональной. Регуляторы и клиенты требуют защиты, а рынок уже разделился на тех, кто готов, и тех, кто нет.

Что произошло

Калифорнийская некоммерческая организация FAR.AI выпустила отчёт о тестировании безопасности флагманских AI-моделей: Claude Opus 4.8 и Fable 5 (Anthropic), GPT-5.5 и 5.6 (OpenAI), Gemini 3.1 Pro (Google) и Grok 4.3/4.5 (SpaceXAI).

Исследователи запустили автоматический инструмент, генерирующий тысячи вариантов вредоносных промптов — от планов кибератак до рецептов биологического оружия. Результат: Grok провалился с 448 успешными джейлбрейками, Gemini — с 249. Claude, Fable и GPT устояли.

Самое пугающее — цена взлома. Автоматизированная атака на Grok обошлась в $58, на Gemini — в $278. Это дешевле, чем ужин в приличном ресторане.

Глава FAR.AI Адам Глив жёстко подытожил: «AI-модели сейчас регулируются меньше, чем рестораны. Разговоры о добровольных обязательствах компаний — это чушь».

Google DeepMind отбился формальным комментарием про «многоуровневую защиту», Anthropic — про «постоянное улучшение». Но факт остаётся фактом: у одних компаний защита работает, у других — нет, а федеральных стандартов безопасности в США до сих пор не существует.

В июне администрация Трампа временно заблокировала Fable 5 и Mythos 5 из-за рисков нацбезопасности. OpenAI и Anthropic просили отложить релизы новых моделей из-за киберугроз. Но это разовые меры, а не системный подход.

Автор: Сергей Ефимов · Источник: wired.com

Разработчикам. Теперь понятно, что защита от джейлбрейков — не опциональная фича, а обязательный компонент архитектуры. Если ваш продукт интегрирует AI, проверьте, какую модель используете: Claude и GPT показали устойчивость, Grok и Gemini — дыры размером с ворота. Плюс появился инструмент для автоматического тестирования безопасности — можно взять на вооружение для собственных моделей.

Бизнесу. Если ваш бизнес завязан на AI-инфраструктуре, выбор модели теперь — вопрос не только производительности, но и безопасности. Google и SpaceXAI показали слабость в защите, что создаёт юридические и репутационные риски. Скоро Иллинойс обяжет проводить независимые аудиты безопасности — это станет стандартом. Кто не готов — проиграет.

Инвесторам. Рынок AI-безопасности взлетит. FAR.AI показали, что третьесторонние инструменты для тестирования моделей — это не фантазия, а необходимость. Anthropic и OpenAI уже вложились в защиту и показывают результат. Google и Маск отстают — это или сигнал к снижению оценок, или возможность для стартапов, которые закроют эту дыру.

Хайп30
Реальная польза75
Заработать80
  • Создать SaaS для автоматического тестирования безопасности AI-моделей — аналог FAR.AI для корпоративного сегмента
  • Консалтинг по выбору безопасных AI-моделей для финтеха, медтеха и крит. инфраструктуры — сейчас компании выбирают вслепую
  • Разработать middleware-слой для существующих моделей, который фильтрует вредоносные промпты до того, как они дойдут до модели
  • Подготовка к обязательным аудитам: сервисы для документирования и сертификации AI-систем под новые законы штатов
  • Инвестиции в стартапы, которые делают open-source инструменты для red teaming и пентестинга AI
  • Результаты FAR.AI покрывают только простые автоматические джейлбрейки — сложные атаки могут вскрыть уязвимости даже в Claude и GPT
  • Регуляторный хаос: законы принимаются на уровне штатов, федеральных стандартов нет — рынок живёт в неопределённости
  • Google и SpaceXAI могут быстро залатать дыры — тогда этот отчёт станет историческим артефактом, а не аргументом против них
  • Хайп вокруг биооружия и кибератак может быть раздут: реальные кейсы использования AI для терактов (Боко Харам) единичны и малодетализированы

Это первое по-настоящему серьёзное сравнительное исследование безопасности топовых моделей, и оно раскалывает индустрию пополам. С одной стороны — Anthropic и OpenAI, которые вложились в защиту и показывают результат. С другой — Google и Маск, которые либо недооценили риски, либо решили сэкономить. И вот вам результат: автоматический взлом за цену доставки еды.

Что важно: это не теоретическая угроза. Есть документированные случаи использования ChatGPT и других моделей террористическими группировками. Это реальность. И пока федеральное правительство США топчется на месте, штаты вводят обязательные аудиты. Для стартапов и консалтинговых компаний это золотая жила — рынок AI-безопасности только формируется, а спрос уже есть. Кто первым займёт нишу тестирования и сертификации, тот и заработает.

Инструменты из статьи

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →
DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии