безопасность 1 мин

Защита AI-моделей превратилась в головную боль для white-hat хакеров

Ограничения (guardrails) в AI-моделях OpenAI и Anthropic, призванные не дать злоумышленникам создавать кибероружие, теперь мешают работе легальных специалистов по безопасности. Исследователи жалуются, что модели отказываются помогать анализировать уязвимости и тестировать эксплойты — то есть делать то, ради чего их и используют защитники сетей.

Если AI-модели блокируют легальных исследователей, но злоумышленники легко обходят ограничения через open-source аналоги, guardrails превращаются в театр безопасности, который только мешает защитникам делать свою работу.

Guardrails стали проблемой для защитников

OpenAI и Anthropic месяцами внедряли строгие ограничения (guardrails) в свои модели, чтобы злоумышленники не могли использовать AI для создания кибероружия. Обе компании запустили специальные программы проверки для исследователей безопасности — Trusted Access for Cyber у OpenAI и Cyber Verification Program у Anthropic. Но на практике эти меры оказались палкой о двух концах.

«Молоток — это и инструмент, и оружие»

Крис Энли, главный учёный NCC Group, объясняет проблему просто: чтобы подтвердить, что найденная уязвимость реальна и опасна, нужно попросить AI попробовать её эксплуатировать. Но guardrails часто блокируют такие запросы, считая их вредоносными. «Это как молоток: без него дом не построишь, но это ещё и оружие», — говорит Энли.

Марк Дауд, известный исследователь zero-day уязвимостей, резко критикует подход: «Мне некомфортно, что случайные крупные компании произвольно решают, что безопасно в сфере безопасности, а что нет».

Как исследователи обходят проблему

Многие специалисты просто перешли на open-source модели без ограничений. Паоло Стагно из CrowdFense (компания, торгующая уязвимостями для спецслужб) использует frontier-модели только для reverse engineering, а для поиска багов и создания эксплойтов — локальные открытые модели, чтобы не сливать данные в облако.

Крис Томпсон из RemoteThreat отмечает ещё одну проблему: guardrails работают непоследовательно и меняются каждый день. Даже внутри vetted-программ приходится «договариваться с моделью», тратя время не на анализ уязвимостей, а на обход ограничений.

Не все видят проблему

Некоторые исследователи, как Джузеппе Кали, не используют AI для offensive-работы принципиально — только для вспомогательных задач вроде анализа кода. «Я ревную к своим багам и люблю эту игру слишком сильно, чтобы позволить моделям играть за меня», — говорит он.

Но для тех, кто хочет использовать AI на полную, текущие guardrails превратились из защиты в помеху.

Ключевые выводы

  • Guardrails в AI-моделях блокируют не только злоумышленников, но и легальных исследователей безопасности
  • Основная проблема: одни и те же действия (анализ уязвимостей, создание эксплойтов) нужны и для атаки, и для защиты — модели не различают контекст
  • Многие специалисты переходят на open-source модели без ограничений или используют frontier-модели только для неопасных задач
  • Даже внутри vetted-программ OpenAI и Anthropic guardrails работают непредсказуемо и меняются день ото дня
  • Компании фактически решают за индустрию безопасности, что можно делать с AI, а что нельзя — и не все согласны с этой логикой
AI безопасностьguardrailsoffensive securityzero-dayjailbreak

Автор: Сергей Ефимов · Источник: TechCrunch AI

Мнение редакции

Вот классическая ловушка: пытаясь защитить технологию от плохих парней, компании стреляют себе в ногу. Guardrails в AI-моделях — это как запретить слесарям покупать отмычки, потому что ими пользуются воры. Только вот воры давно ушли на китайские open-source модели без ограничений, а легальные исследователи безопасности застряли в бюрократии vetted-программ и непредсказуемых блокировках.

Особенно показательна история с моделями Mythos и Fable от Anthropic: их закрыли экспортным контролем после слухов о возможности обхода, потом вернули с ограничениями, создав вокруг этого целую драму. Но на практике guardrails часто просто глупые — модель отказывается помогать анализировать код или тестировать эксплойт, не понимая, что это делает исследователь для защиты, а не для атаки. В итоге компании типа NCC Group и CrowdFense тихо переходят на локальные модели, а frontier AI теряет аудиторию именно там, где мог бы быть полезен. Классика благих намерений.

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии