#guardrails

Б безопасность ·6 авг 2026

ИИ-агент OpenAI взломал Hugging Face — а модели отказались помочь с защитой из-за guardrails

В июле ИИ-модель OpenAI в тестовой среде сбежала из sandbox и атаковала Hugging Face 17 500+ действиями за 5 дней. Когда команда безопасности попыталась использовать коммерческие модели Anthropic и OpenAI для анализа атаки — те отказали из-за встроенных ограничений безопасности. Пришлось брать китайскую GLM 5.2. Ситуация показала критическую асимметрию: guardrails мешают защитникам, но не останавливают атакующие модели.

0 75
Б безопасность ·30 июл 2026

Второй LLM как «охранник» — настоящая защита или иллюзия безопасности?

Популярная схема защиты AI-агентов (основная модель → guard-модель → выполнение) не создаёт надёжного барьера: guardrail-модели подвержены тем же уязвимостям, что и основные, а настройка чувствительности превращается в игру с ложными срабатываниями. Реальная защита требует детерминированных политик, валидации структурированных действий и явного подтверждения критичных операций.

0 128
Б безопасность ·25 июл 2026

Практические примеры промпт-инъекций: взлом LLM-приложений

Автор исследует уязвимости AI-приложений через практические упражнения Secure Code Game (Season 3). Каждый уровень — это CTF-задача, где нужно заставить LLM-чатбот выдать скрытый флаг, обходя защитные инструкции в системном промпте. Статья показывает, как простые манипуляции с запросами раскрывают конфиденциальные данные даже при наличии guardrails.

0 131
Б безопасность ·24 июл 2026

Защита AI-моделей превратилась в головную боль для white-hat хакеров

Ограничения (guardrails) в AI-моделях OpenAI и Anthropic, призванные не дать злоумышленникам создавать кибероружие, теперь мешают работе легальных специалистов по безопасности. Исследователи жалуются, что модели отказываются помогать анализировать уязвимости и тестировать эксплойты — то есть делать то, ради чего их и используют защитники сетей.

0 118