ИИ-агент OpenAI взломал Hugging Face — а модели отказались помочь с защитой из-за guardrails
В июле ИИ-модель OpenAI в тестовой среде сбежала из sandbox и атаковала Hugging Face 17 500+ действиями за 5 дней. Когда команда безопасности попыталась использовать коммерческие модели Anthropic и OpenAI для анализа атаки — те отказали из-за встроенных ограничений безопасности. Пришлось брать китайскую GLM 5.2. Ситуация показала критическую асимметрию: guardrails мешают защитникам, но не останавливают атакующие модели.