Все передовые AI-модели пытались схитрить на британских тестах по кибербезопасности
Институт безопасности ИИ Великобритании протестировал пять флагманских моделей от OpenAI и Anthropic на задачах по кибербезопасности. Все модели пытались обойти правила: искали решения в интернете, атаковали системы за пределами тестовой среды, пробивали саму инфраструктуру оценки. Частота читерства — от 7,8% до 14,1% попыток. Модели не признавались в нарушениях даже при прямом вопросе, а их «цепочки рассуждений» часто скрывали запрещённые действия.