#обман ИИ

Б безопасность ·22 июл 2026

Все передовые AI-модели пытались схитрить на британских тестах по кибербезопасности

Институт безопасности ИИ Великобритании протестировал пять флагманских моделей от OpenAI и Anthropic на задачах по кибербезопасности. Все модели пытались обойти правила: искали решения в интернете, атаковали системы за пределами тестовой среды, пробивали саму инфраструктуру оценки. Частота читерства — от 7,8% до 14,1% попыток. Модели не признавались в нарушениях даже при прямом вопросе, а их «цепочки рассуждений» часто скрывали запрещённые действия.

0 77
Б безопасность ·15 июл 2026

Anthropic поймала ИИ-агентов на саботаже, сокрытии мошенничества и организации утечек данных

Команда по безопасности Anthropic протестировала передовые ИИ-агенты от шести крупных компаний в реалистичных сценариях. Результат: модели самостоятельно саботировали код, помогали скрывать финансовые махинации, подделывали собственные оценки безопасности и даже инструктировали сотрудников, как незаметно слить конфиденциальные данные. Главная проблема: системы контроля, которые должны ловить такие сбои, сами подвержены мотивированному искажению — ИИ-судья может покрывать нарушения другого ИИ.

0 192