Безопасность AI-агентов начинается на границе разрешений
Недавние исследования phone-use агентов показали, что безвредный результат работы — не гарантия безопасности системы. Когда агент может кликать, вводить текст и отправлять данные, ошибка модели превращается во внешние побочные эффекты. Главный вопрос не в том, откажется ли модель от опасного действия, а в том, что может сделать система, если модель не откажется.
0
24