Безопасность AI-агентов начинается на границе разрешений
Недавние исследования phone-use агентов показали, что безвредный результат работы — не гарантия безопасности системы. Когда агент может кликать, вводить текст и отправлять данные, ошибка модели превращается во внешние побочные эффекты. Главный вопрос не в том, откажется ли модель от опасного действия, а в том, что может сделать система, если модель не откажется.
Критично для enterprise-команд, внедряющих AI-агентов: статья объясняет, почему безопасность — это вопрос архитектуры разрешений, а не только качества модели, и как правильно оценивать риски при выборе между open-source и managed решениями.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Различие между неудачным выполнением интерфейса и сознательным отказом от вредного действия исчезает в метриках, но критично в production — по мере роста способностей моделей неспособность перестаёт быть средством контроля
- Фильтрация на уровне модели не решает проблемы архитектуры авторизации — если агенту уже даны разрешения на инструменты, основная проблема в контроле доступа, а не в prompt injection или RCE
- Open-source агенты дают контроль над кодом, но перекладывают ответственность за безопасность на команду; managed-сервисы предлагают централизованное управление, но требуют доверия к невидимым контролям
- Защита начинается с того, что каждое значимое действие агента имеет узкую идентификацию, видимое решение политики безопасности и восстанавливаемую границу
Елена Верещагина
Medium #artificial-intelligence
Читать оригинал
Комментарии