Вся опасность агента — в одном слое. Стройте защиту там
Автор утверждает, что безопасность AI-агентов нужно обеспечивать не улучшением промптов или обучения модели, а жёстким контролем на уровне выполнения tool calls — единственной точке, где текстовые решения модели превращаются в реальные действия. LLM может ошибаться или быть скомпрометирована prompt injection, но если слой исполнения инструментов написан правильно, никакие вредоносные команды не пройдут.
Практическое руководство для разработчиков AI-агентов, показывающее архитектурный подход к безопасности: вместо бесконечного улучшения промптов сосредоточиться на детерминированном слое выполнения инструментов. Особенно актуально для production-систем с доступом к критичным ресурсам.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- LLM — это чистая функция без побочных эффектов; реальные действия происходят только при вызове инструментов (tool calls), который контролируется обычным кодом
- Prompt injection неизбежна и вероятно неустранима, но её можно сделать безвредной: если модель скомпрометирована, но tool executor блокирует опасные вызовы, атака не имеет эффекта
- Правила безопасности из системного промпта — это пожелания, которые можно обойти; те же правила в коде tool executor — это гарантии
- Разделение ответственности: модель отвечает за суждения (judgment), граница инструментов — за enforcement; смешивание этих уровней — корневая ошибка в дизайне агентов
Комментарии