безопасность 1 мин

Как защитить AI-агентов и LLM-приложения в бою: фреймворк от Mend.io

Mend.io выпустили практический гайд по защите AI-агентов, MCP-серверов и LLM-приложений. Главное: традиционная безопасность приложений не работает с агентами — поведение определяется не только кодом, но и моделью, промптами и инструментами. Нужны новые подходы: от поиска теневых агентов до гвардрейлов в рантайме.

AI-агенты уже в проде у многих компаний, но традиционные инструменты безопасности их не видят. Этот фреймворк даёт конкретные шаги, чтобы не словить утечку данных или злоупотребление правами агента.

Что произошло

Mend.io опубликовали фреймворк для защиты AI-агентов и LLM-приложений в продакшене. Главный тезис: традиционная безопасность приложений (AppSec) построена на предсказуемости кода, но агенты ведут себя непредсказуемо — результат зависит от модели, промпта, контекста, пользовательского ввода и доступных инструментов.

Новые угрозы: prompt injection приходит через данные, а не код; агент с широкими правами может навредить без эксплуатации уязвимостей; отравленное описание инструмента на MCP-сервере меняет поведение агента без изменения кода. Эти проблемы не попадают в CVE-базы.

Гайд предлагает семь артефактов: карту атак по пяти слоям (взаимодействие, агент, интеграция, модель, код), AI-BOM с 9 полями на агента, чеклист из 12 пунктов по настройкам безопасности, правила автоматизации триажа, схему гвардрейлов (Python SDK или Docker API), дорожную карту зрелости и самооценку на 15 вопросов.

Основные практики: искать теневых агентов через сканирование репозиториев, мониторинг сетевого трафика и аудит API-ключей; использовать гвардрейлы для входящих (prompt injection, jailbreak) и исходящих (утечка PII, учётных данных) угроз; автоматизировать только те решения, где можно объяснить причину; ограничивать права агентов на уровне системы, а не только промптами.

Автор: Елена Верещагина · Источник: marktechpost.com

Разработчикам. Готовые артефакты для интеграции: Python SDK и Docker API Server для гвардрейлов, AI-BOM с расширенными полями, чеклист настроек безопасности. Можно встроить проверки прямо в CI/CD и защитить промпты версионированием.

Бизнесу. Снижает риски утечек данных и злоупотреблений агентами в проде. Помогает пройти аудиты по NIST AI RMF, OWASP AIMA, ISO 42001 и EU AI Act. Модель зрелости показывает, где бизнес по сравнению с индустрией.

Инвесторам. Рынок инструментов безопасности для AI растёт — традиционные решения не закрывают новые угрозы. Компании, которые строят гвардрейлы, AI-BOM и автоматизацию триажа для агентов, займут нишу раньше конкурентов.

Хайп35
Реальная польза70
Заработать65
  • Создать SaaS для автоматического поиска теневых агентов и MCP-серверов в корпоративных средах — сканирование репозиториев, мониторинг трафика, аудит ключей.
  • Разработать платформу для управления AI-BOM: регистрация агентов, отслеживание зависимостей моделей, мониторинг EOL версий и прав доступа.
  • Построить консалтинговый бизнес вокруг подготовки компаний к EU AI Act и NIST AI RMF — аудиты, внедрение фреймворков, обучение команд.
  • Запустить marketplace гвардрейлов и политик безопасности для популярных LLM-фреймворков (LangChain, LlamaIndex) — готовые модули для prompt injection, PII фильтрации.
  • Сделать red team-as-a-service для AI-агентов: непрерывное тестирование на проникновение, отчёты с рекомендациями по улучшению гвардрейлов.
  • Фреймворк от вендора (Mend.io) — может быть заточен под продвижение их продуктов, не факт, что универсален.
  • Избыточная бюрократия: 15-вопросные оценки и AI-BOM с 9 полями на агента могут замедлить разработку в небольших командах.
  • Автоматизация триажа без достаточного контроля может давать ложноотрицательные результаты — пропуск реальных угроз.
  • Гвардрейлы увеличивают латентность и стоимость запросов — нужно тестировать влияние на производительность.

Это первая попытка систематизировать безопасность агентов на практическом уровне — не абстрактные принципы, а чеклисты, артефакты, конкретные инструменты. Карта атак по пяти слоям и AI-BOM с расширенными полями — полезные штуки, которые можно внедрить завтра. Особенно ценно признание, что CVE и традиционные сканеры не видят prompt injection, отравленные описания инструментов и агентов с широкими правами.

Но это спонсированный материал от Mend.io — вендор продвигает свой подход и продукты. Гвардрейлы как Python SDK или Docker API — удобно, но нужно тестировать влияние на латентность и стоимость запросов. А 15-вопросная самооценка и AI-BOM с 9 полями могут превратиться в бюрократию, если команда маленькая. Главное — взять принципы (shift left + protect right, автоматизация только с доказательствами) и адаптировать под свой стек, не копируя слепо.

Ещё по теме

Комментарии