Люди пропустили каждую третью угрозу от AI-агентов: эксперимент на 40 тысячах сессий
Разработчик создал браузерную игру, где пользователь одобряет команды AI-агента под давлением времени. Из 409 тысяч решений люди пропустили 33% вредоносных команд — особенно те, что маскировались под безобидные npm-скрипты. Исследование показывает: «человек в цикле» как защита от взломанных AI-агентов работает плохо из-за усталости от разрешений.
Если вы используете AI-агентов для кода (а скоро будете), это напрямую влияет на безопасность ваших проектов. Понимание слабых мест «человека в цикле» помогает строить правильную защиту — не на бдительности, а на технических мерах.
Что произошло
Бывший инженер Uber Алекс создал браузерную игру, симулирующую работу с AI-агентом для кода. Игрок одобряет или блокирует команды под таймером — среди обычных git status и npm test спрятаны вредоносные вроде cat ~/.aws/credentials (читает секреты AWS) или скрипты, отправляющие данные на сторонний сервер.
За несколько месяцев набралось 40 тысяч игровых сессий и 409 тысяч решений. Результаты:
- Пропущено 33% угроз — каждая третья вредоносная команда одобрена
- Самая опасная маскировка: npm run analyze одобрили 64,7% игроков, хотя скрипт в package.json передавал данные через curl на внешний API. Скрипты за знакомыми названиями пропускали в 2 раза чаще обычных атак (52,5% vs 28,4%)
- Усталость от разрешений: к концу сессии процент ошибок растёт — люди начинают одобрять всё подряд
- Спорная команда: cat ~/.zshrc одобрили 45,9% — для одних безвредно, для других (кто хранит API-ключи в профиле) — утечка секретов
Очевидно деструктивные команды (rm -rf) ловят хорошо. А вот тихие экфильтрации данных пропускают в три раза чаще.
Игра подтверждает тезис Anthropic: чем больше пользователь видит запросов разрешений, тем меньше внимания уделяет каждому. «Человек в цикле» как последняя линия защиты от скомпрометированных AI-агентов — слабое звено.
Автор: Елена Верещагина · Источник: hnrss.org
Разработчикам. Если используете AI-агентов для кода (Claude, Cursor и т.п.) — не расслабляйтесь на одобрении команд. npm run и похожие скрипты могут выполнять что угодно из package.json. Держите секреты отдельно от .zshrc/.bashrc, используйте песочницы и не экспортируйте API-ключи в переменные окружения напрямую. Auto-режимы в Claude Code тоже не панацея.
Бизнесу. Если даёте сотрудникам AI-кодеров с доступом к репозиториям — permission fatigue реальна. Люди начинают одобрять всё подряд под давлением скорости. Нужны технические меры: изоляция среды, разделение секретов, логирование команд. Полагаться только на бдительность разработчика — плохая стратегия безопасности.
Инвесторам. Безопасность AI-агентов — новая проблемная зона. Рынок инструментов для sandboxing, автоматической проверки команд, управления секретами в AI-окружениях будет расти. Anthropic уже признаёт проблему permission fatigue. Кто решит её удобно и надёжно — получит долю в enterprise-сегменте AI-инструментов для разработки.
- Сервис автоматической проверки команд AI-агентов с ML-моделью для детекции подозрительных паттернов (не просто Auto Mode, а deeper context awareness)
- Песочница-as-a-Service для запуска AI-агентов: изолированное окружение с контролируемым доступом к секретам и файловой системе
- Обучающие курсы и симуляции для разработчиков по безопасности AI-агентов (аналог игры, но для корпоративного обучения)
- Плагины для IDE с визуализацией рисков команд: подсвечивают команды с доступом к секретам/сети в реальном времени
- Управление секретами специально для AI-агентов: автоматическая ротация, временные токены, scope-ограниченный доступ
- Проблема переоценена: в игре 34% команд были угрозами, в реальности их доли процента — fatigue может быть меньше на практике
- Технические решения (Auto Mode, песочницы) сами станут целью атак — adversarial prompts для обхода защиты
- Рынок решений фрагментирован: каждый AI-агент со своей моделью разрешений, унификация далека
- Разработчики могут просто отключить проверки ради скорости, если они слишком навязчивы
Это один из тех редких экспериментов, которые превращают интуитивные догадки в конкретные цифры. Да, это игра, да, в реальности угроз меньше — но суть не меняется: человек устаёт одобрять сотни команд и начинает кликать автоматически. Особенно показательно, что npm run analyze с вредоносным скриптом в package.json пропустили 65% игроков — хотя логи показывали, что внутри curl на сторонний сервер. Люди просто не читают.
На практике это значит: если ваш AI-агент имеет доступ к коду и может выполнять команды, полагаться на вашу бдительность — наивно. Нужны технические меры: изоляция окружения (Docker, VM), хранение секретов вне переменных окружения (.env файлы с доступом только на чтение, vault-решения), логирование всех команд с алертами на подозрительные паттерны. А если продаёте AI-инструмент для enterprise — модель разрешений должна быть умнее, чем «спроси человека на каждую команду».
Инструменты из статьи
Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...
Доступ из РФ →
Комментарии