безопасность 1 мин

Полевые заметки #1 — Галлюцинации LLM

Исследователь безопасности описывает реальный случай тестирования LLM-системы: сначала он был уверен, что нашёл удалённое выполнение кода (RCE), но затем понял, что модель просто галлюцинирует правдоподобные, но полностью выдуманные результаты. Статья показывает, как недетерминированность LLM создаёт иллюзию успешной эксплуатации и почему нельзя доверять выводу модели без независимой проверки.

Обязательно для специалистов по безопасности и разработчиков AI-систем: показывает, как традиционные методы пентеста не работают с LLM, и предлагает практические техники различения реальных уязвимостей от галлюцинаций при тестировании.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • LLM могут галлюцинировать не только факты, но и результаты выполнения несуществующих инструментов — модель выдала три разных версии /etc/passwd, ни одна из которых не была реальной
  • Недетерминированность LLM работает в обе стороны: помогает обнаружить фейковые результаты (разные ответы на один запрос) и позволяет добиться срабатывания инъекции повторными попытками
  • Crescendo-атака — постепенная многоходовая эскалация, основанная на склонности LLM следовать паттернам и обращать внимание на недавний контекст, особенно сгенерированный самой моделью
  • Для проверки реальности выполнения кода автор предлагает криптографический тест: попросить модель вычислить хеш случайной строки и сравнить с локально вычисленным
безопасностьгаллюцинацииprompt-injectioncrescendo-атакатестирование-на-проникновение
Сергей Ефимов Medium #llm
Читать оригинал

Ещё по теме

Комментарии