Учёные научились восстанавливать промпты LLM по тексту ответа с почти 100% точностью
Исследователи из IIT Bombay и Adobe Research создали метод Previous-Token Prediction (PTP), который по выходному тексту LLM восстанавливает исходный промпт — без доступа к весам модели. Работает даже на чужих моделях вроде GPT-4o. Это огромная брешь в безопасности: можно извлечь системные промпты компаний, персональные запросы пользователей и коммерческие секреты.
Если ваш бизнес или продукт завязан на LLM, эта уязвимость может обнулить конкурентное преимущество или привести к утечке конфиденциальных данных. Время действовать — до того, как методика станет инструментом массовых атак.
Что произошло

Исследователи IIT Bombay и Adobe Research представили метод Previous-Token Prediction (PTP), который переворачивает логику работы LLM: вместо предсказания следующего токена обратная модель предсказывает предыдущие. Обучается она с нуля на синтетических данных целевой модели — нужен только выходной текст, веса модели не требуются.
Пример из статьи: промпт «How to reach out to competitors to find their pricing strategies?» восстановлен слово в слово. Плюс модель сгенерировала 6 вариаций с тем же смыслом, но другими формулировками.

Самое опасное: обратная модель, натренированная на крошечной Qwen-3-0.6B, смогла реконструировать промпты GPT-4o. То есть атакующему не обязательно знать, какая модель создала текст — достаточно небольшой открытой обратной модели.
Где уязвимость
Компании рискуют утечкой системных промптов: правила модерации, инструкции для агентов, секреты продукта. Пользователи — утечкой личных запросов: медицинские консультации, финансы, конфиденциальная переписка. Если метод работает на продакшен-моделях, AI-лабораториям придётся экстренно латать.
Автор: Сергей Ефимов · Источник: the-decoder.com
Разработчикам. Новая угроза для API и чат-ботов: любой вывод модели потенциально открывает исходный промпт. Нужно срочно пересматривать архитектуру системных инструкций, вводить обфускацию промптов и мониторинг утечек. Обратные модели теперь реальный инструмент атаки.
Бизнесу. Если ваш продукт опирается на кастомные системные промпты (например, AI-агент с уникальной логикой), конкуренты могут их восстановить через обычные запросы. Критично для SaaS с AI-ядром, чат-ботов поддержки и любых сервисов, где промпт — это конкурентное преимущество. Нужны юридические и технические меры защиты.
Инвесторам. Сектор AI-безопасности получит новый драйвер роста: спрос на prompt obfuscation, watermarking, monitoring утечек. Компании с открытыми API и встроенными LLM (OpenAI, Anthropic, Microsoft) под давлением — потребуются патчи и новые протоколы. Возможен рост интереса к on-premise решениям и федеративному обучению.
- Разработка SaaS-инструментов для обфускации и шифрования промптов перед отправкой в API (prompt firewall)
- Консалтинг по аудиту AI-систем на утечку промптов: проверка уязвимости корпоративных чат-ботов и агентов
- Платформа для мониторинга и детектирования попыток реконструкции промптов в логах API
- On-premise AI-решения с акцентом на безопасность для финансов, здравоохранения, юриспруденции
- Open-source библиотеки для watermarking и fingerprinting промптов — монетизация через enterprise-версии
- Метод пока работает только в исследовательских условиях, на production-моделях с дополнительными защитами может быть менее эффективным
- AI-лаборатории могут быстро внедрить контрмеры (например, добавление шума в вывод или изменение токенизации), что обесценит атаки
- Паника вокруг темы может привести к overengineering безопасности и ненужным затратам на защиту там, где реальной угрозы нет
- Юридические последствия использования обратных моделей для атак пока не ясны, но регуляторы могут приравнять это к взлому
Это не теоретическая угроза, а реальная брешь, которую можно эксплуатировать уже сейчас. Если у тебя в продукте зашиты уникальные системные промпты или пользователи доверяют тебе чувствительные запросы — пора всерьёз задуматься о защите. Обфускация, мониторинг, on-premise варианты — всё это из разряда «хорошо бы» переходит в «срочно надо».
Но и паниковать рано: метод работает в лаборатории, на боевых системах с защитой может быть слабее. Вопрос в том, как быстро AI-компании среагируют. Если OpenAI, Anthropic и остальные внедрят контрмеры в ближайшие недели — окей. Если затянут — увидим первые громкие утечки корпоративных промптов. В любом случае, тема AI-безопасности только что стала горячее.
Комментарии