Учёные научились восстанавливать промпты LLM по тексту ответа с почти 100% точностью
Исследователи из IIT Bombay и Adobe Research создали метод Previous-Token Prediction (PTP), который по выходному тексту LLM восстанавливает исходный промпт — без доступа к весам модели. Работает даже на чужих моделях вроде GPT-4o. Это огромная брешь в безопасности: можно извлечь системные промпты компаний, персональные запросы пользователей и коммерческие секреты.
0
90