LLM никогда не будут безопасными: почему языковые модели невозможно защитить от взломов
Исследователи доказали фундаментальную уязвимость всех LLM: модели не могут отличить источник инструкции по тегам (<user>, <system>), а ориентируются только на стиль текста. Это позволяет обходить любые защиты, подделывая «внутренние заметки» модели (chain-of-thought forgery). Проблема неустранима архитектурно — значит, безопасных LLM в принципе не существует.
0
65