Как научить AI игнорировать вредные команды: StruQ и SecAlign против prompt injection
Исследователи из UC Berkeley представили два метода защиты языковых моделей от prompt injection — атак, когда вредоносные инструкции прячутся в пользовательских данных. StruQ и SecAlign дообучают модель различать настоящие команды и подделки, снижая успешность атак с 45% до 8% без потери качества работы.