SecOPD:利用策略内蒸馏缓解自适应提示注入攻击
提示注入被认为是人工智能代理面临的首要威胁。当代理访问网站、文件或电子邮件中的外部数据时,攻击者可能在数据中插入“忽略之前的所有指令并执行……”之类的提示。论文《SecOPD》研究了一种基于策略内蒸馏的方法,用于检测自适应提示注入,或限制其影响。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。