安全措施奏效了。LLM 系统真的更安全吗?
一项研究考察了已部署 LLM 服务中的安全措施是否真正提升了整个系统的安全性。拒答率、攻击成功率和政策违规率等常见指标,只能说明控制措施在受测试请求上的表现,并不能反映攻击者在调整方法或寻找其他入口后,仍能获得多少有害任务帮助。研究使用统一的部署层面标准比较不同类型的安全措施。一次成功的攻击就足以证明有害帮助仍然存在;但较高的局部评测分数,并不能证明剩余的有害帮助很少。要得出这一结论,还需要了解安全措施执行后周边系统仍允许什么,而相关证据在大多数被分析的论断中都很有限。研究因此指出,安全研究不应止步于提高局部指标,而应根据其是否真正提升已部署系统的安全性来评估改进效果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。