StepGuard:通过可扩展监督学习逐步防护AI代理
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确率。在AgentDojo和AgentDyn测试中,相比不使用防护机制,平均攻击成功率降低77.3%,而平均效用仅下降2.8个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。