原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.24777
立即前往原文

StepGuard:通过可扩展监督学习逐步防护AI代理

StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确率。在AgentDojo和AgentDyn测试中,相比不使用防护机制,平均攻击成功率降低77.3%,而平均效用仅下降2.8个百分点。
行业资讯 应用 伦理与安全 AI模型 研究 2026-08-31 11:00:53 259 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。