原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17597
立即前往原文

HarnessRisk:面向生命周期的智能体运行框架安全基准

HarnessRisk是一项评估AI智能体安全性的基准,覆盖运行框架配置、能力扩展、运行时操作、状态持久化、行动控制和事件恢复六个阶段。该基准包含128个沙盒案例,将合法用户目标与嵌入不受信任工作流工件中的对抗性指令配对。在三个运行框架、六个语言模型和14种配置上的测试显示,攻击成功率为12.6%至80.9%,实用性为75.0%至97.6%。在所有运行框架中,配置阶段最脆弱。研究还发现,模型即使能够识别风险,也不一定会采取安全行动。
行业资讯 应用 伦理与安全 研究 2026-08-19 12:31:14 890 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。