HarnessRisk:面向生命周期的智能体运行框架安全基准
HarnessRisk是一项评估AI智能体安全性的基准,覆盖运行框架配置、能力扩展、运行时操作、状态持久化、行动控制和事件恢复六个阶段。该基准包含128个沙盒案例,将合法用户目标与嵌入不受信任工作流工件中的对抗性指令配对。在三个运行框架、六个语言模型和14种配置上的测试显示,攻击成功率为12.6%至80.9%,实用性为75.0%至97.6%。在所有运行框架中,配置阶段最脆弱。研究还发现,模型即使能够识别风险,也不一定会采取安全行动。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。