A.I.G. 评估 DeepSeek Harness 抵御间接提示注入的能力
一项研究使用 AI-Infra-Guard 评估 DeepSeek Harness(DSH)抵御间接提示注入攻击的能力。研究覆盖 16 个间接内容渠道、文本和文件载体、35 个攻击目标及 12 种攻击方法,共进行了 14,560 次受控执行。研究保留了 DSH 的智能体循环、工具注册、模型适配器和会话事件路径,并通过本地测试工具避免外部副作用。观察到的最高攻击成功率分别为:文本模式下的虚假完成攻击 17.0%,以及文件模式下的隐藏 Unicode 攻击 25.5%。研究分析了 DSH 对工具结果和策略钩子的处理方式,并建议在不受信任的内容与敏感操作之间增加控制措施。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。