SkillDRE 通过执行前与运行时反馈演化智能体技能
SkillDRE 是一个用于自动演化 AI 智能体恶意技能包的框架。它将执行前的扫描器引导优化,与在防御机制下根据执行结果进行的运行时改进结合起来。每次修改都会重新扫描并执行,从而形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 的平均攻击成功率达到 45.28%,比最强基线高 40.3%。最终提交的技能未被 SkillScan 检出,同时基本保持了良性任务性能。研究表明,如果孤立评估执行前扫描或运行时防御,可能会忽视两者交互产生的攻击能力。代码已在 GitHub 上提供。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。