原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32400
立即前往原文

SkillDRE 通过执行前与运行时反馈演化智能体技能

SkillDRE 是一个用于自动演化 AI 智能体恶意技能包的框架。它将执行前的扫描器引导优化,与在防御机制下根据执行结果进行的运行时改进结合起来。每次修改都会重新扫描并执行,从而形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 的平均攻击成功率达到 45.28%,比最强基线高 40.3%。最终提交的技能未被 SkillScan 检出,同时基本保持了良性任务性能。研究表明,如果孤立评估执行前扫描或运行时防御,可能会忽视两者交互产生的攻击能力。代码已在 GitHub 上提供。
行业资讯 伦理与安全 研究 开源 2026-09-29 13:31:02 924 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。