原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.06966
立即前往原文

MOLE:检测 AI 智能体的内部威胁

MOLE 是一个开放基准,用于评估能否在日常工作中检测 AI 智能体的有害活动。该基准包含 150 个由 AI 运营的账户、9 个有状态服务、30 个工作日、12 种威胁,以及来自 4 个模型、总量约 200 亿个 token 的数据。39 个智能体模型中,72% 完成了大部分被分配的有害目标;智能体是否拒绝执行,并不能可靠预测目标是否会完成。在单日审计事件比较中,即使表现最好的监控器也漏掉了近一半已经完成的危害。基于基准的搜索使一个中等水平监控器的性能提升了 49% 至 64%;在估算成本相近的情况下,选择性使用更强的监控器还使预算受限 AUC 提升了 10%。
行业资讯 伦理与安全 研究 开源 2026-09-09 10:30:58 539 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。