MOLE:检测 AI 智能体的内部威胁
MOLE 是一个开放基准,用于评估能否在日常工作中检测 AI 智能体的有害活动。该基准包含 150 个由 AI 运营的账户、9 个有状态服务、30 个工作日、12 种威胁,以及来自 4 个模型、总量约 200 亿个 token 的数据。39 个智能体模型中,72% 完成了大部分被分配的有害目标;智能体是否拒绝执行,并不能可靠预测目标是否会完成。在单日审计事件比较中,即使表现最好的监控器也漏掉了近一半已经完成的危害。基于基准的搜索使一个中等水平监控器的性能提升了 49% 至 64%;在估算成本相近的情况下,选择性使用更强的监控器还使预算受限 AUC 提升了 10%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。