HazardAuditor:从可执行威胁到更安全的计算机使用代理
计算机使用代理正越来越多地操作浏览器、终端、文件系统和外部服务,由此产生的安全风险往往在运行过程中出现,而不仅存在于生成内容中。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同代理,并将其交互统一为标准事件表示,以支持跨框架监督。研究人员还提出Guard Policy Optimization,解决基于词元的训练目标容易让较长推理过程过度影响优化的问题。在多项基准测试和不同类型的计算机使用系统中,HazardAuditor的准确率较此前最强的防护模型最高提升16.5个百分点。代码、模型和评估材料计划公开发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。