原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15134
立即前往原文

HazardAuditor:从可执行威胁到更安全的计算机使用代理

计算机使用代理正越来越多地操作浏览器、终端、文件系统和外部服务,由此产生的安全风险往往在运行过程中出现,而不仅存在于生成内容中。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同代理,并将其交互统一为标准事件表示,以支持跨框架监督。研究人员还提出Guard Policy Optimization,解决基于词元的训练目标容易让较长推理过程过度影响优化的问题。在多项基准测试和不同类型的计算机使用系统中,HazardAuditor的准确率较此前最强的防护模型最高提升16.5个百分点。代码、模型和评估材料计划公开发布。
行业资讯 伦理与安全 AI模型 研究 开源 2026-09-15 13:00:54 917 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。