原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34241
立即前往原文

AdaGuard:支持用户自定义策略的自适应防护模型

AdaGuard是一系列防护模型,可根据推理时提供的策略评估智能体的行为轨迹。研究团队推出了AdaptiveSafety数据集,包含10,939条训练样本和1,000条测试样本,覆盖包含1至100条规则的策略。数据集结合了策略和行为变化的反事实案例、解释信息以及完整的违规规则列表。强化学习方法SafePO用于提升违规识别能力,并平衡解释推理与最终判定。AdaGuard提供0.6B、4B和8B参数规模的模型。4B模型在AdaptiveSafety上的二元准确率为89.30%,在DynaBench上为71.82%。项目代码仓库已在GitHub开源。
行业资讯 应用 伦理与安全 AI模型 研究 开源 2026-09-29 12:30:59 921 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。