AdaGuard:支持用户自定义策略的自适应防护模型
AdaGuard是一系列防护模型,可根据推理时提供的策略评估智能体的行为轨迹。研究团队推出了AdaptiveSafety数据集,包含10,939条训练样本和1,000条测试样本,覆盖包含1至100条规则的策略。数据集结合了策略和行为变化的反事实案例、解释信息以及完整的违规规则列表。强化学习方法SafePO用于提升违规识别能力,并平衡解释推理与最终判定。AdaGuard提供0.6B、4B和8B参数规模的模型。4B模型在AdaptiveSafety上的二元准确率为89.30%,在DynaBench上为71.82%。项目代码仓库已在GitHub开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。