直接问 Jev:通过校准决策强化学习零样本检测 AI 对齐失效
一项研究评估了经过校准决策强化学习训练的模型 Jev,能否检测语言模型的对齐失效。研究团队推出 RLCDAlignBench,涵盖 10 类失效、44 项基准测试和 5 个目标模型。仅使用一个通用问题,零样本中位数 AUROC 即达到 0.886,并在多数基准测试中超过监督式基线。Jev 与参考评分器在人工标注上的一致程度相当,也揭示了部分现有基准的缺陷。研究称,其成本比基于 LLM 评审的评分低 63 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。