原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.29429
立即前往原文

直接问 Jev:通过校准决策强化学习零样本检测 AI 对齐失效

一项研究评估了经过校准决策强化学习训练的模型 Jev,能否检测语言模型的对齐失效。研究团队推出 RLCDAlignBench,涵盖 10 类失效、44 项基准测试和 5 个目标模型。仅使用一个通用问题,零样本中位数 AUROC 即达到 0.886,并在多数基准测试中超过监督式基线。Jev 与参考评分器在人工标注上的一致程度相当,也揭示了部分现有基准的缺陷。研究称,其成本比基于 LLM 评审的评分低 63 倍。
行业资讯 伦理与安全 AI模型 研究 2026-09-28 05:31:00 615 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。