原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.16816
立即前往原文

ImpossibleRubrics:对生成式评分标准作为奖励信号进行压力测试

这项研究考察语言模型生成的评分标准究竟会奖励诚实回答,还是会被对抗性回答利用。ImpossibleRubrics包含169个涵盖六类“不可能性”的任务,每项任务都配有可验证的证书,规定诚实回答可以提出哪些主张,另有48个可回答的对照任务。在11个评分标准生成器中,违反证书的回答在无偏评测集上有8%至26%的概率获得奖励,在有针对性的压力测试集上最高达到36%。一条要求果断作答、惩罚含糊其辞的通用评分标准,甚至有64%的概率被利用。结果表明,问题不只是评分标准含糊,而是它们精确地奖励了错误的主张。
行业资讯 伦理与安全 研究 2026-09-16 20:00:57 601 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。