原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.02824
立即前往原文

MetaRubric:为基于评分标准的强化学习学习奖励

基于评分标准的强化学习按单项要求评估开放式回答,但评审有时会在回答缺少所需信息时仍然给分。研究团队将这一问题称为“空洞给分”,它甚至可能反转回答在 GRPO 中的优势。MetaRubric 只在回答提供充分证据时才给分,并利用当前策略生成的回答及反事实任务变体调整评分标准。在多个基础模型上,与使用静态评审的 GRPO 相比,MetaRubric 将 PubMedQA 准确率提高了 6.00 至 20.40 个百分点。研究还报告称,该方法在 HealthBench-Hard 和两个多模态医疗基准测试上也取得了提升。
行业资讯 研究 2026-10-05 11:01:01 923 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。