原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.16072
立即前往原文

学习尚未掌握的内容,而非已经掌握的内容:用于多奖励策略优化的饱和感知优势重加权

该研究提出 SA-MRPO,用于具有多个奖励目标的语言模型后训练。不同于采用固定权重的方法,SA-MRPO 分别标准化各个奖励目标,并根据目标的饱和程度,动态降低已经基本达成目标的贡献。这使优化资源转向更困难、仍有提升空间的目标。在数学推理、自适应推理和编程基准测试中,SA-MRPO 在多种设置下优于 GDPO:AIME24 提升最高达 5%,自适应推理平均提升 3.8%,AMC23 最高提升 9.2%,编程通过率最高提升 2.3%,同时保持较容易目标的性能。
行业资讯 AI模型 研究 2026-08-18 14:31:03 964 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。