学习尚未掌握的内容,而非已经掌握的内容:用于多奖励策略优化的饱和感知优势重加权
该研究提出 SA-MRPO,用于具有多个奖励目标的语言模型后训练。不同于采用固定权重的方法,SA-MRPO 分别标准化各个奖励目标,并根据目标的饱和程度,动态降低已经基本达成目标的贡献。这使优化资源转向更困难、仍有提升空间的目标。在数学推理、自适应推理和编程基准测试中,SA-MRPO 在多种设置下优于 GDPO:AIME24 提升最高达 5%,自适应推理平均提升 3.8%,AMC23 最高提升 9.2%,编程通过率最高提升 2.3%,同时保持较容易目标的性能。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。