让稀疏奖励发挥作用:面向多奖励强化学习的密度感知奖励聚合
多奖励强化学习旨在训练大型语言模型同时满足多个行为目标。研究发现,即使采用针对各项奖励分别归一化的方法,不同目标之间的学习信号仍可能不均衡。论文指出,某项奖励的优势能量与其在多少比例的 rollout 组中产生非零相对信号有关。作者提出 DARA,根据每个批次中各奖励的活跃程度调整权重,让较少出现的奖励获得更大权重,同时不改变策略优化目标。在工具调用和数学推理实验中,与 GDPO 相比,DARA 达到特定合规水平所需的训练步数分别最多减少 26% 和 65%,最终表现仍具竞争力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。