模型改变想法之处:通过回溯分歧定位提升可验证奖励强化学习的效率
该研究提出 Hindsight-Divergence Localization(HDL),通过 token 对数似然的变化,识别可验证奖励强化学习中值得进一步探索的早期决策点。HDL 不再独立生成大量完整轨迹,而是先生成少量根轨迹,再从选定位置生成续写来补足训练组。续写复用根轨迹的前缀,策略更新仅依据新生成的后缀。在数学、编程和智能体任务的三个模型测试中,与组规模和训练步数相同的 GRPO 相比,HDL 最多将生成 token 数减少至 2.5 分之一,并将 rollout 实际运行时间缩短至 1.8 分之一。其性能也有所提升,在智能体任务上最高提高 12.5 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。