超越已采样轨迹进行学习:面向 RLVR、考虑离策略影响的跨模型轨迹交换
在可验证奖励强化学习(RLVR)中,有限的 rollout 预算可能产生全部失败的回答组,无法提供基于奖励的学习信号。GRAFT 用其他模型提供的有效轨迹替换这类回答组,并考虑离策略影响。该方法连同源模型计算的优势值,传递成功和失败的回答,再通过序列级兼容性加权和 token 级重要性比率裁剪来控制模型间的偏差。在三组异构模型配对和五项数学推理基准测试中,使用相同 rollout 预算时,GRAFT 相比 GRPO 提升了两个模型的表现:平均提高 2.1 分,模型平均表现最高提高 4.5 分。即使不进行同步联合训练,使用存储的轨迹也能平均提高 1.8 分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。