Cliff:从第一个错误开始学习推理过程奖励
这项研究提出了 Cliff,一种用于改进大语言模型可验证奖励强化学习的奖励塑形方法。研究利用现成的大语言模型识别每条推理轨迹中的第一个错误,并为正确前缀分配正向的词元级优势,为错误之后、已受无效前缀影响的部分提供负向反馈。在 12 个场景的实验中,Cliff 的推理性能比在线策略蒸馏高 15%,比标准 GRPO 高 7%;即使教师模型能力有限,也能取得改进。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。