原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.02817
立即前往原文

Cliff:从第一个错误开始学习推理过程奖励

这项研究提出了 Cliff,一种用于改进大语言模型可验证奖励强化学习的奖励塑形方法。研究利用现成的大语言模型识别每条推理轨迹中的第一个错误,并为正确前缀分配正向的词元级优势,为错误之后、已受无效前缀影响的部分提供负向反馈。在 12 个场景的实验中,Cliff 的推理性能比在线策略蒸馏高 15%,比标准 GRPO 高 7%;即使教师模型能力有限,也能取得改进。
行业资讯 AI模型 研究 2026-09-03 10:30:58 157 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。