原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.37868
立即前往原文

超越已采样轨迹进行学习:面向 RLVR、考虑离策略影响的跨模型轨迹交换

在可验证奖励强化学习(RLVR)中,有限的 rollout 预算可能产生全部失败的回答组,无法提供基于奖励的学习信号。GRAFT 用其他模型提供的有效轨迹替换这类回答组,并考虑离策略影响。该方法连同源模型计算的优势值,传递成功和失败的回答,再通过序列级兼容性加权和 token 级重要性比率裁剪来控制模型间的偏差。在三组异构模型配对和五项数学推理基准测试中,使用相同 rollout 预算时,GRAFT 相比 GRPO 提升了两个模型的表现:平均提高 2.1 分,模型平均表现最高提高 4.5 分。即使不进行同步联合训练,使用存储的轨迹也能平均提高 1.8 分。
行业资讯 AI模型 研究 2026-09-30 10:31:10 997 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。