RISE:通过自我外推策略蒸馏实现递归改进
RISE 是一种语言模型后训练方法,可直接从模型自身的 RLVR 训练轨迹中构建合成教师模型。该方法在参数空间或输出 logit 空间中外推当前检查点与较早锚点之间的变化,从而生成密集的逐 token 监督信号,无需外部模型或特权条件信息。基于结果的奖励将外推引向正确推理,而蒸馏则改进逐 token 的决策。随着学生模型不断进步,教师模型也会持续更新,使蒸馏从一次性压缩步骤转变为递归改进机制。在数学推理、多领域 STEM、代码生成和多轮智能体任务实验中,RISE 均优于仅使用 RLVR 的训练以及 on-policy 自蒸馏。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。