Self-Retrospection Distillation:将事后经验转化为事前预见能力
在采用可验证奖励的强化学习(RLVR)中,如果一组中的所有轨迹获得相同奖励,学习信号就会很有限;但轨迹仍能揭示任务要求和失败原因。研究人员提出“前瞻式学习”,并通过 Self-Retrospection Distillation(SRD)实现:利用已完成轨迹中的经验,训练策略在行动前预测有用知识和潜在陷阱。这些预测仅作为训练目标,推理时无需生成。在 10 项整合工具的推理及长时程智能体任务中,SRD 相较 RLVR 和自蒸馏基线最高提升 24.2 个百分点。在 2B 设置下,RLVR 的成功率为 0.0%;在相同轨迹预算下加入 SRD 后,成功率达到 60.6%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。