On-policy 参数更新方向是 LLM 后训练泛化能力的关键
这项研究探讨了 on-policy 后训练为何通常具有较强的泛化能力,并将观察到的特性应用于监督微调(SFT)。SFT 倾向于沿着一致的方向更新参数,而 on-policy 训练会在训练过程中持续调整更新方向。研究人员提出 OPSFT,将 SFT 的更新限制在由 on-policy 训练确定的方向上。结果表明,该方法有望把部分 on-policy 方法的泛化优势迁移到 SFT,同时保留 SFT 的训练效率和利用高质量样本的能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。