原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36659
立即前往原文

On-policy 参数更新方向是 LLM 后训练泛化能力的关键

这项研究探讨了 on-policy 后训练为何通常具有较强的泛化能力,并将观察到的特性应用于监督微调(SFT)。SFT 倾向于沿着一致的方向更新参数,而 on-policy 训练会在训练过程中持续调整更新方向。研究人员提出 OPSFT,将 SFT 的更新限制在由 on-policy 训练确定的方向上。结果表明,该方法有望把部分 on-policy 方法的泛化优势迁移到 SFT,同时保留 SFT 的训练效率和利用高质量样本的能力。
行业资讯 AI模型 研究 2026-10-05 11:30:59 732 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。