原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36802
立即前往原文

EasyPPO:稳定 Critic 是关键

这项研究发现,Critic 的两种失效模式可能导致大语言模型的 PPO 训练不稳定:在 Actor 和 Critic 训练中都排除被截断的 rollout,以及不同提示词之间的回报噪声分布不均。EasyPPO 通过仅对 Actor 筛除过长 rollout、按噪声水平加权 Critic 回归损失,并缩小 Critic 的小批量规模来应对这些问题。在编程、数学推理和多轮搜索测试中,EasyPPO 在整个训练过程中保持稳定,并优于 PPO、VAPO 和 HL-Gauss PPO。与 PPO 相比,其最佳验证分数分别提高了 14.89%、2.28% 和 9.47%。
行业资讯 研究 2026-09-30 11:31:25 216 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。