原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.18708
立即前往原文

重新思考 PPO 中的评论家学习:理解并缓解价值扁平化

一项研究发现,用于训练大型语言模型的近端策略优化(PPO)评论家存在一种系统性失效模式。实际状态价值可能在不同中间状态之间剧烈变化,但评论家的预测却相对平坦,研究人员将其称为“价值扁平化”。在 FrozenLake 环境和 Qwen3-Base 上的实验表明,该现象可能与价值损失中的隐式方差惩罚,以及时间相关状态导致的冗余更新有关。研究提出 SParse Proximal Policy Optimization(SP³O),每个响应只对少量且彼此间隔较远的状态应用价值损失。即使每个响应只监督三个状态,SP³O 也能缓解价值扁平化,并在不同模型规模和评测套件上持续提升策略性能。
行业资讯 AI模型 研究 2026-09-17 15:00:58 198 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。