超越稳定性与探索的两难:用于大语言模型策略优化的环境正则化
一项研究提出环境正则化策略优化(ERPO),作为大语言模型训练中传统 Policy-KL 正则化的替代方案。ERPO 通过 Query-KL 项限制训练查询分布的偏移,同时不对响应分布施加直接的梯度压力,从而在提升训练稳定性的同时保留探索能力。该方法无需额外的前向传播,即可接入 GRPO、PPO 和 REINFORCE 类训练流程。在六项数学推理基准测试中,作者报告称,ERPO 提高了准确率,并在高温解码和长周期训练条件下表现出明显更强的稳定性。源代码已在 GitHub 上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。