通过变分学习探索RLVR的参数空间
该研究探讨了大语言模型强化学习中的参数空间探索。与温度缩放等动作空间方法不同,参数空间方法从后验分布中采样不同策略,使各策略能够生成不同的rollout。作者提出了扰动参数策略优化(Perturbed Parameter Policy Optimization,3PO),通过不同的采样和rollout分组策略估计奖励。在OLMo-3-1025-7B和Qwen2.5-Math-7B的数学推理与代码生成实验中,3PO系列方法在几乎相同的FLOPs成本下,平均下游性能持续优于标准GRPO。使用多个参数样本还减少了零优势分组,以及训练期间格式错误或不正确的rollout。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。