腾讯混元将临界批大小理论应用于大模型强化学习:PPO生成吞吐最高提升2.29倍,GRPO训练时间缩短29%
腾讯混元研究团队探讨了在线大模型强化学习中的批大小调整问题,重点关注生成与训练扩展速度不一致的情况。研究将经典临界批大小理论应用于这一场景,发现对于PPO和GRPO,只要相应调整学习率,就能在有限范围内扩大批大小,同时保留每条响应的学习效果。在固定硬件配置下,扩大批大小使PPO生成吞吐最高提升2.29倍。测试中表现最佳的GRPO配置则以少29%的时间达到相同验证目标。研究为提高在线强化学习训练效率提供了一种可操作的方法。
本文来源:AIbase,仅供学习参考,版权归原作者所有。