Best Practice Critic Optimization 改进语言模型强化学习训练
Best Practice Critic Optimization(BPCO)是一种面向大型语言模型的训练方法,用精心设计的评论器取代了针对每个提示采样多个回答的做法。该方法结合了 DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化的策略优势,以及根据回答长度调整的广义优势估计。在数学推理任务的受控实验中,BPCO 在参数规模从 15 亿到约 300 亿的模型上持续改进了强大的评论器基线。它只需为每个提示采样一个回答,就能达到或超过基于群组的方法,并且同样改善了使用评分标准奖励的训练效果。代码已在 GitHub 上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。