关于 KL 正则化策略优化
论文提出 KL-Regularized Policy Optimization(KLPO),用于大语言模型的异步强化学习。该方法旨在处理来自过时检查点的轨迹,以及推理系统与训练系统之间的概率差异,同时不需要重要性权重或为每个提示生成多个回答。KLPO采用正则化改进步骤的闭式解,并在采样器自身生成的轨迹上通过最小二乘法拟合其最优性条件。作者还证明,无需评论器即可根据终端回报计算梯度,并指出若干现有方法是KLPO的特例。这些成果主要属于理论贡献;摘要未提供实际性能提升的证据。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。