原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.08963
立即前往原文

关于 KL 正则化策略优化

论文提出 KL-Regularized Policy Optimization(KLPO),用于大语言模型的异步强化学习。该方法旨在处理来自过时检查点的轨迹,以及推理系统与训练系统之间的概率差异,同时不需要重要性权重或为每个提示生成多个回答。KLPO采用正则化改进步骤的闭式解,并在采样器自身生成的轨迹上通过最小二乘法拟合其最优性条件。作者还证明,无需评论器即可根据终端回报计算梯度,并指出若干现有方法是KLPO的特例。这些成果主要属于理论贡献;摘要未提供实际性能提升的证据。
行业资讯 AI模型 研究 2026-10-08 11:01:01 550 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。