原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35505
立即前往原文

从强化学习视角看 OPD:面向高样本效率 LLM 推理的最小二乘策略蒸馏

该研究从强化学习角度分析语言模型的在策略蒸馏(OPD)。研究建立了 OPD 反向 KL 目标与 KL 正则化策略优化之间的联系,并提出最小二乘策略蒸馏(LSPD)。该方法通过乐观探索保持策略多样性,同时重复利用已收集的离策略轨迹,以提高 rollout 效率。理论分析将 LSPD 与乐观价值学习联系起来,并在理想化的在线探索设置下给出 O(log K) 的遗憾上界。在六个数学推理基准和多种教师—学生模型配置中,LSPD 的 Avg@16 平均提升 1.59 分。最高至 k=64 的 Pass@k 评估表明,随着采样数量增加,该方法能更好地保持策略多样性。完全离策略版本仅使用前 25% 的 rollout 批次,就达到了接近标准 OPD 的性能。
行业资讯 AI模型 研究 2026-09-29 16:01:03 466 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。