原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.08798
立即前往原文

通过在策略反向蒸馏实现从弱到强的泛化

研究人员提出了在策略反向蒸馏(OPRD),旨在让更强的学生模型从较弱的教师模型中学习,同时超越教师的性能。OPRD在学生模型生成的轨迹上,评估教师策略相对于参考策略的变化,并仅放大得到验证器支持、且与该变化方向一致的策略梯度更新。这样既能利用教师指导加快训练,又不会将教师的能力上限强加给学生。在连续模型迁移和多教师蒸馏实验中,OPRD以更少的学生更新次数取得了优于现有强化学习和蒸馏方法的性能。研究还表明,该方法在教师强于学生的传统蒸馏场景中同样有效。
行业资讯 AI模型 研究 2026-09-09 12:31:00 965 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。