原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.31046
立即前往原文

On-Policy 蒸馏真的在蒸馏吗?从噪声教师到自我改进

一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On-Policy Self-Adaptation(OPSA),根据 token 的熵调整负向学习信号。与 Qwen3-1.7B 相比,OPSA 在 AIME24 上将 Avg@32 提高了 35.41 分,相对提升 263%,并比 OPD 高出 16.77 分。在多个模型系列和任务上的实验显示,该方法具有一定的泛化能力。
行业资讯 AI模型 研究 2026-09-01 11:00:54 772 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。