原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.28845
立即前往原文

LastOPD:稳定潜在式 On-Policy 蒸馏中的性能崩溃

一项新研究分析了潜在式 On-Policy 蒸馏为何会先提升小型语言模型的表现,随后却导致性能崩溃。研究将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base,MATH-500 准确率在 10 个步骤内从 25% 升至 46%,但随后降至 11%,尽管对齐指标仍在持续改善。作者认为,问题源于不同规模模型中按深度匹配的潜在层承担着不同功能。LastOPD 仅在语言模型头共同读取的最后一层状态上应用潜在信号,并在 10 个步骤内逐步过渡到 token 级蒸馏。与仅使用 token 的 OPD 相比,该方法使 MATH-500 分数分别提高 5.55 和 4.02 个百分点,并以约一半的训练步骤达到相同最终分数。代码已公开。
行业资讯 AI模型 研究 开源 2026-09-29 08:01:14 228 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。