LastOPD:稳定潜在式 On-Policy 蒸馏中的性能崩溃
一项新研究分析了潜在式 On-Policy 蒸馏为何会先提升小型语言模型的表现,随后却导致性能崩溃。研究将 Qwen3-4B 和 Qwen3-8B 蒸馏到 Qwen3-1.7B-Base,MATH-500 准确率在 10 个步骤内从 25% 升至 46%,但随后降至 11%,尽管对齐指标仍在持续改善。作者认为,问题源于不同规模模型中按深度匹配的潜在层承担着不同功能。LastOPD 仅在语言模型头共同读取的最后一层状态上应用潜在信号,并在 10 个步骤内逐步过渡到 token 级蒸馏。与仅使用 token 的 OPD 相比,该方法使 MATH-500 分数分别提高 5.55 和 4.02 个百分点,并以约一半的训练步骤达到相同最终分数。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。