当 EOS Token 不一致:理解 On-Policy 蒸馏中的长度膨胀
该研究分析了模型在 On-Policy 蒸馏(OPD)过程中为何会生成过长的回答,甚至耗尽生成预算。研究人员发现,基础学生模型与经过后训练的教师模型对终止 Token 的偏好不一致,是造成这一现象的重要原因。在 Qwen3、Llama 和 Gemma 上的实验表明,即使两个模型声明的停止集合相同,它们仍可能将停止概率分配给不同的 EOS Token。因此,仅对齐解码停止集合并不足够。将功能等价的 EOS Token 视为同一个语义停止动作,可以显著缓解由不匹配导致的长度膨胀。不过,分阶段训练分析还显示,终止偏好会在训练过程中明显变化,且在终止对齐后仍会出现另一种持续的长度膨胀。研究人员已发布包含所提修正方案的实现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。