中间训练阶段的知识蒸馏更有利于推理而非事实记忆
一项研究发现,基于logit的知识蒸馏在不同训练阶段会产生不同效果。在预训练阶段,它能同时提升推理能力和事实记忆;但在中间训练阶段,虽然推理能力继续增强,事实知识的获取却会放缓。研究人员将这一现象归因于教师模型在不同数据领域中的置信度差异,以及学生模型不断变化的知识状态。研究提出了Switch Distillation:利用教师模型的预测熵,仅在教师高度确信的词元上进行蒸馏,否则使用交叉熵训练。与标准的下一词元预测相比,该方法使推理性能提升至1.61至1.71倍,使知识和常识性能提升至1.13至1.19倍,同时保留96.7%至96.8%的事实记忆能力。这些优势在后训练阶段仍然存在。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。