无需推理轨迹训练专业模型,用于领域专家知识蒸馏
本研究探讨了专业模型仅使用问答对、没有明确推理监督时,如何将领域知识传递给学生模型。研究人员发现,专业模型的优化过程会从潜在的推理轨迹空间中隐式选择一种分布。由于学生模型只继承专业模型采样得到的轨迹,而不继承其参数或优化约束,因此知识蒸馏可以作为观察这一潜在分布的通用探针。在27组专业模型与学生模型的配对中,专业化与泛化能力的特征呈现出极强的相关性。通过明确控制专业模型的分布漂移,可以系统地调节教师模型和学生模型在领域精度与通用能力保留之间的权衡。相关现象在化学、物理和多语言场景中均得到验证,并且跨越了不同的模型家族。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。