校准教师与学生之间的差异以改进策略内蒸馏
策略内蒸馏通过学习更强教师模型与策略内学生模型之间的逐 token 差异,提升推理模型的能力。但这种差异不仅反映教师与学生之间的能力差距,也包含教师自身产生的偏差;在使用特权信息时,这一问题会进一步加剧。研究提出校准策略内蒸馏(Cal-OPD),通过正向和负向特权干预估计教师自身的偏差区域,并只保留超出该区域的差异作为优化信号。在数学推理基准测试中,Cal-OPD仅保留原始差异的约52%至65%,却在不同模型规模下持续优于标准OPD及其变体。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。