我们能相信教师模型吗?用于自蒸馏的信用方向与幅度解耦
该研究提出了 Decoupled Credit Self-Distillation(DCSD),用于改进语言模型和多模态模型优化过程中的信用分配。现有方法将信用信号的方向与贡献幅度绑定在一起,使二者容易受到教师模型判断错误和偏好差异的影响。DCSD 通过信念边际探测确定信用方向,并利用边际信息增益衡量贡献幅度。在 11 个基准测试中,DCSD 的综合表现优于 GRPO、OPSD、RLSD 和 RLCSD。与基础模型相比,该方法在数学推理上的综合得分提高 8.45 分,在多模态推理上提高 7.01 分。此外,它修正了 6% 令牌的信用方向,并将令牌信用幅度降低了 1.5 倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。