从梯度到能力:理解多教师在线策略蒸馏
这项研究考察多个经强化学习训练的教师模型信号,如何影响共享学生模型的参数更新和学习结果。基于 Qwen3-1.7B 的实验显示,按 token 求平均会使较长回答获得更高权重,而 Adam 会缩小教师梯度差异在最终更新中的体现。BF16 舍入也会掩盖许多细微变化。基于概率最高的 64 个 token 计算的 KL 梯度与全词表梯度接近,但其对数学准确率的影响取决于平均方式。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。