原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.02179
立即前往原文

从梯度到能力:理解多教师在线策略蒸馏

这项研究考察多个经强化学习训练的教师模型信号,如何影响共享学生模型的参数更新和学习结果。基于 Qwen3-1.7B 的实验显示,按 token 求平均会使较长回答获得更高权重,而 Adam 会缩小教师梯度差异在最终更新中的体现。BF16 舍入也会掩盖许多细微变化。基于概率最高的 64 个 token 计算的 KL 梯度与全词表梯度接近,但其对数学准确率的影响取决于平均方式。
行业资讯 AI模型 研究 2026-10-06 01:00:59 107 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。