特权信息能为策略内自蒸馏带来什么?
一项研究分析了解答或完整推理过程等参考信息,能为语言模型的策略内自蒸馏带来多少额外价值。研究人员构建了 AMPLE-Math 数据集,包含 5,319 道数学题,每道题提供六种共享同一答案的推理视图,并将使用参考信息的蒸馏与条件匹配的无参考蒸馏进行比较。结果显示,在启用思考能力的评估中,Qwen3-1.7B 的大部分性能提升都可以由无参考蒸馏解释。参考信息带来的额外收益在 Qwen 上较为有限,在使用经过整理的解答时最明显;对 SmolLM3-3B 而言,完整推理轨迹在某一训练阶段带来了两个百分点的提升。然而,更长的思考式推理过程也可能导致性能下降。研究认为,蒸馏的主要价值在于促进不同推理模式之间已有能力的迁移。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。