原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.20612
立即前往原文

特权信息能为策略内自蒸馏带来什么?

一项研究分析了解答或完整推理过程等参考信息,能为语言模型的策略内自蒸馏带来多少额外价值。研究人员构建了 AMPLE-Math 数据集,包含 5,319 道数学题,每道题提供六种共享同一答案的推理视图,并将使用参考信息的蒸馏与条件匹配的无参考蒸馏进行比较。结果显示,在启用思考能力的评估中,Qwen3-1.7B 的大部分性能提升都可以由无参考蒸馏解释。参考信息带来的额外收益在 Qwen 上较为有限,在使用经过整理的解答时最明显;对 SmolLM3-3B 而言,完整推理轨迹在某一训练阶段带来了两个百分点的提升。然而,更长的思考式推理过程也可能导致性能下降。研究认为,蒸馏的主要价值在于促进不同推理模式之间已有能力的迁移。
行业资讯 AI模型 研究 2026-09-18 11:01:04 205 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。