原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.21619
立即前往原文

校准教师与学生之间的差异以改进策略内蒸馏

策略内蒸馏通过学习更强教师模型与策略内学生模型之间的逐 token 差异,提升推理模型的能力。但这种差异不仅反映教师与学生之间的能力差距,也包含教师自身产生的偏差;在使用特权信息时,这一问题会进一步加剧。研究提出校准策略内蒸馏(Cal-OPD),通过正向和负向特权干预估计教师自身的偏差区域,并只保留超出该区域的差异作为优化信号。在数学推理基准测试中,Cal-OPD仅保留原始差异的约52%至65%,却在不同模型规模下持续优于标准OPD及其变体。
行业资讯 AI模型 研究 2026-09-21 12:31:00 760 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。