无需任何监督的策略内自蒸馏
研究人员提出 U-OPSD,一种面向大语言模型的无监督策略内自蒸馏方法。该方法只使用模型自身生成的内容:首先采样多个推理结果,通过多数投票构建伪解答,再针对与伪解答不一致的结果进行蒸馏,从而修正模型自信但错误的回答。在五个数学推理基准测试中,非思考模式下的 Qwen3 40亿和80亿参数模型相较基础模型分别提升了8.5%和10.7%。在多种设置中,U-OPSD的表现达到或超过了依赖标准答案监督的 OPSD 和 GRPO。相关代码已在 GitHub 开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。