SimpleOPD:面向长上下文推理的简单、与分词器无关的在线策略蒸馏
该研究探讨如何通过在线策略蒸馏,将长上下文教师模型的数学证明推理能力迁移到短上下文学生模型。SimpleOPD在共享文本空间中进行蒸馏,仅对齐教师和学生分词器表示为相同文本范围的部分。学生模型参考KL损失以及对特殊终止词元的屏蔽,有助于减少输出过长、频繁截断、师生分布偏移和训练不稳定。在Qwen3、Intern-S2、GLM-4.7和Gemma-4等模型上的实验显示,数学推理能力均获得稳定提升。Intern-S2-Preview在ProofBench上提升21.2分,达到55.2,超过Gemini-2.5-Pro。在HLE和HiPhO上的改进还表明,迁移的推理能力可能泛化到数学之外的科学任务。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。