原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.19408
立即前往原文

超越模仿:根据推理进展筛选在线蒸馏信号

研究人员提出R2-OPD,以解决语言模型后训练中在线蒸馏(OPD)的一项局限。标准OPD将教师模型产生的奖励视为推理进展的可靠指标,但有些偏离教师输出的推理步骤实际上更有助于解决问题,却可能因此获得较低奖励。R2-OPD分别依据教师奖励和独立估计的推理进展,对同一轨迹中的推理片段进行排序。当两种排序不一致时,该方法会抑制相应的蒸馏信号,同时保留有效的教师指导。作者报告称,与标准OPD相比,该方法能持续提升推理性能,但目前的描述没有提供具体的基准测试数据。
行业资讯 AI模型 研究 2026-08-25 11:31:22 677 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。