超越模仿:根据推理进展筛选在线蒸馏信号
研究人员提出R2-OPD,以解决语言模型后训练中在线蒸馏(OPD)的一项局限。标准OPD将教师模型产生的奖励视为推理进展的可靠指标,但有些偏离教师输出的推理步骤实际上更有助于解决问题,却可能因此获得较低奖励。R2-OPD分别依据教师奖励和独立估计的推理进展,对同一轨迹中的推理片段进行排序。当两种排序不一致时,该方法会抑制相应的蒸馏信号,同时保留有效的教师指导。作者报告称,与标准OPD相比,该方法能持续提升推理性能,但目前的描述没有提供具体的基准测试数据。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。