选择多样化的 SFT 推理轨迹可提升 RL 后的泛化能力
一项研究探讨监督微调(SFT)数据中的推理路径多样性如何影响模型经过强化学习(RL)后的表现。研究提出一种轻量级规则筛选器,用于挑选解题过程各异的样本。在训练条件一致的对比中,这种方法提升了模型对数学和谜题问题的覆盖能力,也能改善训练阶段未见问题的表现。在合成实验中,OLMo3-7B在未用于SFT的环境中pass@8提高16.9分。单模型设置下,十个数学基准的平均pass@8最高提高6.2分。该筛选器仅使用CPU运行,无需调用模型,并在三个开源语料上以RL后的平均表现胜过成本更高的替代方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。