Next-Chunk 推理强化学习真的优于 SFT 吗?重新审视无 CoT 数据下的训练策略
一项受控研究比较了 Next-Chunk 推理强化学习与 Mixed SFT。后者是一种更简单的监督微调方法,同时使用无 CoT 数据和长 CoT 数据进行训练。Mixed SFT 在 RLVR 后的性能上限明显更高,而所需训练算力减少了 60 倍以上。这一优势在领域内数学推理和领域外推理任务中均得到体现。研究表明,Next-Chunk RL 的收益可能主要来自更有效地利用无 CoT 数据,而不一定源于强化学习形式本身。此外,RLVR 前更高的准确率并不必然转化为 RLVR 后更高的准确率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。