原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.23256
立即前往原文

Next-Chunk 推理强化学习真的优于 SFT 吗?重新审视无 CoT 数据下的训练策略

一项受控研究比较了 Next-Chunk 推理强化学习与 Mixed SFT。后者是一种更简单的监督微调方法,同时使用无 CoT 数据和长 CoT 数据进行训练。Mixed SFT 在 RLVR 后的性能上限明显更高,而所需训练算力减少了 60 倍以上。这一优势在领域内数学推理和领域外推理任务中均得到体现。研究表明,Next-Chunk RL 的收益可能主要来自更有效地利用无 CoT 数据,而不一定源于强化学习形式本身。此外,RLVR 前更高的准确率并不必然转化为 RLVR 后更高的准确率。
行业资讯 AI模型 研究 2026-08-27 15:01:14 311 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。