原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.07103
立即前往原文

重新审视后训练中的完整推理轨迹

NAVER AI的一项研究考察了大型语言模型在后训练阶段是否需要完整的推理轨迹。实验表明,完整轨迹带来的收益有限,而即使经过大幅截断的部分轨迹仍然有效。注意力分析和受控的词元删除实验显示,许多中间词元对最终推理质量的贡献很小。使用轨迹的起点和终点进行训练,可能促使模型依靠内部知识推断缺失步骤。该方法对基于强化学习和策略内蒸馏的后训练方法同样有帮助。研究团队已在GitHub上公开代码。
行业资讯 AI模型 研究 开源 2026-09-10 10:01:26 366 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。