原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35954
立即前往原文

ROSS:通过选择性监督从自生成的 rollout 中重新学习

语言模型后训练中产生的历史 rollout 可能保留有用行为,但也可能包含错误和冗余步骤。ROSS 将完整的历史轨迹保留为上下文,只对选定的模型生成续写部分计算训练损失。在数学、代码生成、指令遵循和软件工程评测中,该方法提升了已有检查点的表现。以 Qwen3.6-35B-A3B 为例,六项 MOPD 基准的平均分从 58.40% 提高到 62.20%,SWE-bench Verified 从 64.20% 提高到 68.40%。该方法通过离线监督微调实现,无需额外生成策略 rollout。
行业资讯 AI模型 研究 2026-09-30 12:01:42 376 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。