原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.07108
立即前往原文

面向大规模长上下文强化学习后训练的在线协同训练投机解码

研究人员提出了一套端到端系统,通过在线协同训练草稿模型,加速强化学习后训练中成本占比很高的 rollout 生成。该系统将分支注意力融入上下文并行执行,并在不改变流水线调度的情况下,在不同流水线阶段之间传输目标模型的中间特征。在最大规模达1220亿参数的模型上进行的实验显示,rollout 和端到端处理速度均得到显著提升;其上下文并行设计还可扩展至25.6万 token,并比现有方法节省内存。代码已在 GitHub 开源。
行业资讯 AI模型 研究 开源 2026-09-09 12:01:41 941 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。