面向大规模长上下文强化学习后训练的在线协同训练投机解码
研究人员提出了一套端到端系统,通过在线协同训练草稿模型,加速强化学习后训练中成本占比很高的 rollout 生成。该系统将分支注意力融入上下文并行执行,并在不改变流水线调度的情况下,在不同流水线阶段之间传输目标模型的中间特征。在最大规模达1220亿参数的模型上进行的实验显示,rollout 和端到端处理速度均得到显著提升;其上下文并行设计还可扩展至25.6万 token,并比现有方法节省内存。代码已在 GitHub 开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。