原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34645
立即前往原文

Nereus:面向大语言模型后训练的自适应并行

Nereus是一种运行时系统,可在GPU集群上动态调整大语言模型的强化学习后训练任务。它会考虑资源可用性、序列长度、内存压力,以及生成、推理和训练阶段之间不断变化的瓶颈。基于成本的控制器选择满足内存约束的执行方案,并在任务运行期间协调分布式模型状态和GPU传输。在基于真实数据的跟踪测试中,在线调整张量并行和流水线并行使平均单步延迟降低了27.7%。在使用1,024块GPU的运行中,6次转换仅占总运行时间的0.079%。对于8B PPO,Nereus的端到端吞吐量比OpenRLHF高2.14至7.27倍,比Verl高1.10至1.47倍。
行业资讯 应用 研究 2026-09-29 17:31:04 249 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。