原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.06647
立即前往原文

LoGRA:利用低秩梯度草图扩展大语言模型强化学习

LoGRA是一种面向大语言模型强化学习后训练的方法,通过将有用的学习信号保留为紧凑的低秩梯度草图来降低内存需求。这些表示可用于模型更新和策略同步。基于预测KL的步长控制会估算策略变化,以避免更新幅度过大。在推理任务中,LoGRA将平均训练内存最多降低45.7%,且未牺牲性能。研究还报告称,该方法可在单个配备8张GPU的节点上稳定训练270亿参数模型超过1,100步,而Dense Adam会因内存不足无法运行。代码已在Molt库中提供。
行业资讯 研究 开源 2026-10-07 09:31:03 820 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。