LoGRA:利用低秩梯度草图扩展大语言模型强化学习
LoGRA是一种面向大语言模型强化学习后训练的方法,通过将有用的学习信号保留为紧凑的低秩梯度草图来降低内存需求。这些表示可用于模型更新和策略同步。基于预测KL的步长控制会估算策略变化,以避免更新幅度过大。在推理任务中,LoGRA将平均训练内存最多降低45.7%,且未牺牲性能。研究还报告称,该方法可在单个配备8张GPU的节点上稳定训练270亿参数模型超过1,100步,而Dense Adam会因内存不足无法运行。代码已在Molt库中提供。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。