SFT产生冲突,RL实现共存:大语言模型多任务学习的理论与实证分析
一项研究分析了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时为何表现不同。初步实验显示,SFT在多阶段训练中会造成严重的任务冲突,而RL能够让不同任务更稳定地共存。在参数层面,RL会针对不同任务产生稀疏且近似正交的更新。研究人员认为,这源于两种方法在梯度干扰上的差异:SFT中的干扰受梯度绝对大小限制,而RL中的干扰受优势归一化和在线策略优化引起的梯度方差限制。基于这一发现,研究提出了Parallel-RL,一种将多任务训练解耦的方法,旨在提升训练效率和灵活性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。