原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.03573
立即前往原文

SFT产生冲突,RL实现共存:大语言模型多任务学习的理论与实证分析

一项研究分析了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时为何表现不同。初步实验显示,SFT在多阶段训练中会造成严重的任务冲突,而RL能够让不同任务更稳定地共存。在参数层面,RL会针对不同任务产生稀疏且近似正交的更新。研究人员认为,这源于两种方法在梯度干扰上的差异:SFT中的干扰受梯度绝对大小限制,而RL中的干扰受优势归一化和在线策略优化引起的梯度方差限制。基于这一发现,研究提出了Parallel-RL,一种将多任务训练解耦的方法,旨在提升训练效率和灵活性。
行业资讯 AI模型 研究 2026-08-10 15:01:23 971 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。