Local Support Learning 旨在减少大语言模型的灾难性遗忘
一项研究分析了大型预训练模型在持续训练过程中出现的灾难性遗忘问题。研究提出 Local Support Learning(LSL),将标准权重适配器与门控函数结合起来。门控函数只在输入激活来自适配器自身训练分布时启用更新,从而减少对既有能力的干扰。该方法使用基于高斯混合模型的门控机制,在无法访问历史数据的情况下区分不同学习阶段的数据。作者称,在参数规模最高达70亿的语言模型上,LSL能够在多个训练阶段保留预训练能力和微调能力,同时保持较低的额外内存与计算开销。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。