SMAT:简单高效的合并感知训练方法
模型合并可以在无需联合重新训练的情况下整合多个专家模型的能力,但标准训练并不能保证模型合并后的表现。SMAT同时优化任务损失,以及在模拟合并参数上的预期损失。通过多项效率优化,其训练时间相比标准微调增加不到2%。在四种语言和视觉语言模型骨干上,SMAT在五种合并方法中的平均分数较各骨干最强的基线提升了1.07至2.16分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。