UniMoMo:通过专家合并加速大型推荐模型
UniMoMo是一种面向稀疏混合专家推荐模型的训练后压缩框架。它不依赖参数距离,而是利用无标签校准集测量专家对相同推荐状态的功能相似性,并据此合并专家。同时,分层自适应保护机制会限制对高路由频率专家的合并,以减少性能下降。该方法无需额外的在线压缩模块,即可将训练完成的模型转换为更小的专家配置。在Amazon Beauty、KuaiRec和TenRec数据集上,四专家模型达到原始NDCG@10的99.92%至102.30%,并在A100上实现1.28至1.63倍加速。更激进的双专家、top-1配置达到原始性能的98.36%至104.24%,速度提升1.47至2.21倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。