E-MoE:面向非因子化扩散语言模型的增强型专家混合
掩码扩散模型可以在每个去噪步骤中生成多个词元,但其反向过程通常将不同位置独立建模,因此在步骤较少时可能影响生成质量。E-MoE将Mixture-of-Experts骨干网络的专家路由决策作为共享离散潜变量,以捕捉位置之间的依赖关系。与采用连续潜变量的方法不同,E-MoE能够避免后验坍塌,且相较于因子化基线不会增加激活参数数量。在合成多模态基准、二值化MNIST和LM1B上,该方法提升了少步生成效果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。