原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.37533
立即前往原文

E-MoE:面向非因子化扩散语言模型的增强型专家混合

掩码扩散模型可以在每个去噪步骤中生成多个词元,但其反向过程通常将不同位置独立建模,因此在步骤较少时可能影响生成质量。E-MoE将Mixture-of-Experts骨干网络的专家路由决策作为共享离散潜变量,以捕捉位置之间的依赖关系。与采用连续潜变量的方法不同,E-MoE能够避免后验坍塌,且相较于因子化基线不会增加激活参数数量。在合成多模态基准、二值化MNIST和LM1B上,该方法提升了少步生成效果。
行业资讯 AI模型 研究 2026-10-03 02:01:03 565 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。