原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.32821
立即前往原文

仅凭路由漂移,无法判定合并后的 MoE 大语言模型是否失效

一项针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究分析了模型合并后专家路由的变化。研究人员发现,大多数专家重新分配源于输入变化,而非路由器参数改变。与原始路由的差异也难以预测恢复原路由是否能提高下一个 token 的似然度。因此,研究将路由失效定义为:在其他参数保持不变时,可通过特定路由干预挽回的任务损失。团队还发布了分析工具包和 Selective Router Repair 代码。
行业资讯 AI模型 研究 开源 2026-09-29 12:01:24 297 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。