仅凭路由漂移,无法判定合并后的 MoE 大语言模型是否失效
一项针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究分析了模型合并后专家路由的变化。研究人员发现,大多数专家重新分配源于输入变化,而非路由器参数改变。与原始路由的差异也难以预测恢复原路由是否能提高下一个 token 的似然度。因此,研究将路由失效定义为:在其他参数保持不变时,可通过特定路由干预挽回的任务损失。团队还发布了分析工具包和 Selective Router Repair 代码。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。