原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.13058
立即前往原文

面向 MoE 模型强化学习的专家空间探索

研究人员提出了专家空间探索强化学习(ESRL),通过主动探索专家路由选择来改进混合专家(MoE)模型的强化学习。ESRL 将高置信度专家保留为锚点,把随机路由限制在合理的候选集合内,并根据路由器熵调整扰动强度。此外,该方法会记录 rollout 阶段使用的专家路径,并在策略优化时重放,以减少路由不匹配。在多种 MoE 架构以及数学、科学和编程任务上的实验显示,ESRL 无需额外采样或计算成本,就取得了对比方法中的最佳表现。在 Qwen3-30B-A3B 上,ESRL 相比 GRPO 将平均 Pass@1 和 Pass@8 分别提高了 3.2 和 4.5 个百分点。
行业资讯 AI模型 研究 2026-09-15 16:32:37 187 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。