原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.30837
立即前往原文

MOPD-Router重新思考多教师在线策略蒸馏中的教师路由

MOPD-Router在token级别分配多个教师模型的监督信号,而不是根据领域标签将每个提示词固定路由给单一教师。该框架不需要领域标签,也不需要额外训练路由模型。其ExpertAlign指标会评估哪位教师对当前token的修正最能体现有用的专业能力。在有标签和无标签训练数据上的实验中,ExpertAlign取得了整体最佳表现。在无标签数据上,其总分比平均聚合高5.88分;在有标签数据上,比标准MOPD高3.95分。研究代码已公开。
行业资讯 AI模型 研究 开源 2026-09-28 20:31:48 547 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。