MOPD-Router重新思考多教师在线策略蒸馏中的教师路由
MOPD-Router在token级别分配多个教师模型的监督信号,而不是根据领域标签将每个提示词固定路由给单一教师。该框架不需要领域标签,也不需要额外训练路由模型。其ExpertAlign指标会评估哪位教师对当前token的修正最能体现有用的专业能力。在有标签和无标签训练数据上的实验中,ExpertAlign取得了整体最佳表现。在无标签数据上,其总分比平均聚合高5.88分;在有标签数据上,比标准MOPD高3.95分。研究代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。