D^3-MOPD:面向高效多教师蒸馏的自适应动态领域调度
D^3-MOPD 是一种用于 on-policy 蒸馏的调度器,可将多个领域专家教师模型的知识整合到一个学生模型中。与训练前固定各领域数据比例的方法不同,它会跟踪每个领域的反向 KL 散度变化,并根据剩余提升空间和当前改进速度动态调整采样比例。一个异步监控进程负责执行调度,不会改变核心训练循环。在使用 Qwen3.6-35B-A3B 学生模型和四个领域专家教师模型的实验中,作者报告称,D^3-MOPD 弥补了学生与教师平均性能差距的 97%,而标准 MOPD 为 63%。该方法以约三分之一的 rollout 步数达到相同的峰值性能,并在七项基准测试中的三项超过了专业教师模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。