DiffGate:面向按策略蒸馏的难度门控教师指导
按策略蒸馏使用语言模型自身生成的轨迹进行训练。DiffGate 将这一方法与 GRPO 结合:验证器选出失败轨迹并为其提供教师指导,指导强度依据组内难度调整,同时设置上限以避免更新过度。在 Qwen3 学生模型测试中,DiffGate 在评估的四种模型与领域组合中,pass@8 均优于对照 GRPO。结果仅适用于文中所述模型和评估流程。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。