原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.04596
立即前往原文

DiffGate:面向按策略蒸馏的难度门控教师指导

按策略蒸馏使用语言模型自身生成的轨迹进行训练。DiffGate 将这一方法与 GRPO 结合:验证器选出失败轨迹并为其提供教师指导,指导强度依据组内难度调整,同时设置上限以避免更新过度。在 Qwen3 学生模型测试中,DiffGate 在评估的四种模型与领域组合中,pass@8 均优于对照 GRPO。结果仅适用于文中所述模型和评估流程。
行业资讯 AI模型 研究 2026-10-08 01:31:05 218 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。