蒸馏前先验证:基于提示词层级教师闸控的在线策略模型蒸馏
研究人员提出了一种名为“教师闸控在线策略蒸馏”(TGOPD)的新框架,旨在通过在提示词层级验证教师模型的可靠性,来优化模型的后期训练蒸馏。传统的在线策略蒸馏会无差别地应用教师监督,容易引入错误的更新。TGOPD 仅在教师通过可靠性检查时才将提示词导向密集蒸馏,其余则分流至基于验证器的 GRPO 算法。在 40 亿和 350 亿参数规模的数学、代码及指令遵循测试中,TGOPD 的表现均优于传统方法,并将教师端 GPU 的使用率从 9.8% 大幅提升至 78.9%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。