原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.02998
立即前往原文

蒸馏前先验证:基于提示词层级教师闸控的在线策略模型蒸馏

研究人员提出了一种名为“教师闸控在线策略蒸馏”(TGOPD)的新框架,旨在通过在提示词层级验证教师模型的可靠性,来优化模型的后期训练蒸馏。传统的在线策略蒸馏会无差别地应用教师监督,容易引入错误的更新。TGOPD 仅在教师通过可靠性检查时才将提示词导向密集蒸馏,其余则分流至基于验证器的 GRPO 算法。在 40 亿和 350 亿参数规模的数学、代码及指令遵循测试中,TGOPD 的表现均优于传统方法,并将教师端 GPU 的使用率从 9.8% 大幅提升至 78.9%。
行业资讯 AI模型 研究 2026-09-08 10:31:00 368 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。