重新思考大语言模型的在线策略蒸馏 II:一个训练样本
一项研究在数据极简条件下分析在线策略蒸馏(OPD),仅用一个查询训练模型。单查询 OPD 在数百个训练步骤中仍持续改进,并在多个任务领域和模型系列中恢复了完整数据训练的大部分收益。一个查询即可覆盖完整数据 OPD 所访问状态的 71.5%;加入 16 个语义多样的查询后,覆盖率达到 98.9%,性能与完整数据训练相当。研究人员认为,OPD 的主要瓶颈不是数据不足,而是学生模型吸收教师监督信号的速度较慢。多教师 OPD、内容较少的模板以及跨领域查询也表现出类似结果,表明任务内容与状态覆盖可以相互分离。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。