在学生模型状态下学习教师模型的续写
该研究提出了OLIVE(OnLine InterVEntion),一种用于语言模型的在线蒸馏方法。在每次迭代中,不断演化的学生策略生成一个新的前缀,教师模型以自回归方式续写该前缀,学生模型再根据教师生成的词元,通过交叉熵进行更新。OLIVE旨在解决离线监督微调中的序列协变量偏移、词元级在线策略蒸馏中的监督信号碎片化,以及分布匹配蒸馏需要访问教师词元概率等问题。在困难推理任务和智能体任务中,OLIVE以相近的GPU小时成本持续优于现有蒸馏方法。异步实现还将总训练时间缩短了23.8%。仅使用GPT-5.4-mini生成的文本时,OLIVE的持续训练在ScienceWorld上的表现比使用同一教师进行离线SFT高出13%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。