原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.36246
立即前往原文

在学生模型状态下学习教师模型的续写

该研究提出了OLIVE(OnLine InterVEntion),一种用于语言模型的在线蒸馏方法。在每次迭代中,不断演化的学生策略生成一个新的前缀,教师模型以自回归方式续写该前缀,学生模型再根据教师生成的词元,通过交叉熵进行更新。OLIVE旨在解决离线监督微调中的序列协变量偏移、词元级在线策略蒸馏中的监督信号碎片化,以及分布匹配蒸馏需要访问教师词元概率等问题。在困难推理任务和智能体任务中,OLIVE以相近的GPU小时成本持续优于现有蒸馏方法。异步实现还将总训练时间缩短了23.8%。仅使用GPT-5.4-mini生成的文本时,OLIVE的持续训练在ScienceWorld上的表现比使用同一教师进行离线SFT高出13%。
行业资讯 AI模型 研究 2026-09-30 09:01:26 154 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。