原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04172
立即前往原文

重新思考大语言模型的在线策略蒸馏 II:一个训练样本

一项研究在数据极简条件下分析在线策略蒸馏(OPD),仅用一个查询训练模型。单查询 OPD 在数百个训练步骤中仍持续改进,并在多个任务领域和模型系列中恢复了完整数据训练的大部分收益。一个查询即可覆盖完整数据 OPD 所访问状态的 71.5%;加入 16 个语义多样的查询后,覆盖率达到 98.9%,性能与完整数据训练相当。研究人员认为,OPD 的主要瓶颈不是数据不足,而是学生模型吸收教师监督信号的速度较慢。多教师 OPD、内容较少的模板以及跨领域查询也表现出类似结果,表明任务内容与状态覆盖可以相互分离。
行业资讯 AI模型 研究 2026-09-04 11:30:56 176 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。