原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.26872
立即前往原文

Self-OPD:无需教师模型的流匹配模型策略内蒸馏

论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的分支会吸引学生模型,优势较低的分支则受到抑制。对于多目标对齐,Self-OPD 在奖励层面融合归一化分数,从而避免直接的梯度冲突。在单一和混合奖励基准测试中,作者报告称该方法无需任务专用教师模型即可优于以往的强化学习和 OPD 方法。
行业资讯 AI模型 研究 2026-08-28 14:00:57 736 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。