Self-OPD:无需教师模型的流匹配模型策略内蒸馏
论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的分支会吸引学生模型,优势较低的分支则受到抑制。对于多目标对齐,Self-OPD 在奖励层面融合归一化分数,从而避免直接的梯度冲突。在单一和混合奖励基准测试中,作者报告称该方法无需任务专用教师模型即可优于以往的强化学习和 OPD 方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。