Context-Matched Distillation:面向自回归视频蒸馏的因果教师模型
Context-Matched Distillation(CMD)是一种在保持精确在线控制的同时,加速自回归视频生成的方法。现有视频蒸馏流程通常使用双向教师模型,利用学生在生成目标时无法获得的未来帧和控制信息进行评分,从而造成教师与学生因果信息范围不一致。CMD采用因果教师模型,只根据目标生成时可用的历史信息和控制信号进行评估。Prefix Scoring进一步在学生实际生成的前缀上下文中评估目标;Prefix Corruption则通过扰动训练早期产生的不可靠前缀来提升训练稳定性。实验显示,CMD在短视频和长视频基准测试中取得了自回归方法中的领先综合表现,并显著提升了对随时间变化的摄像机控制信号的遵循能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。