Mask Forcing 通过双噪声掩码滚动改进自回归视频扩散蒸馏
该研究提出 Mask Forcing,用于改进面向实时视频生成的自回归视频扩散模型蒸馏。现有的 Distribution Matching Distillation 方法受到反向 KL 目标函数的模式选择倾向影响,可能导致学生模型分布坍缩,并生成过度饱和或过度平滑的视频。Mask Forcing 在自回归自滚动过程中,沿空间和时间维度使用随机掩码,将更干净的信号注入噪声输入。这样可以促使学生模型探索教师分布的更多区域,改善中间预测并减少误差累积。实验表明,该方法能够提升多种自回归视频扩散蒸馏方法的视觉质量,且无需真实视频数据或额外的后训练阶段。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。