原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.09123
立即前往原文

Mask Forcing 通过双噪声掩码滚动改进自回归视频扩散蒸馏

该研究提出 Mask Forcing,用于改进面向实时视频生成的自回归视频扩散模型蒸馏。现有的 Distribution Matching Distillation 方法受到反向 KL 目标函数的模式选择倾向影响,可能导致学生模型分布坍缩,并生成过度饱和或过度平滑的视频。Mask Forcing 在自回归自滚动过程中,沿空间和时间维度使用随机掩码,将更干净的信号注入噪声输入。这样可以促使学生模型探索教师分布的更多区域,改善中间预测并减少误差累积。实验表明,该方法能够提升多种自回归视频扩散蒸馏方法的视觉质量,且无需真实视频数据或额外的后训练阶段。
行业资讯 AI模型 研究 2026-09-09 13:01:03 544 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。