LIFT:通过策略内自蒸馏实现大视角变化下的未来布局控制视频生成
LIFT 是一种可控的图像到视频生成框架,将相机控制与未来布局控制结合起来。用户可以指定未来视角中应出现的内容及其位置,尤其是最终帧的场景布局。现有方法通常只能控制相机运动轨迹,而文本提示对未来内容和空间布局只能提供粗略指导。LIFT 采用策略内自蒸馏,将使用逐帧密集布局训练的教师模型能力迁移到仅以最终帧布局为条件的学生模型中。研究人员还构建了 LIFT-Vista 数据集,其中包含大幅视角变化以及在时间上保持一致的相机和布局标注。实验结果显示,与其他方法相比,LIFT 在视频质量、未来布局可控性和相机可控性方面均有所提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。