用于长篇多镜头视频生成的 Multi-Grid 后训练
MovieGrid 是一种用于生成由多个按时间排序镜头组成的长篇视频的后训练方法。它将长视频拆分为较短片段,排列在空间网格中并进行联合建模,从而实现片段之间的全局信息交换。研究团队从 1,000 部长篇视频构建了 MGLV 数据集,其中包含 5.4 万个网格视频,以及故事和角色标注。该方法结合 Grid Embedding、角色感知故事提示和 Grid Boundary Loss,提升镜头内及镜头间的一致性。在相同 token 预算下,MovieGrid 在 1,616 帧视频中生成的镜头数量是 Temporal Packing 的 6.05 倍,并在涵盖五类真实场景的基准测试中,在镜头内和镜头间一致性方面取得当前最佳结果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。