AlayaVista:从全景状态到透视视频的流式世界建模
AlayaVista是一种可由摄像机控制的流式视频世界模型,旨在保持广泛的场景上下文,同时生成高保真的透视视图。系统从单张透视图像出发,利用预训练的全景扩展模型构建360度场景先验,并将其作为受摄像机条件控制的全景潜在状态持续演化。潜在视口渲染器将该状态转换为指定视角的视频潜在表示,透视细化模块则负责恢复细节、抑制伪影并进行超分辨率。为实现高效流式生成,研究团队将全景生成改造为分块自回归生成,并将全景生成和透视细化都蒸馏为少步过程。此外,研究还构建了MUGEN数据集,包含1,318小时真实全景视频,分辨率至少为4K,并配有丰富的语义和几何标注。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。