WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型
WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实验显示,该模型提升了长时一致性和摄像机控制精度,并在持续数分钟的探索过程中保持视觉质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。