World in World:利用世界模型探索世界
World in World是一种无需额外训练的推理接口,面向自回归视频世界模型。它整合源视频观测、目标视角投影、几何渲染以及此前生成的状态,并通过冻结因果视频模型原生的自注意力机制进行处理。对应路由器利用持久化点标识和几何信息,建立相关视觉标记之间的对应关系。基于注意力响应的证据级分类器自由引导机制,则分别调节各辅助信息通道的额外贡献。该接口在不修改基础模型的情况下,支持相机控制的视频重渲染、长时段场景重访和人体动作迁移。研究在多种视角变化下评估了该方法,考察感知质量、时间一致性和相机跟随准确率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。