超越像素:从视频先验到4D世界
该研究提出 Latent-to-4D,用于根据文本或图像条件生成动态3D场景。与先重建RGB视频、再交由独立4D模型处理的方法不同,该方法将视频模型最终去噪后的潜在表示作为显式4D预测的可复用接口。研究人员使用约1,000段重建视频训练了一个检查点,并可将其原样迁移到多个使用同一VAE系列的视频扩散Transformer上。在Text4D-200和I4D-200数据集上,Latent-to-4D的投影式DINO-F1分别比匹配的Wan+4RC级联方法高出2.88–3.45分和5.81分。人类评测者在几何结构、时间稳定性和整体质量方面也更偏好该方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。