原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10744
立即前往原文

超越像素:从视频先验到4D世界

该研究提出 Latent-to-4D,用于根据文本或图像条件生成动态3D场景。与先重建RGB视频、再交由独立4D模型处理的方法不同,该方法将视频模型最终去噪后的潜在表示作为显式4D预测的可复用接口。研究人员使用约1,000段重建视频训练了一个检查点,并可将其原样迁移到多个使用同一VAE系列的视频扩散Transformer上。在Text4D-200和I4D-200数据集上,Latent-to-4D的投影式DINO-F1分别比匹配的Wan+4RC级联方法高出2.88–3.45分和5.81分。人类评测者在几何结构、时间稳定性和整体质量方面也更偏好该方法。
行业资讯 应用 AI模型 研究 2026-08-12 11:01:01 321 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。