原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33253
立即前往原文

VGGT-Diff:融合视觉几何与扩散模型,从稀疏视角合成新视图

VGGT-Diff是一种多视图扩散模型,可根据少量输入图像生成新的观察视角。该方法将VGGT-Ω提取的视觉几何特征输入预训练视频扩散模型,结合基于几何的重建能力与扩散模型的生成先验。具备置信度感知能力的视觉几何路由器会将3D点对齐到目标视角,同时保留前后表面的信息。沿可靠3D轨迹约束残差一致性,可进一步提升多视图结果的稳定性。实验表明,该方法在不同难度的视角插值和外推任务中取得了有竞争力或领先的表现。代码已在GitHub开源。
行业资讯 AI模型 研究 开源 2026-09-29 12:01:24 715 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。