VGGT-Diff:融合视觉几何与扩散模型,从稀疏视角合成新视图
VGGT-Diff是一种多视图扩散模型,可根据少量输入图像生成新的观察视角。该方法将VGGT-Ω提取的视觉几何特征输入预训练视频扩散模型,结合基于几何的重建能力与扩散模型的生成先验。具备置信度感知能力的视觉几何路由器会将3D点对齐到目标视角,同时保留前后表面的信息。沿可靠3D轨迹约束残差一致性,可进一步提升多视图结果的稳定性。实验表明,该方法在不同难度的视角插值和外推任务中取得了有竞争力或领先的表现。代码已在GitHub开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。