NAMVIS:下一尺度自回归多视图图像合成
NAMVIS是一种无需扩散模型、可根据少量输入图像合成新视角的框架。它不采用反复去噪,而是在少数由粗到细的尺度步骤中预测离散视觉令牌,并并行处理各尺度和目标视角。其多尺度投影姿态编码将相机几何信息注入注意力机制。在Objaverse、GSO和OmniObject3D数据集上,作者报告称,NAMVIS在PSNR、SSIM和LPIPS指标上优于扩散模型基线,并且在相同评估设置下运行速度超过三倍。研究结果表明,几何条件化的下一尺度自回归方法可能成为稀疏视角多视图合成中更高效的扩散模型替代方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。