利用视频生成模型学习几何信息
GeoNeXt重新利用预训练视频生成模型,从单张图像中联合估计深度和表面法线。该方法将几何估计定义为下一帧预测任务,从而利用视频模型中结构化的视觉先验,并以远少于以往方法的标注数据学习图像与几何信息之间的关系。在多个数据集上的实验表明,GeoNeXt在零样本单目深度和表面法线估计方面优于以往的任务专用型和统一型生成方法。它的性能还接近使用超过百倍数据训练的判别式先进方法,并在多个基准测试中超过这些方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。