TrackEverything:通过去重三维场景表示实现长时程密集追踪
TrackEverything是一种三维点追踪器。据研究团队介绍,它可使用40 GB GPU内存追踪超过1,000帧视频中的可见点。该方法将视频表示为世界坐标系中的持久三维场景轨迹,并合并对同一表面的重复观测。系统先优化各点的目标位置并将其分类为静态或动态,再仅为动态点解码密集轨迹。在TAPVid-3D测试中,研究团队报告称,该方法在短视频上的APD比开源全帧密集三维追踪器高出20%以上;在长序列上,其表现也能与先进的稀疏追踪器相竞争。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。