InfiniHand:从第一人称视频流式估计世界坐标系中的手部运动
InfiniHand是一种前馈式方法,可从未经校准的第一人称视频中连续重建手部三维运动。它联合估计手部几何结构和相机运动,而不是串联独立的手部姿态估计器与SLAM系统。该方法采用持续时空记忆,并使用约5,000小时的第一人称数据进行训练。在基准测试中,与ViDiHand相比,其ARCTIC PA-p误差降低21.4%,同时减轻世界坐标系重建中的漂移。处理速度为每秒11.19帧,超过HaWoR的两倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。