RLHND:利用视频基础模型实现物理一致的手部追踪,助力机器人学习
RLHND 从单目第一人称视频中估计手部姿态、接触和受力信息,以支持机器人策略训练。该模型将预训练的 Cosmos 3 视频扩散骨干用作特征提取器,利用其学到的手部运动及手物交互先验。系统旨在生成符合解剖结构的姿态,并保持手部形状一致。研究人员报告称,该模型在姿态、接触和受力估计基准测试中达到领先水平,并通过动作重定向和真实机器人实验展示了其用于机器人学习的潜力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。