PointWAM:面向灵巧机器人操作的三维世界动作建模
PointWAM 是一种三维世界动作模型,可在共享的时空坐标系中,以点轨迹的形式联合预测场景与手部动作。与主要依赖 RGB 图像或潜在表示的方法不同,它显式建模空间结构和接触几何。该模型利用大规模人类演示视频进行预训练,根据彩色点云和语言指令预测场景与手部随时间的变化,再将预测的手部运动转换为机器人动作。在 DexJoCo 的十项任务中,PointWAM 比此前最佳水平高出 11.7 个百分点,并在真实机器人上优于表现强劲的视觉-语言-动作模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。