原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.02840
立即前往原文

PointWAM:面向灵巧机器人操作的三维世界动作建模

PointWAM 是一种三维世界动作模型,可在共享的时空坐标系中,以点轨迹的形式联合预测场景与手部动作。与主要依赖 RGB 图像或潜在表示的方法不同,它显式建模空间结构和接触几何。该模型利用大规模人类演示视频进行预训练,根据彩色点云和语言指令预测场景与手部随时间的变化,再将预测的手部运动转换为机器人动作。在 DexJoCo 的十项任务中,PointWAM 比此前最佳水平高出 11.7 个百分点,并在真实机器人上优于表现强劲的视觉-语言-动作模型。
行业资讯 应用 研究 2026-10-06 09:00:54 600 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。