通过渐进式视觉规划进行世界动作建模
ProWAM 是一种用于机器人控制的世界动作模型,可同时预测动作和按顺序排列的视觉子目标。与生成完整视频序列或仅预测单个未来画面的方法相比,该设计旨在提升长时程任务的执行能力。ProWAM 只需运行一次视频骨干网络即可缓存子目标特征,重新规划时仅需进行轻量级动作调整。研究团队报告称,该模型在 LIBERO-Plus(85.8%)和随机化 RoboTwin(75.7%)模拟基准上取得了当时的最佳成绩。在无需额外训练的真实世界测试中,ProWAM 的成功率达到 70%,在新场景中比最强基线高出 15 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。