通过频谱引导,从人类交互视频中学习机器人动作
WING是一种将第一人称视角视频中的交互知识迁移到机器人策略的框架。它将摄像者自身的运动与手和物体之间的交互分离,再利用变化缓慢的时间结构来关联人类动作与机器人行为。WING在LIBERO、RoboTwin 2.0和RoboCasa-GR1上的平均成功率分别为99.20%、93.80%和57.7%。在多种泛化条件下的四项真实世界操作任务中,该方法也取得了良好表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。