利用 VLM 代理进行上下文机器人学习
该研究提出 GPT-Policy,一种用于机器人上下文学习的框架。系统包括保留任务相关视觉变化的上下文编译器、提出机器人工具动作的视觉语言模型,以及验证并执行每个动作并报告结果的受限控制器。在真实机器人测试中,即使没有机器人动作标注,人类视频演示也能提高任务完成率;在对接触敏感的任务中,对齐的动作参考带来了进一步提升。研究还通过可靠性、效率、模型对比和上下文消融实验,分析了该方法的表现与局限,以及将视觉语言模型能力部署到真实机器人时面临的挑战。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。