Show-Harness:仅凭 VLM 智能体即可操控机器人
Show-Harness 是一个通过紧凑语义接口,让视觉语言模型(VLM)控制机器人的框架。VLM 负责选择离散的语义动作,针对具体机器人设计的解释器则以确定性方式将其转换为实际动作。该方法支持利用前沿闭源 VLM 进行零样本机器人控制,也能通过数小时的 GPU 微调,使小型开源 VLM 用于低成本部署。其 GUMI 接口还允许人类和智能体通过图形界面收集演示数据,无需专用遥操作硬件。实验显示,该方法在不同任务、机器人形态和环境之间具有较强的泛化能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。