原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.22966
立即前往原文

将视觉语言模型的智能迁移到机器人控制

该研究探讨视觉语言模型(VLM)能否将数字世界中的能力迁移到实体机器人控制。RoboDawn为智能体式VLM提供了一组精简的离散指令,用于平移、旋转和夹爪操作。模型以闭环方式运行:观察机器人的视觉状态,推理并执行下一步动作,再根据执行结果调整后续决策。通过少量上下文示例,模型可以同时学习接口使用方法和任务解决策略。在RoboTwin 2.0 C2R上,成功率从零样本条件下的53.2%提升至单示例条件下的73.6%,超过π0.5基线的46.0%。在RoboDojo上,成功率也从35.67%提升至47.17%。该框架还迁移到了真实的Franka机器人,完成了将方块放入篮中和堆叠方块等任务。
行业资讯 应用 AI模型 研究 2026-09-22 11:01:30 288 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。