World Action Agent通过动作预演将VLM用于机器人操作
World Action Agent(WAA)是一种多智能体系统,让视觉语言模型(VLM)通过可视化操作空间控制机器人。执行前,系统将动作作为可编辑提案呈现,智能体可根据规划反馈预览并修改。系统会自动选择接触区域视角,并在执行过程中进行校正,以形成从观察到执行的控制闭环。WAA还可从专家视频和人工指导中获得技能,并利用交互轨迹训练更小型的VLM。在LIBERO-Pro上,仅使用从LIBERO-90获得的技能,WAA的平均成功率达到75.6%,超过对比系统;这些技能无需额外学习,也能用于robosuite。使用交互轨迹微调Qwen3.5-9B后,其域外成功率从1.7%提升至43.3%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。