基础模型协同架构推动实体智能体实现长时程导航
NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQA上比情节式接口高出14.9个百分点。在Unitree Go2机器人上,系统成功率达到78.3%;随着任务时程延长,其相对最强基线的优势从10个百分点扩大到45个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。