原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17512
立即前往原文

Embodied-Navigator:通过指点、思考、记忆与对齐实现高效导航

研究人员提出了 TAMP-Nav,一种利用大型视觉语言模型进行具身导航的框架。系统不要求模型直接预测复杂的三维动作,而是先选择图像中的二维像素,再将其投影为三维坐标,由底层 SLAM 控制器执行。选择性推理和基于锚点的轨迹记忆机制减少了不必要的计算,同时保留关键历史信息。基于 GRPO 的两级对齐方法结合全局结果奖励与细粒度过程奖励。作者报告称,TAMP-Nav 在 R2R-CE 上达到 66.2% 的成功率,训练仅需 9 万条轨迹。
行业资讯 应用 AI模型 研究 2026-08-19 12:00:57 288 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。