原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34759
立即前往原文

PanoVLN:迈向高效的全景视觉语言导航

该研究提出了 PanoVLN,一种面向全景观测的视觉语言导航模型。系统并非简单地用全景图替代透视图,而是结合更长时域的动作序列预测、置信度引导的执行策略、包含频繁分支点且指令明确的训练路线,以及融合语义和几何信息的视觉特征。在使用 4B 骨干模型和纯 RGB 输入的情况下,PanoVLN 在 R2R-CE 和 RxR-CE Val-Unseen 基准上的成功率分别比此前最佳方法高出 11.9% 和 8.7%。四足机器人上的真实环境实验还表明,该方法导航速度更快,暂停次数更少。
行业资讯 应用 AI模型 研究 2026-09-30 13:01:06 730 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。