PanoVLN:迈向高效的全景视觉语言导航
该研究提出了 PanoVLN,一种面向全景观测的视觉语言导航模型。系统并非简单地用全景图替代透视图,而是结合更长时域的动作序列预测、置信度引导的执行策略、包含频繁分支点且指令明确的训练路线,以及融合语义和几何信息的视觉特征。在使用 4B 骨干模型和纯 RGB 输入的情况下,PanoVLN 在 R2R-CE 和 RxR-CE Val-Unseen 基准上的成功率分别比此前最佳方法高出 11.9% 和 8.7%。四足机器人上的真实环境实验还表明,该方法导航速度更快,暂停次数更少。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。