原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.01404
立即前往原文

评估多模态大语言模型作为无人机控制的视觉语言行动智能体

该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到达。在多无人机场景中,模型还可能将同一坐标盲目复制到不同视角。研究表明,模型的空间感知能力相对可靠,主要问题在于持续遵守行动协议,以及准确判断任务何时完成。
行业资讯 应用 AI模型 研究 2026-09-02 10:31:06 634 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。