评估多模态大语言模型作为无人机控制的视觉语言行动智能体
该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到达。在多无人机场景中,模型还可能将同一坐标盲目复制到不同视角。研究表明,模型的空间感知能力相对可靠,主要问题在于持续遵守行动协议,以及准确判断任务何时完成。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。