Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索
Qwen-Drive-1.0是一款面向自动驾驶的视觉语言模型,将三维感知、视觉问答和运动规划统一到同一框架中。外部鸟瞰视角(BEV)感知头负责三维目标检测、语义占用预测和BEV地图分割,并为三维场景结构提供可检查的接口。规划模块基于共享的视觉语言模型表示生成车辆未来轨迹。分阶段训练方案结合驾驶监督数据与通用视觉语言数据,在培养驾驶能力的同时,尽量保留广泛的视觉理解和指令遵循能力。多种开放环、伪闭环和闭环评估显示,该模型在三维感知、驾驶场景理解和运动规划方面具有较强竞争力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。