原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.00111
立即前往原文

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索

Qwen-Drive-1.0是一款面向自动驾驶的视觉语言模型,将三维感知、视觉问答和运动规划统一到同一框架中。外部鸟瞰视角(BEV)感知头负责三维目标检测、语义占用预测和BEV地图分割,并为三维场景结构提供可检查的接口。规划模块基于共享的视觉语言模型表示生成车辆未来轨迹。分阶段训练方案结合驾驶监督数据与通用视觉语言数据,在培养驾驶能力的同时,尽量保留广泛的视觉理解和指令遵循能力。多种开放环、伪闭环和闭环评估显示,该模型在三维感知、驾驶场景理解和运动规划方面具有较强竞争力。
行业资讯 应用 AI模型 研究 2026-09-02 10:31:06 795 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。