原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.ithome.com/0/998/997.htm
立即前往原文

阿里巴巴开源 Qwen-Drive-1.0-4B:面向自动驾驶的视觉语言基础模型

阿里巴巴开源了基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型 Qwen-Drive-1.0-4B。该模型在保留原有视觉语言模型架构的同时,统一整合了 3D 感知、视觉问答和运动规划。其分阶段训练方案结合驾驶监督数据与通用视觉语言数据,旨在兼顾驾驶专属能力、通用视觉理解和指令遵循能力。模型提供 SFT 和强化学习两种规划专家,评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。阿里巴巴表示,项目仅使用公开来源的规划数据。强化学习训练后,模型在人类偏好对齐和闭环安全性方面有所提升,但开环位移误差略有增加。
行业资讯 应用 行业新闻 科技巨头 AI模型 研究 开源 2026-09-06 17:30:05 469 阅读 阅读约 1 分钟 来源:IT之家
本文来源:IT之家,仅供学习参考,版权归原作者所有。