阿里千问开源Qwen-Drive-1.0-4B,首款自动驾驶视觉语言基础模型亮相
阿里千问于9月6日开源Qwen-Drive-1.0-4B,这是首个面向自动驾驶的视觉语言基础模型。该模型基于Qwen3.5-4B构建,统一3D感知与视觉问答,并扩展至运动规划,支持SFT和RL双版本,在保留通用能力的同时提升驾驶安全与人类偏好对齐。
阿里千问本周正式开源了Qwen-Drive-1.0-4B,这是其推出的首个面向自动驾驶领域的视觉语言基础模型。该模型基于Qwen3.5-4B架构打造,在预训练阶段即实现了3D感知与视觉问答任务的统一处理,并将能力边界进一步延伸至运动规划环节,且完全保留了预训练视觉语言模型的原始架构设计。
据官方技术文档披露,Qwen-Drive-1.0采用分阶段训练策略,将驾驶监督数据与通用视觉语言数据有机结合。这种训练方案使得模型在获得驾驶特定技能的同时,并未牺牲其对通用视觉场景的理解力和指令遵循能力,为后续在复杂道路环境中的部署奠定了基础。
此次开源版本同时提供了SFT(监督微调)和RL(强化学习)两个规划专家模型。官方评测体系覆盖了3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划等多个维度。值得注意的是,所有规划样本均仅使用公开来源的数据集构建,并统一了不同数据集的轨迹格式,确保了评测的透明性和可复现性。
评测结果显示,SFT模型在各项基准上已展现出较强竞争力。而经过强化学习优化的版本,在人类偏好对齐和闭环安全性方面获得了全面提升,尽管为此付出了微小的开环位移误差代价。这一权衡取舍反映了自动驾驶模型在真实应用中对安全性和稳定性的优先考量。
目前,Qwen-Drive-1.0-4B的模型权重已同步上线GitHub、Hugging Face和ModelScope平台,开发者可自由下载并基于其进行二次开发或研究。这一开源举措有望推动自动驾驶领域视觉语言模型的研究进展,为行业提供新的技术参考基准。