自动驾驶的长期矛盾是「感知」和「决策」分属两套系统、两套数据、两套训练流程。阿里 Qwen 团队与华中科技大学把这件事压进了一个 4B 的多模态模型里:同一个 VLM 主干既做通用视觉理解,又接出 BEV 感知头和规划专家,用一个分阶段训练配方同时吃驾驶监督数据和通用视觉语言数据。
Qwen-Drive-1.0 是首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,并且全程保持预训练 VLM 架构无改动。模型以原生多模态的 Qwen3.5-4B 为基座,增加两个外部模块。BEV 感知头作为显式、可检视的 3D 探针,联合完成 3D 目标检测、语义 Occupancy 预测与 BEV 地图分割。规划专家基于流匹配生成未来自车轨迹。通过分阶段训练,显著提升了通用 VLM 的自动驾驶能力,并在 3D 感知、驾驶视觉问答与运动规划任务上验证了其可行性,形成了一个统一的自动驾驶视觉-语言模型,为驾驶场景适配提供了新一代 VLM 基座。
核心亮点
-
统一多任务架构。 Qwen-Drive-1.0 是首个在预训练阶段统一 3D 感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,并且全程保持预训练 VLM 架构无改动。 -
外部 BEV 感知头。 作为显式、可检视的 3D 探针,联合学习 3D 检测、语义 Occupancy - 预测与 BEV 地图分割,使同一预训练 VLM 具备明确的感知输出,同时保持极具竞争力的视觉-语言性能。 -
分阶段训练与数据配方。 统一跨数据集标签,重新对驾驶相关的 VQA 数据集打标并按语义一致性过滤样本,将驾驶数据与通用视觉-语言监督相结合,在完成领域适配的同时缓解灾难性遗忘。 -
基于流匹配的规划专家。 面向预训练 VLM 表征设计,生成未来自车轨迹。统一的轨迹标注支持跨多个公开驾驶数据集联合训练,在开环、伪闭环与闭环评测中均取得极具竞争力的结果
关
相关链接
-
论文:https://arxiv.org/abs/2609.00111 -
代码:https://github.com/QwenLM/Qwen-Drive-1.0 -
博客: https://qwen.ai/research -
权重:https://modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B -
协议:Apache-2.0(可商用)
内容介绍
Qwen-Drive-1.0 不是把现有感知模型和规划模型拼起来,而是从一个通用 VLM 出发,证明「驾驶能力」可以通过附加轻量外部模块 + 分阶段训练注入,而不牺牲模型的通用视觉理解。它的卖点在于:一个 4B 模型既能回答「前面那辆车是什么颜色」这类通用问题,也能输出可行驶轨迹,并且 BEV 感知结果作为显式、可检查的 3D 接口对外暴露。
对工程侧,它给出了一条相对低门槛的路线:基座是现成的 Qwen3.5-4B,外挂模块和数据管线开源,研究者可以在此之上替换感知头或规划专家。
方法概述
1. 共享 VLM 主干(Qwen3.5-4B)
模型保留 Qwen3.5 多模态 VLM 的架构,原生多模态的 4B 版本作为统一表征来源。LLM Decoder 不做改动,因此同一套权重既能承接通用 VQA,也能承接驾驶 VQA——这是它「不丢通用能力」的前提。
2. BEV 感知头作为 3D 探针
外部 BEV 感知头联合执行 3D 目标检测、语义占用(semantic occupancy)预测与 BEV 地图分割。论文把它定位为对共享表征中 3D 信息可及性的探针,同时给出一个显式、可检查的 3D 场景结构接口,方便调试和可视化,而不只是黑盒输出。
3. 规划专家与分阶段训练
规划专家以共享 VLM 表征为条件生成未来自车轨迹。训练采用分阶段配方,把感知、语言、规划三类目标组合起来;统一数据管线做三件事:把异构感知标注映射到共享标签空间、重标驾驶 VQA 回答以保证格式与事实一致性、把多个公开驾驶数据集的轨迹标准化为统一的 waypoint 表示。SFT 版是模仿训练的规划专家,RL 版是在基准目标上做奖励优化后的同一专家,两者共享同一个 VLM。
实验结果
规划性能(SFT 为模仿训练的规划专家,RL 为同一专家在基准目标上做奖励优化后;两者共享一个 VLM):
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
驾驶场景理解:
|
|
|
|
|
|
|
|
|
|---|---|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
通用视觉语言能力基本保留:基座 Qwen3.5-4B 在 MMBench 87.1、MMStar 75.3、MMMU 73.4、MMMU-Pro 64.9/61.3、CharXiv 65.1、OCRBench 86.9、RealWorldQA 76.3 等基准上本就靠前,但是论文称驾驶训练后该能力大体未损。
结论
Qwen-Drive-1.0 展示了一条务实的路线:不推翻 VLM,而是用「共享主干 + 外挂专家 + 分阶段训练」把驾驶能力叠加进去,4B 规模也利于社区复现。对关注世界模型与具身智能的读者,它是「VLM 如何长出生理级空间与规划能力」的一个可运行样本。
-
对研究员:Apache-2.0 + 完整代码/数据管线,适合做消融(换感知头、换规划专家、改训练阶段顺序)。 -
对工程落地者:4B 体量部署友好,BEV 头提供可检查接口;但这是研究初版,量产级安全冗余需自行补齐。 -
对内容创作者:它把「会看、会答、会开」统一到一个小模型,是讲「端到端自动驾驶平民化」的好素材。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

