自动驾驶的两派之争,被 arXiv 2609.00111 用「外挂 BEV 头 + LoRA 微调」和解了

  • 关联论文:2609.00111

如果你刷自动驾驶新闻超过半年,一定听过两派在吵架:

「端到端派」:大模型一锅端,从摄像头像素直接吐方向盘角度,人类开车就是这么开的 「模块化派」:3D 感知、轨迹预测、规划各管一摊,每一摊都有成熟 BEV(鸟瞰图)方案在 nuScenes 跑分漂亮

2026 年 9 月一篇来自阿里通义千问团队的论文(Qwen-Drive-1.0)说:别吵了,我两个都要

具体做法是:拿一个已经预训练好的视觉-语言大模型(Qwen-VL)当「大脑」外挂两个小专家——一个负责 3D 感知(BEV 头)、一个负责轨迹规划(Planning Expert),用低秩适配(LoRA)轻量微调主干保住通用视觉-语言能力。

结果: - 在 nuScenes 3D 检测、BEV 分割上与专用 BEV 检测器持平或略优 - 在闭环仿真规划上表现有竞争力 - 在通用 VQA、图像描述上几乎不掉点——这是端到端派常常牺牲的能力

真正难的不是「加一个 BEV 头」,而是三件事同时不崩:① 3D 感知不退化;② 通用 VQA 不丢;③ 闭环规划能跑动。这三件事之前的工作通常只能保证其中一两条。

为什么这件事值得大众关注

自动驾驶过去三年最大的一个矛盾是:端到端派想要一个大模型吃所有任务,但大模型本身是 2D 的、没有 3D 几何感;模块化派手里有现成的 BEV 检测能力,但又舍不得扔掉成熟稳定的传统感知栈。Qwen-Drive-1.0 站中间,给了一种「保留两边优点」的工程范式

更重要的是——这个范式不只适用于自动驾驶。论文里的「通用基础模型 + 外挂领域专家 + 三阶段防遗忘训练」这个模板,可以直接搬到: - 医疗 VLM(CT 影像头 + 诊断规划专家 + 保住医学问答能力) - 工业 VLM(缺陷检测头 + 维护规划专家 + 保住通用视觉问答能力) - 遥感 VLM(地物分类头 + 变化检测专家 + 保住通用场景理解)

任何「想把通用大模型往垂直领域搬、又怕通用能力塌」的团队,都能从这篇论文抄到一份训练配方。

一句话说清:什么叫「通用大模型 + 外挂 BEV 头」?

传统自动驾驶感知模块长这样:

摄像头 6 路 → BEV 检测器 → 占据预测 → 地图分割 → 规划器 → 方向盘角度

每一摊是一个独立模型,独立训练,独立优化。问题是:这套流程对「为什么这个行人要绕开」「为什么前车刹车灯亮了我该减速」这种语义推理题答不上来——BEV 检测器只输出 3D 框,不告诉你「这个 3D 框是不是危险」。

Qwen-Drive-1.0 的做法是:

摄像头 6 路 → Qwen-VL 主干(冻结 + LoRA 轻量微调)
              ├─ BEV 头(3D 检测 / 占据 / 地图分割)
              ├─ VQA 头(驾驶场景问答)
              └─ Planning Expert(自车未来轨迹)

主干冻结参数 + LoRA 微调——这是保住通用视觉-语言能力的关键。 BEV 头和 Planning Expert 是外挂小模块,独立训练、独立检查、可视化。

打个比方:

老板(VLM 主干)本来是管公司战略的,现在让他顺便看一眼前台雷达图、听听客服电话——但他原本的「战略决策」能力不能丢。LoRA 就是给老板加了一副「行业专用眼镜」,让他看得懂雷达图,但不会改他原本的思维方式

三阶段防遗忘训练:保住通用能力的关键

论文最值得抄的不是架构,是训练编排——「staged training recipe」:

阶段 1:BEV 感知预热

用 nuScenes 等驾驶数据训 BEV 头,先让 3D 任务稳定。这一阶段主干完全冻结

阶段 2:驾驶语言对齐

把驾驶相关的问答、规划指令、轨迹数据混进 VLM 的指令微调里,激活驾驶语义。这一阶段主干用小学习率 + LoRA dropout——既学新东西,又不剧烈扰动主干。

阶段 3:混合通用数据回流 ⚠️ 关键创新

把通用视觉-语言数据重新喂回去,防止灾难性遗忘

这就是论文除了自动驾驶本身之外的最大可迁移贡献: - 不刷新主干权重:这一阶段的主干更新幅度小于前两阶段(更小学习率 + 更高 LoRA dropout) - 采样比例:驾驶数据与通用数据的混合比是经验值(论文没给自动选择算法) - 顺序敏感:通用回流放在最后是有意为之——如果混在前阶段同步训练,BEV 任务会主导梯度,通用能力直接塌

这个模式可以推广到任何「领域适配 + 通用能力保留」的任务——医学 VLM、工业 VLM、遥感 VLM 全能套用。

为什么选 BEV 作为「探针」?

BEV(Bird's Eye View,鸟瞰图)在自动驾驶里几乎是事实标准的中间表征:

  • 几何性质:BEV 是正交的、尺度均匀的,适合做检测、占据、地图分割三件套的统一张量
  • 数据生态:nuScenes / Waymo / Argoverse 等主流数据集都提供 BEV 标注,BEV 头可以直接复用
  • 规划友好:自车轨迹就是 BEV 平面里的曲线,BEV 表征对规划模块是天然的输入

论文选 BEV 而非 3D voxel / point cloud / NeRF 等其他 3D 表示,本质上是把「已经在工业里跑通的 BEV 范式」和「VLM 的语义理解」拼起来,降低工程化阻力

工程落地的现实约束

⚠️ 以下几个坑在量产前必须看清:

  1. 延迟预算:典型量产 ADAS 要求感知 + 规划端到端 < 100ms。Qwen-VL-7B 前向推理约 500ms-1s,加上 BEV 头和 Planning Expert 总延迟大概率超过 1s。缓解:用 INT8 量化版 Qwen-VL-2B/4B,或把 VLM 换成专用轻量 3D 感知模型
  2. BEV 视角与相机数量强相关:nuScenes 用 6 个相机 360° 覆盖。如果量产车只有前视 + 后视 2-4 个相机,BEV 重建质量会显著下降——论文没有 ablation 不同相机配置的 performance degradation
  3. 闭环仿真 ≠ 真车:CARLA 仿真的物理真实性不如真实道路。论文 claim 的「闭环规划 highly competitive」在仿真里成立,真实道路上可能因为行人 / 骑行者 / 施工等长尾场景而大打折扣
  4. LoRA rank 选择 trade-off:rank 太低(r=4/8)通用能力保住了但领域适应不够;rank 太高(r=64/128)领域适应强但通用能力可能塌。建议先在内部评测集上 ablate r=8/16/32/64 四个值
  5. 多模态扩展问题:论文主要基于相机,但量产车通常有激光雷达 + 毫米波。是否需要把激光雷达特征也融合进来?还是纯视觉方案已经足够?论文没有讨论
  6. 灾难性遗忘的在线验证难:阶段 3 的「通用数据回流防遗忘」在离线训练时可以控制,但上线后持续收集新数据做增量训练时,通用能力是否还保持需要持续监控——建议建立通用 VQA 回归测试集,每版本更新前跑一次

适合谁读

  • 自动驾驶工程师:特别是已经在用 Qwen-VL 或类似通用 VLM 的团队,可以直接参考架构和训练编排
  • VLM 研究者:想看 VLM 在 3D / 具身任务上能撑多远,这是一份干净的 case study
  • 端到端 vs 模块化争论的旁观者:论文提供了一个相对平衡的样本
  • Robotaxi / 量产 AD 团队:关心「通用能力保留 + 闭环仿真不掉点」两个指标的人,值得细读
  • 大模型迁移到垂直领域的实践者:医学 / 工业 / 遥感 VLM 团队能从这篇的「领域适配 + 通用能力保留」模式里抄到一份范式

一句话总结

Qwen-Drive-1.0 用「冻结主干 + 外挂 BEV 头 + 三阶段防遗忘训练」把端到端派和模块化派的优点捏在一起——3D 感知不退化、通用 VQA 不掉点、闭环规划不掉队——这套「通用大模型 + 外挂领域专家」的范式不止适用于自动驾驶,可以直接搬到任何「想把通用大模型搬进垂直领域」的工程场景。


三个标题变体

  1. 数字钩子版:3D 感知不退化、通用 VQA 不掉点、闭环规划不掉队 —— arXiv 2609.00111 让端到端和模块化两派和解了
  2. 拟人化版:阿里通义给大模型戴了副「自动驾驶眼镜」,通用能力还稳稳地
  3. 类比版:通用 VLM 是老板,BEV 头和规划专家是新配的副驾驶 —— 老板的战略思维不能丢

小红书风格卡片文案(可直接发布)

🚗 自动驾驶圈吵了三年的架,终于有论文出来「和稀泥」了:

端到端派:「大模型一锅端,人类就是这么开车的!」 模块化派:「BEV 检测器在 nuScenes 跑分漂亮,凭什么扔掉?」

通义千问 2026 年 9 月这篇论文(Qwen-Drive-1.0)说:别吵了,两个都要

🧠 怎么做的?三步走

1️⃣ 拿预训练好的 Qwen-VL 当「大脑」——冻结主干 + LoRA 微调 2️⃣ 外挂两个小专家: - BEV 头(3D 检测 / 占据 / 地图分割) - Planning Expert(自车未来轨迹) 3️⃣ 三阶段防遗忘训练: - 阶段 1:BEV 感知预热 - 阶段 2:驾驶语言对齐 - 阶段 3:通用数据回流(⚠️ 关键创新)

📊 实测三件事同时不崩: - ✅ 3D 感知(检测 / 占据 / 分割)不退化 - ✅ 通用 VQA / 图像描述 不掉点 - ✅ 闭环仿真规划 表现有竞争力

⚠️ 量产前必须看清的 6 个坑: 1. 延迟预算最硬:Qwen-VL-7B 前向 ~500ms-1s,总延迟大概率超过 1s——需要 INT8 量化或换轻量模型 2. BEV 视角依赖相机数量:6 相机 vs 量产车的 2-4 相机,质量差异大 3. 闭环仿真 ≠ 真车:CARLA 物理真实性有限,真车长尾场景未知 4. LoRA rank 选择:太低领域适应不够,太高通用能力塌 5. 多模态融合:激光雷达 / 毫米波怎么接入论文未讨论 6. 灾难性遗忘在线验证:上线后增量训练,通用能力需持续监控

💡 方法学价值不止自动驾驶: 「通用基础模型 + 外挂领域专家 + 三阶段防遗忘训练」这套范式,可以直接搬到: - 🏥 医疗 VLM(CT 影像 + 诊断规划) - 🏭 工业 VLM(缺陷检测 + 维护规划) - 🛰️ 遥感 VLM(地物分类 + 变化检测)

任何「想把通用大模型往垂直领域搬、又怕通用能力塌」的团队,都能抄到一份训练配方。

🎯 适合谁读: - 自动驾驶工程师(已经在用 Qwen-VL 的团队可直接参考) - VLM 研究者(VLM 在 3D 任务上能撑多远的 case study) - 大模型迁移到垂直领域的实践者(医学 / 工业 / 遥感)

一句话:给大模型戴副「行业眼镜」,老板的战略思维不能丢——这就是「外挂专家 + 防遗忘训练」的核心哲学。

👇 互动话题:你见过哪些「大模型 + 外挂模块」的成功案例?评论区聊聊 👇

自动驾驶 #端到端vs模块化 #QwenDrive #QwenVL #BEV感知 #LoRA微调 #大模型微调 #领域适配 #防灾难性遗忘 #arXiv2609.00111 #VLM #3D感知 #闭环规划 #nuScenes #AI工程 #每天学点AI