DriveZero:超越人类示范的端到端自动驾驶系统 DriveZero: End-to-End Driving Beyond Human Demonstrations
解耦预训练感知与决策、蒸馏统一,端到端驾驶首次超越人类司机
前置知识
端到端自动驾驶
将车载传感器观测与导航意图直接映射为车辆运动轨迹的范式,不显式拆分为检测、预测、规划等独立模块。主流做法是行为克隆:以人类驾驶日志中记录的轨迹为监督信号训练神经网络,优点是可扩展、训练稳定,缺点是行为上限被日志锁死。
本文正是针对该范式的根本局限展开:克隆人类日志使系统受制于日志质量与覆盖面,理解这一背景才能体会 DriveZero 用强化学习轨迹替代人类轨迹的核心动机。
PPO(近端策略优化)
一种策略梯度强化学习算法,通过裁剪重要性采样比率限制每次策略更新的幅度,兼顾样本效率与稳定性。本文中 PPO 同时训练驱动策略(actor)与价值函数 critic,后者估计折扣回报,并被复用于推理期的价值引导动作搜索。
DriveRL 用 PPO 从零(无模仿预训练)训练特权教师策略,其 critic 又支撑了测试时动作搜索,是理解本文方法与实验设计的基础。
特权教师与学生蒸馏
教师策略使用训练时可得而部署时不可得的特权信息(如真值物体状态、向量地图)学习驾驶行为;学生模型仅用相机图像等可部署输入模仿教师输出。本文教师从结构化场景状态 rollout 20 步轨迹,学生以 winner-takes-all 损失回归该轨迹。
DriveZero 的整个训练框架就是特权到视觉的迁移,理解该范式才能明白为何学生无需进入仿真器或渲染器,即可继承教师在闭环中学到的能力。
Winner-Takes-All(WTA)损失
处理多模态输出的训练技巧:模型一次输出 $M$ 个候选(本文为 64 条轨迹提案),与目标比较后仅让距离最近的候选承担回归损失,其余候选梯度置零。这样不同轨迹查询可自动分工捕捉不同驾驶模式,模式间选择交给打分分支。
DriveZero 的轨迹解码器输出 64 条提案,WTA 损失 $\mathcal{L}_{traj}=\min_m \mathrm{dist}(\hat{\tau}_m, \tau^T)$ 是其核心训练目标之一,不懂它就看不懂轨迹如何学。
多教师视觉蒸馏(RADIO 路线)
把 DINOv3、SigLIP2、SAM、Depth Anything 等冻结视觉基础模型的特征蒸馏进单一骨干:共享 ViT 为每个教师输出一个 summary token,并为所有教师输出共享的 patch token,经轻量适配器对齐。配合 PHI-S 标准化平衡不同教师特征的量纲与方差,全程无需任何任务标注。
DriveVFM 完全沿用该配方构建驾驶视觉骨干,它是学生规划器感知能力的来源,也是消融实验(教师逐个累加)的重要对象。
研究动机
绝大多数端到端驾驶系统通过模仿人类驾驶日志学习,行为上限被日志的质量与覆盖面牢牢锁死。具体而言:每条日志场景只包含一个被实现的未来——同一场景下多种动作本都可行,但系统只能学到司机实际开的那一种;安全关键的偏离与恢复操作(急刹避让、绕行)在正常驾驶日志中天然稀缺;更致命的是分布漂移,策略一旦驶出示范分布,其自身到达的状态在离线数据中根本不存在,误差逐步复合。基准数据也印证了日志的不稳健:nuPlan 上 Log-Replay 专家在非反应式 Val14 拿到 93.53 分,但反应式模式骤降至 80.32,Test14-hard 反应式仅 68.80;NAVSIMv1 navtest 上人类司机 PDMS 为 94.8,最强模仿学习方法 DrivoR-Scale 已达 94.6,基准接近饱和,模仿范式的天花板清晰可见。
本文的目标是本文的目标是构建一个行为不再受人类示范约束的端到端驾驶系统:让驾驶行为的来源从'克隆日志'变为'强化学习在闭环交互中自主探索与优化',同时保持相机-only 的可部署形态。量化目标包括:在 nuPlan 三个社区划分(Val14、Test14-hard、Test14-random)的非反应式与反应式共六个设置上超越 Log-Replay 专家;在 NAVSIMv1 navtest 上达到并超越人类司机的 94.8 PDMS;在 NAVSIMv2 navhard 与真闭环 HUGSIM 上刷新 SOTA;且全程不使用任何人类轨迹作为监督。作者还希望验证配方的可扩展性——用仿真数据扩充训练集能带来稳定增益,并最终在真实车队上完成部署演示。
与已有工作不同的是,既有工作走了两条路:一是给共享骨干挂检测、车道、分割、深度等辅助感知头,依赖海量任务标注;二是特权 RL 教师加视觉学生蒸馏,如 ROACH 把 CARLA RL 教练蒸馏进单目策略、GigaPixel 用简化渲染器做自博弈 DAgger——但它们都直接拿现成的视觉编码器,感知与决策没有各自在最适合的学习范式里预训练。本文的独特切入是彻底解耦:感知需要理解世界,受益于海量静态图像与丰富表征监督,不需要交互;动作需要与环境交互形成闭环反馈,但结构化状态足够紧凑、可高吞吐并行仿真。于是先分别预训练 DriveRL 与 DriveVFM,再用轨迹蒸馏把二者重新统一成相机-only 规划器,学生自始至终不进入渲染环境。另一个独特杠杆是目标条件化:教师可在同一场景下被查询增强的驾驶意图,产生日志原理上无法提供的反事实监督。
核心方法
整体思路分三步,直觉是各学各的、蒸馏合体。第一步动作模型 DriveRL:把 922,703 条 nuPlan 日志转成混合智能体交互世界,96 张 GPU、每 rank 2,048 个世界(全场最多 196,608 个并行)跑 PPO,从零训练 5.70M 参数特权教师,输入结构化场景与目标点,输出 jerk 与转角速率的 Beta 分布;110 步 rollout、5Hz、$\gamma=0.99$,2,400 次更新约 21 小时。第二步感知模型 DriveVFM:按 RADIO 聚合蒸馏路线把 DINOv3、SigLIP2、SAM、Depth Anything V2 蒸馏进单一 ViT 骨干,两阶段渐进分辨率(256² 60 万迭代加 512² 20 万迭代,batch 2,048),语料混合 LAION-2B、ImageNet-21K、SA-1B 与驾驶图像,无需任务标注。第三步 DriveZero 用 DriveVFM 加 LoRA 编码四路相机,64 条提案以 WTA 损失回归教师 rollout 轨迹,打分分支预测 PDM 六项分量,推理选最高分提案。
核心创新有三层。第一,按学习范式解耦:此前端到端驾驶要么克隆人类轨迹,要么如 ROACH、GigaPixel 闭环训练但视觉编码器拿来就用;本文论证感知与动作需要不同配方——感知吃大规模多样图像与表征监督,动作吃闭环交互的高吞吐反馈,分别预训练再蒸馏统一,这是与已有范式的本质区别。第二,DriveRL 把真实 nuPlan 日志变成可交互世界:每个交通参与者通过统一的物理状态-动作接口挂接独立行为提供者(日志回放、IDM 规则、自博弈策略),配合场景一致性检查的演员插入门控,解决自车偏离日志后晚到车辆落在不合理位置甚至碰撞的问题。第三,也是最妙的:教师是目标条件的生成式模型,对同一场景换一个导航意图就能查询出新的目标一致轨迹——这种目标增强监督是人类日志原理上给不出的(改了目标就没有对应的人类轨迹),消融显示正是它让 RL 监督(93.61)反超人类监督(93.92)达到 94.41 PDMS。此外,价值引导测试时搜索把 PPO 的 critic 变成'推理算力换性能'的旋钮,无需任何重训练。
方法步骤详情
流水线四步。① DriveRL:观测为至多 96 个参与者的 5 帧 5Hz 历史、256 个地图 token、红绿灯与两点目标,交叉注意力聚合;策略头输出 jerk 与转角速率的独立 Beta 分布;奖励 $r_t=h_t+(1-d_t)(g_t+\prod_k q_{t,k}^{1/H})$:$h_t$ 硬事件终止、$g_t$ 到点奖励、六项软指标几何加权,$H=110$。② 测试时搜索:Beta 众数为候选 0、另采 $N-1$ 个,$L=5$ 步 rollout,按折扣累积奖励加 critic 自举 $V(O_L)$ 打分,超众数裕量 $\delta=0.03$ 才切换。③ DriveVFM:共享 ViT 产出各教师 summary token 与共享 patch token,前者余弦匹配,后者 PHI-S 标准化后 MSE 回归。④ DriveZero:DriveVFM 冻结仅训 rank-32 LoRA,每相机 16 个 register,64 条提案 WTA 回归教师 20 步轨迹,打分分支对 6 项 PDM 目标做 BCE,训练 25 epochs。
技术新颖性
技术新颖性体现在四处。其一,闭环 RL 从零训练且无模仿预训练,在 nuPlan 规模上系统性跑通并超越 Log-Replay 专家(六项均值 93.01,所有设置领先),挑战了'RL 需要模仿热启动'的常见预设。其二,混合智能体仿真工程:整个 rollout 循环(背景车行为、车辆动力学、奖励计算、场景编辑)全部实现为批量化 GPU 算子,单 GPU 2,048 个世界、96 GPU 并行 196,608 个世界,这是 21 小时训完教师的工程前提。其三,学生开环训练即可继承教师闭环能力——蒸馏目标来自每帧冻结教师按日志回放背景车 rollout 出的轨迹,学生不进仿真器、无需渲染,与 GigaPixel 依赖自博弈 DAgger 与简化渲染器的路线完全不同,训练成本大幅降低。其四,目标增强把教师当作'反事实轨迹生成器',与价值引导搜索共同构成'训练期生成多样监督、推理期局部策略改进'的完整图景。DriveVFM 的 PHI-S 特征平衡与受 Kimi K2 QK-Clip 启发的注意力稳定化也具工程新意。
实验结果
nuPlan 闭环(Table 2):DriveRL 六项均值 93.01,全面超越 Log-Replay(Val14 NR 93.53、反应式仅 80.32);测试时搜索(N=64)升至 93.57。测试时扩展(Table 3):候选数 8→64 使均值 93.12→93.57。NAVSIMv1(Table 4):DriveRL 95.8 超人类 94.8;DriveZero 94.8 追平人类,Scale 版 95.3 创 SOTA(次优 DrivoR-Scale 94.6)。NAVSIMv2 navhard(Table 5):DriveZero 51.5,Scale 版 57.1 创纪录(超 PDM-Closed 56.6),Stage 2 大幅提升。HUGSIM 零样本(Table 6):Scale 版 HD-Score 46.6,比 GigaPixel 38.5 高 8.1。消融(Table 7):DriveVFM 94.41 对 DINOv3 93.88;教师累加 93.69→94.41;RL 加目标增强 94.41 反超人类监督 93.92。系统已在小米实车上完成演示。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| nuPlan 闭环驾驶(六设置均值) | CLS(0-100) | DriveRL 93.01;DriveRL-TTS 93.57 | Log-Replay 专家;CaRL 93.87(Val14 NR,反应式全面落后) | 六个设置全面超越 Log-Replay,均值 +0.56(TTS) |
| NAVSIMv1 navtest 伪闭环 | PDMS | DriveZero-Scale 95.3(DriveZero 94.8) | Human Driver 94.8;最强基线 DrivoR-Scale 94.6 | 超人类 0.5 分、超最强基线 0.7 分,首个超越人类的端到端模型 |
| NAVSIMv2 navhard 伪闭环 | EPDMS | DriveZero-Scale 57.1 | PDM-Closed 56.6(真值输入);DrivoR-Scale 54.6;GigaPixel 50.1 | +0.5 对最强基线,Stage 2 从 60.8 提升到 69.1 |
| HUGSIM 真闭环零样本 | HD-Score 平均 | DriveZero-Scale 46.6 | GigaPixel 38.5;DrivoR-Scale 38.1 | +8.1 分 |
| DriveVFM 骨干消融(navtest) | PDMS(ViT-S) | 94.41 | DINOv3 ViT-S 93.88;DINOv2 93.88;Depth Anything 2 93.72 | +0.53 |
局限与改进
作者坦承与数据可见的局限:其一,DriveRL 轨迹监督单独使用时(93.61)略低于人类轨迹监督(93.92),必须叠加目标增强才能反超,说明蒸馏目标质量高度依赖增强策略的设计;其二,测试时搜索在反应式 Test14-hard 上几乎无增益(89.15 对 89.18),且视界 L 增大会引入串行延迟;其三,SimScale 数据扩展让 navhard Stage 1 从 84.1 降到 82.3,OOD 数据对分布内性能存在轻微负迁移。我自己的观察:HUGSIM Extreme 档绝对值仍很低(RC 39.8、HD-Score 27.6),真闭环驾驶离可用尚远;部署版依赖自动标注的感知真值混合车载感知降级输入,仿真到真实的感知误差链未完全量化;navtest 已到 95 分位,基准饱和使 0.5 分级别的提升统计意义存疑;奖励是六项硬编码几何加权,可解释但未必最优。
独立分析的弱点
独立分析五个弱点。第一,视觉学生是纯开环训练,教师失误会被原样蒸馏,且学生没有 on-policy 纠错机会(GigaPixel 用 DAgger 正是为此),改进方向是在神经世界模型里做短程闭环微调,或对接近分布的状态做 DAgger 式重查询。第二,教师观测来自自动标注的感知真值,部署时车载检测、在线建图与导航的误差会直接劣化教师行为,论文用域随机化缓解但未量化这条误差链,改进方向是对学生直接在带噪观测上蒸馏,或训练感知噪声鲁棒的教师。第三,96 GPU 21 小时的 RL 加 80 万次迭代全局 batch 2,048 的 DriveVFM 预训练,门槛是大厂集群级,社区难以复现与迭代,改进方向是发布教师轨迹数据集或轻量 DriveVFM-S 权重。第四,nuPlan 评测背景车由 IDM 驱动,自博弈带来的自然交互优势在该基准上无从体现(论文自己承认增益很小),改进方向是推动采用学习型背景车的评测协议。第五,测试时搜索每次规划需并行 rollout 最多 64 个候选,虽可批量化但对车载实时性与功耗仍是负担,可研究早期退出或蒸馏搜索结果。
未来方向
作者提出的方向:把自博弈作为部署配置进一步扩展(真实交通中背景车会像真司机一样反应,而 nuPlan 的 IDM 评测无法奖励这一点);系统已在真实车队验证,下一步自然是更大规模的实车闭环。基于成果可延伸的方向:其一,目标增强可推广到语言级意图条件(变道、超车、让行风格),把教师变成可控驾驶行为生成器,与 VLA 范式衔接;其二,DriveVFM 配方可加入更多异构教师(如 VLM 语义教师),并系统研究驾驶专属语料配比;其三,把 DriveRL 交互世界与世界模型或神经渲染结合,让视觉学生也能闭环训练,消除开环蒸馏的复合误差;其四,价值引导搜索可与扩散规划器或大模型规划器结合,推广'训练期生成、推理期搜索'的解耦思路;其五,'分别预训练、蒸馏统一'的配方本身可迁移到机器人操作等具身智能任务。
复现评估
复现评估:论文为技术报告形式,附项目网站 xiaomiautol3.github.io/DriveZero,截至报告未提及开源代码或权重。数据侧 nuPlan、NAVSIM v1/v2、HUGSIM 均公开,SimScale 数据来自已发表工作,数据可得性尚可。算力是最大门槛:DriveRL 需 96 张 GPU 约 21 小时,且依赖自研的批量化 GPU 仿真器——单卡 2,048 个并行世界的运行时工程是核心 know-how,论文公开的实现细节有限;DriveVFM 预训练 80 万次迭代、全局 batch 2,048,同样是集群级投入。相对可行的路径:只复现 DriveZero 蒸馏与评测(需自训教师生成轨迹或等官方发布),DriveVFM 可用公开 RADIO 权重近似替代。综合判断:完整复现难度极高(大厂资源级),仅评测与消融复现为中等难度。
论文图表