← 返回 2026-08-10

SimWAM:用于端到端自动驾驶的简单世界-动作模型 SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai 📅 2026-08-07 👍 103 2026-08-15 18:30
世界-动作模型 强化学习 流匹配 端到端自动驾驶 视频生成

视频生成仅作训练信号,推理时丢弃视频分支直接预测轨迹

前置知识

世界-动作模型 (World-Action Model, WAM) 与 imagine-then-act 范式

WAM 把世界模型(生成/预测未来观测)和动作/策略预测联合学习,最早源于具身智能(如 DreamZero、LingBot-VA)。自动驾驶里的 WAM(如 DriveWAM、DriveLaW)通常采用 imagine-then-act 流水线:先让视频生成模型合成未来若干帧隐变量 $z_{t+1:t+N}$,再把这些未来帧作为条件去规划轨迹 $a_{t+1:t+H}$,即 $p(a|o,s,l,z)$。这等于把昂贵的视频生成塞进了实时规划回路。

理解本文必须先明白 imagine-then-act 为何在推理时带来高延迟——SimWAM 的全部贡献就是为了'保留 WAM 的训练红利、但在推理时彻底丢弃视频分支',这只有相对于 imagine-then-act 才有意义。

Rectified Flow / 流匹配 (Flow Matching)

流匹配用线性插值 $x_\tau=(1-\tau)x+\tau\epsilon$($\epsilon\sim\mathcal{N}(0,I)$,$\tau\in[0,1]$)连接噪声与数据,其常速度场为 $\epsilon-x$,训练一个网络 $v_\theta$ 去回归该速度,损失为 $\mathcal{L}_{FM}=\mathbb{E}_{x,\epsilon,\tau}\|v_\theta(x_\tau,\tau,c)-(\epsilon-x)\|_2^2$。采样时沿 ODE $dx_\tau=v_\theta d\tau$ 从 $\tau=1$(噪声)积分到 $\tau=0$(数据)。相比高斯扩散,rectified flow 路径更直、可用更少步数采样。

SimWAM 同时用流匹配建模未来视频帧和轨迹,是方法的核心数学语言;后续 RL 阶段还需把确定性 ODE 改写成保持边缘分布的 SDE,没有这个基础看不懂。

Mixture-of-Attention / 共享注意力 (Shared Attention)

在多模态 DiT 里,不同专家(这里指视频 DiT 与动作 DiT)通过共享的注意力 token 流交换信息:把各专家的 key/value token 拼到一个公共注意力层里,使一个专家的表征能被另一个专家 attend 到,但参数完全独立。本文在此基础上进一步加 attention mask 控制谁能看到谁。

隔离注意力掩码(isolated attention mask)就构建在这种共享注意力之上——它规定动作 token 和未来帧 token 都能看当前观测 $z(o_t)$,但彼此互不可见,这是训练后能丢弃视频分支的底层机制。

NAVSIM 基准与 PDMS 指标

NAVSIM 建立在 nuPlan 的 OpenScene 子集上,是一种非反应式(non-reactive)规划基准:剔除了平凡的静止/匀速场景,保留路口、汇入、转弯等难例。本文在 navtrain(103,288 场景)上训练,在 navtest(12,146 场景)上评测。核心指标 PDMS(Predictive Driver Model Score)由 NC(无碰撞)、DAC(可行驶区域合规)两个二值惩罚因子,与 EP(自车进度)、TTC(碰撞时间)、C(舒适度)三个加权质量项组合而成,满分附近的人类代理为 94.8。

PDMS 是论文所有改进的衡量标尺,论文的核心战绩 91.5 PDMS 必须在这个上下文里理解;且 RL 阶段用的奖励正是 NAVSIM 的 PDM 奖励。

GRPO 与 Flow-GRPO 强化学习

GRPO(Group Relative Policy Optimization)是 PPO 的变体:对每个场景采样一组 G 个候选动作,用组内相对优势 $\hat A_i=(R_i-\bar R)/\sigma_R$ 做带裁剪的策略更新。Flow-GRPO 进一步把确定性流 ODE 替换为保持边缘分布的 SDE:$dx_\tau=[v_\theta+\frac{\sigma_\tau^2}{2\tau}x_\tau+(1-\tau)v_\theta]\,d\tau+\sigma_\tau dw$,其中 $\sigma_\tau=a\sqrt{\tau/(1-\tau)}$,从而获得可处理的转移密度 $\pi_\theta(x_{\tau-\Delta\tau}|x_\tau)=\mathcal{N}(\mu_\theta,\sigma_\tau^2\Delta\tau I)$ 以支持重要性采样。

SimWAM 的第二阶段训练就是 Flow-GRPO:它需要从噪声里采样多条多样轨迹、用驾驶奖励反向更新策略。没有这一步,模型停在 90.3 PDMS 的模仿学习上限。

Wan2.2-5B 视频生成模型与视频 VAE/T5 编码器

Wan2.2-5B 是一个大规模文本到视频的扩散 Transformer。配套的视频 VAE 把每帧图像压成隐空间 token,T5 文本编码器把导航指令编码成 cross-attention 的条件。本文把 Wan2.2-5B 作为视频专家的初始化,当前帧作为干净条件,未来 N 帧加噪后用流匹配重建。

视频专家是 SimWAM 动态先验的来源,理解它的输入输出(图像→隐 token、文本指令→条件)才能理解联合训练为何能把交通动态'灌'进动作专家。

研究动机

端到端自动驾驶把原始传感器直接映射到规划轨迹,近年的 VLA(视觉-语言-动作)与世界-动作模型(WAM)通过语义推理或显式世界动力学超越了纯模仿学习。然而自动驾驶里的 WAM(如 DriveLaW、DriveWAM、Epona)几乎都沿用 imagine-then-act 范式:推理时先合成未来驾驶场景隐变量 $z_{t+1:t+N}$,再以其为条件生成轨迹,联合分布写作 $p_\theta(a_{t+1:t+H}|o_t,s_t,l)=\int p_\theta(z_{t+1:t+N}|o_t,s_t,l)\,p_\theta(a|o,s,l,z)\,dz$。这一设计把昂贵的视频合成塞进了实时规划回路,导致延迟大幅上升:Figure 1 显示 Epona、DriveWAM、DriveLaW 等世界模型类规划器普遍落在 1500–3200ms,而 SimWAM 在更低延迟下取得更高 PDMS。其根本症结在于:显式的未来合成对'学习'世界动力学其实并非必要,却强行绑定了推理代价。

本文的目标是本文的目标是设计一个简单、有效且灵活的世界-动作模型,使视频生成只充当训练信号、不进入推理回路。具体而言:(1) 在训练阶段通过联合流匹配把预训练视频专家的交通动态先验迁移到一个轻量动作专家;(2) 通过结构性约束让动作专家只依赖当前观测 $z(o_t)$,从而训练后可整体丢弃视频 DiT 及其 VAE 解码器,推理时只剩直接预测轨迹的自包含规划器;(3) 在保持规划质量的同时把延迟压到与直接轨迹预测相当的水平,目标是在 NAVSIM navtest 上刷新 SOTA;(4) 进一步用强化学习在模仿学习之外直接优化驾驶质量奖励;(5) 让架构具备灵活性——视频骨干可替换、动作专家可独立缩放,且不改变学习目标与推理流水线。

与已有工作不同的是,已有工作存在一个关键但未被充分利用的洞察:FastWAM 指出视频共训练对动作预测的收益主要来自'训练时的表征学习',而非'测试时的未来想象'。本文正是把这一洞察推到极致——用隔离注意力掩码(isolated attention mask)从结构上切断动作专家对未来帧 token 的依赖,使动作专家只通过当前观测 $z(o_t)$ 间接吸收视频专家塑造的动态知识。这相当于把想象与行动解耦:训练时视频专家'教'动作专家,推理时视频专家被彻底丢弃。与之前所有 drive WAM 相比,SimWAM 是第一个把 imagine-then-act 退化成'训练时想象、推理时行动'的简洁方案,且这个解耦只靠一个注意力掩码实现,几乎不增加架构复杂度。

核心方法

SimWAM 的思路是'训练时共享、推理时分离'。模型由两个参数完全独立的专家组成:一是初始化自 Wan2.2-5B 的视频 DiT(含视频 VAE 与 T5 编码器),重建未来 $N$ 帧以提供交通动态监督;二是隐宽 $d_a=1024$ 的轻量动作 DiT,用流匹配预测 8 个路径点 $a_{t+1:t+H}$(4 秒、2Hz)。二者仅通过共享注意力流交互,以联合损失 $\mathcal{L}=\mathcal{L}_{actFM}+\lambda\mathcal{L}_{vidFM}$($\lambda=1$)训练。关键创新是隔离注意力掩码:当前观测 token 同时被未来帧 token 和动作 token 看到,但二者彼此不可见,于是动作专家学到的轨迹完全独立于未来帧。训练后整个视频分支(含 VAE 解码器与未来帧生成)被丢弃,只留动作 DiT 做直接轨迹预测,推理退化为 $p_\theta(a|o_t,s_t,l)=p_\theta(a|z(o_t),s_t,l)$。最后用 Flow-GRPO 在难场景上微调动作专家的 LoRA 适配器。

核心创新是'隔离注意力掩码 + 训练时想象'的组合。在共享注意力流中,未来帧 token $z_{t+1:t+N}$ 与动作 token 都 attend 到当前观测 token $z(o_t)$,但它们之间用掩码互不可见(而 bidirectional 或 action→video 两种基线则会让动作 token 看到未来帧)。这一看似极小的改动带来两个本质区别:第一,动作专家的全部知识都通过被视频专家'加工过'的当前观测表征流入,推理时不再需要未来帧,因此视频 DiT 可整体删除;第二,由于两专家参数完全独立、仅通过注意力接口交换信息,视频骨干可以任意替换(换成更强的视频生成器即可增强先验),动作专家也可独立缩放(0.21B 到 1.02B),而学习目标和推理流水线完全不变。这与 DriveWAM/DriveLaW 把规划'绑定'到未来生成的做法形成鲜明对比——本质是从'解耦观察者'变成了'耦合观察者'。

方法步骤详情

方法分四阶段。(1) 联合流匹配训练:输入前摄像头 $o_t$(384×672)、自车状态 $s_t$、导航指令 $l$。视频专家用 Wan2.2-5B 初始化,视频 VAE 把每帧压成隐 token,T5 把 $l$ 编为 cross-attention 条件,当前帧作干净条件、未来 8 帧加噪后用流匹配重建。动作专家以 $c=\{z(o_t),s_t,l\}$ 为条件输出速度场 $v_{\theta_a}(a^\tau,\tau,c)$,以 $\mathcal{L}_{actFM}+\lambda\mathcal{L}_{vidFM}$ 用 AdamW($10^{-4}$)训练 100 epoch。(2) 隔离掩码:在共享注意力层使动作 token 与未来帧 token 互不可见。(3) 强化学习:把确定性 ODE 改为边缘保持 SDE 以获可处理转移密度,采 $G=8$ 条轨迹用 PDM 奖励做 GRPO;只更新 rank-32 LoRA,学习率 $5\times10^{-5}$,只在模仿 PDMS<90 的难子集训练。(4) 推理:仅留动作 DiT,10 步采样收敛。

技术新颖性

技术新颖性有三层。第一,隔离注意力掩码是唯一需要的结构性改动——它用极简方式实现'训练时想象、推理时行动',把动作专家从未来帧中解耦,使视频分支可整支丢弃;消融显示这种最简的依赖结构反而取得最佳 PDMS(90.3),优于 bidirectional(90.2)和 action→video(90.1)。第二,参数完全独立的解耦双专家架构带来两条独立的缩放维度:视频骨干可替换(LTX-Video、Wan2.1-1.3B、Wan2.2-5B、Cosmos2.5 均可即插即用,PDMS 从 88.7 到 90.4 单调上升),动作专家可缩放(0.21B→1.02B 使 PDMS 从 89.9 升到 90.3),且视频专家的增强不增加任何部署开销。第三,把确定性流 ODE 转为边缘保持的 SDE,再在自包含的动作专家上做 GRPO——这与以往只在 VLA 的语言推理或高层决策上做 RL 不同,本文是对连续轨迹预测的直接强化,且因为动作专家已与视频解耦,RL 可独立进行而无需重跑视频前向。

SimWAM 概览。联合训练时视频与动作 DiT 通过共享注意力学习未来动态与轨迹生成,注意力掩码把动作 token 限制在当前观测;推理与 RL 时仅保留动作 DiT。
Figure 2: SimWAM 概览。联合训练时视频与动作 DiT 通过共享注意力学习未来动态与轨迹生成,注意力掩码把动作 token 限制在当前观测;推理与 RL 时仅保留动作 DiT。

实验结果

在 NAVSIM navtest(12,146 场景)上 SimWAM 仅用单前摄像头取得 91.5 PDMS 刷新 SOTA(Table 1):超最强 VLA 规划器 SGDrive(91.1)0.4 分、ExploreVLA(90.4)1.1 分;同单摄像头设定下超 DriveWAM(90.1)1.4 分、DriveLaW(89.1)2.4 分,并在世界模型类取得最佳 DAC(98.7)与 EP(86.4)。组件分析(Table 2):仅动作 DiT 86.6→加视频 90.3(+3.7)→加 RL 91.5(+1.2)。隔离掩码最优(Table 3)。视频骨干灵活(Table 4):Cosmos2.5 达 90.4、Wan2.1-1.3B 达 90.2。动作专家缩放(Table 5):0.21B→1.02B 使 PDMS 89.9→90.3。零样本 nuScenes(Table 6)取得最低平均碰撞率 0.04%、L2 误差 0.96m。延迟处 Pareto 前沿(Figure 1);采样 10 步收敛(Table 10)。

NAVSIM navtest 基准上与 SOTA 规划器的对比。C 表示摄像头,L 表示 LiDAR。
Table 1: NAVSIM navtest 基准上与 SOTA 规划器的对比。C 表示摄像头,L 表示 LiDAR。
组件分析。
Table 2: 组件分析。
注意力掩码分析。
Table 3: 注意力掩码分析。
视频骨干灵活性。
Table 4: 视频骨干灵活性。
nuScenes 开环规划基准上的零样本泛化。∗表示仅用前摄像头。
Table 6: nuScenes 开环规划基准上的零样本泛化。∗表示仅用前摄像头。
RL 训练动态。星号标记模仿学习检查点;难子集训练持续优于全量训练。
Figure 3: RL 训练动态。星号标记模仿学习检查点;难子集训练持续优于全量训练。
Ours-IL 与 Ours-RL 在两个 navtest 场景下的定性对比。红色椭圆标出 Ours-RL 走得更远且仍在可行驶区域内的区域。
Figure 4: Ours-IL 与 Ours-RL 在两个 navtest 场景下的定性对比。红色椭圆标出 Ours-RL 走得更远且仍在可行驶区域内的区域。
查看结构化数据
任务指标本文基线提升
NAVSIM navtest 端到端规划 PDMS(越高越好) SimWAM 91.5(单前摄像头) 最强 VLA 规划器 SGDrive 91.1;最强 WAM DriveWAM 90.1;DriveLaW 89.1;Epona 86.2 较 SGDrive +0.4,较 DriveWAM +1.4,较 DriveLaW +2.4,较 Epona +5.3;同时延迟显著更低
组件消融(NAVSIM navtest) PDMS Action-only 86.6 → +Video 90.3 → +RL 91.5 仅动作 DiT 86.6 视频联合训练 +3.7,强化学习再 +1.2,合计 +4.9 PDMS
注意力掩码消融 PDMS 隔离掩码 90.3 bidirectional 90.2;action→video 90.1 隔离掩码最优且唯一支持推理丢弃视频分支,NC 与 TTC 也最佳
nuScenes 零样本开环规划 平均碰撞率(%,越低越好) SimWAM 0.04%(无需微调、无辅助监督) DriveWAM 0.06%;Epona 0.36%;UniAD 0.31%(需微调+辅助监督) 取得最低平均碰撞率,平均 L2 误差 0.96m 与 DriveWAM 持平
采样步数效率(NAVSIM) PDMS / 延迟 10 步 90.3 PDMS / 518ms 1 步 68.9 / 115ms;20 步 90.2 / 968ms 10 步即收敛,20 步无增益反而近翻倍延迟

局限与改进

作者明确承认 NAVSIM 是非反应式(non-reactive)基准——其他车辆不响应自车行为,这与真实闭环交通存在差距,因此 PDMS 的提升未必等比例转化为真实部署的安全收益。其次,方法仅使用单前摄像头,未利用多视角与 LiDAR,作者把多传感器融合留作未来工作。RL 阶段只针对模仿 PDMS 低于 90 的难子集,且只更新 rank-32 LoRA,是一种相对保守的策略,是否在更激进的更新下仍稳定未做充分探索。我自己的观察是:视频专家训练阶段仍依赖昂贵的 Wan2.2-5B 及其 VAE/T5,训练算力门槛很高;其次 nuScenes 上的平均 L2 误差(0.96m)虽与最强零样本基线持平但并非最低,说明在'贴近专家轨迹'这一维度上未必领先;再者 RL 的奖励完全采用 NAVSIM 的 PDM 奖励,存在对该基准过拟合的风险,跨基准泛化有待验证。

独立分析的弱点

第一个弱点是非反应式评测:NAVSIM 中他车不响应自车,SimWAM 在反应式/闭环仿真(如 closed-loop NAVSIM、Bench2Drive)下的表现未知;改进方向是把评测扩展到闭环并相应设计奖励。第二个弱点是训练算力与数据门槛高——视频专家用 Wan2.2-5B、训练 100 个 epoch,对中小团队难以复现;改进方向是探索更小的蒸馏视频专家或冻结大部分视频参数。第三个弱点是 RL 奖励单一(仅 PDM 复合奖励),可能在未见过的交通文化或长尾场景(如异常行人、施工区)表现不稳;改进方向是引入多样化的人类偏好奖励或安全约束。第四个弱点是单摄像头输入丢失了侧后方信息,在汇入、变道等需后视场景可能受限;改进方向是把动作专家的观测编码器扩展为多视角。第五个弱点是 nuScenes 的 L2 指标并不领先,说明对特定数据集专家轨迹风格的拟合仍可加强,可考虑少量目标域微调。

未来方向

作者提出的方向有三:(1) 把视频骨干替换为更强的驾驶域视频生成模型(实验已显示 Cosmos2.5 比 Wan2.2-5B 更好),期待随视频生成进步而持续受益;(2) 扩展到多视角与多模态传感器;(3) 在闭环/反应式基准上验证。基于本成果可延伸的方向:第一,把 Flow-GRPO 推广到更多样的奖励(舒适性、能耗、乘客偏好),甚至引入人类反馈 RLHF;第二,探索动作专家与视频专家的联合 RL,让视频专家也参与'想象'难场景;第三,把隔离注意力掩码这一解耦思想迁移到机器人操作的 WAM(如 DreamZero、LingBot-VA),实现'训练用想象、部署用策略'的统一范式;第四,研究视频专家的可插拔蒸馏,使整个训练流水线更轻量;第五,结合大语言模型提供高层导航与意图,形成'语义-世界-动作'三层解耦架构。

复现评估

复现性整体较好。作者明确声明代码与模型权重开源在 https://github.com/H-EmbodVis/SimWAM/ 。数据集(NAVSIM 的 navtrain 103,288 场景、navtest 12,146 场景;nuScenes)均为公开基准。关键超参数披露充分:动作专家隐层 $d_a=1024$、前摄像头 384×672、8 路径点 4s@2Hz、AdamW 余弦调度学习率 $10^{-4}$、100 epoch、$\lambda=1$;RL 用 rank-32/$\alpha=16$ LoRA、$G=8$ 采样、学习率 $5\times10^{-5}$、难子集 PDMS<90。主要复现障碍是算力:视频专家基于 Wan2.2-5B,联合训练需要较大显存(延迟测于单卡 A100),中小团队难以承担;视频 VAE/T5 也需额外加载。消融实验覆盖全面(注意力掩码、视频骨干、动作规模、采样步数、分辨率、预测视野、采样器、未来视频目标),便于二次研究。综合评估为'高可信、中等复现难度'。