RISE:面向世界动作模型的自适应想象 RISE: Adaptive Imagination for World Action Models
按预期规划收益逐步决定想象深浅,让世界动作模型在质量与算力间自适应权衡。
前置知识
世界动作模型(WAM)
一类把'预测世界未来演化'与'生成动作'耦合在一起的模型:先由预测器根据当前观测自回归地想象未来状态(潜变量序列),再让规划器基于观测与想象出的未来前缀输出轨迹或动作。与直接从观测回归动作的端到端策略不同,WAM 让策略能通过动作的后果来评估动作,从而更好地处理交互与不确定性。
本文的全部创新都建立在对 WAM 推理流程的改造上:RISE 讨论的 Roll/Stop 决策正是插在'想象'与'规划'之间,不理解 WAM 的三段式结构(Encoder–Predictor–Planner)就无法理解调度器的位置和作用。
PDMS / EPDMS 评估指标
NAVSIM 基准上广泛使用的规划指标。PDMS(Predictive Driver Model Score)由无碰撞(NC)、可行驶区域合规(DAC)、ego 进度(EP)、碰撞时间(TTC)等子项加权得到;EPDMS 是 NAVSIM v2 的扩展版,额外加入车道保持、扩展舒适度等更多子项。分数越高规划越好,是论文所有主实验的最终排序依据。
论文的核心概念'未来规划增益'直接以规划分数为度量单位:继续想象一步的收益定义为规划分数的变化量 $q_{h+1}-q_h$。只有理解 PDMS/EPDMS 的构成,才能明白增益信号、Rollout Gate 训练目标以及主结果表中每个数字的含义。
JEPA 潜空间表征与自回归 rollout
JEPA(Joint-Embedding Predictive Architecture)在抽象潜空间而非像素空间做预测,避免重建高频细节。V-JEPA 2 用 ViT 将视频编码为 token 序列;本文把它作为冻结编码器,预测器以帧因果方式自回归地追加未来潜变量步,每步对应两帧原始视频(2 Hz 采样、两帧 tubelet),NAVSIM 上最多 rollout $H_D=4$ 步。
RISE 的'想象'就是在这个潜空间里逐步追加 $\hat{z}_{t+1},\hat{z}_{t+2},\ldots$,调度器评估和风险细化都作用在这些潜 token 上。不熟悉潜空间 rollout,就无法理解'风险画像对每个前缀深度打分'和'在潜空间做范数受限梯度细化'这两个关键机制。
反事实想象(counterfactual)
反事实指'在同一场景起点下,如果事情走向不同会发生什么'。真实驾驶日志只记录了实际发生的那一个未来,因此缺少'本可避免/本会发生事故'的对照样本。本文用视频生成模型 Wan 2.7 从源关键帧合成带事故的反事实视频,与事实源配对,用于监督风险排序:事故起始帧之后,反事实必须被判定为比事实更危险。
CounterDrive 是论文两大贡献之一,也是风险画像监督信号的唯一来源。理解'生成数据没有几何真值、因此只做排序而非回归'这一设计约束,才能明白为什么损失函数要引入起始帧掩码 $m_{i,k}$ 和排序 margin。
扩散轨迹规划器
把轨迹规划建模为去噪扩散过程:训练时对真值轨迹加噪(方差保持调度 $\tau(u)=\alpha_u\tau^*+\sigma_u\epsilon$),模型学习从噪声还原轨迹;推理时从高斯噪声出发经 20 步 DPM-Solver++ 采样,一次性生成 6 条带置信度的候选轨迹,再按置信度选优。本文规划器是 12 层扩散 Transformer。
论文的规划分数 $q_h$ 是把规划器在各深度前缀上输出的最优候选喂给固定几何评估器算出来的;理解扩散规划器的多模态输出与候选选择规则,才能理解 $q_h$、增益目标 $B^*_h$ 以及最终轨迹是怎么来的。
研究动机
端到端自动驾驶正从直接轨迹回归转向'先想象未来再行动':世界动作模型(WAM)把预测的世界演化纳入动作生成,让策略通过动作的后果而非仅凭当前观测来评估动作。然而现有方法的想象计算是全局固定的,主要分三种组织方式:共享骨干的 imagine-and-plan(预测与规划共用表示)、级联的 imagine-then-plan(先完成整个未来 rollout 再交给规划器)、以及去掉测试时想象的直接规划。它们都不会在每个部分 rollout 之后重新评估'当前前缀是否已足以支撑规划'。论文的实证分析量化了这种一刀切的代价:在 NAVSIM 上按取得最高规划分数的 rollout 深度分组,1,248 个场景在零 rollout($h^*=0$)时最优,把深度从 0 加到 4 反而使其 EPDMS 从 89.9 降至 88.4;而 4,036 和 2,180 个场景分别在深度 3 和 4 最优,对应组的 EPDMS 可从 88.5 提升到 91.1。也就是说,开阔路段白白浪费算力,密集行人或交叉路口场景却想象不足,不存在对所有场景都最优的固定预算。此外风险学习还面临数据瓶颈:真实驾驶日志只记录了唯一发生的那一个未来,安全关键的反事实结局在数据中天然缺失。
本文的目标是本文的核心目标是为 WAM 引入'按需想象'的能力:定义一个名为未来规划增益(Future Planning Gain)的信号,度量在第 $h$ 步继续 rollout 相对于就此停止所能带来的规划分数变化,让模型在每个 rollout 步重新估计该信号,并据此做出二元的 Roll/Stop 序列决策。由此产生的有效 rollout 深度 $K(c;\lambda)\in\{0,\ldots,H\}$ 是场景相关的:开阔道路可以为 0(直接从观测规划),复杂交互场景可以到数据集上限 $H$(NAVSIM 为 4、nuScenes 为 3),且 $K=H$ 时退化为标准全 rollout WAM。第二个目标是补齐风险监督的数据缺口:构建反事实驾驶数据集 CounterDrive,为选中场景生成多样化结局与风险等级的'假如'视频,由人工验证轨迹有效性、标注事故起始帧与因果类别,为风险画像提供时间局部化的监督。最终系统要在 NAVSIM v1/v2 与 nuScenes 上同时取得更好的规划质量与更低的平均 rollout 开销,并能作为插件迁移到其他 WAM 架构而不修改其预测器和规划器。
与已有工作不同的是,独特切入在于把'想象多少'从固定的架构超参数转变为逐步的序贯决策问题。与以往工作不同,论文不预先把场景划分为易/难类别,也不让模型一次性回归最终 rollout 深度,而是提出以规划分数为货币的效用度量:$B^*_h=[q_{h+1}-q_h,\ldots,q_{H_D}-q_h]$ 直接把'多想象一步'与下游规划质量的改善绑定,且决策在每一步局部重估。这与自适应计算领域常见的停止准则本质不同——依据是规划增益而非表征收敛:消融显示按'相邻潜变量收敛'停止的 Latent Margin 基线平均要 rollout 2.98 步、延迟 308.532ms 却只有 89.7 EPDMS,而 Scheduler 用 2.40 步、287.429ms 达到 90.8。另一处独特设计是反事实数据的用法:生成的'假如事故'视频没有几何真值,因此不做标量回归,而是与事实源配对,只要求在标注的事故起始帧之后反事实风险排序更高,配合起始帧掩码做时间局部化校准,绕开了生成数据几何标注不可靠的问题。最后,成本项 $\lambda(c_j-c_h)$ 显式进入门控输入,使同一模型通过调整 $\lambda$ 就能在质量与延迟之间平滑切换,而无需重新训练。
核心方法
直觉上,想象是有代价的,只有当预期规划收益抵得过额外计算时才值得继续想象。技术路线是在标准 Encoder–Predictor–Planner WAM 之外挂一个轻量调度器(Scheduler)。编码器用冻结的 V-JEPA 2(ViT-L/16)把 4 帧 256×512 前视图像编码为 2 个观测潜变量步(每步 512 个 1024 维 token);预测器是 12 层、隐藏维 384、12 头的帧因果 Transformer,以相邻位姿的相对变化为条件,自回归生成最多 $H_D$ 个未来潜变量步;规划器是 12 层扩散 Transformer,以观测 token、选定前缀(用可学习的来源嵌入区分观测与想象)及自车运动历史为条件,经 20 步 DPM-Solver++ 采样生成 6 条候选轨迹,每条含 8 个 0.5s 间隔位姿 $(x,y,\cos\psi,\sin\psi)$。调度器由潜变量评估器与 rollout 门控组成:评估器每步输出风险画像 $R_h=[r_1,\ldots,r_h]$(当前前缀已暴露的风险)与增益画像 $B_h=[b_{h\to h+1},\ldots,b_{h\to H_D}]$(继续想象的预期收益);门控综合特征 $\xi_h=[R_h,B_h,h/H_D,c_h,\Delta c_{h+1}]$ 与计算偏好 $\lambda$ 输出 $x_h$:$x_h>0$ 则 Roll(预测器追加一个潜变量并重新评估),否则 Stop(非空前缀先做风险细化,再一次交给规划器)。有效 rollout 深度不靠直接预测,而是从反复的 Roll/Stop 决策中自然涌现。
核心创新是未来规划增益(Future Planning Gain):把'继续想象'的效用直接表达为规划分数的变化。训练时对每个真实样本枚举所有有效深度 $h=0,\ldots,H_D$,用固定几何评估器计算规划分数 $q_h$,从而得到每个前缀的增益目标 $B^*_h=[q_{h+1}-q_h,\ldots,q_{H_D}-q_h]$。与已有工作的本质区别有三。第一,现有 WAM(imagine-and-plan、imagine-then-plan、no imagination)的推理调度是全局指定的架构选择;RISE 把它变成每步重新评估的局部决策,有效深度从重复 Roll/Stop 中涌现,门控从不直接预测最终深度。第二,停止准则来自规划效用而非表征量:消融中依据'相邻潜变量收敛'的 Latent Margin 平均 rollout 2.98 步、延迟 308.532ms 却只有 89.7 EPDMS,而 Scheduler 用 2.40 步、287.429ms 达到 90.8——说明'想象到表征不动了'与'想象到规划不再变好'是两回事。第三,风险与增益解耦监督:增益用真实数据的全深度规划结果直接回归;风险则借助 CounterDrive 反事实配对做排序学习(事故起始帧之后反事实必须比事实更危险,之前要求风险对齐),用生成视频绕开了真实日志'只有一个未来'的根本缺陷,同时不需要为生成数据构造几何标注。
方法步骤详情
方法分三阶段训练。阶段 I 训练预测器(真实数据加通过的 CounterDrive 片段,损失为逐潜变量步 LayerNorm 后的 L1 距离,80 epochs、学习率 $2\times10^{-4}$)与初始变前缀规划器 $\Pi_0$(训练时均匀采样深度 $h\in\{0,\ldots,H_D\}$,20 epochs、$2\times10^{-5}$)。阶段 II 先训风险画像:真实样本以固定几何评估器 $r^*=(4R_{col}+R_{near}+R_{traj}+0.2R_{comf})/6.2$ 为回归目标(Huber 损失),验证过的反事实配对提供排序损失 $\mathcal{L}_{rank}$(margin 1.0、权重 $\gamma=\beta_{cf}=1$)与起始帧前的局部校准 $\mathcal{L}_{loc}$;随后对非空前缀做 $M_r=2$ 步范数约束的风险细化 $\tilde{Z}^{m+1}_h=\tilde{Z}^m_h-\eta\nabla\sum_k r_k$(步长 $\eta=0.05$、信任半径 0.25);$\Pi_1$ 从 $\Pi_0$ 初始化、在细化后前缀上训练 50 epochs($5\times10^{-5}$);最后对每个真实样本枚举全部深度计算规划分数 $q_h$,构造增益目标 $B^*_h$ 做回归。阶段 III 冻结其余模块,以 $g^*_h=\max_{j>h}[(q_j-q_h)-\lambda(c_j-c_h)]$ 的符号为二分类目标,BCE 训练门控(50 epochs、$10^{-3}$,$\lambda\in\{0,0.001,0.005,0.01,0.05\}$、默认 0.005)。推理按算法 1 执行:每步评估器与门控决定 Roll/Stop,Stop 后细化前缀一次交给规划器,从 6 条候选中选置信度最高者输出。
技术新颖性
技术新颖性体现在四个层面。其一,系统级而非模块级创新:Scheduler 不改动 Encoder/Predictor/Planner 任何参数即可插入其他架构,迁移实验把 DAWN 从 89.1 提升到 90.3 PDMS 且保持 100 的满分碰撞项,证明这是可移植的通用'自适应想象'机制;早退/自适应计算思想在 LLM 推理中常见,但以规划增益为停止信号并系统化用于驾驶 WAM 属于首次。其二,风险引导的潜变量细化:停止后用冻结的风险分支对 $\hat{Z}_h$ 做小范数梯度修正($M_r=2$ 步、范数裁剪 0.25),相当于推理时用学到的风险知识'擦亮'想象前缀,2 步即把 PDMS/EPDMS 从 90.5/89.8 提到 90.9/90.2 且继续加步无增益。其三,反事实数据管线:VLM 两段式构造 prompt(近场描述与事故描述都严格限定在源关键帧可见物体内)加固定相机约束,交给 Wan 2.7 生成 10 秒 1080p 视频(2Hz 采样 20 帧),OpenVO 恢复逐帧自车位姿,人工验证保真度并标注事故起始帧与三类因果类别,最终形成 nuScenes 2,432/511、NAVSIM 5,013/1,000 训练/测试片段。其四,成本条件化门控:$\lambda$ 作为输入而非固定超参,一个模型覆盖整条质量—延迟权衡曲线,消融显示 $\lambda=0.005$ 时达最优 90.8 EPDMS。
实验结果
主结果覆盖三个基准与四组分析。规划性能:NAVSIM v1 取得 91.5 PDMS(NC 99.1、DAC 97.7、EP 98.3、C 100、TTC 98.6),超最强基线 DriveFuture(90.7)0.8 分,EP 与 TTC 分别提升 2.9 和 1.9 分;NAVSIM v2 取得 90.8 EPDMS,超 DriveFuture(89.9)0.9 分,九项组件指标中七项第一或并列第一;nuScenes 上平均 L2 误差 0.31m、平均碰撞率 0.10 均为最优(对比 WorldRFT 0.47m、DAWN 0.33m 与碰撞率 0.11)。消融:CounterDrive 单独把 EPDMS/PDMS 从 88.9/89.7 提到 89.8/90.5,Scheduler 单独提到 90.4/91.2,二者合并 90.8/91.5,呈互补关系;组件层面,Evaluator 单独贡献 90.3/90.9,Gate 单独 90.6/91.2。调度策略对比:Scheduler 以 2.40 平均 rollout、287.429ms 延迟达 90.8 EPDMS,优于 Random Stop(2.03 步、264.075ms、89.5)和 Latent Margin(2.98 步、308.532ms、89.7)。安全评估:CounterDrive 把四个深度的风险排序 AUC 从 0.49–0.52(近随机)提到 0.93–0.96,事故识别准确率 0.51→0.96。迁移:Scheduler 插入 DAWN 使 PDMS 89.1→90.3,EP +2.7、TTC +2.3。敏感性:$\lambda=0.005$ 最优,增至 0.01 时 EPDMS 骤降至 88.6;深度均匀采样(89.8)远优于只训两端深度(87.4);风险细化 2 步即饱和。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 端到端规划(NAVSIM v1) | PDMS | 91.5(NC 99.1 / DAC 97.7 / EP 98.3 / TTC 98.6) | DriveFuture 90.7(此前最优);DAWN / DriveLaW 89.1 | +0.8;其中 EP +2.9、TTC +1.9 |
| 端到端规划(NAVSIM v2) | EPDMS | 90.8(NC 99.1 / DAC 97.7 / DDC 99.7 / TTC 98.7 / EC 87.4) | DriveFuture 89.9;Latent-WAM 89.3 | +0.9;9 项组件指标中 7 项第一或并列第一 |
| 轨迹预测(nuScenes) | 平均 L2 误差 (m) | 0.31(1s/2s/3s = 0.16/0.29/0.49) | WorldRFT 0.47;DAWN 0.33 | 较最优基线降低 0.02–0.16 m |
| 轨迹预测(nuScenes) | 平均碰撞率 (%) | 0.10(1s 时 0.00) | DAWN 0.11;World4Drive 0.16;BEV-Planner 0.59 | 全场最低,1s 碰撞为 0 |
| 安全关键风险排序(反事实测试集) | AUC@2s | 0.95(@1s 0.96 / @3s 0.96 / @4s 0.93),事故识别准确率 0.96 | 无 CounterDrive 模型 0.52,准确率 0.51 | AUC +0.43,准确率 +0.45 |
| 调度器迁移到 DAWN(NAVSIM v2) | PDMS | 90.3(EP 87.0 / TTC 98.3 / NC 99.9) | 原始 DAWN 89.1(EP 84.3 / TTC 96.0) | +1.2,EP +2.7、TTC +2.3,不改动其预测器/规划器 |
| 自适应 rollout 策略对比(NAVSIM v2) | EPDMS / 平均 rollout 步数 / 延迟 | Scheduler:90.8 / 2.40 步 / 287.429 ms | Random Stop 89.5 / 2.03 步 / 264.075 ms;Latent Margin 89.7 / 2.98 步 / 308.532 ms | 质量 +1.1~+1.3,开销居中 |
局限与改进
作者承认两点:其一,自适应 rollout 实验目前只覆盖自动驾驶,能否推广到其他具身领域尚待验证;其二,由于生成与过滤反事实样本的成本,CounterDrive 未对 NAVSIM 训练集形成一一覆盖,配对监督只存在于选中的子集内。我的补充观察:第一,整套监督信号锚定在固定几何评估器 $E_{risk}$ 上,其权重(4:1:1:0.2)为手工设定,且风险回归目标来自 $\Pi_0$ 的输出质量——教师弱则 $r^*$ 与 $B^*$ 目标皆有噪声,而 $E_{risk}$ 与真实 PDMS/EPDMS 并不一致;第二,成本可调范围有限,Scheduler 平均仍需 2.40 步 rollout 与 287ms 延迟,论文未报告与 zero-imagination 基线的延迟对比;第三,风险细化只作用于非空前缀且步数、范数受限($h=0$ 时完全跳过),对需要大幅修改计划的场景可能无能为力;第四,反事实视频由 Wan 2.7 生成并依赖人工过滤,物理保真度与分布偏差缺乏量化评估,事故标注只有帧级起始点和三类因果标签,粒度较粗;第五,$\lambda$ 超出 $[0,0.005]$ 后性能急剧下降(0.01→88.6 EPDMS),说明门控对训练用的 $\lambda$ 网格过拟合,插值到其他成本偏好的泛化性存疑;第六,编码器只用前视单目、perception-free 设定,多视角与占据预测下的适用性未验证。
独立分析的弱点
独立分析的弱点与改进方向:一是监督瓶颈——$E_{risk}$ 是手工几何规则的线性组合,风险目标只用 $\Pi_0$ 产生候选,若换成更强的规划器或直接用官方 metric 模型构造目标,增益画像会更贴近真实评测指标;可引入学习型价值函数或多教师集成来降低目标噪声。二是延迟结构——门控在每步串行重新评估,rollout 越深调度开销越大;可将门控蒸馏为单次深度预测器,或让评估器与预测器并行推测执行以隐藏决策延迟。三是 $\lambda$ 敏感性——训练网格 $\{0,0.001,0.005,0.01,0.05\}$ 上 0.01 与 0.05 分别掉到 88.6/88.4 EPDMS,说明成本条件化并未学到平滑的帕累托面;改进可在连续 $\lambda$ 上插值采样训练,或改为在延迟预算约束下的显式条件优化。四是反事实管线的扩展性——依赖 VLM prompt、Wan 2.7 与人工验证,每条片段成本高且事件类型受 prompt 想象力限制;可用自动化几何一致性校验、多生成器投票与对抗性事件搜索替代或减轻人工。五是单目前视与 perception-free 限定——遮挡密集场景的风险评估可能失真;扩展到 BEV/占据表征、让评估器消费多视角 token 是自然方向。六是泛化证据单薄——迁移实验只有 DAWN 一个架构、NAVSIM 一个基准,'插件通用性'的说法需要更多架构上的重复验证。
未来方向
作者提出的方向:把自适应 rollout 作为世界动作模型的一般原则推广到自动驾驶之外(机器人操作、具身导航等任何'行动前想象'的场景);扩大 CounterDrive 规模,覆盖更多训练样本与更多样的事故类型。基于本文成果可自然延伸的工作:第一,把 $K(c;\lambda)$ 作为测试时算力分配的接口与安全认证结合——高风险预测可触发更深的 rollout 甚至多种子集成,形成风险感知的分级推理;第二,用反事实数据反向训练策略:既然 CounterDrive 能把风险排序 AUC 从约 0.5 提到 0.96,它可作为世界模型强化学习(如 DreamerAD 类)的危险经验回放池或约束来源;第三,用可学习价值网络替代固定几何 $E_{risk}$,让 $q_h$ 直接对齐官方 PDMS/EPDMS,消除教师与指标的不一致;第四,把门控扩展为多目标帕累托调度器(延迟、能耗、安全加权),并结合推测执行类并行想象来隐藏串行决策延迟;第五,在更多 WAM(Latent-WAM、Epona、Cosmos Policy 等)上做大规模移植实验,并推动 CounterDrive 成为安全关键世界建模的标准评估资源;第六,把风险细化从潜空间小步修正升级为规划器引导(classifier-guidance 式),以处理需要大改计划的场景。
复现评估
复现条件总体友好。开源情况:代码在 GitHub(COOWAI/RISE),CounterDrive 数据集发布于 HuggingFace(COWARobot/CounterDrive),项目页提供概览;基准数据 NAVSIM 与 nuScenes 均公开,评测有官方工具。资源需求:主训练用 8×A100(bfloat16、每卡 batch 4、有效 batch 32),预测器 80 epochs、$\Pi_0$ 20 epochs、$\Pi_1$ 50 epochs;轻量的评估器与门控在单张 A100 上以 FP32 离线训练(各 50 epochs、学习率 $10^{-3}$),全深度枚举构造 $q_h$ 目标是主要离线开销。附录给出了几乎全部细节:网络规格、损失权重($\gamma=\beta_{cf}=\beta_{loc}=1$)、细化超参($\eta=0.05$、信任半径 0.25、$M_r=2$)、$\lambda$ 网格与默认值 0.005、数据增强全部关闭、随机种子 239,并附训练/推理伪代码(算法 1、2)与完整的 VLM/Wan prompt 模板。难度评估:若复用已发布的 CounterDrive,基准级复现(对齐 NAVSIM/nuScenes 指标)难度中等;若要从零重建 CounterDrive,则需要 Wan 2.7 视频生成、VLM prompt 管线与人工验证团队,工程与标注成本显著,且生成模型版本差异会改变数据分布。论文未报告单场景推理 FLOPs 或更细粒度的延迟分解。
论文图表
对比四种想象策略:(a) imagine-and-plan 用观测与预测潜变量联合规划;(b) imagine-then-plan 先完成未来 rollout 再生成动作;(c) no imagination 直接从观测规划;(d) RISE 引入轻量 Scheduler,自适应地把计算路由到继续预测或最终规划。
这张图定义了论文的问题坐标系:前三种已有范式的推理调度都是全局固定的,(d) 展示了 RISE 的差异化定位——把想象深度变成每步决策。理解四种范式的差异是理解全文动机的前提。
把 NAVSIM 样本按取得最高规划分数的最优深度 $h^*$ 分组的直方图:1,248 个场景 $h^*=0$ 最优,4,036 个场景最优深度为 3,2,180 个场景为 4;且 $h^*=0$ 组深度从 0 加到 4 时 EPDMS 从 89.9 降到 88.4,$h^*=4$ 组则从 88.5 升到 91.1。
它用数据直接论证了论文的核心动机——不存在对所有场景都最优的固定 rollout 深度,深想象对一部分场景有害、对另一部分有益。这是'自适应想象是否必要'这一根本问题的定量答案。
按偏好 rollout 深度分组的代表性场景可视化:$h=0$ 的场景多为开阔道路、交互有限,观测已足够;$h=1\&2$ 涉及红绿灯、车辆或道路施工等中等交互;$h=3\&4$ 涉及密集人流或交叉车辆,未来演化模糊,需要更深的预测。
给 Figure 3 的统计结论提供了直观的语义解释:最优深度与场景交互复杂度对应。读者由此能理解调度器学到的决策边界有什么物理含义,以及何时想象最值钱。