延迟暴露未来轨迹:面向自动驾驶 VLM 可验证推理的训练框架 Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
把自动驾驶规划变成轨迹选择题,先推理后揭示候选,治好教师的锚定偏置
前置知识
Chain-of-Thought (CoT) 监督与锚定偏置
CoT 监督指让模型在给出最终决策前,先输出一段显式的「证据→因果→结论」推理链作为训练目标,通常由更强的教师模型在标注阶段生成。锚定偏置(anchoring bias)是认知心理学概念:当人(或模型)事先被告知一个结论时,会下意识地围绕这个已知结论去拼凑理由,而非从证据出发独立推断。
本文的核心动机正是发现:现有 AD-VLM 在标注 CoT 时把 GT 未来轨迹提前喂给教师,触发了严重的锚定偏置,使监督信号本身不可信。
Vision-Language-Action (VLA) 模型
VLA 模型把一个大型视觉语言模型(VLM)与一个更小的「动作专家」级联:VLM 负责高层场景理解和决策推理,动作专家负责把决策转成精确的几何与动力学输出。在自动驾驶中,VLM 的推理质量直接决定下游规划的安全性与可解释性。
本文只针对 VLM 的推理部分,不训练动作专家,因此需要一种语言模型友好的接口来表达驾驶决策,这正是 AD-MCQ 要解决的。
GRPO(Group Relative Policy Optimization)
GRPO 是一种组相对策略优化算法:对同一个问题采样 G 条 rollout,用组内奖励的归一化优势(advantage)作为梯度方向,避免为每个问题单独训练价值网络,是 DeepSeek-R1 等推理模型 RLVR 训练的主流方法。
DEFT-RLVR 的两轮交互被序列化为一条 rollout 用 GRPO 联合优化,理解 GRPO 才能看懂为什么 Turn 1 和 Turn 2 能共享同一标量奖励。
轨迹码本与 K-means 量化
把每条 5 秒、2Hz 的未来轨迹(10 个 ego 坐标系下的 $(x,y)$ 航点)展平成 20 维向量,对大量真实轨迹做 K-means 聚类,得到 $K$ 个原型,每条轨迹用最近原型的索引来表示。这样连续几何被压缩成有限的「运动词汇表」,可用来构造选择题选项。
AD-MCQ 的候选轨迹全部来自这个码本(论文用 $K=8192$、聚类 $N=489042$ 条),理解量化误差才能判断「选择题」是否丢掉了关键精度。
研究动机
当下主流的自动驾驶 VLA 模型普遍用「教师模型 + CoT 监督」来增强 VLM 的推理能力,但一个被忽视却致命的缺陷是:在需要落到具体驾驶决策的场景里,几乎所有标注管线都会在让教师推导理由之前,先把记录下来的 GT 未来轨迹喂给它。作者在 100 个强因果难场景(70 个 Waymo + 30 个内部数据,覆盖急停、静止起步、急转弯)上做了配对人评,结果触目惊心:GT 条件下的 CoT 质量分只有 5.02,而不暴露 GT 的因果规划 CoT 达到 6.43;严重幻觉率从 29% 飙升到 50%;成对偏好比较里 GT 条件仅获 24% 偏好,因果规划拿到 60.5%。更糟的是图 1 的典型案例:场景里根本没有任何「强制转向」标志,教师却在 CoT 里凭空捏造了一个,只为合理化那条被提前看到的右转轨迹。这种「事后合理化」会把捏造的因果证据注入下游训练数据,让整个监督方向从根上就错了。
本文的目标是作者的目标是把未来轨迹的角色从「决策前的锚点」翻转成「决策后的验证目标」,让推理过程既保留轨迹级别的精确监督,又不让目标泄漏污染因果推断。具体落到三个可量化的诉求:第一,构造一个语言模型友好的、可精确判分的驾驶决策接口,避免开放式坐标生成把高层决策和底层几何纠缠在一起;第二,设计一种信息顺序机制,强制策略先从场景证据独立得出决策,再揭示候选轨迹做落地;第三,训练后既要显著提升 AD-MCQ 准确率(在 Qwen3-VL-8B 上从无训练的 28.1% 提升),又要让一般视觉能力(12 个基准平均)不掉甚至略涨,证明学到的是可迁移的「场景→决策」推理而非任务专用记忆。
与已有工作不同的是,本文的独特切入点是「监督方向」这个被几乎所有 AD-CoT 工作忽略的维度。已有工作要么只做场景理解 QA(不落到轨迹决策),要么把 GT 轨迹当先验塞给教师;而本文把它类比到推理模型蒸馏里的「先解后验」范式——解题时藏起答案、只在事后核对。但作者敏锐地发现 AD 不能直接套用:开放式轨迹生成会把高层决策、连续几何、底层动力学耦合在一起,对 VLM 极不友好。于是他们用「选择题」这个最小代价接口解耦掉几何生成,再配合「延迟暴露」严格保证候选轨迹不进入第一轮推理。这种「先换接口、再换信息顺序」的组合拳是别人没做过的。
核心方法
直觉上,可以把整套方法类比成数学奥赛的阅卷规则:你必须先写出完整的解题过程并锁定答案,之后才能去和标准答案对一对编号——绝不允许你先偷看选项再编理由。技术上分三块。第一块是 AD-MCQ:用 $K=8192$ 的码本把驾驶规划重写成「六选一」的轨迹选择题,把开放式坐标生成替换成可精确判分的选择。第二块是 DEFT(延迟暴露):两轮交互,第一轮只看场景独立得出高层决策(HLD),第二轮才揭示候选轨迹做匹配落地,$u_{1,i}=p_1(X_i)$,$y_{1,i}\sim\pi_\theta(\cdot|u_{1,i})$,第二轮 $y_{2,i}\sim\pi_\theta(\cdot|u_{1,i},y_{1,i},u_{2,i})$。第三块是 RLVR 训练:用 GRPO 把两轮序列当成一条 rollout 联合优化,奖励 $R_{i,j}=R_{i,j}^{MCQ}\cdot R_{i,j}^{RUB}$ 由 MCQ 正确性门控一个基于离线生成、在线纯文本打分的 rubric 过程奖励。
最本质的创新点是「信息顺序决定推理性质」这一洞察。已有方法(包括作者自己做的 JEFT 对照组)都是把场景和候选轨迹一起喂给模型,模型一旦看到候选,注意力就会不自觉地围绕「我倾向哪个选项」去组织理由,这正是选择题版的锚定偏置。DEFT 强行改变信息流:让 $\pi_\theta$ 在完全看不到候选的情况下先把决策「钉死」在 HIGH_LEVEL_DECISION 这一行,候选轨迹随后只能扮演「把抽象决策匹配到最接近的具体几何」的落地角色,绝不能反过来塑造决策。配合 rubric 奖励只对「答对的 rollout」给过程监督、且 judge 只看纯文本 CoT(看不到图、看不到候选、看不到 GT),三层设计共同堵死了「靠选项捷径蒙对」的退路,迫使模型真的去学场景证据到决策的因果链。
方法步骤详情
完整流程分六步。一(离线建码本):从约 51 万条轨迹用 MiniBatchKMeans 聚类出 $K=8192$ 个原型,用最近原型量化,$T=10$ 航点,选定点样本外 ADE 为 0.290m、利用率 92%。二(造题):把 GT 最近原型做 oracle,按相似度 $\rho_{ij}\in[0.30,0.85]$ 采 5 个硬负样本(Dev/Test 还加 scale 匹配负样本与匀速外推负样本),凑成 6 选项随机洗牌,记录 oracle 位置 $a_i^\star$。三(Turn 1 因果推理):仅给场景 $X_i=(V_i,H_i,I_i)$,温度 1.0、top-p 0.95、上限 12000 token,产出证据→因果→速度→方向并锁定 HLD。四(Turn 2 落地):揭示候选 $A_i$,把已锁定决策匹配到最接近候选,解析 $\hat{a}_i$。五(离线 rubric):用 Qwen3.6-35B-A3B 对每场景生成带权原子评分准则 $C_i$,跨 rollout 复用。六(GRPO 联合优化):对每题采 $G$ 条两轮 rollout,仅对正确答题的 rollout 用纯文本 judge 打 rubric 分,最终奖励 $R_{i,j}=R_{i,j}^{MCQ}\cdot R_{i,j}^{RUB}$,前向只算一次、只对生成 token 算梯度。
技术新颖性
和三类已有技术对比,新颖性清晰。第一,相对 GT 条件 CoT 蒸馏,本文首次把「锚定偏置」作为 AD-VLM 的具体问题实证化(100 场景配对人评 + 严重幻觉率量化),并给出「延迟暴露」这一信息层而非数据层的解法。第二,相对开放式轨迹 token 生成(图 7 的诊断实验),本文证明即便 SFT 过拟合后 in/out-of-distribution 的 ADE 仍远高于码本 0.279m 重建下限,说明主要误差来自 token 生成而非量化;AD-MCQ 把生成外部化为「选择」,既绕开 token 误差又保住轨迹级粒度。第三,相对「在线 VLM judge rubric」方案,本文把准则离线生成、在线只跑纯文本 judge,使单步耗时从 724.4s 降到 426.5s(快 41.1%),同时 CFS/HLD 还更高——这是「准则复用 + 文本评分」对「每题重算 + 多图评分」的工程级创新。
实验结果
主结果表(Table 2)按四条线索展开。其一,延迟暴露本身收益巨大:8B 上无训练 JEFT 仅 28.1%,DEFT 直接涨到 56.6%(+28.5pp),4B 从 34.0% 到 65.6%,说明信息顺序在推理时就能兑现。其二,同奖励下 DEFT+RLVR($R^{MCQ}$) 把 8B 推到 76.4%,比 JEFT+RLVR($R^{MCQ}$) 的 61.1% 高 15.3pp,CFS、HLD 同步上升,证实延迟暴露抑制了选项捷径。其三,加 rubric 后 DEFT-RLVR 在 8B 达 ACC 77.9%、CFS 0.658、HLD 0.501,图 6 显示回复更短、熵更低、KL 漂移更小,rubric 剪掉了无产出探索。其四,关键卖点是「不掉一般能力」:8B 一般视觉平均从 54.81% 微涨到 56.09%,而蒸馏路线 JEFT Distillation 会砸到 49.80%。跨域 Table 3 在 nuScenes 上 ACC 从 39.6% 提到 49.5%,证明学到的是可迁移推理。效率上单步仅 426.5s、比纯正确性训练贵 0.5%;图 8 在 20 种候选构造下 DEFT-RLVR 全胜 training-free DEFT。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| AD-MCQ-500 准确率 (Qwen3-VL-8B) | ACC (%) | 77.9 (DEFT-RLVR) | 28.1 (training-free JEFT) | +49.8 pp |
| AD-MCQ-500 准确率 (Qwen3.5-4B) | ACC (%) | 82.2 (DEFT-RLVR) | 34.0 (training-free JEFT) | +48.2 pp |
| 同奖励下延迟暴露收益 (8B) | ACC (%) | 76.4 (DEFT+RLVR R_MCQ) | 61.1 (JEFT+RLVR R_MCQ) | +15.3 pp |
| 一般视觉能力平均 (8B) | General AVG (%) | 56.09 (DEFT-RLVR) | 54.81 (Base VLM) | +1.28 pp(蒸馏路线反而 -4.9 pp) |
| 跨域 nuScenes-500 准确率 | ACC (%) | 49.5 (DEFT-RLVR) | 39.6 (training-free DEFT) | +9.9 pp |
| rubric 训练效率 | 单步秒数 | 426.5s (DEFT-RLVR) | 724.4s (在线 rubric 变体) | 快 41.1%,且比纯正确性仅贵 0.5% |
局限与改进
作者坦诚的局限有几条:AD-MCQ 本质是「验证接口」而非端到端连续规划器,落地仍需下游规划器把选中轨迹细化;评测规模有限(Test 仅 500 场景,Dev 仅 100),统计显著性靠 8 次重复采样保证但绝对覆盖面偏窄;CFS、HLD 两个核心 CoT 指标都依赖 Qwen3.5-397B-A17B 做 judge,作者虽在附录 E 验证了与人工标注的一致性,仍是「模型评模型」的二阶问题。我额外观察到三点:第一,码本 $K=8192$ 覆盖不了的真实罕见机动会被强制映射到最近原型,对长尾安全场景有隐患;第二,rubric 由 Qwen3.6-35B-A3B 离线生成,准则集本身的偏差会渗入奖励;第三,所有训练场景都来自 Waymo 类分布,nuScenes 虽做了跨域验证但只是单一外部域,对真正异构的路况(如非结构化道路、两轮车密集城区)泛化未经验证。
独立分析的弱点
独立来看,第一个弱点是「选择题表达力天花板」:当正确机动落在码本 0.279m 重建误差之外(如极端避让),oracle 本身就是次优解,无论怎么训都学不到更优轨迹,改进方向是把码本做成自适应扩展或引入残差修正项。第二个弱点是「rubric judge 与策略同源」:准则生成、文本评分、策略推理都来自 Qwen 系,若 judge 对某种推理风格有系统偏好,奖励会放大该风格,改进方向是引入跨家族 judge 集成或人工抽检校准。第三个弱点是「两轮交互的推理成本」:Turn 1 + Turn 2 加起来最高 24576 token,对实时性要求高的部署不友好,改进方向是蒸馏成单轮 + KV 缓存复用,或用投机解码压缩 Turn 1。第四个弱点是「6 选项的判别粒度有限」:高分场景里相邻候选 ADE 仅 7m 量级,但极相似的未来(图 8 显示高相似度区最难)会撞到判别下限,改进方向是按场景难度自适应选项数与相似度带。
未来方向
作者明确指出的方向是:把 AD-MCQ 作为「可控难度的可验证 AD 推理实验台」,通过候选数量与相似度边界系统研究推理难度。基于成果可延伸的方向有四:其一,把码本从纯运动学聚类升级为「场景条件码本」,让候选随场景动态检索;其二,把 DEFT 两轮接口接入真正的端到端规划器(如结合 diffusion planner 做轨迹细化),补上连续规划短板;其三,把 rubric 奖励推广到多模态judge(加入视频时序证据核验),降低纯文本评分的盲区;其四,把延迟暴露范式迁移到机器人操作、具身导航等同样存在「目标泄漏」的 VLA 任务,验证「先解后验」的普适性。
复现评估
复现友好度很高,是这篇论文的加分项。代码、模型权重、AD-MCQ 数据集全部开源(GitHub: hzx122/DEFT-RLVR,HF: hzxllll/DEFT-RLVR-model-HF 与 hzxllll/AD-MCQ)。基座用公开的 Qwen3-VL-8B-Instruct 和 Qwen3.5-4B,训练只需 5000 场景,蒸馏配置 TP=2、batch 32、lr $1\times 10^{-5}$、序列长 20480,单卡规模即可起步;RLVR 用 GRPO,rubric judge 走纯文本所以显存压力小。附录给出完整码本构造(算法 1)、蒸馏目标构造(算法 2)、两轮 prompt 模板(附录 F.1-F.3)和评测 prompt(附录 F.6),连候选采样的随机种子都用 SHA1(base_seed:record_key) 确定。主要门槛是需要 Qwen3.5-397B-A17B 做 CoT 标注与评测 judge、Qwen3.6-35B-A3B 做 rubric,这两个大模型对中小团队不便宜;但只复现 RLVR 主线时用更小开源 judge 也能跑通。整体难度中等偏上,可复现性在 AD-VLM 方向属优秀水平。
论文图表
左半部分是一个典型案例:场景里只有绿色栅栏和右转路形,根本没有「强制转向」标志,但 GT 条件下的 CoT 却凭空捏造了一个强制转向标志来合理化那条已知的右转 GT 轨迹;右半部分是聚合统计,标注为 ✓GROUND CUE 的因果规划 CoT 与标注为 ✕FABRICATED CUE 的 GT 条件 CoT 对比,后者质量分更低、严重幻觉率更高。
这张图是整篇论文动机的「罪证照片」,直观展示了锚定偏置如何把捏造的因果证据注入 CoT 监督,没有它读者很难信服「监督方向」是个真问题。