← 返回 2026-08-04

延迟暴露未来轨迹:面向自动驾驶 VLM 可验证推理的训练框架 Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Yikun Ban, Deqing Wang 📅 2026-08-03 👍 140 2026-08-09 18:30
强化学习 自动驾驶 视觉语言模型 轨迹预测 链式思维推理

把自动驾驶规划变成轨迹选择题,先推理后揭示候选,治好教师的锚定偏置

前置知识

Chain-of-Thought (CoT) 监督与锚定偏置

CoT 监督指让模型在给出最终决策前,先输出一段显式的「证据→因果→结论」推理链作为训练目标,通常由更强的教师模型在标注阶段生成。锚定偏置(anchoring bias)是认知心理学概念:当人(或模型)事先被告知一个结论时,会下意识地围绕这个已知结论去拼凑理由,而非从证据出发独立推断。

本文的核心动机正是发现:现有 AD-VLM 在标注 CoT 时把 GT 未来轨迹提前喂给教师,触发了严重的锚定偏置,使监督信号本身不可信。

Vision-Language-Action (VLA) 模型

VLA 模型把一个大型视觉语言模型(VLM)与一个更小的「动作专家」级联:VLM 负责高层场景理解和决策推理,动作专家负责把决策转成精确的几何与动力学输出。在自动驾驶中,VLM 的推理质量直接决定下游规划的安全性与可解释性。

本文只针对 VLM 的推理部分,不训练动作专家,因此需要一种语言模型友好的接口来表达驾驶决策,这正是 AD-MCQ 要解决的。

GRPO(Group Relative Policy Optimization)

GRPO 是一种组相对策略优化算法:对同一个问题采样 G 条 rollout,用组内奖励的归一化优势(advantage)作为梯度方向,避免为每个问题单独训练价值网络,是 DeepSeek-R1 等推理模型 RLVR 训练的主流方法。

DEFT-RLVR 的两轮交互被序列化为一条 rollout 用 GRPO 联合优化,理解 GRPO 才能看懂为什么 Turn 1 和 Turn 2 能共享同一标量奖励。

轨迹码本与 K-means 量化

把每条 5 秒、2Hz 的未来轨迹(10 个 ego 坐标系下的 $(x,y)$ 航点)展平成 20 维向量,对大量真实轨迹做 K-means 聚类,得到 $K$ 个原型,每条轨迹用最近原型的索引来表示。这样连续几何被压缩成有限的「运动词汇表」,可用来构造选择题选项。

AD-MCQ 的候选轨迹全部来自这个码本(论文用 $K=8192$、聚类 $N=489042$ 条),理解量化误差才能判断「选择题」是否丢掉了关键精度。

研究动机

当下主流的自动驾驶 VLA 模型普遍用「教师模型 + CoT 监督」来增强 VLM 的推理能力,但一个被忽视却致命的缺陷是:在需要落到具体驾驶决策的场景里,几乎所有标注管线都会在让教师推导理由之前,先把记录下来的 GT 未来轨迹喂给它。作者在 100 个强因果难场景(70 个 Waymo + 30 个内部数据,覆盖急停、静止起步、急转弯)上做了配对人评,结果触目惊心:GT 条件下的 CoT 质量分只有 5.02,而不暴露 GT 的因果规划 CoT 达到 6.43;严重幻觉率从 29% 飙升到 50%;成对偏好比较里 GT 条件仅获 24% 偏好,因果规划拿到 60.5%。更糟的是图 1 的典型案例:场景里根本没有任何「强制转向」标志,教师却在 CoT 里凭空捏造了一个,只为合理化那条被提前看到的右转轨迹。这种「事后合理化」会把捏造的因果证据注入下游训练数据,让整个监督方向从根上就错了。

本文的目标是作者的目标是把未来轨迹的角色从「决策前的锚点」翻转成「决策后的验证目标」,让推理过程既保留轨迹级别的精确监督,又不让目标泄漏污染因果推断。具体落到三个可量化的诉求:第一,构造一个语言模型友好的、可精确判分的驾驶决策接口,避免开放式坐标生成把高层决策和底层几何纠缠在一起;第二,设计一种信息顺序机制,强制策略先从场景证据独立得出决策,再揭示候选轨迹做落地;第三,训练后既要显著提升 AD-MCQ 准确率(在 Qwen3-VL-8B 上从无训练的 28.1% 提升),又要让一般视觉能力(12 个基准平均)不掉甚至略涨,证明学到的是可迁移的「场景→决策」推理而非任务专用记忆。

与已有工作不同的是,本文的独特切入点是「监督方向」这个被几乎所有 AD-CoT 工作忽略的维度。已有工作要么只做场景理解 QA(不落到轨迹决策),要么把 GT 轨迹当先验塞给教师;而本文把它类比到推理模型蒸馏里的「先解后验」范式——解题时藏起答案、只在事后核对。但作者敏锐地发现 AD 不能直接套用:开放式轨迹生成会把高层决策、连续几何、底层动力学耦合在一起,对 VLM 极不友好。于是他们用「选择题」这个最小代价接口解耦掉几何生成,再配合「延迟暴露」严格保证候选轨迹不进入第一轮推理。这种「先换接口、再换信息顺序」的组合拳是别人没做过的。

核心方法

直觉上,可以把整套方法类比成数学奥赛的阅卷规则:你必须先写出完整的解题过程并锁定答案,之后才能去和标准答案对一对编号——绝不允许你先偷看选项再编理由。技术上分三块。第一块是 AD-MCQ:用 $K=8192$ 的码本把驾驶规划重写成「六选一」的轨迹选择题,把开放式坐标生成替换成可精确判分的选择。第二块是 DEFT(延迟暴露):两轮交互,第一轮只看场景独立得出高层决策(HLD),第二轮才揭示候选轨迹做匹配落地,$u_{1,i}=p_1(X_i)$,$y_{1,i}\sim\pi_\theta(\cdot|u_{1,i})$,第二轮 $y_{2,i}\sim\pi_\theta(\cdot|u_{1,i},y_{1,i},u_{2,i})$。第三块是 RLVR 训练:用 GRPO 把两轮序列当成一条 rollout 联合优化,奖励 $R_{i,j}=R_{i,j}^{MCQ}\cdot R_{i,j}^{RUB}$ 由 MCQ 正确性门控一个基于离线生成、在线纯文本打分的 rubric 过程奖励。

最本质的创新点是「信息顺序决定推理性质」这一洞察。已有方法(包括作者自己做的 JEFT 对照组)都是把场景和候选轨迹一起喂给模型,模型一旦看到候选,注意力就会不自觉地围绕「我倾向哪个选项」去组织理由,这正是选择题版的锚定偏置。DEFT 强行改变信息流:让 $\pi_\theta$ 在完全看不到候选的情况下先把决策「钉死」在 HIGH_LEVEL_DECISION 这一行,候选轨迹随后只能扮演「把抽象决策匹配到最接近的具体几何」的落地角色,绝不能反过来塑造决策。配合 rubric 奖励只对「答对的 rollout」给过程监督、且 judge 只看纯文本 CoT(看不到图、看不到候选、看不到 GT),三层设计共同堵死了「靠选项捷径蒙对」的退路,迫使模型真的去学场景证据到决策的因果链。

方法步骤详情

完整流程分六步。一(离线建码本):从约 51 万条轨迹用 MiniBatchKMeans 聚类出 $K=8192$ 个原型,用最近原型量化,$T=10$ 航点,选定点样本外 ADE 为 0.290m、利用率 92%。二(造题):把 GT 最近原型做 oracle,按相似度 $\rho_{ij}\in[0.30,0.85]$ 采 5 个硬负样本(Dev/Test 还加 scale 匹配负样本与匀速外推负样本),凑成 6 选项随机洗牌,记录 oracle 位置 $a_i^\star$。三(Turn 1 因果推理):仅给场景 $X_i=(V_i,H_i,I_i)$,温度 1.0、top-p 0.95、上限 12000 token,产出证据→因果→速度→方向并锁定 HLD。四(Turn 2 落地):揭示候选 $A_i$,把已锁定决策匹配到最接近候选,解析 $\hat{a}_i$。五(离线 rubric):用 Qwen3.6-35B-A3B 对每场景生成带权原子评分准则 $C_i$,跨 rollout 复用。六(GRPO 联合优化):对每题采 $G$ 条两轮 rollout,仅对正确答题的 rollout 用纯文本 judge 打 rubric 分,最终奖励 $R_{i,j}=R_{i,j}^{MCQ}\cdot R_{i,j}^{RUB}$,前向只算一次、只对生成 token 算梯度。

技术新颖性

和三类已有技术对比,新颖性清晰。第一,相对 GT 条件 CoT 蒸馏,本文首次把「锚定偏置」作为 AD-VLM 的具体问题实证化(100 场景配对人评 + 严重幻觉率量化),并给出「延迟暴露」这一信息层而非数据层的解法。第二,相对开放式轨迹 token 生成(图 7 的诊断实验),本文证明即便 SFT 过拟合后 in/out-of-distribution 的 ADE 仍远高于码本 0.279m 重建下限,说明主要误差来自 token 生成而非量化;AD-MCQ 把生成外部化为「选择」,既绕开 token 误差又保住轨迹级粒度。第三,相对「在线 VLM judge rubric」方案,本文把准则离线生成、在线只跑纯文本 judge,使单步耗时从 724.4s 降到 426.5s(快 41.1%),同时 CFS/HLD 还更高——这是「准则复用 + 文本评分」对「每题重算 + 多图评分」的工程级创新。

The framework of AD-MCQ and DEFT-RLVR
Figure 3: The framework of AD-MCQ and DEFT-RLVR
Direct trajectory-token generation introduces coupled prediction and capability-retention bottlenecks
Figure 7: Direct trajectory-token generation introduces coupled prediction and capability-retention bottlenecks

实验结果

主结果表(Table 2)按四条线索展开。其一,延迟暴露本身收益巨大:8B 上无训练 JEFT 仅 28.1%,DEFT 直接涨到 56.6%(+28.5pp),4B 从 34.0% 到 65.6%,说明信息顺序在推理时就能兑现。其二,同奖励下 DEFT+RLVR($R^{MCQ}$) 把 8B 推到 76.4%,比 JEFT+RLVR($R^{MCQ}$) 的 61.1% 高 15.3pp,CFS、HLD 同步上升,证实延迟暴露抑制了选项捷径。其三,加 rubric 后 DEFT-RLVR 在 8B 达 ACC 77.9%、CFS 0.658、HLD 0.501,图 6 显示回复更短、熵更低、KL 漂移更小,rubric 剪掉了无产出探索。其四,关键卖点是「不掉一般能力」:8B 一般视觉平均从 54.81% 微涨到 56.09%,而蒸馏路线 JEFT Distillation 会砸到 49.80%。跨域 Table 3 在 nuScenes 上 ACC 从 39.6% 提到 49.5%,证明学到的是可迁移推理。效率上单步仅 426.5s、比纯正确性训练贵 0.5%;图 8 在 20 种候选构造下 DEFT-RLVR 全胜 training-free DEFT。

Human-rated effect of pre-reasoning GT-trajectory exposure on CoT quality
Table 1: Human-rated effect of pre-reasoning GT-trajectory exposure on CoT quality
Main results on AD reasoning and general visual capability
Table 2: Main results on AD reasoning and general visual capability
Training dynamics of the Qwen3-VL-8B-Instruct RLVR variants
Figure 6: Training dynamics of the Qwen3-VL-8B-Instruct RLVR variants
查看结构化数据
任务指标本文基线提升
AD-MCQ-500 准确率 (Qwen3-VL-8B) ACC (%) 77.9 (DEFT-RLVR) 28.1 (training-free JEFT) +49.8 pp
AD-MCQ-500 准确率 (Qwen3.5-4B) ACC (%) 82.2 (DEFT-RLVR) 34.0 (training-free JEFT) +48.2 pp
同奖励下延迟暴露收益 (8B) ACC (%) 76.4 (DEFT+RLVR R_MCQ) 61.1 (JEFT+RLVR R_MCQ) +15.3 pp
一般视觉能力平均 (8B) General AVG (%) 56.09 (DEFT-RLVR) 54.81 (Base VLM) +1.28 pp(蒸馏路线反而 -4.9 pp)
跨域 nuScenes-500 准确率 ACC (%) 49.5 (DEFT-RLVR) 39.6 (training-free DEFT) +9.9 pp
rubric 训练效率 单步秒数 426.5s (DEFT-RLVR) 724.4s (在线 rubric 变体) 快 41.1%,且比纯正确性仅贵 0.5%

局限与改进

作者坦诚的局限有几条:AD-MCQ 本质是「验证接口」而非端到端连续规划器,落地仍需下游规划器把选中轨迹细化;评测规模有限(Test 仅 500 场景,Dev 仅 100),统计显著性靠 8 次重复采样保证但绝对覆盖面偏窄;CFS、HLD 两个核心 CoT 指标都依赖 Qwen3.5-397B-A17B 做 judge,作者虽在附录 E 验证了与人工标注的一致性,仍是「模型评模型」的二阶问题。我额外观察到三点:第一,码本 $K=8192$ 覆盖不了的真实罕见机动会被强制映射到最近原型,对长尾安全场景有隐患;第二,rubric 由 Qwen3.6-35B-A3B 离线生成,准则集本身的偏差会渗入奖励;第三,所有训练场景都来自 Waymo 类分布,nuScenes 虽做了跨域验证但只是单一外部域,对真正异构的路况(如非结构化道路、两轮车密集城区)泛化未经验证。

独立分析的弱点

独立来看,第一个弱点是「选择题表达力天花板」:当正确机动落在码本 0.279m 重建误差之外(如极端避让),oracle 本身就是次优解,无论怎么训都学不到更优轨迹,改进方向是把码本做成自适应扩展或引入残差修正项。第二个弱点是「rubric judge 与策略同源」:准则生成、文本评分、策略推理都来自 Qwen 系,若 judge 对某种推理风格有系统偏好,奖励会放大该风格,改进方向是引入跨家族 judge 集成或人工抽检校准。第三个弱点是「两轮交互的推理成本」:Turn 1 + Turn 2 加起来最高 24576 token,对实时性要求高的部署不友好,改进方向是蒸馏成单轮 + KV 缓存复用,或用投机解码压缩 Turn 1。第四个弱点是「6 选项的判别粒度有限」:高分场景里相邻候选 ADE 仅 7m 量级,但极相似的未来(图 8 显示高相似度区最难)会撞到判别下限,改进方向是按场景难度自适应选项数与相似度带。

未来方向

作者明确指出的方向是:把 AD-MCQ 作为「可控难度的可验证 AD 推理实验台」,通过候选数量与相似度边界系统研究推理难度。基于成果可延伸的方向有四:其一,把码本从纯运动学聚类升级为「场景条件码本」,让候选随场景动态检索;其二,把 DEFT 两轮接口接入真正的端到端规划器(如结合 diffusion planner 做轨迹细化),补上连续规划短板;其三,把 rubric 奖励推广到多模态judge(加入视频时序证据核验),降低纯文本评分的盲区;其四,把延迟暴露范式迁移到机器人操作、具身导航等同样存在「目标泄漏」的 VLA 任务,验证「先解后验」的普适性。

复现评估

复现友好度很高,是这篇论文的加分项。代码、模型权重、AD-MCQ 数据集全部开源(GitHub: hzx122/DEFT-RLVR,HF: hzxllll/DEFT-RLVR-model-HF 与 hzxllll/AD-MCQ)。基座用公开的 Qwen3-VL-8B-Instruct 和 Qwen3.5-4B,训练只需 5000 场景,蒸馏配置 TP=2、batch 32、lr $1\times 10^{-5}$、序列长 20480,单卡规模即可起步;RLVR 用 GRPO,rubric judge 走纯文本所以显存压力小。附录给出完整码本构造(算法 1)、蒸馏目标构造(算法 2)、两轮 prompt 模板(附录 F.1-F.3)和评测 prompt(附录 F.6),连候选采样的随机种子都用 SHA1(base_seed:record_key) 确定。主要门槛是需要 Qwen3.5-397B-A17B 做 CoT 标注与评测 judge、Qwen3.6-35B-A3B 做 rubric,这两个大模型对中小团队不便宜;但只复现 RLVR 主线时用更小开源 judge 也能跑通。整体难度中等偏上,可复现性在 AD-VLM 方向属优秀水平。