以意图行动:为视觉-语言-动作模型蒸馏行为意图 Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
用冻结教师VLM把已执行行为的语义目标蒸馏进VLA动作解码器,大幅提升操作成功率与泛化
前置知识
VLA 模型(Vision-Language-Action)
将预训练视觉-语言模型(VLM)骨干与动作解码器组合的机器人基础模型:VLM 把图像观测和语言指令编码为上下文 token,动作解码器(常用流匹配或扩散 Transformer)在此基础上生成连续电机指令。代表工作包括 π0/π0.5、GR00T-N1 系列、OpenVLA 等,本文即在 GR00T-N1.7 与 π0.5 两个骨干上实验。
本文的全部改动都发生在 VLA 的动作解码器内部,需要先理解「VLM 编码上下文、解码器出动作」的分工,才能明白为什么意图应插在解码器中间层并组织剩余计算。
行为克隆(Behavior Cloning, BC)
最常用的机器人策略监督方式:把示教数据中的(观测,指令)→专家动作当作监督信号,用监督学习直接拟合上下文到动作的映射。它只告诉模型「这一步该输出哪条电机指令」,却不告诉模型这个动作在指令下要达成什么目标。
BC 是本文批判的起点:作者认为 BC 让解码器学到强映射却让行为目的保持隐式,INDI 的动机就是补上这一缺失的监督维度,并用量化实验说明其后果。
流匹配(Flow Matching)
一类连续动作生成目标:向真值动作 $A_t$ 加噪得到 $A^{\lambda}_t = (1-\lambda)\epsilon + \lambda A_t$,训练解码器预测速度场 $u = A_t - \epsilon$,推理时从噪声迭代去噪得到动作。GR00T-N1.7 的 DiT 与 π0.5 的动作专家均采用此目标,本文原样保留。
INDI 的动作损失就是骨干原有的流匹配损失;接地行的「无梯度预测→detach→再加噪」自条件设计,正是为了兼容流匹配多步去噪推理而存在的。
未来监督(Future-based Supervision)
用未来信息增强动作学习的方法族:预测未来帧/子目标图像(DreamGen、Video Prediction Policy)、对齐未来观测的潜在特征(FLARE)、或预测轨迹/运动场/点轨迹(Track2Act 等)。这些信号描述未来可能的样子与运动如何展开,属于行为的具体实现而非其语义目标。
这是本文最主要的对照系。论文核心论点是「实现≠目标」:实验中未来监督只把 SimplerEnv-Bridge 提到 68.0%,远低于 INDI 的 84.7%,理解这一差距才能抓住论文贡献。
中间层表征对齐(REPA 式蒸馏)
在生成模型的中途层插入投影头,用余弦损失把内部表示对齐到外部强特征(本文对齐到教师 VLM 的中间层隐状态),并对目标施加 stop-gradient(记作 $sg(\cdot)$)。相比只在输出端监督,中间层对齐能让该表示塑造后续所有计算。
INDI 的意图对齐损失 $\mathcal{L}_I$ 与接地对齐损失都采用这一范式,且特意选在解码器 50% 深度处监督,使恢复出的意图能够影响剩余一半解码层。
教师 VLM 与功能意图(Cosmos-Reason2)
本文用冻结的 Cosmos-Reason2-8B 作为训练期教师:输入当前观测、指令、粗动作摘要与约 1.6 秒执行视频,先写不超过 4 句的推理,再输出一句 30–50 token 的功能目的语句;意图目标取自其处理证据时的第 18 层(中点层)隐状态。该模型经过物理 AI 后训练,具身理解更强。
教师替换实验表明教师质量决定成败:换成 Qwen3.5-9B 反而低于基线(54.5% vs 61.5%),因此必须理解教师目标如何构建、其几何性质如何被诊断。
研究动机
VLA 模型的动作解码器至今几乎完全靠行为克隆训练:给定观测和指令,模型只被告知「该复现哪条电机指令」,却从不被告知「这串动作在指令下要达成什么局部目标」。这种监督在短任务上勉强够用,但任务一长或场景一变,解码器只能靠上下文-动作的统计关联硬撑,后果具体而可量化:在 SimplerEnv-Bridge 上,强基线 GR00T-N1.7 平均成功率只有 64.3%,其中「放入 EP 篮子」任务仅 36.0%;在 24 个任务的 RoboCasa Kitchen 上,每任务仅 100 条示教时平均 64.1%;真实世界四任务中最长的「抽屉收纳」在干净场景下只有 24.0%,加入干扰物后跌到 8.0%。另一条路线是未来监督——预测未来帧、潜在观测、轨迹或运动场——但论文指出这些信号监督的都是行为的具体「实现方式」(what may happen),而非其共同语义目标:同一阶段动作在不同任务中服务不同目标(同样是抓取,可能为了堆叠也可能为了丢弃),同一目标又可通过多种执行实现,因此这类监督天花板明显——未来监督只把 Bridge 平均从 64.3% 提到 68.0%,自由潜变量控制甚至降到 57.0%,低于不做任何增强的基线。
本文的目标是本文的目标是让 VLA 动作解码器显式表征「行为级意图」——即在指令约束下、即将执行的动作序列所要达成的局部目标(什么对象或关系发生变化、这一段为指令推进了什么)。具体拆成三个可检验的子目标:其一,把意图变成可训练的监督信号,由于机器人示教数据并不标注局部目标,需要借助一个冻结的教师 VLM 从「当前观测+指令+粗动作摘要+执行视频」中自动解读已执行行为,离线生成意图目标;其二,让部署时的学生解码器仅凭标准 VLA 输入(观测、指令、本体状态)就能在解码器中间层恢复出该意图表示,并让它真正参与动作与接地的联合预测,而不是一个摆设性的辅助对齐目标;其三,部署阶段完全移除教师和一切目标生成模块,把开销控制在极小量级(参数增幅低于 1.5%),并在 SimplerEnv-Bridge、RoboCasa Kitchen 与真实双臂平台上验证性能与分布外泛化(未见物体、干扰物场景)的同步提升。
与已有工作不同的是,本文的独特切入在于对「中间监督信号」的重新定义。以往方法给解码器的额外监督都是行为的某种实现:未来帧/子目标图像是场景实现,轨迹/运动场/点轨迹是运动实现,具身思维链(ECoT)是推理实现;INDI 监督的则是这些实现所共同服务的语义目标本身。与从轨迹学潜计划的 LMP、LADS 相比,那些潜变量是与策略联合训练的重构编码,INDI 蒸馏的却是一个冻结教师 VLM 对行为的语义解读,目标分布固定、语义稳定。另一个关键差异是「证据侧」目标:教师目标取自其处理多模态证据(视频+动作摘要)时的中间层隐状态,而非其生成文本之后的表示——消融显示证据侧目标比响应侧目标高 6.0 个百分点(85.5% vs 79.5%),即「蒸馏教师的感知而非教师的语言」更有效。此外,INDI 把意图做成「功能性中间状态」:通过非对称注意力、上下文瓶颈路由(门控 $\alpha\sim\text{Bernoulli}(0.5)$)和意图错配损失,强迫下游动作与接地预测依赖意图的具体内容,这与把辅助信号当旁路读出的做法有本质区别。
核心方法
INDI 的直觉是:如果解码器先知道「这一步要干什么」,再决定「具体怎么动」,长时序操作会稳定得多。技术路线分两条线。教师线:冻结的 Cosmos-Reason2-8B 对每个约 1.6 秒的示教片段,输入当前观测 $o_t$、指令 $\ell$、粗动作摘要 $c_A(W_t)$ 与执行视频,在单次自回归前向中缓存两类目标——处理证据时的中间层(第 18 层)隐状态按 8 个区域池化成的意图目标 $I^*_t$、生成功能目的语句的末层隐状态池化成的文本目标 $R^*_t$;另有冻结的 Cosmos-Reason2-2B 视觉编码器对片段末端观测 $o_{t+H}$ 编码、64→16 空间池化得到视觉结果目标 $V^*_t$。这些目标全部离线生成并缓存复用。学生线:预训练 VLA 的流匹配动作解码器(GR00T-N1.7 或 π0.5)在其 token 流中追加 8 个永不加噪的干净可学习意图查询 $Q_I$,以及自条件的视觉/文本接地行;意图在解码器 50% 深度处(GR00T 第 16/32 块、π0.5 第 9/18 层)被监督恢复,剩余层在意图的组织下联合完成动作与两种接地预测。部署时教师、缓存目标、对齐投影头和错配分支全部移除,策略只吃原始 VLA 输入,内部自行形成意图与接地状态。
核心创新是把「行为级意图」确立为动作解码器缺失的监督目标,并让它成为功能性的中间语义状态。与行为克隆(监督哪个动作被演示)和未来监督(监督未来如何展开)的本质区别在于:INDI 监督的是动作序列在指令下服务的局部目标。实现上有三个环环相扣的设计。第一,证据侧意图目标:教师解读多模态证据时的中间层表示比其生成文本后的表示保留更多感知接地,消融证明前者更好(85.5% vs 79.5%)。第二,意图错配损失 $\mathcal{L}_{mis} = \max(0, m + D_{right} - D_{swap})$:在批内循环移位意图表示构造错配样本,强迫「匹配意图的下游动作+接地损失比错配意图低至少 margin $m=0.05$」,使解码对意图内容敏感而非仅对潜通路的存在敏感。第三,上下文瓶颈门控:训练时采样 $\alpha\sim\text{Bernoulli}(0.5)$,一半更新中非意图行只能经意图查询获取 VLA 上下文。两个机制缺一不可:去掉瓶颈成功率从 85.5% 跌至 70.0%,去掉错配损失跌至 74.0%,两者都去掉仅剩 65.5%,而清零意图更是跌到 45.5%(低于基线),证明意图是被真实使用的必需通路。
方法步骤详情
第一步(目标构建,离线一次性):对每个 $H$ 步示教片段(Bridge $H{=}8$、5Hz;RoboCasa $H{=}32$、20Hz,均约 1.6 秒),把连续动作按训练集分位数离散成粗运动摘要,与观测、指令、视频一起送入教师提示(要求先在 think 块写不超过 4 句推理,再输出一句 30–50 token 的功能意图);从第 18 层证据 span 隐状态按 $K_I{=}8$ 个连续区域均值池化得 $I^*_t$(宽 4096),从末层生成语句池化得 $R^*_t$,用视觉编码器编码末端观测得 $V^*_t$(每相机 16 槽、宽 2048)。第二步(解码器改造):在 GR00T-N1.7 的 DiT 流中追加 $[Q_t, A^{\lambda}_t, Z^{V,\lambda}_t, Z^{R,\lambda}_t, Q_I]$,意图查询永不加噪。第三步(意图恢复):中点层读出意图行状态 $H^{tap}_{I,t}$,经三层 SiLU MLP 投影后与教师目标做余弦对齐 $\mathcal{L}_I = \frac{1}{K_I}\sum_k [1-\cos(P_I(H^{tap}_{I,t,k}),\, sg(I^*_{t,k}))]$。第四步(动作与接地):动作流保留流匹配损失 $\mathcal{L}_A = \mathbb{E}\|\hat{u}_A - u_A\|_2^2$;接地行先做无梯度前向预测干净状态,detach 后在采样流时间重新加噪作为输入,末层用 REPA 式表征对齐损失训练。第五步(意图依赖):非对称注意力(意图查询只看状态/上下文/彼此;接地行看意图;动作行看意图+接地)+瓶颈门控+错配损失。总目标 $\mathcal{L} = \mathcal{L}_A + 0.5\mathcal{L}_I + 0.5\mathcal{L}_V + 0.5\mathcal{L}_R + 0.1\mathcal{L}_{mis}$;部署时 $\alpha{=}1$ 并移除教师侧全部模块。
技术新颖性
技术新颖性体现在四点。第一,监督对象新:首次把「教师 VLM 对已执行行为的语义解读」作为动作解码器的蒸馏目标,区别于未来帧(DreamGen)、潜在未来观测(FLARE 对齐未来观测潜特征)和推理链(ECoT)——消融证明教师意图比同结构的未来视觉对齐高 17.5 个百分点(85.5% vs 68.0%),而同参数量的自由潜变量反而低于基线(57.0% vs 61.5%),说明增益来自监督语义而非额外容量。第二,目标来源新:证据侧中间层目标优于生成响应侧目标(85.5% vs 79.5%),这一「蒸馏教师感知而非教师语言」的发现对所有蒸馏类工作都有参考价值。第三,机制新:意图错配损失把「表征被使用」变成显式训练目标,配合瓶颈路由使意图成为必需通路——清零意图使成功率从 85.5% 崩到 45.5%(低于基线),跨目标注入干预使成功率从 84.5% 跌至 45.2%,证明它是携带内容的中间状态而非无差别门控。第四,诊断新:提出角度预算(angular budget)、有效秩、片段内方差占比三个教师目标几何指标,单调对应下游成功率,可预测地区分好教师(Cosmos-Reason2,85.5%)与坏教师(Qwen3.5-9B,54.5%),为「教师选择」提供了训练前即可执行的可操作检验。
实验结果
发现一:大幅且跨骨干的提升。SimplerEnv-Bridge 上 GR00T-N1.7 从 64.3% 升至 84.7%(+20.4pp),四任务全升:Spoon +4.0、Carrot +5.4、Stack +12.0、EP-Basket 从 36.0% 飙至 96.0%(+60.0pp);π0.5 从 52.3% 到 58.8%。RoboCasa Kitchen(每任务 100 条示教)上 GR00T-N1.7 从 64.1% 到 70.3%;INDI 用 1/30 的数据达到 70.3%,距官方 3000 条示教检查点的 70.8% 仅 0.5pp,且高于所有已报道方法(FLARE 66.4%、RS-CL 69.7% 均用 300 条);π0.5 从 34.9% 到 41.4%,Others 类 +14.0pp。发现二:真实世界提升集中于长时序任务。四任务各 50 次试验、三条件(干净/未见物体/干扰物)平均成功率 62.0%→68.7%,其中跨箱堆叠 +7.3pp、抽屉收纳 +10.7pp,短任务仅 +4.7/+4.0pp;抽屉任务的差距在抓取阶段就已拉开(50.0%→70.0%),而跨箱堆叠的差距出现在第一个子目标完成后的阶段切换处。发现三:增益确来自意图监督。固定评估的控制实验中,仅接地 60.0%、自由潜变量 57.0% 均低于基线 61.5%,未来监督 68.0%,纯意图 76.0%,加双接地后 85.5%。发现四:恢复的潜变量真正起意图作用——任务 1-NN 纯度 92.0%、三段进度分类 77.8%( chance 33.3%)、同目标异序列相似度 0.150 高于异目标同序列的 −0.017;代价很小:GR00T-N1.7 参数 +1.3%(+46.4M)、单次查询推理 56.1→61.5ms(1.10×)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SimplerEnv-Bridge(GR00T-N1.7) | 平均成功率(4 任务×3 次评估) | 84.7% | GR00T-N1.7 基线 64.3% | +20.4pp,其中 EP-Basket 36.0%→96.0%(+60.0pp) |
| SimplerEnv-Bridge(π0.5) | 平均成功率 | 58.8% | π0.5 基线 52.3% | +6.5pp,四任务全部提升 |
| RoboCasa Kitchen 24 任务(GR00T-N1.7,G100) | 宏平均成功率 | 70.3% | GR00T-N1.7 G100 64.1%;未来监督 65.8% | +6.2pp(对基线),用 100 条示教逼近 3000 条检查点的 70.8% |
| RoboCasa Kitchen 24 任务(π0.5) | 宏平均成功率 | 41.4% | π0.5 基线 34.9% | +6.5pp,Others 类 +14.0pp |
| 真实世界四任务(SO-101 双臂) | 三条件平均成功率(各 50 次试验) | 68.7% | GR00T-N1.7 基线 62.0% | +6.7pp;长任务 Drawer Storage +10.7pp、Cross-Bin Stacking +7.3pp |
| 教师意图 vs 未来监督(同结构对照) | SimplerEnv-Bridge 固定评估平均 | INDI 85.5% | 未来监督 68.0%;自由潜变量 57.0%;仅接地 60.0% | 意图监督较未来监督 +17.5pp,证明增益来自语义目标而非额外容量 |
局限与改进
作者承认的局限有三。其一,意图语义被教师封顶:策略能学到的语义上限由教师 VLM 的具身理解决定,教师不行时蒸馏反而有害(Qwen3.5-9B 使成功率跌至 54.5%,低于不蒸馏的 61.5%),且框架没有「意图是错的」的概念,也没有执行与目标矛盾时修正目标的机制。其二,意图是被恢复而非被选择的:部署时每个查询只确定性地恢复一个意图并立即消费,无法在阶段歧义时维持目标分布、无法跨 rollout 保持意图、也无法接受「你应该在做 X」式的语言纠正。其三,意图只从成功示教的单一时间窗读取,而失败与被纠正的片段才最显式地陈述目标,却完全被忽略。我的补充观察:RoboCasa 上 π0.5 的 Pick-and-Place 仅 +1.3pp,逐任务看 INDI 并非全面占优(如 PnP 到微波炉 28.0% 远低于未来监督的 57.3%),未来监督变体在 RoboCasa 上呈现明显的逐任务重分布而非一致提升;控制变量实验在固定单次评估上进行(基线 61.5%,低于主表三次评估均值 64.3%),单次运行方差较大;推理延迟增加 10%(GR00T)到 21%(π0.5),对 5–20Hz 控制可行但高频场景有成本;意图窗口固定约 1.6 秒,无法表达跨窗口的层级化长期目标。
独立分析的弱点
独立分析四个弱点。第一,教师单点依赖:整个方法的语义上限由一个教师 VLM 决定,且作者证明坏教师比不蒸馏更糟(Qwen3.5-9B 得 54.5% < 基线 61.5%),教师更换还可能引入许可与成本问题。改进方向:训练前用角度预算/片段内占比做教师筛查;多教师集成或按任务域路由教师;用执行成败反馈对目标重加权。第二,意图不可查询、不可编辑:干预实验证明了该状态可寻址,但部署策略从不利用这一点,无法接受人类语言纠正或子目标指定。改进方向:把意图查询开放为接口,支持测试时注入文本目的或视觉子目标,实现人机协作纠错与分层规划。第三,监督只来自成功示教:失败片段(占机器人自主经验的大头)被完全忽略,而它们恰恰最显式地暴露「行为应该达成什么」。改进方向:从失败与纠正片段蒸馏「意图违背」信号,训练意图-结果一致性判别器,或以意图为潜变量做 RL 微调。第四,固定 1.6 秒窗口与静态一次性蒸馏:目标离线生成后不再更新,无法随策略改进而自举,长程任务的嵌套目标被窗口截断。改进方向:层级化意图(任务→阶段→窗口三级);随训练进程用当前策略的 rollout 重新请教师标注,形成迭代蒸馏。另外接地双流带来 10–21% 推理延迟,高频灵巧操作可对接地流做蒸馏或剪枝。
未来方向
作者在结论与附录 D 中明确提出三个方向:一是让意图经验证后再用——对照执行结果校验教师目标,或通过策略自身交互(而非固定解释器)获取意图,打破教师语义封顶;二是把意图做成接口——供规划器读取、供人类以「你应该在做 X」的方式纠正、供执行反馈写入,让策略能维持目标分布并跨 rollout 保持意图,作者称这是最具价值的扩展;三是层级化意图与从失败/被纠正行为中蒸馏意图。基于其成果还可自然延伸:把意图几何诊断(角度预算、片段内占比)用于自动化教师筛选与多教师数据配比;将意图状态与 VLM 骨干的推理链(如 ECoT)结合,形成「语言推理→意图→动作」的完整链路;在跨具身数据上验证意图的具身无关性——同目标异序列相似度 0.150 高于异目标同序列 −0.017 的结果暗示意图独立于具体执行方式,有望跨机械臂迁移;利用意图空间的任务相关度几何(Spoon-Carrot 最近、EP-Basket 最远)做任务聚类、课程学习与技能库组织;以及把意图错配损失推广为通用的「中间表示内容依赖」训练准则,应用于其他生成式策略架构。
复现评估
复现条件较好但算力门槛高。有利因素:两个骨干(GR00T-N1.7 官方仓库、π0.5/openpi)与教师(Cosmos-Reason2-8B/2B)均公开;仿真基准 SimplerEnv-Bridge 与 RoboCasa Kitchen 公开且协议清晰(每任务 50 回合×3 次独立评估);论文给出完整超参数($K_I{=}K_R{=}8$、$K_V{=}16$/相机、margin $m{=}0.05$、损失权重 0.5/0.5/0.5/0.1、上下文丢弃 0.5、教师目标取第 18 层、池化方式、教师提示全文)与训练配置(AdamW,GR00T 学习率 $10^{-4}$,Bridge 2 万步/批 1536,RoboCasa 6 万步/批 480),还有成本表与项目页。不利因素:需要 3 张 B200(各 183GB)GPU,训练 17–29 小时/基准;教师目标需对数万片段(Bridge 约 5.3 万回合中抽帧)离线跑 8B VLM 推理一次;真实世界部分需自建 SO-101 双臂遥操作平台(带头部+双腕三相机)并采集 4 任务×100 条示教;论文未明确承诺开源训练代码,错配训练、瓶颈路由、表征编辑干预等细节需按论文自行实现。总体:仿真部分对有 VLA 微调经验的团队属中高难度,真实平台部分难度更高。
论文图表
三栏对比图:(a) 行为克隆直接监督动作;(b) 未来监督叠加未来帧/轨迹等实现信号;(c) INDI 把教师从已执行行为解读出的行为级意图蒸馏进解码器,由意图组织动作与「如何展开、达成什么」的多种接地表示。右侧柱状图给出 GR00T-N1.7 成绩:SimplerEnv-Bridge 64.3%→84.7%(+20.4pp),RoboCasa-Kitchen 64.1%→70.3%(+6.2pp),并标注未来监督仅 68.0%。
一图讲清论文的问题定位(BC 与未来监督都缺「行为目标」)与量级最大的结果,是理解全文动机与贡献的最短路径。
(a) 任务判别投影:真实示教段与仿真 rollout 的恢复意图按行为目标(spoon/carrot/stack/eggplant)清晰分离;(b) 阶段判别投影:不同任务的意图按执行阶段(early 0–33%、mid 33–66%、late 66–100%)组织,而非按任务聚集。
证明恢复的潜变量同时编码「行为目标」与「执行进度」两个语义维度,是论文声称「该表示功能上就是意图」的核心表征学证据,配合 92.0% 任务纯度与 77.8% 三段分类准确率食用。