SG-WAM:几何感知策略空间中的自引导世界建模 SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
0.9B小模型自引导预测未来状态并注入几何监督,登顶LIBERO与LIBERO-Plus
前置知识
世界动作模型 World Action Model (WAM)
在视觉-语言-动作(VLA)模型基础上额外建模「环境在未来如何随机器人动作演化」的范式。除了像普通策略那样把观测映射到动作,它还显式监督策略去预测动作施加后场景会怎样变化,从而给表征注入动作因果性的监督信号。常见实现分两类:在观测空间预测未来图像/视频/深度(显式),或在潜在空间预测未来表征(隐式)。
本文正是针对 WAM 的「未来该在什么空间里建模」这一核心矛盾提出方案,不懂 WAM 的动机就无法理解它要解决什么问题。
EMA 目标网络与 BYOL 自举
用网络自身参数的指数滑动平均(EMA)副本来生成监督目标:$\bar{\Theta} \leftarrow \mu\bar{\Theta} + (1-\mu)\Theta$,典型 $\mu=0.999$。目标分支不回传梯度,只随在线网络缓慢更新。这是 BYOL(Bootstrap Your Own Latent)类自监督方法的核心,能在没有负样本的情况下避免表征坍缩,提供一个稳定且与在线表征同源的监督源。
SG-WAM 的「自引导」精髓就在于用同一策略的 EMA 副本提供未来监督目标,理解 BYOL 才能明白为什么这种目标不会与动作专家错位。
条件流匹配 Flow Matching 动作专家
一种连续动作生成方法,把动作去噪过程建模为学习一个速度场 $v_\omega(A_t^\tau, \tau, H_t)$。训练时把专家动作与高斯噪声线性插值得 $A_t^\tau = \tau A_t + (1-\tau)\epsilon$($\tau\sim\mathcal{U}(0,1)$),损失为 $\mathcal{L}_{\text{act}}=\mathbb{E}\|v_\omega-(A_t-\epsilon)\|_2^2$;推理时从噪声积分速度场得到动作块。相比离散化动作 token,它更适合高自由度的连续机器人控制。
动作专家是 SG-WAM 三大训练目标之一,也是最终部署的输出头,理解它才能看懂端到端联合优化是怎么搭起来的。
VGGT 几何基础模型
Visual Geometry Grounded Transformer,一类从单/多视图图像直接预测 3D 几何结构(点云、深度、相机位姿等)的基础模型。本文用冻结的 VGGT-1B 抽取主视图最终聚合层的几何特征,把 1369 个 patch token 重排成 37×37 网格再自适应池化到 8×8,作为几何监督目标。它只负责在训练时「塑造」策略视觉 token 的方向,不直接进入推理。
几何监督是 SG-WAM 两大创新之一,正是靠 VGGT 把「动作改变场景的位置信息」注入策略表征,否则无法理解「geometry-aware」的含义。
研究动机
世界动作模型(WAM)的有效性,关键取决于「未来动力学究竟在哪个表征空间里被建模」。现有 WAMs 只能满足这一要求的一半。其一是观测空间路线(如 VPP、WorldVLA、UniPi),它们预测未来图像、视频、深度或表面法向,虽然信息密集,但模型必须同时刻画纹理、视角、背景、光照等大量与操作成功弱相关的表面变化,宝贵的建模容量被浪费在「看起来像」而非「动了什么」上;在精细化抓取、形变物体折叠这类需要局部空间结构的场景里,像素级重建甚至会模糊掉真正决定成败的细节。其二是潜在空间路线(如 VLA-JEPA、Fast-WAM、UniVLA),它们通过外部定义的未来编码器、预训练特征空间或事后构造的潜在子目标来施加未来监督,虽然避免了重建负担,但这些目标表征并不保证与动作专家实际使用的策略表征是同一族,预测目标强调的信息与动作生成所需的信息存在系统性错位——即「目标-策略失配」。更要命的是,两类方法都默认策略表征会自动保留操作所需的几何信息,但实际操作不仅要知道「什么变了」,还要精确捕捉「在哪里、以何种方式变化」,而几何往往只是作为重建副产品或辅助目标出现,并未直接用来组织那个与动作耦合的未来对齐空间。
本文的目标是本文要构造一个既能与动作生成强耦合、又充分几何感知的「未来对齐空间」,并据此训练一个高性能 WAM。具体目标有三:第一,让未来监督直接作用在动作专家实际消费的策略表征上,使预测目标与动作表征同源、消除目标-策略失配;第二,通过显式的几何监督让该策略空间保留操作所需的局部空间结构(在哪里、如何变化);第三,在仅用 0.9B 参数且不做大规模具身预训练的前提下,在 LIBERO 与更具挑战性的 LIBERO-Plus 上达到与 3B–7B 模型相当甚至更好的成功率,并在真实机器人上同时取得较强的同分布与分布外泛化。所有这些目标要在统一的单阶段端到端框架里同时达成。
与已有工作不同的是,作者抓住了一个被普遍忽视的关键点:「把未来预测从观测空间挪到潜在空间」并不足够。真正的问题是,潜在空间的未来目标必须由「生成动作的那个策略本身」来定义,而不是由另一个外部编码器或预训练特征来定义。已有潜在 WAM 虽然在策略网络内部联合训练预测与控制,但目标却来自未来观测编码器、预训练特征空间、潜在子目标或后验分支,仍未摆脱跨表征失配。SG-WAM 的独特切入角度是:用同一策略的在线分支生成当前动力学状态、用同一策略的 EMA 副本从未来观测生成监督目标,从而把「自举式自监督(BYOL)」思想第一次干净地搬到 WAM 的策略空间里;同时让冻结的 3D 几何教师只去「塑造」视觉上下文而不定义预测目标,使几何以不引入新失配的方式注入策略表征。这一组合视角在已有工作中是空白的。
核心方法
直觉上,可以把策略想象成一个学生,既要会动手又要会「想象后果」。SG-WAM 给这个学生在 VLM 序列里塞了一小摞可学习的「草稿本」——dynamics tokens(默认 8 个),用来概括与动作相关的场景状态,然后教学生预测「当我执行某段动作后,这些草稿会怎么变」;而批改答案的不是外部老师,而是一个比学生稍旧、缓慢更新的学生副本(EMA)。同时一个冻结的 3D 几何模型在旁边不断提醒学生:草稿本背后对应的视觉画面要保持住空间结构。技术路线上,Qwen3.5-0.8B 这个 VLM 骨干把多视图图像 token、语言 token 和可学习动力学 token 拼成一个序列,联合做上下文化得到 $H_t=[H_t^V, H_t^L, H_t^Q]$;该表征同时喂给三条分支:几何对齐分支(冻结 VGGT 监督主视图视觉 token)、自引导未来预测分支(SGWP 预测未来动力学 token 状态并与 EMA 目标对齐)、以及条件流匹配动作专家(生成动作块)。三条损失单阶段联合优化,推理时只保留在线 VLM、动力学 token 与动作专家。
全文最核心的思想:未来对齐空间应当是「策略派生的(policy-derived)」而非「策略附属的(policy-auxiliary)」。也就是说,当前动力学表征 $z_t^Q$ 与未来目标 $\bar{z}_{t+\Delta}^Q$ 必须来自同一个策略架构——在线分支生成 $z_t^Q$,EMA 副本从未来观测生成 $\bar{z}_{t+\Delta}^Q$,二者天然同族,预测损失 $\mathcal{L}_{\text{pred}}=\frac{1}{N_q d}\|\hat{z}_{t+\Delta}^Q-\text{sg}(\bar{z}_{t+\Delta}^Q)\|_F^2$ 因此能够直接塑造动作专家实际消费的表征。这与以往用外部未来编码器、预训练特征或后验分支构造目标的潜在 WAM 有着本质区别:那些方法即便在网络层面联合训练,目标也仍来自「另一个表征家族」。再叠加一个只塑造而非定义预测目标的冻结 VGGT 几何教师(用方向性余弦对齐 $\mathcal{L}_{\text{geo}}=\frac{1}{N_v^m}\sum_j(1-\cos\langle\hat{Z}_{t,j}^G,Z_{t,j}^G\rangle)$),就让动力学 token 处于一个「既与动作相关、又有几何感知」的空间。这种「自举目标 + 仅塑造性几何」的组合,是区别于所有已有 WAM 的本质创新。
方法步骤详情
完整流程分训练与推理两阶段。训练时:(1)编码输入——多视图观测编码为视觉 token $f_t^V\in\mathbb{R}^{N_v\times D}$,语言编码为 $f^L\in\mathbb{R}^{N_l\times D}$;(2)拼接 8 个可学习动力学 token $Q\in\mathbb{R}^{N_q\times D}$ 到序列末尾,RoPE 位置从原图像-语言序列末位续编,过 VLM 骨干得到上下文化表征 $H_t=[H_t^V,H_t^L,H_t^Q]$;(3)几何塑造——冻结 VGGT-1B 把主视图(518×518,重排为 37×37 并池化到 8×8)抽成几何目标 $Z_t^G$,策略侧用一个轻量 token-wise 投影器把主视图视觉 token 映射到 VGGT 维度并做余弦方向对齐 $\mathcal{L}_{\text{geo}}$;(4)自引导预测——投影动力学 token 到紧凑空间 $z_t^Q=P_\phi(H_t^Q)$,把 8 步、每步 7 维的干预动作序列经 MLP+时序位置编码成 $e_A$,SGWP(自注意力+交叉注意力)预测 $\hat{z}_{t+\Delta}^Q=F_\psi(z_t^Q,e_A)$;(5)EMA 目标——把未来观测、语言与 EMA 动力学 token $\bar Q$ 喂入 EMA 策略得 $\bar H_{t+\Delta}^Q$ 并投影为目标 $\bar z_{t+\Delta}^Q=\bar P_\phi(\bar H_{t+\Delta}^Q)$,按 $\bar\Theta\leftarrow\mu\bar\Theta+(1-\mu)\Theta$($\mu=0.999$)更新、不回传梯度;(6)动作专家——对全上下文 $H_t$ 做条件流匹配生成动作块,损失 $\mathcal{L}_{\text{act}}$;(7)三项损失 $\mathcal{L}=\mathcal{L}_{\text{act}}+\lambda_{\text{geo}}\mathcal{L}_{\text{geo}}+\lambda_{\text{pred}}\mathcal{L}_{\text{pred}}$($\lambda_{\text{geo}}=\lambda_{\text{pred}}=0.1$)单阶段端到端联合优化。推理时移除 VGGT、SGWP 与 EMA 分支,仅在线 VLM+动力学 token+动作专家部署,只需当前观测与语言指令。
技术新颖性
与已有技术的差异可分三条对比线。第一,相对显式 WAM(VPP、WorldVLA、UniPi 等):本文不做任何观测级重建,避免把容量浪费在纹理/光照/背景上,把监督信号集中在「动作如何改变场景」上。第二,相对潜在 WAM(VLA-JEPA、Fast-WAM、UniVLA、DIAL、World Guidance 等):它们的未来目标来自未来观测编码器、预训练特征、潜在子目标或后验分支,仍是「另一族表征」;而 SG-WAM 的当前态与未来态同源于一个策略(在线+EMA),首次把 BYOL 自举机制干净地搬进 WAM 策略空间。第三,相对几何相关方法:以往几何要么是重建副产品、要么是辅助 token 或预定义特征空间,本文让冻结 VGGT 只做「方向性塑造」,只改写视觉 token 的方向而不约束幅值分布,既注入几何又不破坏预训练表征兼容性、不引入新的目标-策略失配。此外,把动力学 token 同时作为「预测对象」与「动作专家上下文」,使预测与动作生成真正共享同一表征通路,这种「同一 token 双重身份」的设计在已有 WAM 中也是少见的。
实验结果
逐项分析关键实验。其一是 LIBERO 四套件(Table 1):SG-WAM 以 0.9B 参数、无具身预训练拿到平均 98.5%,追平参数量大 7 倍的 Spatial Forcing(7B, 98.5%),并超过 π0.5(3.3B, 96.9%)、GR00T N1.6(3B, 97.0%)、π0(3.3B, 94.4%)。分项看 Spatial 99.4、Object 99.8、Goal 98.6、Long 96.2,均在最优或次优之列,说明小模型配合自引导未来监督也能逼近天花板。其二是 LIBERO-Plus 零样本鲁棒性(Table 2):SG-WAM 整体 73.0% 居首,明显领先最强基线 OpenVLA-OFT(69.6%)与 VLA-JEPA(62.9%)。在 7 类扰动中,相机 58.6、机器人本体 48.9、语言 81.4、光照 89.8、背景 86.1、噪声 80.7、布局 74.2;尤其值得注意的是在标准 LIBERO 上同样很强的 Spatial Forcing 与 Fast-WAM 在这里分别跌到 29.1% 与 50.0%,而 SG-WAM 仍稳,说明几何+自引导带来的表征更不依赖表面视觉线索。其三是真实机器人(Table 3):在 Pick&Place 同分布 75%、背景迁移 55%、光照变化 60%、新物体 40%,全面高于 VLA-JEPA(35/20/25/20)与 VPP(30/15/10/10);长程 Toolbox 组织 ID 达 50%,子任务拆解(Table 6)显示越靠后阶段优势越大,说明动作条件潜在预测有助于在多步操作中维持任务进展。其四是消融(Table 4):完整 98.5%、去掉世界建模 97.6%、去掉几何 96.6%、两者皆无 95.3%,世界建模贡献(约 1.9pp)大于几何(约 0.9pp),且世界建模在 LIBERO-Long 上影响最大(96.2→92.2)。其五是 token 数(Table 5):1→96.1、4→97.5、8→98.5、16→97.2,呈非单调,8 为最佳,说明适度容量即可表达交互动力学。其六是 null-action 消融(Table 7):把干预动作换成全零序列后降至 97.6%,证明具体动作信息确实为未来预测提供了有用信号,尤其在长程任务(Long −1.6pp)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO 四套件平均成功率 | Average Success Rate (%) | 98.5% | Spatial Forcing 98.5%(7B)、π0.5 96.9%(3.3B)、GR00T N1.6 97.0%(3B) | 以 0.9B 追平最强 7B 基线;相对 π0.5 +1.6pp、相对 π0(94.4%)+4.1pp |
| LIBERO-Plus 零样本鲁棒性(7 类扰动整体) | Overall Zero-shot Success Rate (%) | 73.0% | OpenVLA-OFT 69.6%、VLA-JEPA 62.9%、Fast-WAM 50.0%、π0 53.6%、Spatial Forcing 29.1% | 相对最强基线 OpenVLA-OFT +3.4pp;相对 VLA-JEPA +10.1pp;相对标准 LIBERO 上的强者 Fast-WAM 高出 +23.0pp |
| 真实机器人 Pick & Place(同分布 ID) | Success Rate (%,20 次试验) | 75% | VPP 30%、VLA-JEPA 35% | 相对 VPP +45pp、相对 VLA-JEPA +40pp |
| 消融:世界建模+几何监督贡献 | LIBERO 平均成功率 (%) | 98.5%(两者皆用) | 两者皆无 95.3%;仅几何 96.6%;仅世界建模 97.6% | 世界建模贡献约 +1.9pp,几何贡献约 +0.9pp,二者互补;世界建模在 LIBERO-Long 上贡献 +4.0pp |
局限与改进
作者与客观上存在的局限包括:其一,真实世界实验只覆盖 3 个桌面任务、每任务 100 条示教,规模偏窄,是否能推广到更多操作类型(如双手、工具使用、接触丰富任务)未经验证;其二,在 LIBERO-Plus 的 7 类扰动中,「机器人本体迁移」仅 48.9%,是所有扰动里最弱的一项,说明策略对具体本体仍较敏感,跨本体泛化并未真正解决;其三,真实世界 Towel Folding 的成功率偏低(ID 25%、各 OOD 25–35%),表明对形变物体的几何状态建模仍不充分;其四,几何教师只作用于主视图且为冻结 VGGT,腕部视图未受几何监督,多视图几何融合缺失;其五,LIBERO 已接近饱和(多数方法 95%+),消融 1–2pp 的提升在统计噪声边缘,难于干净归因;其六,未在大规模跨本体数据集(如 Open X-Embodiment 量级)上验证,作者自己也把「扩展到更大骨干与跨本体数据」列为未来工作。
独立分析的弱点
第一个弱点:真实世界形变物体表现弱(Towel Folding OOD 仅 25–35%)。改进方向是引入布料/可形变物体专用的几何或状态教师,或让动力学 token 显式编码形变自由度,而不只靠通用 VGGT 的刚体几何。第二个弱点:LIBERO-Plus 的本体迁移最差(48.9%),说明动作空间与本体仍强耦合;可加入本体条件 token、动作重定向(retargeting)或本体不变的潜在动作空间,把「想象动作后果」与「具体关节指令」解耦。第三个弱点:几何监督只覆盖主视图,腕部近景与接触区未被几何塑造,而这恰是精细操作成败所在;改进方向是用多视图/视频版 VGGT 同时塑造腕部视图,或在 SGWP 里引入接触状态预测。第四个弱点:消融增益小(1–2pp)且在接近饱和的基准上,难以证明因果;改进方向是在更难的、未饱和的基准(如更强的 LIBERO-Plus 子集、真实长程任务)上重新评测,并报告多 seed 方差。第五个弱点:EMA 动量 $\mu=0.999$ 固定且未做敏感性分析,BYOL 类方法存在表征坍缩风险,长时间训练或换数据规模时稳定性未知;可加入停止梯度监控、预测-目标相似度的坍缩检测,或对比不同动量曲线。
未来方向
作者明确提出的方向:把自引导世界建模框架扩展到更大策略骨干与更广的跨本体数据集,以支撑多样本体与操作任务。基于成果可延伸的方向包括:第一,把学习到的潜在动力学空间用作规划与奖励信号——既然策略已能预测「动作后的草稿状态」,可据此做模型预测控制或目标条件规划,而不只是把预测作为表征正则;第二,从单步未来扩展到多步/视频级长程动力学预测,直接服务长程任务(本文已显示 LIBERO-Long 与 Toolbox 长程任务受益最大);第三,引入多视图几何教师,把腕部视图与接触几何一并纳入塑造;第四,系统研究 BYOL 自举在 WAM 中的稳定性与坍缩边界,给出动量/目标维度的设计指南;第五,探索把动力学 token 作为跨任务/跨本体共享的「操作中间语言」,与 latent action 类工作结合。
复现评估
复现难度中等偏低、可重现性较好。骨干 Qwen3.5-0.8B 与 VGGT-1B 均为公开模型,LIBERO/LIBERO-Plus 是公开基准,真实硬件(UR5e + Azure Kinect + RealSense D405 + RTX 3090)属常见配置。关键超参披露充分:8 个动力学 token、8 步干预动作(每步 7 维)、40k 步训练、全局 batch 96、余弦学习率+5k 步线性预热(VLM 1e-5、训练专属模块 2.5e-5、动作头 1e-4)、$\lambda_{\text{geo}}=\lambda_{\text{pred}}=0.1$、EMA $\mu=0.999$、VGGT 输入 518×518、37×37 池化到 8×8、真实世界每任务 100 条示教训 40 epoch。论文提供了项目页 sg-wam.github.io(大概率伴随代码与权重)。需要留意:真实示教数据需自行采集,未明确给出总 GPU 时长与所用显卡型号(仅推理提到 RTX 3090),0.9B 模型配 batch 96 训 40k 步粗估需数张 A100/H100 训练数天;几何与 EMA 分支只在训练期存在,推理开销与普通 0.9B VLA 相当。整体看,一个有机器人平台与中等算力的实验室复现仿真部分可行性高,真实世界复现则受限于示教采集与硬件标定。
论文图表
该图把三类未来建模方式并列:显式预测路线(重建未来观测/深度/光流,带来「感知负担」)、潜在建模路线(辅助潜在目标,存在「目标-策略失配」)、以及 SG-WAM(在策略派生表征里做潜在动力学建模,同时注入几何,标记为「动作相关」)。底部示意了在线策略表征如何同时驱动动作专家与潜在动力学预测。
这张图是全文的「问题-方案」总纲,一眼就能看清 SG-WAM 想规避的两条老路与它自身的定位,是理解动机与核心创新的最佳入口。