Enfold:将世界模型想象折叠进预测表征的超高效具身控制 Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
把世界生成模型构造未来的内部计算蒸馏为仅由当前观测预测的表征,控制时无需执行生成器
前置知识
世界生成模型(WGM)
在海量视频上训练的生成式模型(本文用 Cosmos-Predict 2.5 2B),给定当前观测与指令可预测未来画面如何演变。它通过迭代去噪把被腐蚀的潜变量 $y_t = \alpha_t y_0 + \sigma_t\epsilon$ 逐步还原为连贯的未来视频,去噪网络的每一层都会产生中间隐藏状态。
本文全部出发点是把这套模型构造未来的中间计算(而非输出像素)拿来当监督,不熟悉 WGM 的工作方式就无法理解 G2R 目标从何而来。
Flow Matching(流匹配)
一种训练连续生成模型的方法:学习速度场 $v_\theta$,把高斯分布的样本沿常微分方程搬运到数据分布,训练目标是回归插值路径的目标速度 $u_t(y_0,\epsilon)$,即 $\mathcal{L} = \mathbb{E}[\|v_\theta(y_t,t,\cdot) - u_t\|^2]$。
Enfold 的生成器分支 R2G 和动作头都用条件 flow matching 实现,公式(5)(6)的损失都建立在这个框架上。
JEPA 与预测表征学习
Joint-Embedding Predictive Architecture:不在像素空间重建未来,而是在表征空间预测,学生网络从当前观测预测目标编码器对未来帧的输出特征,从而学到忽略不可预测细节的时序表征,代表作有 I-JEPA、V-JEPA。
Enfold 属于这一思想家族,但监督目标从判别编码器的端点特征换成生成式模型的中间状态;理解 JEPA 才能看清它与 VLA-JEPA 的关键差别。
Stop-gradient(梯度截断)
计算图中把某条路径梯度置零的操作,记作 $\mathrm{sg}(z)$ 或 $\bar{z}$:前向照常传值,反向不传梯度。本文用三处:R2G 中 $\bar{z}$ 条件生成器、任务头只读 $\mathrm{sg}(z)$、G2R 目标侧截断。
这是 Enfold 优化结构的核心:保证任务梯度不会把预测编码器改造成策略骨干,使下游性能成为表征信息量的真实读出。
Teacher forcing 与腐蚀时间步 $t$
训练扩散/流模型时不自行采样,而是把真实数据按调度加噪到指定程度(时间步 $t$ 越大腐蚀越重)再让网络还原;提取内部状态时也按此方式前向,称为 teacher-forced pass。$t$ 同时决定输入腐蚀程度与网络各层行为。
论文诊断出最有信息量的生成器层随 $t$ 漂移,这一观察直接催生了时间步条件头 $F_\omega(z, \gamma(t))$ 的设计。
VLA(视觉-语言-动作模型)
把大规模视觉-语言预训练迁移到机器人控制的多模态模型:输入图像与语言指令,由动作专家解码出动作序列,代表工作有 OpenVLA-OFT、$\pi_0$、$\pi_0.5$、GR00T-N1.6,多依赖具身数据预训练。
LIBERO 与 RoboTwin2.0 的对比基线多为 VLA;理解 Enfold 的卖点需要知道它不依赖具身预训练却能与这些 3B-8B 模型竞争。
研究动机
当前利用世界生成模型(WGM)做机器人控制的主流方式都要在动作路径上承担生成器的输出成本:imagine-then-act 方法先用扩散模型渲染未来视频,再用逆动力学模型恢复动作;统一世界-动作模型(如 Motus、Cosmos-Policy、LingBot-VA)在一个解码过程中联合预测视频与动作。在 LIBERO 基准上这类方法的单次动作推理延迟高得惊人:F1 为 352ms,Fast-WAM 为 493ms,Cosmos-Policy 为 1133ms,Motus 达 2759ms,LingBot-VA 高达 3812ms。已有改进如 Fast-WAM 在测试时跳过显式未来生成、VPP 与 AHA-WAM 消耗内部特征或可复用 latent context、ImageWAM 读取图像编辑缓存,但它们仍把生成器或其缓存保留在动作时计算中。另一个问题是生成器的中间状态并非现成的控制表征:它们依赖部署时不可得的未来、随采样噪声波动,且随网络深度与腐蚀程度剧烈变化。
本文的目标是本文目标是回答:能否把世界生成器构造未来的内部计算,内化到一个仅由当前视觉上下文 $c$ 与语言指令 $e$ 推断出的表征 $z$ 中?这个表征要同时满足三点:一是作为监督目标学到的未来导向结构足以支撑高成功率控制;二是可以反馈回去条件未来视频生成(R2G),证明它包含超越可见上下文的预测信息;三是任务头以 stop-gradient 方式读取它,任务梯度不得重塑编码器。最终部署时动作预测只执行预测编码器 $U_\phi$ 与动作头,完全不运行视频生成器,把 LIBERO 上的动作延迟从 Fast-WAM 的 493ms 压到 134ms(Enfold-Flash 进一步到 49ms),同时保持 97.8% 的平均成功率。
与已有工作不同的是,本文的独特切入点在于监督信息取自哪里、如何进入控制。VLA-JEPA 的学生预测判别式目标编码器在未来帧上的特征,目标定义在判别编码器空间;VPP、AHA-WAM、ImageWAM 的动作时上下文来自被执行的生成路径或其缓存;Fast-WAM 虽避免推理时视频 rollout,但视频与动作预测仍在耦合架构内共同训练。Enfold 则把 teacher-forced 前向中生成器处理真实未来时暴露的多级隐藏状态当作预测监督空间,让学生编码器只看当前就去预测这些未来条件状态;学到的表征不被任务梯度塑造,可同时条件未来生成和动作读出,控制路径彻底不含生成器。这是把未来的生成式计算折叠进现在表征的接口级创新,而非单纯的效率工程。
核心方法
直觉:视频生成器把被腐蚀的未来 $y_t$ 逐步去噪成连贯轨迹时,中间状态在不同抽象层级上组织了外观、空间布局与交互结构,这套计算比最终像素更可复用。Enfold 让仅看当前的预测编码器 $z = U_\phi(c, e)$ 在训练期预测这套计算,并与生成器 $G_\theta$ 双向耦合:G2R 方向把生成器 teacher-forced 处理真实未来时暴露的多层状态拼接、层归一化后作为目标,由时间步条件头 $F_\omega(z, \gamma(t))$ 从 $z$ 预测;R2G 方向让 detach 的 $\bar{z}$ 条件生成器的 flow matching 训练;条件 flow-matching 动作头从 $\mathrm{sg}(z)$ 读出动作块。总损失是 G2R、R2G 与任务读出三项的加权和,梯度路由严格分离。生成器用 Cosmos-Predict 2.5 2B,编码器用 DINOv3 ViT-H+/16;推理只跑编码器与动作头,单块动作 134ms,Flash 用 TensorRT 加速到 49ms。
核心创新是非对称的生成式蒸馏:编码器必须在没有未来的情况下预测随机、依赖未来的状态,这迫使它保留能从当前状态预期的转移结构,而不是复刻教师特征里的所有干扰变化——这是像素预测或冻结视觉编码器蒸馏都给不了的性质。第二个关键决定是监督什么:诊断实验(Figure 2、3)表明不存在普遍最优的生成器层,最有信息量的 block 随腐蚀时间步 $t$ 变化,深层状态愈发抑制光照变化、强调全局布局,却对采样噪声更敏感。因此 Enfold 用 $A(\cdot)$ 拼接多个深度的时空 token 构成多级目标,并用时间步条件头 $F_\omega(z, \gamma(t))$ 适应目标随 $t$ 的表达方式。与 Fast-WAM 的本质区别在解耦程度:Enfold 的生成器只是训练期监督者和可选未来解码器,完全退出控制回路;与 VLA-JEPA 的区别在于目标是生成式模型的中间计算而非判别编码器的端点特征。
方法步骤详情
第一步,诊断:对真实未来块 $y_0$ 加噪得 $y_t = \alpha_t y_0 + \sigma_t\epsilon$,teacher-forced 前向暴露各层隐藏状态,用任务/场景检索、有效秩、噪声与光照布局敏感性指标确定监督层。第二步,G2R:生成器以 detach 表征为条件处理 $y_t$,选层拼接、层归一化得目标 $r^{G}_t$;因 $z$ 不依赖 $t$,条件头 $F_\omega(z, \gamma(t))$ 把表征映射到特定时间步坐标系,以 SmoothL1 拟合且目标梯度截断。第三步,R2G:以 flow matching 训练生成器,损失为预测速度场与目标速度的平方误差,detach 的 $\bar{z}$ 使该目标只教生成器使用表征而不塑造编码器。第四步,任务读出:条件 flow-matching 动作头从 $\mathrm{sg}(z)$ 出发,把高斯噪声搬运到示范动作分布生成动作块。第五步,联合优化:梯度路由严格分离,生成器只被未来建模更新。推理时 $U_\phi$ 前向一次得 $z$,动作头直接出块,需要显式未来时才调用 $G_\theta$。
技术新颖性
技术新颖性体现在四个层面。其一,监督空间新:把世界生成器的多级 teacher-forced 内部状态形式化为预测监督空间,并系统刻画其在深度与腐蚀程度上的效用-稳定性权衡(Figure 2 的 Pareto 前沿分析)。其二,接口新:提出表征级接口 WUM(world understanding model)替代以往的视频 rollout、latent context 或缓存接口,动作时刻不再执行任何生成计算。其三,优化结构新:G2R 与 R2G 前向耦合但梯度分离,任务头 detach,使下游性能成为生成器介导学习所暴露信息的读出,而非动作梯度把编码器改造成策略骨干的副产品。其四,验证互惠性:R2G 把 $z$ 回灌给生成器后 PSNR 从 25.92 升到 27.27dB,证明 $z$ 不是策略专用摘要而是共享预测接口,这种双向有效是先前单方向蒸馏方法不具备的证据形态。
实验结果
控制性能:无具身预训练的 Enfold 在 LIBERO 达 97.8% 平均成功率(Object 100.0%、Long 97.4%),超 Fast-WAM 0.2 分、Long 高 2.2 分,参数减半且延迟 134ms(快 3.7 倍),Flash 以 49ms(10.1 倍)保持 97.5%。RoboTwin2.0 双臂平均 91.77%(Flash 92.02%),高于 Fast-WAM 的 91.83%,略低于 LingBot-VA 的 92.20%。真机 4 个双臂任务分布内均 89.7%,比 Fast-WAM 高 11.9 分、比 $\pi_0.5$ 高 3.6 分;OOD 上 $\pi_0.5$ 最强(83.3%),Enfold 第二(76.6%)。机制上:G2R 消融中多级生成器状态 97.8%,优于未来像素 96.0%、单层状态 96.3% 与仅动作 94.9%;R2G 消融加入 $z$ 后 PSNR 25.92 升至 27.27dB、LPIPS 降 12.2%,证明 $z$ 是共享预测接口。表征上,光照敏感比降至 0.020(原 0.157-0.208),有效秩 31.8 反超教师最高 10.7,任务检索 mAP 0.486,对变化区域的预测优势随视距增长($t=32$ 时降 18.2%)。干预实验中场景改变后,重编码的 $z^+$ 使想象与动作同步转向新配置,排除轨迹回放。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| LIBERO(40 个语言条件任务,四套件平均) | 任务成功率 % | Enfold 97.8;Enfold-Flash 97.5 | Fast-WAM 97.6;VLA-JEPA 97.2;$\pi_0$ 94.4 | 对 Fast-WAM +0.2 分且参数减半(3B vs 6B)、延迟降 3.7 倍 |
| LIBERO-Long | 任务成功率 % | 97.4 | Fast-WAM 95.2;$\pi_0$ 88.4 | +2.2 分(对 Fast-WAM) |
| 动作推理延迟(A100 40GB,单动作块) | 毫秒(ms) | Enfold 134ms;Enfold-Flash 49ms | Fast-WAM 493ms;Motus 2759ms;LingBot-VA 3812ms | 3.7 倍 / 10.1 倍加速 |
| RoboTwin2.0(50 个双臂任务,clean/rand 平均) | 任务成功率 % | Enfold 91.77;Enfold-Flash 92.02 | Fast-WAM 91.83;LingBot-VA 92.20(用具身预训练) | 对 Fast-WAM +0.19(Flash),且无需具身预训练 |
| 真机 AgileX 双臂四任务(分布内 ID) | 归一化完成分 % | 89.7 | Fast-WAM 77.8;$\pi_0.5$ 86.1 | 对 Fast-WAM +11.9 分,对 $\pi_0.5$ +3.6 分 |
| LIBERO 未来视频预测(R2G 消融) | PSNR dB / SSIM / LPIPS | 27.27 / 0.902 / 0.0483 | 仅视频 Cosmos:25.92 / 0.885 / 0.0550 | PSNR +1.35dB,LPIPS 降 12.2% |
局限与改进
作者承认的局限:生成器在训练期仍然必需(只是退出控制路径而非全程不需要);干预实验证据是定性的,只构成干预条件下的重规划而非完整因果反事实推断;作者明确指出 LIBERO 上 0.2 分、RoboTwin2.0 上 0.19/0.18 分的优势在没有不确定性估计的情况下不足以支持排名声明,且 OOD 上落后 $\pi_0.5$ 达 6.7 分,承认大分布偏移下的鲁棒性是待解挑战。我的补充观察:全文未报告多种子的方差或置信区间,而主要对比都在接近饱和的基准上以零点几分计;训练需为每个样本跑 2B 生成器的 teacher-forced 前向加 flow matching 更新,实际训练成本论文未量化;方法与 Cosmos-Predict 这类流生成器的内部状态绑定,换到自回归等架构是否成立未验证;TensorRT 加速是工程手段,收益与具体硬件绑定。
独立分析的弱点
第一,训练开销不对称:推理省了生成器,但训练时每个样本都要让 2B 生成器在多个时间步上前向以提取多级目标,再用 flow matching 更新生成器本身,总计算量可能超过直接训练 Fast-WAM 类耦合模型,论文未给出训练 FLOPs 或墙钟时间对比,改进方向是对时间步与层做采样监督、或离线缓存教师特征。第二,评测统计薄弱:LIBERO 与 RoboTwin 的领先都在 0.2 分量级且无方差报告,若做 5 种子均值加减标准差,排名可能翻转,建议补显著性检验。第三,OOD 泛化是短板:真实扰动下 76.6% 对 $\pi_0.5$ 的 83.3%,说明当前观测条件的预测表征在分布外仍依赖演示覆盖,可引入数据增强或在线适应。第四,教师-架构耦合:监督目标定义在 Cosmos 的层结构上,最优层随 $t$ 漂移的诊断结论未必能跨架构迁移。第五,反事实能力有限:模型只能对直接观测到的扰动重规划,无法推断未观测干预的后果。
未来方向
作者方向:把干预实验从定性案例升级为带度量的标准化 benchmark,并探索更完整的因果反事实推断。可延伸方向:其一,师生架构解耦,验证用自回归、masked 或不同规模生成器做教师时多级状态监督是否同样有效,甚至用更大教师蒸馏更小学生;其二,与具身预训练结合,Enfold 无预训练即达 97.8%,若叠加大规模机器人数据预训练能否突破 OOD 短板值得检验;其三,把 $z$ 用作规划或值函数的潜状态空间,检验其对长程任务的放大效应(LIBERO-Long 上已有 2.2 分优势);其四,Flash 路线延伸到量化与蒸馏,把 49ms 进一步压低以支持高频控制和边缘部署;其五,理论层面刻画哪些转移结构可从当前预测这一选择性条件化机制,给出泛化界。
复现评估
复现条件总体较好:核心组件全部公开,生成器用 NVIDIA Cosmos-Predict 2.5 2B,编码器用 Meta DINOv3 ViT-H+/16,评测用公开的 LIBERO(40 任务)与 RoboTwin2.0(50 任务);真机部分用 AgileX 平台,普通实验室难以完全复现,但仿真结果足以验证方法。论文提供项目页(zwl666666.github.io/enfold/),训练配置、数据处理、动作头设置与评测协议在附录 B,诊断协议在附录 C。难度评估为中等偏高:需要 A100 40GB 级 GPU(推理延迟在该协议下测量),训练要同时承载 2B 生成器 teacher-forced 前向与 flow matching 更新;G2R 目标提取、时间步条件头、梯度路由等实现细节需仔细对照公式(3)至(8)。若代码未开源,从零复现预计需资深研究员数周,仿真主表(97.8%/92%)是最可靠的对照锚点。
论文图表
四栏对比未来信息进入动作预测的接口: VLA 方法在视觉-语言表征上加未来预测,动作专家输出控制; 统一 WAM 联合预测未来观测与动作; imagine-then-act 用世界生成模型(WGM)生成视觉未来,再经逆动力学(IDM)恢复动作; Enfold 把 WGM 的未来生成式动力学内化到世界理解模型(WUM)的表征中,该表征同时条件生成与下游动作专家,动作预测无需视频 rollout。
一张图讲清本文与三大类已有方法的接口级差异,是理解论文定位的地图。
(a) 任务/场景检索在生成器各 block 与腐蚀时间步上的表现,轨迹标出最优 block,虚线为最终选定的监督层;(b) 生成噪声敏感性相对输入变化;(c) $t=600$ 时的效用-稳定性权衡,标记大小为有效秩,曲线为 Pareto 前沿。结论是没有哪个 block 全程占优,最优层随 $t$ 变化,部分深层状态语义信息强但对采样噪声更敏感。
这是选择多级监督目标的经验依据,直接支撑方法设计的合理性。
(a) 在 $t\in\{300,600,800,900\}$ 上汇总的光照与布局敏感性随 block 的变化;(b) 噪声、光照、布局三种敏感性随深度的曲线(中位数与四分位距),虚线为选定监督层。深层状态愈发抑制光照变化、保持对任务相关布局的响应,但对采样噪声更耦合,选择性与可预测性不单调同增。
论证必须采用多级目标而非单一最优层,是方法核心设计选择的证据。