← 返回 2026-07-29

时序距离 JEPA:面向潜世界模型预测控制的规划感知表示学习 Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

Jiaxin Bai, Jiaxuan Xiong 📅 2026-07-28 👍 5 2026-08-03 18:30
JEPA 世界模型 准度量学习 模型预测控制 潜空间规划 目标条件RL 离线强化学习 表示学习

从离线演示中挖掘有向时序代价,弥合 JEPA 训练与规划鸿沟

前置知识

JEPA(联合嵌入预测架构)

JEPA 由 Yann LeCun 提倡,它不重建像素,而是训练一个编码器把观测映射到潜空间,再用预测器在潜空间中预测未来嵌入。其核心是“在表示空间中预测”,避免了生成式解码器的开销与不确定性。LeJEPA 进一步引入 SIGReg 正则化来稳定自监督训练、防止表示坍塌,LeWM 则在此基础上加入动作条件预测与潜空间规划,构成从像素到控制的端到端世界模型。

本文全部方法都建立在 JEPA/LeWM 的编码器-预测器骨干之上,理解“潜空间预测而非像素重建”才能看懂为什么存在训练-规划鸿沟,以及为什么本文不去改动力学架构而是去挖规划代价。

LeWM(Le World Model)

LeWM 是一个基于 JEPA 的潜在世界模型控制方法:训练一个动作条件的编码器-预测器做下一潜状态预测,用 SIGReg 防坍塌,测试时用 CEM 在潜空间搜索动作序列,并以潜欧氏距离 $\|z-z_g\|_2^2$ 到目标嵌入作为终端代价打分。它把预测表示的几何距离当成了规划代价。

LeWM 是本文的直接对照基线与骨干网络。本文保留 LeWM 的预测损失与 SIGReg 不变,只在它之上“挖”一个有向时序代价,理解 LeWM 才能理解鸿沟在哪里以及改动在哪里。

模型预测控制(MPC)与交叉熵方法(CEM)

MPC 通过在每一步搜索未来若干步的动作序列、只执行第一步并在新观测后重新规划(滚动时域)来控制。CEM 是常用的零阶搜索:维护动作序列上的对角高斯分布,采样候选序列、用代价函数评估、保留代价最低的精英候选,再用精英的均值方差更新分布。iCEM 在此基础上加入时间相关(彩色)噪声、跨轮精英复用和动量平滑。

本文的“规划”就是用 CEM/iCEM 在潜空间做开环 rollout,并用代价函数排序候选序列。规划阶段用哪个代价函数(有向 $d_\psi$ 还是欧氏 $\ell_2$)正是全文核心抉择。

准度量(Quasimetric)与有向代价

最优目标到达的代价-到-去函数 $D^\star(s,g)$ 在确定性动力学下是非负、对角为零、满足三角不等式但未必对称(从 $A$ 到 $B$ 的代价可能不等于从 $B$ 到 $A$),这种结构称为准度量。MRN(metric-residual network)用对称项 $\|\phi_{sym}(z_s)-\phi_{sym}(z_g)\|$ 加一个非对称 ReLU 残差 $\sum_k\max_k\text{ReLU}(\phi_{asym,k}(z_s)-\phi_{asym,k}(z_g))$ 来参数化这样一个有向非负代价。

本文最关键的技术新颖性就在于用准度量形式刻画“有向时序代价”,与对称的欧氏距离形成本质区别。理解准度量才能理解为什么 directed head 消融会导致最大性能下降。

训练-规划鸿沟(train–plan gap)

JEPA 训练目标是短时域潜空间预测误差,而规划器(MPC)需要的是对多步想象未来按“离目标进度”排序的能力。这两个目标不一致:预测得好不等于排序排得好。具体表现为 LeWM 在 Push-T 上潜欧氏距离与时序间隔的 Spearman 相关仅 $\rho=0.65$,而从日志挖掘的代价可达 $\rho=0.95$。这个差距就是训练-规划鸿沟。

整篇论文的诊断动机就是这条鸿沟。把握这一点,才能理解作者为什么要“挖”一个专门服务规划的代价,而不是继续优化预测。

研究动机

基于 JEPA 的潜在世界模型(如 LeWM)在离线演示日志上做潜空间短时域预测训练,但测试时规划器(latent MPC)需要对多步想象未来按“目标进度”排序。现有 JEPA 规划器直接继承嵌入几何——通常是潜欧氏距离 $\|z-z_g\|_2^2$——作为排序代价。问题在于,这个欧氏距离是表示学习的副产物,并不是从日志里挖出来的进度信号,它没有被训练去反映“还需多少步到目标”、有向可达性或规划器排序。论文用 Push-T 上的留出演示对给出了量化证据:LeWM 的潜欧氏距离与时序间隔的 Spearman 相关只有 $\rho=0.65$,而同日志挖掘出的代价可达 $\rho=0.95$。与此同时,并存的规划感知 JEPA 变体各自只解决一部分:Value-Guided JEPA 用 IQL 做价值塑形(引入了演示日志之外的价值估计器),RC-aux 加多时域开环预测与预算可达性辅助但仍用几何规划,SD-JEPA 用角度三元损失切分进度/内容子空间。它们要么超出无奖励设定,要么重塑几何却不提供显式规划代价,要么把时序结构当成辅助信号而非可发现的 MPC 排序信号。

本文的目标是作者要回答两个紧密耦合的问题:第一,如何从无奖励的离线演示轨迹中挖出能反映目标进度的“有向时序代价”,从而缩小 JEPA 世界模型规划器的训练-规划鸿沟;第二,这个挖出来的代价到底什么时候应该直接当规划代价部署,什么时候又只该用作表示塑形、规划时仍用潜几何(欧氏 $\ell_2$)。为此目标,论文提出 Temporal-Distance-JEPA:保留 LeWM 的编码器-预测器骨干和 SIGReg,新增有向代价头、同轨步骤序正样本与跨轨负样本的时序监督,以及与规划时域匹配的开环 rollout 一致性损失;并在拓扑主导(导航/到达)任务上部署 $d_\psi$、在接触主导(操作)任务上对同一时序训练检查点用潜 $\ell_2$ 规划。最终目标是证明“代价形式与部署方式应当协同设计”,并用锁定的统一评估协议支撑这一主张。

与已有工作不同的是,本文的独特切入角度是:不修改 LeWM 的动力学骨干,也不引入价值估计器或策略学习器,而是把“任务结构应当从哪里被发现”这个问题摆到台前——直接从无奖励演示日志中挖出有向、按时序步数校准的代价,并把这个代价既可作部署的规划代价,又可作几何规划器的表示信号。与 Value-Guided JEPA(依赖 IQL 价值)、RC-aux(预算可达性辅助但几何规划)、SD-JEPA(三元角度)相比,本文保持完全无奖励、显式地把时序结构当作可发现的排序信号,并且首次明确区分“代价类别(有向形式)”与“代价校准(时序标签)”两个层面。更关键的是,作者明确承认纯 $d_\psi$ 在接触主导任务上反而不如几何 $\ell_2$,并把这一现象诊断为信息互补而非缺陷,从而提出按任务拓扑结构选择代价的“双角色”部署方案——这是已有 JEPA 规划工作从未正面回答的部署决策问题。

核心方法

直觉是:规划器要按“离目标还差多少步”排序想象未来,就不该用对称几何距离,而该用一个从“真实步骤顺序”学出的有向代价。技术路线为“骨干不动,只挖代价”:保留 LeWM 编码器-预测器与预测损失 $\mathcal{L}_{pred}$、SIGReg 防坍塌。在此之上新增三块:用 MRN 参数化的有向代价头 $d_\psi$(对称项加非对称 ReLU 残差,满足 $d_\psi(z_s,z_g)\neq d_\psi(z_g,z_s)$)、把同轨步骤差 $\tau(i,j)=j-i$ 当回归标签并加跨轨铰链负样本的时序监督、以及与规划时域 $H=5$ 匹配的多步 rollout 一致性损失。规划时 CEM/iCEM 在 300 候选序列上做开环 rollout,用 $d_\psi$(拓扑任务)或潜 $\ell_2$(接触任务)排序终端潜状态。完整目标 $\mathcal{L}=\mathcal{L}_{pred}+0.5\mathcal{L}_{roll}+1.0\mathcal{L}_{td}+0.09\,\text{SIGReg}$。

核心创新是“代价类别与代价校准分离 + 有向时序挖掘 + 协同部署”。作者把规划代价拆成两个层面:代价的形式(用 MRN 给出的有向、非负、准度量结构 $d_\psi(z_s\to z_g)$),和代价的数值校准(用演示日志里的步骤序 $\tau(i,j)=j-i$ 回归)。这与 LeWM 的本质区别在于:LeWM 的欧氏距离 $\|z-z_g\|_2^2$ 等价于“恒等对称映射 + 零非对称残差”的特例,对称、无法表达目标到达的方向性;而本文用 MRN 头让代价 $d_\psi(z_s,z_g)$ 可以不等于 $d_\psi(z_g,z_s)$。校准上,同轨正样本把 $d_\psi(z_i,z_j)$ 拉向 $j-i$,跨轨铰链负样本 $\text{ReLU}(m-d_\psi(z_i,z_{g'}))$($m=\eta(T-1)$,窗口 $T$)防止“轨迹外假阴性代价过低”。更本质的新颖性在于作者不假装一个代价走天下:拓扑主导任务直接部署 $d_\psi$,接触主导任务用同一时序检查点的 $\ell_2$ 规划,并用接触阶段诊断解释为什么。

方法步骤详情

步骤一(骨干预测):对 $o_t,a_t$ 编码预测 $\hat{z}_{t+1}$,用停止梯度真值算预测损失与 SIGReg。步骤二(时序校准):同轨 $i<j$ 对取 $\tau=j-i$ 作标签,用 Smooth L1 把 $d_\psi$ 拉向 $j-i$;跨轨同时间步负对施铰链 $\text{ReLU}(m-d_\psi)$($m=\eta(T-1)$)防假阴性代价过低。步骤三(rollout 一致性):用专家动作做 $H=5$ 步 teacher-forcing,最小化多步 rollout 损失,使训练 rollout 算子与规划时同一算子误差一致。步骤四(合成训练):ViT-tiny(约15M参数)、192维潜、AdamW 学习率 $5\times10^{-5}$、bf16、训练10 epoch。步骤五(规划):当前观测编码为 $z_t$,CEM/iCEM 采300候选做 $H$ 步 rollout,用 $d_\psi(\hat{z}_H,z_g)$ 或 $\|\hat{z}_H-z_g\|_2^2$ 排序,取精英更新分布,输出最优序列、执行首块并在新观测后重规划。

技术新颖性

技术新颖性有三点。其一,把规划代价显式拆为“代价类别(有向准度量形式)”与“代价校准(时序标签)”,并指出二者必须协同设计:Push-T 消融显示,保留同样时序标签但把有向 MRN 头换成对称欧氏投影头,所有规划设置都大幅下降(Blend 82.7%→56.7%、$\ell_2$ 85.3%→57.3%),证明“只有标签、没有有向形式”不够;去掉 rollout 一致性也独立让 Blend 跌到 62.0%。其二,完全无奖励、无价值估计器、无策略学习器,仅靠演示步骤序与跨轨负对就挖出有向代价,区别于 Value-Guided JEPA(依赖 IQL)、RC-aux(预算辅助但仍几何规划)。其三,首次正面回答“挖出的代价何时该部署”:拓扑任务直接用 $d_\psi$(Two-Room 100%、Reacher 97.0%),接触任务用同一检查点的 $\ell_2$(OGB-Cube 比 LeWM 高14.2点),并用接触阶段日志解释纯 $d_\psi$ 在接触任务上为何不如几何。

Temporal-Distance-JEPA 训练与潜 MPC 流水线
Figure 2: Temporal-Distance-JEPA 训练与潜 MPC 流水线
学到的 $d_\psi$ 与留出时序间隔的关系
Figure 6: 学到的 $d_\psi$ 与留出时序间隔的关系

实验结果

四环境锁定10种子(Table 2),本文每环境都达到或超过 LeWM/RC-aux:Two-Room 100.0%(97.4/98.6)、Reacher 97.0%(96.0/96.8)、Push-T 86.0%(83.6/81.4)、OGB-Cube 82.2%(68.0/81.6),OGB 相对 LeWM +14.2点最显著。Table 4 的 Push-T 消融(3种子)显示每组件都关键:去有向残差降幅最大(Blend 82.7→56.7%、$\ell_2$ 85.3→57.3%),去 rollout 次之(62.0%)。Table 11 代价矩阵(10种子)揭示两种机制:导航纯 $d_\psi$ 优于 $\ell_2$(Two-Room 100.0 vs 99.0、Reacher 97.0 vs 95.0),接触任务 $\ell_2$ 优于纯 $d_\psi$(Push-T 86.0 vs 69.0、OGB 82.2 vs 77.0)。Table 7 给出根因:纯 $d_\psi$ 失败几乎全在接触后(14.3/集),$\ell_2$ 接触前几乎不失手、接触后失败减半到6.0/集;Table 9 证明接触门控无法恢复 $\ell_2$ 的86.0%,接触任务需全程几何打分。

Temporal-Distance-JEPA 与规划感知 JEPA 变体的对比
Table 1: Temporal-Distance-JEPA 与规划感知 JEPA 变体的对比
锁定 10 独立种子的规划成功率
Table 2: 锁定 10 独立种子的规划成功率
文献语境下的规划成功率
Table 3: 文献语境下的规划成功率
Push-T 组件消融(3 种子,10 epoch 协议)
Table 4: Push-T 组件消融(3 种子,10 epoch 协议)
Push-T 在锁定 CEM 下失败发生在何处(3 种子均值,每集 50 episode)
Table 7: Push-T 在锁定 CEM 下失败发生在何处(3 种子均值,每集 50 episode)
Push-T 按起始智能体-方块距离的成功率(锁定 10 种子)
Table 8: Push-T 按起始智能体-方块距离的成功率(锁定 10 种子)
Reacher 求解器与 rollout 代价聚合(锁定验证清单)
Table 10: Reacher 求解器与 rollout 代价聚合(锁定验证清单)
匹配的规划代价矩阵(10 种子均值±标准差)
Table 11: 匹配的规划代价矩阵(10 种子均值±标准差)
锁定检查点/episode/求解器/预算下的规划代价对比
Figure 3: 锁定检查点/episode/求解器/预算下的规划代价对比
Two-Room 在纯 $d_\psi$(iCEM-30, 种子 3072)下随训练 epoch 的成功率
Figure 4: Two-Room 在纯 $d_\psi$(iCEM-30, 种子 3072)下随训练 epoch 的成功率
操作任务的离线 CEM 诊断
Figure 5: 操作任务的离线 CEM 诊断
查看结构化数据
任务指标本文基线提升
Two-Room 导航 规划成功率(%, 10种子) 100.0±0.0%(部署 $d_\psi$) LeWM 97.4±1.3%($\ell_2$) +2.6 个百分点,达满成功率
Reacher 到达 规划成功率(%, 10种子) 97.0±2.4%(部署 $d_\psi$) LeWM 96.0±1.9% +1.0 个百分点
Push-T 操作 规划成功率(%, 10种子) 86.0±4.2%(共享 $\ell_2$ 规划) LeWM 83.6±3.2% +2.4 个百分点(时序表示塑形)
OGBench-Cube 操作 规划成功率(%, 10种子) 82.2±2.9%(共享 $\ell_2$ 规划) LeWM 68.0±2.8% +14.2 个百分点,提升最显著
Push-T 时序排序 Spearman $\rho$ 与真实步序 $d_\psi$ 0.914±0.018(全部对) $\ell_2$ 0.785±0.016 排序更强但接触任务仍以几何规划更好

局限与改进

作者承认三点。其一,纯 $d_\psi$ 在接触任务(Push-T)上反而不如几何 $\ell_2$(69.0% vs 86.0%),即便它时序排序更好;作者归因为“接触后需精细位姿/角度控制,局部几何比进度排序更重要”,并用 Table 9 证明仅靠接近接触时切几何无法恢复 $\ell_2$ 水平。其二,时序标签把演示步骤数当“路径长度上界代理”,仅在最短路时才等于最短路径 $D^\star$,本质是流形上的排序校准而非真实度量。其三,方法严格限定在离线无奖励设定,无在线交互、无奖励模型、无策略学习器。我补充三点:评估仅四个相对低维环境,高维真实机器人视觉控制的泛化未验证;代价部署($d_\psi$ vs $\ell_2$)需按任务“人工选择”,论文给了接触阶段诊断但没给自动选择机制;跨轨负样本用“同时间步”启发式配对会引入假阴性(轨迹间实际可达却被当负例),作者承认但未量化其影响。

独立分析的弱点

弱点一,纯 $d_\psi$ 接触任务弱(Push-T 69.0% vs $\ell_2$ 86.0%),说明“只看进度排序”丢失接触阶段局部几何。改进:设计状态依赖的自适应混合权重 $\alpha(s)$ 而非固定 $\alpha=0.10$,由网络据“是否处于接触相”动态学出,接触阶段日志已提供天然标签。弱点二,代价部署(拓扑用 $d_\psi$、接触用 $\ell_2$)依赖人工先验,缺自动判定。改进:训练轻量相态分类器,或基于 rollout 终端潜状态到目标几何距离的方差自动切换。弱点三,时序标签把演示步骤数当代理,长轨迹非最短路引入噪声,跨轨负样本假阴性未量化。改进:用可达性软标签或对比采样替代同时间步配对。弱点四,评估仅四环境、相对低维,真实高维视觉控制迁移性未知。改进:在 D4RL、MetaWorld 或真实机械臂上演证。弱点五,训练仅10 epoch、消融3种子而主表10种子,统计功效有限且跨表数值不可直接对齐(如85.3% vs 86.0%)。

未来方向

作者显式提出的延伸有:把代价形式与部署方式的协同设计推广到更广的规划感知 JEPA 变体(暗示 RC-aux、SD-JEPA、Value-Guided JEPA 的思路可统一进“代价类别+校准”框架),以及用接触阶段诊断指导自适应代价选择。基于成果可延伸的方向包括:第一,学习状态依赖的混合权重 $\alpha(s)$,把本文“按任务人工选代价”升级为“按相态自动选代价”,用接触阶段日志作监督信号。第二,把跨轨负样本从启发式同时间步配对升级为可达性感知的对比采样,降低假阴性。第三,扩展到高维真实视觉控制与长时域任务(结合 FF-JEPA 等层次化规划器降低搜索难度)。第四,把时序挖掘与在线交互结合,探索演示-在线混合设定下 $d_\psi$ 的持续校准。第五,把“代价类别与校准分离”这一思想迁移到非 JEPA 的潜世界模型(如 DINO-WM、TD-MPC),验证其普适性。第六,研究 $d_\psi$ 绝对尺度与真实步数的对齐(附录 Fig. 6 显示尺度无需匹配,但若能校准到真实步数,或可用于预算感知规划)。

复现评估

复现友好度高。代码公开于 https://github.com/HKBU-KnowComp/Temporal-Distance-JEPA。附录C给完整协议:ViT-tiny(约15M参数、patch14、图像224)、192维潜、AdamW 学习率 $5\times10^{-5}$、bf16、10 epoch;有向头隐维512、$\phi_{sym},\phi_{asym}\in\mathbb{R}^{128}$;损失权重 $0.5/1.0/0.09$。规划默认:时域 $H=5$、50 episode、每轮 CEM/iCEM 300候选;iCEM noise_beta=2.0、平滑0.1、n_elite_keep=5。统计上主表用10独立种子、消融用3种子并标注,检查点与 episode 清单锁定,减少评估噪声。环境为 LeWM 公开四 benchmark,数据为离线演示日志无需采集;ViT-tiny 仅约15M参数、10 epoch,对单卡友好。主要风险:消融与主表种子数不同致数值不可直接对齐(85.3% vs 86.0%),且代价部署需按任务先验人工选择,自动化机制缺失。