去中心化JEPA驱动的标签高效集群状态预测 One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA
每个机器人仅凭局部观测与256字节消息预测同一未来集群状态。
前置知识
联合嵌入预测架构 (JEPA, Joint-Embedding Predictive Architecture)
由 LeCun 提出的一类自监督学习范式,不重建原始观测的全部细节,而是在一个学到的隐空间目标里做预测。其训练目标形如 $\mathcal{L} = \|\hat{Z} - \mathrm{sg}(Z)\|_2^2$,其中 $Z$ 由冻结的目标编码器产生,$\mathrm{sg}(\cdot)$ 为停梯度操作。预测的是潜在语义而非像素,从而避免表征被无关细节淹没。从图像、视频到群体级 JEPA 都已验证。
CS-JEPA 的全部目标函数 $\mathcal{L}_{CS}=\frac{1}{M_Z}\sum\|\hat{Z}_{b,i}^{t+h}-\mathrm{sg}(Z_b^{t+h})\|_2^2$ 都是 JEPA 式的潜在目标预测;不理解 JEPA 的『预测语义而非重建像素』思想,就无法理解为什么它比 Future-Recon 的原始场重建更标签高效。
集群机器人与去中心化控制 (Swarm Robotics / Decentralized Control)
由大量低成本、可互换机器人组成的系统,每个成员只能观测局部邻域、并通过带宽受限的消息与邻居通信,却要表现出一致的全局行为(如 flocking 编队、formation 队形、coverage 覆盖)。去中心化意味着不存在中央节点,信息只能通过逐跳的循环更新传播。置换不变编码器(Deep Sets、GNN)和图策略是常见建模范式。
本文把『从不同局部视角,所有机器人独立预测同一未来集群状态』定义为问题(式2),部署约束是 16 帧局部历史、每有向边 256 字节、一轮同步消息。理解这套『分布式、带宽受限、参数规模与 N 无关』的设定,是读懂其 1105-D 不变目标和 N∈{36,72,108} 泛化实验的前提。
标签高效与岭探针评估 (Label Efficiency & Ridge Probe)
标签高效指模型在极少量带全局标注的样本上就能学好下游任务。本文用岭回归探针(ridge probe, $\alpha=10^{-3}$)拟合冻结表征,标注预算仅 6/12/24 个全局标注的 episode。主指标是跨标签预算的对数-预算-跨度归一化梯形 AUC:$\text{AUC}=0.25E_6+0.50E_{12}+0.25E_{24}$,$E_k$ 为预算 $k$ 下的误差。
论文的全部核心论点是『CS-JEPA 更标签高效』。主表 Table III 报告的就是 Reconstruction-minus-JEPA 的误差 AUC 差值 $\Delta$,正值代表 CS-JEPA 胜。理解 AUC 聚合方式、6/12/24 预算与 episode 级嵌套抽样,才能判断这些 5/5 seed 一致性的结论有多强。
置换不变集编码器与集分词器 (Permutation-Invariant Set Encoder / Set Tokenizer)
处理可变大小集合 $\{x_1,\dots,x_N\}$ 且输出与元素顺序无关的网络。经典做法是 Deep Sets 的均值/求和聚合,或基于注意力的不变函数。本文的集分词器把任意大小的未来集群先嵌入成 $e_j^{t+h}\in\mathbb{R}^{64}$,再用高斯权重 $w_{jk}=\exp(-\|p_j-a_k\|^2/2\sigma^2)$($\sigma=0.22$)围绕 4×4 空间锚点 $a_k$ 聚合,加上全局均值嵌入 token,得到固定 17 个 65-D token = 1105-D 的不变目标 $Z^{t+h}$。
『大小不变』是本文迁移到 N=36/72/108(最大 6× 训练规模)的关键机制:无论集群多大,目标始终是 17 token 的固定布局,模型参数与每机器人消息宽度也不随 N 增长。这正是 CS-JEPA 能在 size-OOD 上仍领先 Future-Recon 的结构原因。
目标隔离与预注册对照 (Target-Isolation & Prospectively Registered Control)
一种严谨的对照实验设计:冻结除『主自监督目标』以外的所有变量(共享冻结的 stage-0 编码器、相同的循环消息骨干、相同的 receiver anchor、相同的部署参数量),只让 CS-JEPA(预测冻结的潜在集目标)与 Future-Recon(重建归一化的原始未来场)对比。协议在生成新数据前预先注册并冻结,聚合结果『只开箱一次』。Future-Recon 反而多 9,607 个训练期参数。
论文主表 Table III 的可信度建立在这套设计上——它把『潜在目标预测 vs 原始场重建』这一单一变量隔离出来,并故意给基线更多容量,使 CS-JEPA 的胜出是保守的。读者若不理解 target-isolation,会误以为这只是又一次 JEPA vs 自动编码器的端到端比较。
研究动机
机器人集群可以表现出一致的全局状态——flocking、分裂、旋转或失去连通性——即使没有任何成员能直接观测到这一状态。一个有用的去中心化预测器必须解决一个反常的推断问题:从各不相同的局部视角出发,所有机器人都要对同一未来集群状态给出准确估计。但现有的拼图各有缺口:置换不变编码器与图策略主要解决『可互换智能体上的策略扩展』[1-3],Global State Prediction (GSP/GSP-N) 训练去中心化智能体预测未来全局状态变化以服务策略 [4,5],多智能体世界模型关注通信、想象动力学或涌现通信 [6-9],而 JEPA 主要在图像/视频/群体生物学/车联网感知上发力 [10,11,15-17]。关键空白在于:JEPA 目标能否把『未来集群』当作一个集合来表示、能否通过固定局部消息接口在每个机器人处被预测、能否迁移到新拓扑与新规模、以及能否减少下游所需的全局标注 episode 数。此外,原始场重建(重建每个机器人的位置/速度/任务向量)会强迫表征编码大量对决策无关的细节,且每条有向边只有 256 字节带宽,在 16 帧历史下信息只能逐跳传播,使得这一标签效率问题更加尖锐。
本文的目标是本文的目标是提出 Collective-State JEPA (CS-JEPA),并给出一个精确的部署契约:每个机器人只用 16 帧局部历史与每有向边 256 字节(64 个 float32)的循环消息,在一次同步消息轮内,独立输出一个 1105 维的『未来集群状态』预测;部署时没有全局池化、没有目标编码器、没有 episode 时钟、没有记录的未来动作。预训练阶段不使用任何下游集群标签,冻结的表征仅用 6/12/24 个全局标注的 episode 训练一个岭探针,去解码极化度、连通性、任务得分等十类物理集群变量。作者要证明:在与接收者锚点、部署容量完全对齐、且基线还多出 9,607 个训练期参数的前提下,预测一个共同的未来潜在目标比重建原始未来场在预测误差与机器人间一致性两个指标上都更标签高效,并在 ID、ring、mutual-kNN 拓扑漂移以及 2–6 倍更大的未见规模上同时成立;此外还要给出规划相关价值估计与闭环决策一致性的额外证据。
与已有工作不同的是,本文的独特切入角度在于把『共享的未来状态』本身上升为可测量、可评估的端点:与其像 V2X-JEPA 那样把多智能体联合嵌入用于融合感知检测、或像群体级 JEPA 那样在集中式上下文上建模生物群体,CS-JEPA 把同一个大小不变的潜在集群目标 $Z^{t+h}$ 作为所有接收者的共同预测对象,但在每个机器人处产生独立的、误差各异的估计 $\hat{Z}_i^{t+h}=P_\theta(I_i^t)$。这与逐智能体轨迹预测、集中式 critic 状态、或对『当下』的共识估计都有本质区别——目标是共同的,而信息与预测误差是接收者特异的。更重要的是,损失里 inter-robot agreement 项的权重恒为零,作者要证明『一致性』能从一个共同未来目标中自发涌现,而无需显式共识惩罚;同时通过预注册、episode 级嵌套抽样与逐组件对齐,把『潜在目标预测』这一变量从其它一切差异中干净地隔离出来。
核心方法
整体思路是:与其重建每个未来机器人的位置/速度/任务向量,不如预测一个紧凑、大小不变的潜在『未来 token 场』来编码集群状态;因为所有机器人共享参数与目标语义,它们应能从不同局部证据收敛到同一目标。技术路线分五环:(1) 冻结的局部编码器把机器人 $i$ 的自观测(归一化位置、速度、2-D 任务向量、激活比特 $b_i$)映射到 $e_i^t\in\mathbb{R}^{64}$;(2) 循环消息传输——每步只广播上一时刻的循环状态,接收者 $i$ 对邻居记忆取均值 $\bar{h}_{i,t-1}=\frac{1}{|N_t(i)|}\sum_{j\in N_t(i)}h_{j,t-1}$ 后送入 GRU 得到 $h_i^t=\text{GRU}([e_i^t,\bar{h}_{i,t-1}],h_{i,t-1})$,每有向边 64 个 float32=256 字节,16 帧下测量到的预热为 15 个消息步;(3) 冻结的目标编码器+集分词器把未来集群编成 1 个全局 token(活跃集均值嵌入+存在质量)加 4×4 空间场,共 17 个 65-D token=1105-D 的 $Z^{t+h}$;(4) 角色条件预测器递归地先预测 $t+2$ 再预测 $t+4$,且对第一次预测停梯度;(5) 仅用 receiver-local 的 $h=4$ 输出训练岭探针解码十类物理集群量。部署期丢弃目标编码器、分词器、重建解码器与锚点头,只保留冻结的局部编码器与循环预测器(123,713 个表征参数)。
核心创新是三者的罕见组合:(a) 大小不变的 JEPA 目标——无论 $N$ 多大,集分词器都把任意活跃集群映射到相同的 17 token、1105-D 布局,参数与每机器人消息宽度都不随 $N$ 增长;(b) receiver-local 预测——每个机器人对自己那份局部信息 $I_i^t$ 独立算出对同一共同目标的估计 $\hat{Z}_i^{t+4}$,没有任何 robot-prediction 平均作为主表征;(c) 损失中 inter-robot agreement 权重恒为零。三者叠加产生了一个反直觉结果:一致性从一个共同未来目标中自发涌现,因为各机器人共享目标语义却各自过滤不同的局部证据。与已有方法的本质区别还在于训练-部署的信息不对称:预训练时在线分支只用 (1) 式的局部信息逐接收者展开,而目标分支一次性从未来活跃集算出 $Z^{t+h}$ 并把同一停梯度目标喂给每个活跃接收者——特权未来状态定义了『该预测什么』却不成为推理输入,receiver-future 锚点防止丢失接收者自身动力学,而这些特权路径在部署期全部移除。
方法步骤详情
完整流程分六步。Step 1 局部编码:冻结编码器把 $o_i^t$(归一化位置、速度、2-D 任务向量、激活比特)映射为 $e_i^t\in\mathbb{R}^{64}$,邻居原始特征不可用,只收其上一时刻 64 维循环记忆。Step 2 循环传输:广播上一时刻循环状态,$\bar{h}_{i,t-1}=\frac{1}{|N_t(i)|}\sum_{j\in N_t(i)}h_{j,t-1}$(空邻域置零),$h_i^t=\text{GRU}([e_i^t,\bar{h}_{i,t-1}],h_{i,t-1})$;同步一轮,每有向边 64×float32=256 B。Step 3 目标构造(仅预训练):冻结目标编码器嵌入每个未来机器人,分词器在锚点 $a_k$ 用高斯权重 $w_{jk}=\exp(-\|p_j-a_k\|^2/2\sigma^2)$、$\sigma=0.22$ 聚合出全局 token(均值嵌入+存在质量)与 4×4 空间场,共 17 个 65-D token=1105-D 的 $Z^{t+h}$,$h\in\{2,4\}$。Step 4 预测:角色条件预测器递归预报 $t+2$ 再 $t+4$,对第一次预测停梯度。Step 5 损失:$\mathcal{L}_{CS}=\frac{1}{M_Z}\sum_{b,i,h}\|\hat{Z}_{b,i}^{t+h}-\mathrm{sg}(Z_b^{t+h})\|_2^2$;receiver 锚点 $\mathcal{L}_{anchor}=\frac{1}{M_e}\sum\|\hat{e}_{b,i}^{t+h}-\mathrm{sg}(e_{b,i}^{t+h})\|_2^2/64$(训练期 MLP 预测接收者冻结的未来嵌入);总损失 $\mathcal{L}_{CS\text{-}JEPA}=\mathcal{L}_{CS}+\lambda\mathcal{L}_{anchor}$,$\lambda=2$(开发后冻结,无后续权重/架构搜索)。Step 6 部署:丢弃目标编码器、分词器、重建解码器、锚点头,冻结编码器+预测器,用 6/12/24 标注 episode 拟合岭探针($\alpha=10^{-3}$)从 receiver-local $h=4$ 预测解码十类集群量。训练 50 epoch、batch 256、Adam lr $5\times10^{-4}$、余弦衰减 $10^{-7}\to10^{-6}$、梯度裁剪 1.0、隐藏 128/潜在 64。
技术新颖性
技术新颖性有四点。第一,首次给出『每机器人预测一个共享未来状态』的精确端点与部署契约:一轮消息、每有向边 256 B、16 帧历史、运行时无未来或全局张量——把一个原本模糊的『群体预测』概念固化成可审计的接口。第二,大小不变的 JEPA 目标(固定 17-token 布局)与 receiver-local 循环预测器组合,并在预训练期用 receiver-future 锚点增强、部署期移除——这种『特权脚手架只在训练期存在』的工程纪律在此前多智能体 JEPA(群体级 JEPA、V2X-JEPA、TrajJEPA)中都没有,三者都不研究这个去中心化共同目标端点。第三,损失里 agreement 权重为零却仍观测到一致性提升,这是把『共识』从显式约束降为涌现属性的关键设计选择。第四,方法论上极具纪律性:预注册、episode 级嵌套抽样、stage-0 编码器与初始化共享、部署参数量对齐(Future-Recon 反而多 9,607 个训练期参数的原始解码器)、目标分支只喂同一停梯度目标——把『潜在目标预测 vs 原始场重建』这一单一变量干净隔离,使 CS-JEPA 的胜出是保守结论而非端到端比较。
实验结果
三个独立 cohort 给出连贯证据。(1) 目标隔离主表 Table III(5 outer seed):四 split 全通过预注册联合判据,accuracy 与 agreement 两指标在 5/5 seed 上都为正。ID Accuracy $\Delta$=0.004636 [0.003741,0.005530]/Agreement 0.001342;Ring OOD 最大 0.057156 [0.048238,0.066073]/0.098817 [0.067873,0.133743];Mutual-kNN 0.053417/0.072980;Size OOD 0.042538/0.079100。关键在 agreement 在物理误差同时下降的每个 split/预算上都改善且其损失权重为零,同时排除『接收者坍缩到同一无信息输出』的平凡解释;$\Delta$=Reconstruction−JEPA,正值代表 CS-JEPA 胜。(2) 动作条件价值 Table V(8 seed,sealed):整体价值 MSE 从 0.02847 降到 0.01553(降幅 45.5%),配对差 −0.01294 [−0.01936,−0.00877],8/8 seed,精确双侧 $p=0.0078125$;context 内 Pearson 从 0.35042 升到 0.47949(+0.12907 [0.10449,0.15447]),8/8;N=8/16/未见 N=32 全部一致;但未降 selected-plan regret($\Delta$=+0.00066, $p=0.734$)。(3) 闭环 Table VI(16 seed):相对 nominal,复合效用 $u=\text{task}-0.5(1-\text{connectivity})-2\,\text{collision}$ 提升 +0.01053 [0.00623,0.01456](13/16, $p=0.000702$),task +0.00831,connectivity +0.00444;相对 Future-Recon,all-first-α 一致性 +0.14472 [0.10282,0.18618](15/16, $p=0.000061$),pairwise 不一致 −0.05888,但复合效用无差异($\Delta$=−0.00018, $p=0.953$)。独立 16-seed 鲁棒性 cohort 复现三个主要正效应。Table IV 的 GSP 式直接监督诊断显示 CS-JEPA 在四 split accuracy AUC 都更低而直接监督 agreement 更低,把标签高效 accuracy 收益与显式监督 agreement 行为分离。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 目标隔离标签高效(5 outer seed,ID/Topology-OOD/Size-OOD) | Reconstruction-minus-JEPA 的 log-预算-跨度归一化梯形 AUC 差 $\Delta$(accuracy & agreement,正值代表 CS-JEPA 胜) | ID 0.004636/0.001342;Ring 0.057156/0.098817;Mutual-kNN 0.053417/0.072980;Size 0.042538/0.079100 | Future-Recon(原始未来场重建,共享冻结 stage-0 编码器、receiver anchor、部署参数量,多 9,607 训练期参数) | 全部 4 split 通过预注册联合判据,accuracy 与 agreement 两指标在 5/5 seed 上均为正效应 |
| 动作条件四步反事实价值估计(8 seed,sealed) | 价值 MSE(越低越好)+ context 内候选得分 Pearson 相关 | MSE 0.01553;Pearson 0.47949;降幅 45.5%;N=8/16/32 全部一致 | Future-Recon MSE 0.02847;Pearson 0.35042 | 整体 MSE 降 45.5%,配对差 −0.01294 [−0.01936,−0.00877],8/8 seed,$p=0.0078125$;Pearson +0.12907 [0.10449,0.15447] |
| 完全去中心化闭环(16 seed,通信半径失效斜坡 N=16/未见 N=32) | 复合效用 vs nominal;首系数一致性 vs Future-Recon | 效用 vs nominal +0.01053(13/16, $p=0.000702$);all-first-α 一致性 vs Future-Recon +0.14472(15/16, $p=0.000061$) | nominal flocking 控制、Future-Recon、plan-only head | 相对 nominal 在效用/task/connectivity 三项都提升;相对 Future-Recon 显著提升决策一致性,但复合效用无显著差异($\Delta$=−0.00018, $p=0.953$) |
局限与改进
作者承认的局限集中在五点:研究仅限仿真器、假设共享归一化坐标系与无噪观测,硬件迁移、机载延迟与安全性均开放;预训练依赖特权未来集群状态;五 seed 的目标隔离研究只覆盖所评估的图族与集群规模;动作条件训练用『每分支对全集群施加同一计划』的穷举反事实监督,但去中心化执行可组合不同接收者选定的计划,因此闭环证据支持的是『相对 nominal 的效用提升』和『对齐正则头下更强的一致性』,而非相对 Future-Recon 或专用控制器的效用优越性;selected-plan regret 未改善。从结果本身还能观察到额外限制:复合效用与 Future-Recon 在闭环上统计无差异,意味着价值估计的 45.5% MSE 降幅并未转化为更好的闭环决策;标签预算仅 6–24 个 episode,任务仅 flocking/formation/coverage 三类,N 上限 108,世界是 2-D 归一化仿真;receiver anchor 权重 $\lambda=2$ 与 $\sigma=0.22$ 是开发后冻结的,但 stage-0 编码器仍是一个外部依赖(作者自训的 mean-target CS-JEPA 编码器,非外部预训练模型)。
独立分析的弱点
独立分析有六处弱点及对应改进方向。弱点一:仿真器内、无噪观测、共享坐标系,真实集群有传感器噪声、定位漂移、丢包;mean 聚合对缺失/迟到消息较脆——改进方向是用注意力或门控聚合替代 mean,并在更真实的通信半径失效下测试(论文已部分做 N=16/32 ramp)。弱点二:预训练依赖特权全局未来状态和单独训练的 stage-0 mean-target 编码器,存在自举依赖——改进方向是端到端从无标签数据训练,或用自蒸馏去掉目标编码器。弱点三:动作条件分支训练对全集群施加同一计划,而执行期各接收者选不同计划,存在 train-exec 错配——改进方向是训练期就用 per-receiver 计划条件化,或加入显式协调层。弱点四:价值估计提升未降低 regret、闭环效用与 Future-Recon 无差异——说明预测信息没有充分耦合到规划目标——改进方向是把价值读出直接接入规划损失而非纯岭回归。弱点五:仅 2-D 归一化世界、3 任务、N≤108,对视觉/深度等富观测的泛化未测——改进方向是接入 V2X-JEPA 式感知或 3-D 无人机集群。弱点六:agreement 在零损失权重下涌现只是经验现象,缺乏理论解释——改进方向是从信息几何或表征对齐角度给出为何共同未来目标能诱导跨机一致性的分析。
未来方向
作者明确提出硬件迁移、机载延迟与安全性三项。基于本文成果可延伸的方向包括:(1) 富观测——用视觉/深度替代位置速度,融合 V2X-JEPA 式协同感知;(2) 更大规模与 3-D 集群(无人机),检验 17-token 目标布局的容量上限;(3) 去掉特权预训练目标,用无标签数据 + 自蒸馏教师;(4) per-receiver 计划条件化以闭合 train-exec 差距并恢复 regret 改善;(5) 从理论上解释『零权重 agreement 为何涌现』,例如从共同目标对局部证据的组织作用出发;(6) 与完整 GSP/GSP-N 策略系统端到端集成以追求回报而非仅解码一致;(7) 扩展到十类之外更多集群量(如信息熵、覆盖均匀度);(8) 系统研究通信带宽折中(如 sub-256 B 区间);(9) 在拜占庭/故障邻居下的鲁棒一致性,把 receiver-local 协议升级为可容错的去中心化预测。
复现评估
本文在可复现性上异常严谨。协议在生成新 cohort 前预注册并冻结,聚合结果『只开箱一次』;提交材料附带完整哈希、清单与运行时记录;部署审计在不调用 target-global/target-adjacency/target-active/collective-label 张量的前提下走在线预测路径;配对方法共享逐位相同的 shared-state 初始化;episode 级嵌套数据切分(Table II)给出明确数量——train/label pool 120、model-selection 30、ID 30、每个 topology-OOD 30、size-OOD 27;label-subset 选择不查看标签值。超参全部写明:50 epoch、batch 256、Adam lr $5\times10^{-4}$、余弦衰减 $10^{-7}\to10^{-6}$、梯度裁剪 1.0、隐藏 128/潜在 64、ridge $\alpha=10^{-3}$、$\sigma=0.22$、$\lambda=2$。参数量透明:CS-JEPA 在线可训练 139,137、部署 123,713(含探针 134,773);Future-Recon 148,744/134,773。统计严谨:外层 seed bootstrap CI、精确配对 sign-flip 检验、100,000 次重采样。短板:正文未明确声明代码/数据开源,stage-0 编码器为作者自训而非外部模型,仿真器与环境需另发布,算力未说明。难度评估:高——需要自建集群仿真器 + 严格目标隔离协议 + 密封 cohort 纪律;若代码与仿真器一并开源则降至中等。
论文图表
给出目标隔离 follow-up 的数据切分。Train/label pool 用 small-world 图 N∈{10,18}、120 episode;model-selection 30;ID test 30;两个 topology-OOD(ring、mutual-kNN)各 30;size-OOD 用 small-world N∈{36,72,108}、27 episode,最大为训练规模 6×。
它把『预注册』具体化——表明数据划分在生成新 cohort 前就固定,是 Table III 可信度的前提,也明确了 size-OOD 的规模跨度(10→108)。
核心结果表。ID Accuracy 0.004636、Agreement 0.001342;Ring OOD 0.057156/0.098817(最大);Mutual-kNN 0.053417/0.072980;Size OOD 0.042538/0.079100,全部 CI 下界为正。所有四个 split 通过预注册联合判据,accuracy 与 agreement 在 5/5 seed 上都为正。
这是论文的中心论点证据:在特权路径、锚点、初始化、部署参数量全部对齐(且基线多 9,607 训练期参数)的条件下,预测共同未来潜在目标比重建原始未来场在预测误差与机器人间一致性上都更标签高效,且在拓扑漂移与规模漂移下成立。
对照早期一个直接监督的 GSP 式诊断:supervised-minus-CS-JEPA 的误差 AUC。CS-JEPA 在四 split 上 accuracy AUC 都更低(Δ 正,0.074–0.092),而直接监督的解码不一致更低(agreement Δ 为负)。
它把『标签高效的 accuracy 收益』与『显式监督带来的 agreement 行为』解耦——证明 CS-JEPA 的 agreement 提升不是来自显式共识监督,而是共同未来目标本身,是理解 Table III 结论的必要对照。
动作条件四步反事实价值表。整体 CS-JEPA MSE 0.01553 vs Future-Recon 0.02847(降幅 45.5%),Pearson +0.12907;N=8 降幅 53.07%、N=16 19.77%、未见 N=32 50.62%;每行每指标在 8/8 seed 上都偏好 CS-JEPA,$p=0.0078125$。
证明 receiver-local CS-JEPA 表征不仅服务十变量解码,还携带规划相关信息——尤其在未见 N=32 上仍成立,支持『规模迁移』声明。但它也揭示 regret 未改善,为后续闭环 Table VI 的谨慎结论埋下伏笔。
16-seed 闭环结果。复合效用 vs nominal +0.01053(13/16, $p=0.000702$)、task score +0.00831、connectivity +0.00444;all-first-α 一致性 vs Future-Recon +0.14472(15/16, $p=0.000061$)、pairwise first-α 不一致 −0.05888;但复合效用 vs Future-Recon 无差异($\Delta$=−0.00018, $p=0.953$)。plan-only head 在每个评估 episode 都选 nominal 控制。
把结论从『标签高效 + 价值估计』推进到『真实闭环决策』:CS-JEPA 相对 nominal 提升效用、相对 Future-Recon 显著改善一致性,但并未在效用上超越 Future-Recon——明确划定了论文声明的边界,避免过度解读。
四 split 上 accuracy 与 agreement 的绝对标签效率曲线(6/12/24 预算)。每个 CS-JEPA 曲线在所有预算与 split 上都低于匹配的重建曲线(越低越好),棒为 95% 外层 seed bootstrap CI。对 seed 级数值做数值积分可精确复现 Table III。
它把 AUC 效应展开成完整曲线,证明优势分布在整个 6–24 标签区间而非由某个挑出的预算驱动,强化了『标签高效』声明的稳健性。