FactorJEPA:把整体未来拆解为布局-智能体-交互通道以应对南半球稠密混乱城市世界 FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
提出DENSEWORLD基准与FactorJEPA,将未来潜表示因子分解为布局、智能体、交互三通道
前置知识
JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)
JEPA 是 LeCun 提出的一类自监督表征学习框架,核心是『在潜空间而非像素空间预测未来』。它由在线编码器 $f_\theta$、动量目标编码器 $\bar{f}_{\bar\theta}$ 和预测器 $g_\phi$ 组成:编码器把上下文帧压成潜向量 $h_t = f_\theta(M_c \odot x)$,预测器在潜空间预测被遮挡的目标帧表征 $\hat{Y}_{t+\Delta}$,目标由动量编码器用 stop-gradient 给出 $Y^\star_{t+\Delta} = sg[\Pi_{M_t}[\bar{f}_{\bar\theta}(x)]]$,损失是 $L_{JEPA} = \| g_\phi(h_t, M_t) - sg[\bar{f}_{\bar\theta}(M_t \odot x)] \|_2^2$。这种设计避免了像素重建浪费容量去学习镜头抖动、光照噪声等无关细节。
FactorJEPA 的全部创新都建立在『替换 JEPA 的单体预测器』这一手术之上,不懂 JEPA 的目标构造和 stop-gradient 机制,就看不懂为什么要拆解、拆解后又怎么合回去。
V-JEPA 2.1(Video JEPA)
V-JEPA 是把 JEPA 思想从图像扩展到视频的工作,2.1 版本提供了 ViT-G(约 2B 参数,$d=1664$,48 个 transformer 块)和 ViT-g(约 1B 参数,$d=1408$,40 块)两个规模。输入是 $384\times384$、采样 16 帧的视频片段,patch 大小 $16\times16$、tubelet 大小 2,前 12 帧作上下文、后 4 帧作未来预测目标。本文所有对比方法都以这两个官方 checkpoint 为唯一初始化源。
FactorJEPA 是对 V-JEPA 2.1 的『预测器手术』而非全新模型,且全部实验都在 1B 和 2B 两种规模上做跨尺度复制。理解这个 backbone 才能理解『冻结的编码器』为什么会塌陷。
LoRA / DoRA / Auto-RGN(参数高效微调家族)
LoRA 把权重更新约束为低秩分解 $W = W_0 + (\alpha/r)BA$,$B\in\mathbb{R}^{d_{out}\times r}, A\in\mathbb{R}^{r\times d_{in}}$,$r\ll\min(d_{in},d_{out})$;DoRA 在此基础上把权重向量拆成幅度 $m$ 和方向 $\frac{W_0+\Delta W}{\|W_0+\Delta W\|}$ 分别学习;Auto-RGN 用相对梯度范数 $s_\ell = \frac{\|\nabla_{\theta_\ell} L_{JEPA}\|_2}{\|\theta_\ell\|_2 + \epsilon}$ 给每个 transformer 块打分,只更新 Top-K 块。三者都是与 FactorJEPA 参数预算对齐的对照组。
论文要证明 FactorJEPA 的增益来自『结构化因子分解』而非单纯增加可训练参数,必须有一组参数匹配的 PEFT 基线做对照,否则结论站不住脚。
DINOv2(自监督视觉特征提取器)
DINOv2 是 Meta 提出的自监督视觉 Transformer(本文用 dinov2_vitg14_reg,patch 14,描述子维度 1536),能在无标注情况下输出高质量的区域掩码、包围盒、描述子和置信度。本文用它做『冻结教师』:$P_n = \mathcal{D}_{pre}(F_{DINOv2}(e^x_n))$,再经时序关联 $\mathcal{A}(P_n)$ 形成 tracklet,最终用确定性结构映射 $\Psi_{struct}$ 生成布局 $T_L$、智能体 $T_A$、可见性 $T_V$、交互 $T_I$ 四类伪标签。
FactorJEPA 完全不用人工标注,监督信号全部来自 DINOv2 伪标签。理解这条教师管线,才能理解为什么评测必须严格隔离训练目标与评估目标,避免『和教师一致』被误读成『世界建模更强』。
Stop-gradient 与动量编码器(EMA target encoder)
为防止 JEPA 训练塌陷到平凡解,目标侧使用 stop-gradient $sg[\cdot]$ 阻断梯度回流,目标编码器 $\bar f_{\bar\theta}$ 通过指数滑动平均跟随在线编码器 $\bar\theta \leftarrow \mu\bar\theta + (1-\mu)\theta$(本文 $\mu=0.99925$)。本文里 DINOv2 教师、缓存目标、可靠性权重 $\omega$ 全部是 stop-gradient 量,梯度只流过 FactorJEPA 分支、因子头、合成字典和顶部 K 层编码器。
FactorJEPA 训练时哪些参数可更新、哪些冻结,是它的『手术』协议的核心。不懂 stop-gradient 就分不清『因子分解』是后验拼出来的还是端到端学出来的。
研究动机
现有世界模型和 JEPA 评测几乎全部聚焦在低密度、车道结构化的驾驶场景(BDD100K、nuScenes),而占全球城市人口绝大多数的『南半球稠密混乱城市』被严重低估。这类场景(DENSEWORLD)有四个相互耦合的破坏性特征:第一,软空间边界——路面、可行驶区、行人区是协商出来的而非画线划出来的;第二,极端智能体异质性——行人、汽车、两轮车、手推车、动物、三轮车在同一块路面上共存;第三,持续遮挡——密度和杂乱导致严重的部分可观测性,预测必须依赖记忆和关系推理;第四,运动由弱车道纪律下的快速社交协商支配而非规则遵守。论文用五个可量化轴证明这不是『看着不同』而是『定量不同的运行区间』:在场景匹配后,DENSEWORLD 的智能体计数密度是 BDD100K/nuScenes 的 $2.30\times$(6.20 vs 2.70 agents/frame),占用率是 $2.28\times$(8.10% vs 3.55%),在市场、商业、立交桥场景差距最大(市场 $2.70\times$)。更致命的是,把十个冻结编码器(V-JEPA 2.1/1/2.0、I-JEPA、LeJEPA、DINOv2 等)放到 DENSEWORLD 运动探针上,Action top-1 全部塌陷在 37.5%–44.4% 的窄带里(多数类基线 19.5%),且没有任何单一模型能赢下每一列——冻结复用彻底不够。
本文的目标是本文有两个并列目标。第一个是建设性目标:交付首个面向稠密、异构、部分可观测城市环境的大规模世界建模基准 DENSEWORLD 1.0——约 1000 小时、22 个印度 Tier-1/Tier-2 城市、drive-through/walk-through/aerial 三种采集模式,覆盖市场、住宅、商业、交通枢纽、遗产、海岸、立交等十余种场景,包含时段、天气、人群密度、交通构成、路面质量、侵占程度等变化,并经隐私过滤(SCRFD 人脸检测 + 自训练 YOLO 车牌检测 + ByteTrack 关联 + 高斯模糊)。第二个是方法目标:在保留 V-JEPA 2.1 编码器、动量目标、掩码策略的前提下,仅替换单体预测器,提出 FactorJEPA,把世界结构变成『一等公民』的预测原语——把未来潜表征分解为布局、可见性门控的智能体、稀疏交互三个通道,用可见性门保留部分可观测智能体,用分离子空间阻止跨因子捷径。目标是同时改进未来潜精度(Future-frame L1)、干预敏感预测(Causal L1)、低证据鲁棒性(Mask-ratio slope),并暴露可复现的运动-信息权衡(Motion cosine)。
与已有工作不同的是,以往工作的独特缺口在于:把未来编码成『一团单体潜向量』,让预测器自由组织内部信息。论文指出,这种『如何组织』的自由度在 DENSEWORLD 里是致命的,因为布局、智能体密度、可见性、交互压力高度相关,高容量预测器会走捷径——用人群纹理代理交互、用可见外观代理物体持久性、用道路几何代理运动——而不恢复真正支配场景演化的结构。本文的独特切入角度有三层:第一,首次把南半球稠密城市从『地理扩展』升级为可量化的高密度高遮挡高交互运行区间;第二,首次把 JEPA 预测器从单体换成显式因子分解,并坦率承认因子分解 $CA^\top = (CR)(AR^{-\top})^\top$ 的非唯一性,因此提出『语义块分离』而非『坐标级可辨识性』;第三,建立严格的评测隔离——DINOv2 伪标签只用于训练,headline 评测用与城市不相交的独立审计切分 $\mathcal{D}_{audit}$ 的人工标注,杜绝『和教师一致』冒充『世界建模更强』。
核心方法
直觉上,FactorJEPA 认为:要预测一个拥挤的印度路口下一秒会发生什么,大脑会同时维护三件事——路怎么走(布局)、有谁在动(智能体)、谁和谁在博弈(交互)。把这三件事塞进同一个潜向量,预测器就会在它们之间打结;把它们显式拆开,再用可见性门处理『看不到的行人其实还在』,预测结构反而更清晰。技术路线上,FactorJEPA 完全保留 V-JEPA 2.1 的在线编码器 $h_n = f_\theta(M_c \odot x_n)$、动量目标编码器 $Y^\star = sg[\bar f_{\bar\theta}(\tilde x^t_n)]$、上下文/目标掩码策略和 JEPA 目标,只把单体预测器 $g_\phi$ 换成因子化预测器 $\Theta_{fact} = \{\Theta_L, \Theta_A, \Theta_I, \Theta_V, \Theta_W, A\}$。对每个目标 token $p$,先构造条件查询 $q_{n,p} = Q(h_n, \pi_p, M_t)$,再并行预测三个坐标块:布局 $c_{n,L} = g_L(q_n) \in \mathbb{R}^{r_L}$、可见性门控智能体 $c_{n,A} = \frac{\sum_i v^{(i)}_n s^{(i)}_n}{\epsilon + \sum_i v^{(i)}_n}$、稀疏交互 $c_{n,I} = \frac{1}{M_n}\sum_{(i,j)\in E_n} w^{(ij)}_n \bar e^{(ij)}_n$。三者各自有独立的合成字典 $A_L, A_A, A_I \in \mathbb{R}^{d\times r_k}$,最终合成 $\hat Y = C_L A_L^\top + C_A A_A^\top + C_I A_I^\top$。整套训练只用 JEPA 目标加上四个正则项,不引入任何像素级监督。
核心创新点是用『可微的因子分解』替代『单体预测』,并坦率处理因子分解的根本非唯一性。已有方法(LoRA/DoRA/Auto-RGN)只是改变参数更新的方式,预测器结构仍是单体;FactorJEPA-RAW 保留因子化架构但不喂 DINOv2 伪标签,能隔离『架构』与『监督』的贡献。和已有方法的本质区别有四点:第一,可见性门 $v^{(i)}_n = \sigma(g_V(q_n, o^{(i)}_n)) \in (0,1)$ 是软门而非硬剔除,既衰减不确定或被遮挡的智能体,又不会在它们重新出现时断续——这是为 DENSEWORLD 的持续遮挡量身设计的;第二,交互分支用归一化对状态 $\bar e^{(ij)}_n = \frac{e^{(ij)}_n}{\epsilon + \|e^{(ij)}_n\|_2}$ 和软强度 $w^{(ij)}_n = \sigma(g_W(q_n, o^{(i)}_n, o^{(j)}_n))$,固定归一化 $M_n = \max\{1, |E_n|\}$ 防止平凡缩放;第三,块结构矩阵分解 $C = [C_L\ C_A\ C_I]$、$A = [A_L\ A_A\ A_I]$ 配合因子专属头 $\hat T_k = C_k P_k^\top$ 锚定语义;第四,跨通道泄漏损失 $L_{sep} = L_{cov} + \beta_{nlin} L_{nlin}$ 同时惩罚线性协方差和非线性 RBF 核依赖,但明确声明『语义块分离』不等于统计独立或因果解耦。这种『强对角可预测 + 弱离块泄漏』的操作化定义避免了过度宣称。
方法步骤详情
完整步骤如下(对应 Algorithm 1 的 46 步)。初始化:从同一个预训练 V-JEPA checkpoint 初始化在线编码器和动量编码器,把单体预测器替换为 $g_\phi = \{g_L, g_A, g_I, g_V, g_W, A_L, A_A, A_I, P_L, P_A, P_I\}$,拷贝 $\bar\theta \leftarrow \theta$,冻结 DINOv2 教师管线、动量编码器和顶部 K 层以下的全部在线编码器块。每个优化步:(1) 采样源分组的 minibatch $\{e^x_n\}_{n=1}^N$;(2) 检索缓存的教师包 $\mathcal{Z}_n = (P_n, \mathcal{A}(P_n), E_n, (T_{n,k}, \omega_{n,k}))$;(3) 计算有效目标指示 $r_{n,k} = \mathbf{1}[\omega_{n,k} \ge \tau_k]$,低于阈值的样本被剔除而非转为负标签;(4) 采样上下文/目标掩码 $(M_c, M_t) \sim \mathcal{M}$;(5) 在线编码器算 $h_n = f_\theta(\tilde e^c_n)$,动量编码器算 $Y^\star_n = sg[\bar f_{\bar\theta}(\tilde e^t_n)]$;(6) 对每个目标 token 算查询 $q_{n,p} = Q(h_n, \pi_p, M_t)$;(7) 并行算布局 $c_{n,L}$、每个智能体的 $s^{(i)}_{n,p} = g_A(q_{n,p}, o^{(i)}_n)$ 和可见性门 $v^{(i)}_{n,p}$,聚合得 $c_{n,A,p}$,每个候选对的 $\bar e^{(ij)}_{n,p}$ 和 $w^{(ij)}_{n,p}$,聚合得 $c_{n,I,p}$;(8) 各自因子头预测 $\hat T_{n,L}, \hat T_{n,A}, \hat T_{n,I}$;(9) 堆叠 $C_L, C_A, C_I$ 合成 $\hat Y = C_L A_L^\top + C_A A_A^\top + C_I A_I^\top$;(10) 算 $L_{JEPA} = \frac{1}{Nm}\|\hat Y - Y^\star\|_F^2$、可靠性归一化的 $L_{factor}$、加权 BCE 的 $L_V$、$L_{sparse}$、$L_{sep} = L_{cov} + \beta_{nlin} L_{nlin}$;(11) 组装 $L = L_{JEPA} + \lambda_{sep}L_{sep} + \lambda_{sparse}L_{sparse} + \lambda_v L_V + \lambda_{sup}L_{factor}$,只在 $\Theta_{fact} \cup \Theta_{top\text{-}K}$ 上反传,梯度范数裁到 $\gamma = 1.0$,EMA 更新动量编码器 $\bar\theta \leftarrow \mu\bar\theta + (1-\mu)\theta$。训练分四级课程:head-only 暖身 → 渐进解冻顶部 K 块,预测重点依次循环布局→智能体→交互。
技术新颖性
技术新颖性体现在五处。第一,预测器结构层面首次把 JEPA 未来潜显式拆为布局/智能体/交互,并用合成字典重组——这是『架构性』分解而非事后分析。第二,可见性门专门为部分可观测设计:传统方法要么硬剔除被遮挡 agent,要么让其污染整体表征,FactorJEPA 用 $v^{(i)}_n \in (0,1)$ 软衰减,可靠性权重 $\omega^{(i)}_{n,V}$ 进一步压低无效证据,避免 discontinuous 跳变。第三,因子分离损失 $L_{sep}$ 同时压制线性协方差 $\|\Gamma_{kk'}\|_F^2$ 和非线性 RBF 核依赖 $\frac{\text{tr}(\bar K_k \bar K_{k'})}{\|\bar K_k\|_F\|\bar K_{k'}\|_F + \epsilon}$,是少数明确处理跨通道捷径的工作。第四,提出 leakage 诊断 $\text{Leak}(k\to k') = \frac{S_{k\to k'} - S_{0\to k'}}{S_{k'\to k'} - S_{0\to k'} + \epsilon}$,要求强对角可预测 + 低离块泄漏才能声称分离有效。第五,评测隔离极其严格:训练目标来自 DINOv2,headline 评测来自与城市不相交的独立审计切分,干预区域、可见性状态、交互对都独立标注,且 Future-frame L1 用冻结 V-JEPA 目标编码器、Motion cosine 用独立冻结的运动估计器、RGB Agent F1 用外部检测器——确保不和伪标签生成器偷渡一致。
实验结果
核心发现可分四块。第一,冻结编码器塌陷:Table 1 显示十个冻结编码器在 DENSEWORLD 运动探针($n_{test}=1825$,±95% BCa CI)上 Action top-1 全在 37.5%–44.4% 窄带,最强的 V-JEPA 2.1 2B 仅 44.4%,I-JEPA ViT-G/16 最低 37.5%;适应后的编码器能到 50.3%–53.2%,证明冻结复用不够。Figure 1 的同问题两编码器对比给出最直观证据:同一个 probe head 下,FactorJEPA 在运动速度题上 69.8% vs 冻结 V-JEPA 2.1 60.9%。第二,在匹配分层 10k 协议下,FactorJEPA 在 2B/1B 两个规模上相对最强竞争者在 Future-frame L1 上分获 $6.3\times$/$4.8\times$ CI 宽度的统计分离,Causal L1 上 $2.3\times$/$2.7\times$,Mask-ratio slope 在 1B 上 $1.9\times$(2B 上 $0.9\times$ 落在 CI 内);Motion cosine 反而落后 $-14.5\times$/$-9.2\times$,暴露有限数据下的预测-运动权衡——因子化目标优先服务结构化预测所需的运动信息,而非最容易线性读出的运动。第三,全量 115k 训练在 1B 上彻底扭转局面:四个主要诊断全部强分离,Mask-ratio slope 达 $43.3\times$、Future-frame L1 达 $33.2\times$、Motion cosine 达 $20.0\times$、Causal L1 达 $13.9\times$(注意这些是配对置信区间单位,不是性能倍数)。第四,跨尺度复制稳定:四个主要诊断的 Spearman $\rho$ 在 $0.895$–$0.978$ 之间(Causal L1 $\rho=0.979$、Motion cosine $\rho=0.952$、Future-frame L1 $\rho=0.938$、Mask-ratio slope $\rho=0.895$),十五个诊断中十二个排序基本一致,证明 1B 可作为 2B 全量训练前的低成本筛选代理。损失曲线(Figure 11)从 $\approx 0.41$ 降到 $\approx 0.38$,每个阶段切换时损失短暂上升再下降,交互阶段停在略高的地板,符合其预测目标更难的预期。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Future-frame L1(未来潜预测精度,↓) | 预测与目标未来嵌入的归一化 L1 距离 | FactorJEPA 3sDI 在 2B 上 0.496,在 1B 上 0.611(分层 10k) | 冻结 V-JEPA 2.1 在 2B 上 0.557、1B 上 0.655;Auto-RGN 在 2B 上 0.526 | 在 2B 上以 $6.3\times$ CI 宽度统计分离于最强竞争者,在 1B 全量 115k 上达 $33.2\times$ 分离 |
| Causal / Intervention L1(干预一致性,↓) | 在独立标注的干预区域施加控制编辑 $I_a$ 后预测与目标潜变化的归一化 L1 | FactorJEPA 3sDI·diH 在 1B 上 0.614,3sDI·int 在 2B 上 0.611 | 冻结 V-JEPA 2.1 在 1B 上 0.655,2B 上 0.648 | 2B 上 $2.3\times$ CI 分离、1B 上 $2.7\times$;跨尺度 Spearman $\rho = 0.979$,是最稳定的诊断 |
| Mask-ratio slope(部分可观测鲁棒性,↓) | 随上下文掩码比例增加,预测误差的 OLS 斜率 | FactorJEPA 3sDI·diH 在 1B 上 0.053 | 冻结 V-JEPA 2.1 在 1B 上 0.065;Auto-RGN 0.062 | 1B 分层 10k 上 $1.9\times$ CI 分离,1B 全量 115k 上飙升至 $43.3\times$——这是全量训练收益最大的指标 |
| Motion cosine(线性可读运动信息,↑) | 线性解码出的运动描述子与目标运动描述子的余弦相似度 | 分层 10k 下落后于通用微调($-14.5\times$/$-9.2\times$),全量 115k 在 1B 上反转为 $+20.0\times$ 分离 | 通用 fine-tuning / continual SSL 在小数据下占优 | 揭示『预测-运动权衡』是数据依赖而非因子分解的内禀限制;115k 全量训练反转了该权衡 |
| Action top-1(运动语义探针准确率,↑) | 固定容量动作探针的 top-1 准确率 | 适应后的 FactorJEPA 系列达 50.3%–53.2% | 十个冻结编码器塌陷在 37.5%–44.4%(V-JEPA 2.1 2B 最高 44.4%),多数类基线 19.5% | 证明冻结复用不够,FactorJEPA 把动作语义从窄带推到 53% 区间,但仍非 FactorJEPA 的强项 |
局限与改进
作者承认的局限有五条且都很坦诚。第一,交互落地是首要开放挑战:当前交互目标只组合了 DINOv2 区域、时序关联、相对运动、可见性、邻近性、可靠性,捕获的是『可分割的视觉对象之间的关系』的一个可处理子集,并不能表示群体级运动、多智能体协商、时间持续交互事件;近处智能体可能独立运动,远处或被遮挡的智能体反而影响未来。第二,因子语义只在通道层面锚定:DINOv2 流水线会漏检小目标、断轨、误边界,且某些区分本质是上下文相关的(停车 vs 摊位 vs 人群),所以论文只声称『语义块分离』而非『坐标级可辨识性』。第三,评测针对预测结构而非完整因果理解:Causal L1 只测干预一致性而非因果识别;Motion cosine 只测线性可读运动而非全部运动信息;实验强调短时预测,长时 rollout、闭环规划、主动感知、在线适应均未测。第四,地理广度不等于普适覆盖:22 个印度城市只是南半球稠密城市的一次大规模实例化,南亚、非洲、拉美、东南亚、中东的差异未覆盖。第五,全量训练不完整:115k 全量只跑了 1B,2B 在分层 10k 下评测,全量 2B 是否进一步增强因子通道仍开放;Cosmos 解码器会有模糊、确定性平均、漏小目标、单未来塌缩。我自己额外观察:DINOv2 教师是『冻结的通用模型』,对 auto-rickshaw、动物车辆的检测置信度可能偏低,这种偏差会直接进入可靠性权重 $\omega_{n,k}$,进而影响哪些样本被纳入因子损失。
独立分析的弱点
独立分析下我看到五个弱点。第一,因子分解的非唯一性使『语义分离』高度依赖 DINOv2 教师质量:若教师在 DENSEWORLD 上系统性低置信(小贩、牲畜、三轮车),$\omega$ 会把大量真交互样本剔除,因子监督实质上偏向『教师看得见的交互』。改进方向是多教师一致性投票或教师无关的因子发现(如对比学习自举)。第二,交互只用稀疏成对耦合 $E_n$,对『群体涌现行为』(一群人同步过街、一队两轮车鱼贯穿行)建模能力弱——成对图无法表达 $k$-元关系。改进方向是引入超图或注意力形式的群组 token。第三,可见性门 $v^{(i)}_n$ 是当前帧的软标量,缺乏对『被遮挡了多久还会回来』的显式时间记忆,长时间消失的 agent 会被永久衰减。改进方向是引入 track-level 的持久性记忆或 object-centric slot attention。第四,评测高度依赖冻结 V-JEPA 目标编码器定义『正确未来』,但这个编码器本身在 DENSEWORLD 上表现差(44.4%),用差的编码器做 ground truth 会有天花板效应——改进方向是同时报告多目标编码器下的结果或学习场景专用目标空间。第五,预测-运动权衡在 10k 下显著(Motion cosine 落后 $-14.5\times$),说明小数据下因子化会牺牲最易线性读出的运动,这对计算预算有限的研究者不友好——改进方向是数据高效的因子蒸馏或运动一致性辅助损失。复现成本方面,全量 1B 训练在 8×H100 上至少 70 GPU 小时(不含 42 GPU 小时的教师缓存),2B 全量未跑(约 2× 成本),对中小团队偏高。此外论文未给出 RGB 解码定量结果的实际数值(Table 10 全是 [result] 占位符),这部分对最终用户感知最直接的指标目前不可验证。
未来方向
作者明确点名的三个方向:(i) 更丰富的交互落地与事件级监督,把『稀疏成对耦合』升级为带时间持续性的高阶关系表征;(ii) 高阶和时间持续的关系建模,覆盖群体涌现、让行、犹豫、共享路权、非正式信号;(iii) 更广地理、更长时程、全量规模的验证,包括跨区域留出评测、闭环规划、动作条件预测、主动感知、在线适应。基于本成果可延伸的方向我认为还有五个:第一,把因子分解推广到音频-视频多模态 JEPA,印度街道的声音(喇叭、叫卖、引擎)是强交互线索;第二,把可见性门升级为主动感知策略——模型主动决定看哪里以降低不确定性,闭环连接到机器人导航;第三,把因子分解与 LLM/world model 的『实体级因果』结合,让 $c_{n,I}$ 直接喂给规划器做反事实推理;第四,把 DENSEWORLD 扩展到其他南半球城市(拉美、非洲、东南亚),测试因子分解的跨文化迁移;第五,用 FactorJEPA 的因子通道做数据高效的强化学习世界模型,因为布局/智能体/交互的显式分离天然适合 model-based RL 的 state abstraction。
复现评估
复现评估整体较好但非完全可复现。开源方面,作者承诺公开发布 DENSEWORLD-115k 数据集和 surgery 训练的 FactorJEPA checkpoints。代码与协议方面,Appendix C 给出了极详尽的配置:Algorithm 1 共 46 步覆盖完整训练流程;Table 6 给出『canonical 配置』,明确 backbone 标识符(vjepa2_1_vit_gigantic_384 / vjepa2_1_vit_giant_384)、因子维 $p_L=p_A=p_I=256$、因子秩 $r_L=64, r_A=96, r_I=64$、可训练编码器深度(2B 的 top-2、1B 的 top-1)、优化器 AdamW($\beta_1=0.9, \beta_2=0.95$)、学习率(预测器 $1.0\times10^{-4}$、编码器 $1.0\times10^{-5}$)、权重衰减 0.04、cosine 退火、20000 步、batch 128、BF16、梯度裁剪 1.0、EMA $\mu=0.99925$、三个随机种子 $\{17,29,43\}$、loss 系数 $\lambda_{sup}=1.0, \lambda_V=0.25, \lambda_{sep}=0.05, \lambda_{sparse}=0.01, \beta_{nlin}=0.10$。算力门槛较高:8×NVIDIA H100 SXM 80GB,1B 全量训练上限 70 GPU 小时(不含 42 GPU 小时教师缓存和 38 GiB 推理分配),2B 全量未执行(约 2× 成本)。难度方面,DINOv2 教师、结构算子、tracklet、候选图、目标、可靠性权重都是冻结的,理论上可严格复刻;但 Table 9/10 的解码器组件(Cosmos checkpoint、transport stack 深度/宽度)多处标注 [from log],即依赖运行日志,公开版本若不附完整 log 会留缺口。最关键的不可复现点是 RGB 定量结果(Table 10 PSNR/SSIM/LPIPS/Flow EPE/Agent F1)全是 [result] 占位符,论文发布时这些数字尚未填入,使得『解码后的视觉质量』这一最直观的指标目前无法核验。
论文图表
展示十类场景的代表帧:market、residential、commercial、promenade、transit、highway、heritage、junction、flyover、beach,体现 DENSEWORLD 在空间、社会、基础设施上的异质性。
让读者直观看到『南半球稠密城市』不是抽象概念,而是一组可视化的、与 BDD100K 截然不同的场景,是 motivation 的视觉证据。
在场景类型匹配后,比较 DENSEWORLD 与 BDD100K、nuScenes 的智能体计数密度和占用率。DENSEWORLD 在市场、商业、立交桥场景差距最大。
把『看着不同』升级为『定量不同的运行区间』,是 DENSEWORLD 作为基准的合法性核心证据。