WorldExam:从表象外观到内在反应性的世界模型基准 WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
分层诊断视频世界模型:外观、控制、空间一致性与内在反应性
前置知识
世界模型 (World Model)
世界模型指能从初始观测 $I$ 和控制指令 $C$ 预测未来视觉状态 $V$ 的生成模型,形式化为 $f: I \times C \to V$。本文聚焦的「视频世界模型」用可控视频生成扮演世界模拟器,用于游戏、机器人、具身智能。控制接口有三类:相机驱动(输入 SE(3) 相机轨迹)、动作驱动(输入离散键盘动作 {W, S, A, D, ...})、语言驱动(输入自然语言提示)。
理解三种接口范式是读懂「为什么不能直接对比、必须分轨评估」的前提,也是理解能力分裂现象的钥匙。
SE(3) 相机轨迹
SE(3) 是三维刚体变换群,含旋转 $R \in \text{SO}(3)$ 和平移 $t \in \mathbb{R}^3$,相机轨迹表示为逐帧位姿 $\{(R_t, t_t)\}_{t=1}^{T}$。本文用 VGGT-Ω 从生成视频恢复 SE(3) 位姿,再算尺度无关平移误差 $e_t = \min_{s \geq 0} \sqrt{\frac{1}{T}\sum_t \|s t_t - t_t^*\|_2}$ 和旋转误差 $e_r = \frac{180}{\pi} \frac{1}{T} \sum_t \arccos\frac{\text{tr}(R_t (R_t^*)^\top) - 1}{2}$。
Camera/Scene/Subject/Terrain 四任务都依赖 SE(3) 几何重建客观打分,是评估协议的几何基础。
视觉语言模型评判 (VLM Judge)
对需要语义因果判断、几何无法捕获的任务(Object/Social/Physical Interaction、Goal Completion),本文用 GPT-5.5 作为 VLM 评判器。它接收从生成视频均匀采样的 10 帧时序图和任务专属清单 $L = \{\ell_k\}_{k=1}^{K}$,对每项返回二值判决,得分 $S_{check}(V, L) = \frac{100}{K} \sum_{k=1}^{K} \mathbb{I}[\ell_k \text{ 在 } V \text{ 中满足}]$。被矛盾、缺失、歧义、画外或不可验证的证据都计为未满足。
VLM 评判是「世界反应性」核心层级的评估手段,其与人类的相关性(ρ=0.8614)直接决定结论可信度。
原子控制单元 (Atomic Control Unit)
原子控制单元是最小不可分控制意图,含前/后/左/右移动 {W, S, A, D}、相机倾斜 {↑, ↓, ←, →} 和停止 ∅。一个用例由 1–3 个单元有序组合而成,每单元分配时间占比 $\rho_i$($\sum_i \rho_i = 1$),如「W[0.5] → D[0.25] → A[0.25]」。同一份控制意图通过接口适配分别转译成相机轨迹、离散动作序列或自然语言。
原子单元是实现「统一基准、跨接口可比」的关键中介,也是切分「显式控制」与「未声明场景反应」的工具。
内在反应性 (Inherent Reactivity)
内在反应性指模型从场景状态推断世界应当如何反应、并生成合理后果的能力,这些后果在输入指令中并未显式描述。如主体爬楼梯时高度应随地形变化、接近障碍时出现接触/避让、进入他人社交距离时他人应合理响应。这种反应是「场景条件的后果」而非对输入的直接描绘,区分了世界模型与普通视频生成器。
这是本文最核心的原创概念,整个基准的目的就是把这种「未被指令指定的隐含反应」从视觉质量和显式控制中独立出来诊断。
研究动机
现有世界模型基准虽已从感知质量向前推进,覆盖了结构化布局控制(WorldScore)、统一动作接口(WorldMark、iWorld-Bench)、提示词指定的交互后果(OmniWorldBench、WBench、WorldOlympiad)、长时序动作生成(WorldRoamBench)等,但绝大多数评估的仍是「显式指令完成度」:测试者预先指定好期望的布局、相机轨迹、动作序列或交互后果,再检查模型是否实现。这种评估无法回答更本质的问题——模型能否推断出初始状态隐含、但指令中未描述的额外后果。比如让主体向前移动时,模型能否让其运动自适应楼梯/斜坡地形?能否在接近障碍时呈现接触或避让?能否让邻近智能体在被侵入社交空间时合理回应?这些场景条件反应恰是世界模型区别于普通视频生成器的核心能力,而现有基准在此留有大片空白。作者明确指出:高视觉质量和显式指令完成并不等价于内在反应性,混在同一总分里会被相互掩盖。
本文的目标是本文要构建一个分层诊断式基准 WorldExam,把「表象外观」与「内在反应性」剥离分别评估。具体目标有三:第一,设计覆盖视觉质量、控制遵循、空间一致性、世界反应性四个层级的诊断框架,让每层能力可独立、可定位打分;第二,构建跨接口统一评测方案,通过原子控制单元的接口适配,让同一份用例公平喂给相机/动作/语言三种范式共 20 个代表性模型;第三,规模上达 1,474 个用例、8 个任务、覆盖第一/第三人称视角与 26 类场景,且针对动态交互任务,在指令中只给触发控制或高层目标、把期望的场景反应刻意留空,从而真正区分「显式完成」与「隐含反应」,揭示当前模型在反应性上的真实短板。
与已有工作不同的是,本文的独特切入角度在于重新定义「该测什么」:现有基准测「我让你做 X,你做到了吗」,WorldExam 测「我只告诉你触发动作或高层目标,场景该如何反应你推断对了吗」。这体现在用例构造哲学——在四个反应性任务和 Goal Completion 中,模型面向的输入只含显式控制或目标,期望的场景条件反应被刻意留空,模型必须从初始场景推断。这让 WorldExam 首次把「未被指令指定的隐含反应」作为独立维度。此外作者还抓住两个被忽视的工程细节:一是同一份 SE(3) 平移在不同相机驱动模型里会诱发不同图像位移,必须做位移对齐校准;二是不同接口能完成的任务不同,必须用静态场景/动态交互两条轨道分别报告,而不是把不支持的任务当失败或在不同场景假设下平均。
核心方法
WorldExam 整体可类比为「给世界模型做分层体检」:先看脸色(视觉质量),再测四肢是否听话(控制遵循),接着测是否有记忆(空间一致性),最后测神经系统是否对刺激正确反应(世界反应性)。技术路线分四块。首先,把任何可控行为表示成一串有序原子控制单元(如「先前进 W,再右转 →」),作为跨接口中介。其次,接口适配把同一控制意图分别翻译成相机驱动的 SE(3) 轨迹、动作驱动的离散键盘序列、语言驱动的自然语言提示。然后,把评测组织成四个递进层级——视觉质量(任务无关指标)、控制遵循(Camera/Subject Control)、空间一致性(Scene Revisit)、世界反应性(四个反应任务 + Goal Completion)。最后用两条轨道分别报告避免接口不兼容的不公平惩罚:静态场景轨道(Camera Control、Scene Revisit,三范式通用)和动态交互轨道(Subject Control + 五个反应性任务,仅动作/语言驱动参与,Goal Completion 仅语言驱动)。模型形式化为 $f: I \times C \to V$。
核心创新是把「世界反应性」从视觉质量和显式控制中独立出来作为全新诊断层级,并用「指令只指定触发、不指定后果」的用例构造哲学来测它。这是与已有基准最本质的区别:OmniWorldBench、WBench、WorldOlympiad 虽也评估交互后果,但它们在提示词中显式指定了期望结果(如「对象被推动、变形或阻挡」),等于在答案里给了提示;而 WorldExam 反应性任务只给出导致反应的控制(如「主体向前」),把反应本身(楼梯上要抬升高度、柔性物体要变形、邻近智能体要让路)刻意留空,强制模型推断。这种「触发在输入、反应在评估」的切分,把「显式完成」和「隐含推断」两类被混在一起的能力彻底分开。Goal Completion 进一步推广到目标导向——只给高层目标(如「按高度排列三颗螺栓」),把执行步骤和逐帧运动都留给模型规划。另一关键创新是为相机驱动模型做图像空间位移对齐,解决「相同平移数值诱发不同位移」导致评测不公平的问题。
方法步骤详情
完整流程含用例构造、接口适配、生成、评估四阶段。(1)静态场景用例:Camera Control 和 Scene Revisit 从已有数据集挑第一人称场景配原子控制组合;Camera 用例由 1–3 个单元分配时间占比,Scene Revisit 用「出去 + 反向回来」往返轨迹(时间占比 0.4/0.6)。(2)动态交互用例走四步流水线:任务专属模式库采样意图 → 模式引导 LLM 作曲器展开结构化草稿 → T2I 生成 N 张候选初始图 → 人工筛选(实体可见、布局支持、留足运动空间)→ 图像条件精炼器对齐到选定初始图,固化清单。(3)接口适配:原子单元译成各范式原生格式,语言驱动用「then」连接动作短语。(4)评估:四任务用 VGGT-Ω 几何重建后 3D 评分;其余四任务用 GPT-5.5 对照清单打分;位移对齐先跑校准视频测水平位移 $d_{m,c}$,按 $k_{m,c} = W/(2 d_{m,c})$ 缩放输入平移。分数如 $S_{cam} = 100\sqrt{s_t s_r}$($s_t = \max(0, 1-e_t/0.5)$)。
技术新颖性
技术新颖性在四层。第一是评测哲学:通过「触发在输入、反应在评估」首次把显式完成与隐含推断分开,区别于 Omni-WorldBench/WBench/WorldOlympiad(提示词写明期望后果)。第二是跨接口统一抽象:原子控制单元 + 接口适配让一份用例同时评三种范式,首创「双轨道」机制(静态/动态)避免接口不兼容的不公平。第三是几何评估客观化:四任务全部用 VGGT-Ω 重建到 3D 再评分,组合尺度无关平移误差 $e_t$、旋转误差 $e_r$、往返成功率 $S_{succ}$、PSNR/LPIPS/SSIM,避免纯主观打分。第四是相机驱动位移对齐:作者发现同一 SE(3) 平移在不同模型诱发不同图像位移(直接影响 Camera Control 和 Scene Revisit 难度),用锚点掩膜 + SAM2 跟踪 + $k_{m,c} = W/(2 d_{m,c})$ 精确校准,让相机驱动模型横向对比第一次变得公平。
实验结果
对 20 个模型评测揭示清晰的「范式依赖能力分裂」。静态场景(Table 2):相机驱动里基于 3D 重建再投影的 NeoVerse 97.33、InSpatio-World 85.94 远超用学习嵌入编码位姿的 ReCamMaster 38.64、FantasyWorld 18.46,证明视觉质量与控制精度正交;Scene Revisit 上两者都拿到 1.000 往返成功率。动态交互(Table 4):动作驱动 Subject Control 最精确(LingBot-World 55.47,语言驱动 Veo 3.1 仅 37.28),但优势几乎不向反应性迁移——最好动作驱动 Terrain 仅 27.49、Object 33.75、Physical 33.43,而语言驱动全面领先:Veo 3.1 在 Object 75.96、Social 85.10、Goal 85.30 拔头筹,Vidu Q3 在 Terrain 64.39、Hailuo 在 Physical 63.84 领先。反直觉发现:Kling 2.5 通用视觉最高但 Goal 仅 48.25,证明视觉质量不等于目标执行。消融(Table 3):NeoVerse 平移倍数 0.10×→2.00× 时 Camera Control 98.25→95.32、Photometric Consistency 80.17→62.45,论证位移对齐必要。VLM 评判人类一致性 ρ=0.8614;换 DA3 后端排名稳定。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Camera Control(静态场景) | Camera Control Score ↑ | NeoVerse 97.33(相机驱动最强) | FantasyWorld 18.46(学习嵌入类最弱) | 3D 重建类相机驱动模型对学习嵌入类领先约 78 分 |
| Scene Revisit(静态场景) | Revisit Success ↑ | NeoVerse / InSpatio-World 1.000 | Hailuo 2.3 0.505(语言驱动最强) | 相机驱动 vs 语言驱动空间记忆差距接近翻倍 |
| Terrain Interaction(动态交互) | Terrain Interaction Score ↑ | Vidu Q3 64.39、Hailuo 2.3 61.57 | WorldPlay 27.49(动作驱动最强) | 语言驱动反应性比动作驱动领先约 37 分 |
| Social Interaction(动态交互) | Social Interaction Score ↑ | Veo 3.1 85.10、Vidu Q3 81.91 | LingBot-World 60.37(动作驱动最强) | 语言驱动比动作驱动领先约 25 分 |
| Goal Completion(仅语言驱动) | Goal Completion Score ↑ | HappyHorse 1.0 / Veo 3.1 约 85.3 | Kling 2.5 48.25(视觉质量最高但目标执行最弱) | 视觉质量与目标执行呈负相关,证明二者解耦 |
| VLM 评判人类一致性 | Spearman ρ / PLCC | ρ=0.8614 / PLCC=0.8583(800 实例) | Social Interaction 单任务 ρ=0.7019 最低 | 证明 GPT-5.5 清单评判与人类判断强相关 |
局限与改进
作者承认的局限有三:第一,动态交互评测要求可靠的第三人称主体控制,Goal Completion 仅限语言驱动,覆盖面受限于当前接口能力;第二,指标只评估端到端可观察行为,不能判断推理发生在哪里、也无法证明视频生成器内部真学到了因果表示——对闭源商用系统(Veo 3.1、HappyHorse),其专有提示词增强可能本身就参与了场景接地和执行规划,得分难归因;第三,范围仍限于现有接口能表达的行为。我的额外观察:清单评测虽与人类 ρ=0.8614,但 Social Interaction 的 ρ 仅 0.7019 最低,说明该任务主观性最大,结论需谨慎;VGGT-Ω/DA3 重建在快速运动或遮挡下可能不稳,引入「重建误差」被算到模型头上;位移对齐只校准相机驱动模型,未对语言驱动做类似「位移匹配」,可能让语言驱动在 Camera Control 的低分被低估了难度;测试用例初始图由 T2I 合成,可能与真实分布有偏差,影响外部效度。
独立分析的弱点
第一,反应性任务「未声明后果」判定高度依赖人工清单质量,清单遗漏判据会系统性漏检(如 Physical Reaction 清单没列「摆动周期是否合理」,模型可能生成「会动但周期错」的视频得分)。改进:引入物理仿真对照自动生成清单或多模型对抗采样补全判据。第二,几何评估对重建后端敏感——换 DA3 后范式内排名稳定但 Camera Control 绝对分数变化最大(语言驱动相对变化 5.36%),重建误差混入模型分。改进:多后端集成或合成场景用 GT 深度。第三,语言驱动 Camera Control 低分可能部分源于「位移匹配不公」——只有相机驱动做了 $k_{m,c}$ 校准。改进:为语言驱动设计等价位移对齐探针。第四,只评估最终视频不评估中间表征,无法回答「模型是否学到内部因果」。改进:增加干预式探针(扰动初始图障碍物看反应是否随之改变)。第五,Goal Completion 仅限语言驱动、动态交互仅 2 个动作驱动模型合格,样本偏小。改进:随新模型发布扩样重测。
未来方向
作者明确提出:扩展到更广泛接口、更长时序交互、更多干预式设置,以提供对「持久世界理解」更强的测试。基于成果可延伸的方向:第一,把「触发在输入、反应在评估」哲学推广到多智能体协作和长程规划(如让模型在 1000+ 帧里持续维持物理一致与社会反应);第二,构建「干预版」WorldExam——主动扰动初始场景关键物体/约束,对比反应是否合理改变,把「行为正确」升级为「因果理解正确」;第三,把世界反应性作训练信号反向蒸馏进生成模型,用 WorldExam 分数做 RL 或 DPO 奖励,弥补「视觉质量高、反应性差」鸿沟;第四,对闭源模型开发「白盒探针」替代直接归因,分离「提示词增强」与「生成器内在能力」贡献;第五,扩展到第一人称具身任务的真实机器人回放验证,把视频世界模型与可执行物理体打通。其中干预式设置和反应性训练信号最可能催生下一代真正具有「世界理解」的模型。
复现评估
作者承诺公开发布基准数据和评测工具包(项目页 WorldExam.github.io),是复现最大利好。数据侧:1,474 用例 + 模式库 + 初始图提示 + 清单都开源,但动态交互初始图依赖 T2I 生成器 + 人工筛选,复现 N 张候选图用不同生成器会有分布漂移。算法侧:接口适配、几何重建(VGGT-Ω 公开)、VLM 评判(GPT-5.5 需 API 付费)、SAM2 跟踪、变点检测都明确给出,但 VLM 评判依赖 GPT-5.5 闭源,换 VLM 替代会引入评判方差。算力侧:要跑 20 模型 × 1,474 用例,6 个相机 + 7 个动作驱动模型本地权重(分辨率 560×336 到 1280×704,帧 49–177),7 个语言驱动走商用 API,费用不低,单卡可跑本地子集。难度评估:协议严谨、代码/数据开源承诺到位,对有 API 预算和几张消费级 GPU 的团队,复现核心评测(自选几模型 + 全部静态场景)可行;完整复现需中等规模投入,约 1–2 人月。
论文图表