← 返回 2026-08-04

WorldExam:从表象外观到内在反应性的世界模型基准 WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang 📅 2026-08-03 👍 34 2026-08-09 18:30
世界反应性 可控视频生成 基准测试 物理仿真 视频世界模型

分层诊断视频世界模型:外观、控制、空间一致性与内在反应性

前置知识

世界模型 (World Model)

世界模型指能从初始观测 $I$ 和控制指令 $C$ 预测未来视觉状态 $V$ 的生成模型,形式化为 $f: I \times C \to V$。本文聚焦的「视频世界模型」用可控视频生成扮演世界模拟器,用于游戏、机器人、具身智能。控制接口有三类:相机驱动(输入 SE(3) 相机轨迹)、动作驱动(输入离散键盘动作 {W, S, A, D, ...})、语言驱动(输入自然语言提示)。

理解三种接口范式是读懂「为什么不能直接对比、必须分轨评估」的前提,也是理解能力分裂现象的钥匙。

SE(3) 相机轨迹

SE(3) 是三维刚体变换群,含旋转 $R \in \text{SO}(3)$ 和平移 $t \in \mathbb{R}^3$,相机轨迹表示为逐帧位姿 $\{(R_t, t_t)\}_{t=1}^{T}$。本文用 VGGT-Ω 从生成视频恢复 SE(3) 位姿,再算尺度无关平移误差 $e_t = \min_{s \geq 0} \sqrt{\frac{1}{T}\sum_t \|s t_t - t_t^*\|_2}$ 和旋转误差 $e_r = \frac{180}{\pi} \frac{1}{T} \sum_t \arccos\frac{\text{tr}(R_t (R_t^*)^\top) - 1}{2}$。

Camera/Scene/Subject/Terrain 四任务都依赖 SE(3) 几何重建客观打分,是评估协议的几何基础。

视觉语言模型评判 (VLM Judge)

对需要语义因果判断、几何无法捕获的任务(Object/Social/Physical Interaction、Goal Completion),本文用 GPT-5.5 作为 VLM 评判器。它接收从生成视频均匀采样的 10 帧时序图和任务专属清单 $L = \{\ell_k\}_{k=1}^{K}$,对每项返回二值判决,得分 $S_{check}(V, L) = \frac{100}{K} \sum_{k=1}^{K} \mathbb{I}[\ell_k \text{ 在 } V \text{ 中满足}]$。被矛盾、缺失、歧义、画外或不可验证的证据都计为未满足。

VLM 评判是「世界反应性」核心层级的评估手段,其与人类的相关性(ρ=0.8614)直接决定结论可信度。

原子控制单元 (Atomic Control Unit)

原子控制单元是最小不可分控制意图,含前/后/左/右移动 {W, S, A, D}、相机倾斜 {↑, ↓, ←, →} 和停止 ∅。一个用例由 1–3 个单元有序组合而成,每单元分配时间占比 $\rho_i$($\sum_i \rho_i = 1$),如「W[0.5] → D[0.25] → A[0.25]」。同一份控制意图通过接口适配分别转译成相机轨迹、离散动作序列或自然语言。

原子单元是实现「统一基准、跨接口可比」的关键中介,也是切分「显式控制」与「未声明场景反应」的工具。

内在反应性 (Inherent Reactivity)

内在反应性指模型从场景状态推断世界应当如何反应、并生成合理后果的能力,这些后果在输入指令中并未显式描述。如主体爬楼梯时高度应随地形变化、接近障碍时出现接触/避让、进入他人社交距离时他人应合理响应。这种反应是「场景条件的后果」而非对输入的直接描绘,区分了世界模型与普通视频生成器。

这是本文最核心的原创概念,整个基准的目的就是把这种「未被指令指定的隐含反应」从视觉质量和显式控制中独立出来诊断。

研究动机

现有世界模型基准虽已从感知质量向前推进,覆盖了结构化布局控制(WorldScore)、统一动作接口(WorldMark、iWorld-Bench)、提示词指定的交互后果(OmniWorldBench、WBench、WorldOlympiad)、长时序动作生成(WorldRoamBench)等,但绝大多数评估的仍是「显式指令完成度」:测试者预先指定好期望的布局、相机轨迹、动作序列或交互后果,再检查模型是否实现。这种评估无法回答更本质的问题——模型能否推断出初始状态隐含、但指令中未描述的额外后果。比如让主体向前移动时,模型能否让其运动自适应楼梯/斜坡地形?能否在接近障碍时呈现接触或避让?能否让邻近智能体在被侵入社交空间时合理回应?这些场景条件反应恰是世界模型区别于普通视频生成器的核心能力,而现有基准在此留有大片空白。作者明确指出:高视觉质量和显式指令完成并不等价于内在反应性,混在同一总分里会被相互掩盖。

本文的目标是本文要构建一个分层诊断式基准 WorldExam,把「表象外观」与「内在反应性」剥离分别评估。具体目标有三:第一,设计覆盖视觉质量、控制遵循、空间一致性、世界反应性四个层级的诊断框架,让每层能力可独立、可定位打分;第二,构建跨接口统一评测方案,通过原子控制单元的接口适配,让同一份用例公平喂给相机/动作/语言三种范式共 20 个代表性模型;第三,规模上达 1,474 个用例、8 个任务、覆盖第一/第三人称视角与 26 类场景,且针对动态交互任务,在指令中只给触发控制或高层目标、把期望的场景反应刻意留空,从而真正区分「显式完成」与「隐含反应」,揭示当前模型在反应性上的真实短板。

与已有工作不同的是,本文的独特切入角度在于重新定义「该测什么」:现有基准测「我让你做 X,你做到了吗」,WorldExam 测「我只告诉你触发动作或高层目标,场景该如何反应你推断对了吗」。这体现在用例构造哲学——在四个反应性任务和 Goal Completion 中,模型面向的输入只含显式控制或目标,期望的场景条件反应被刻意留空,模型必须从初始场景推断。这让 WorldExam 首次把「未被指令指定的隐含反应」作为独立维度。此外作者还抓住两个被忽视的工程细节:一是同一份 SE(3) 平移在不同相机驱动模型里会诱发不同图像位移,必须做位移对齐校准;二是不同接口能完成的任务不同,必须用静态场景/动态交互两条轨道分别报告,而不是把不支持的任务当失败或在不同场景假设下平均。

核心方法

WorldExam 整体可类比为「给世界模型做分层体检」:先看脸色(视觉质量),再测四肢是否听话(控制遵循),接着测是否有记忆(空间一致性),最后测神经系统是否对刺激正确反应(世界反应性)。技术路线分四块。首先,把任何可控行为表示成一串有序原子控制单元(如「先前进 W,再右转 →」),作为跨接口中介。其次,接口适配把同一控制意图分别翻译成相机驱动的 SE(3) 轨迹、动作驱动的离散键盘序列、语言驱动的自然语言提示。然后,把评测组织成四个递进层级——视觉质量(任务无关指标)、控制遵循(Camera/Subject Control)、空间一致性(Scene Revisit)、世界反应性(四个反应任务 + Goal Completion)。最后用两条轨道分别报告避免接口不兼容的不公平惩罚:静态场景轨道(Camera Control、Scene Revisit,三范式通用)和动态交互轨道(Subject Control + 五个反应性任务,仅动作/语言驱动参与,Goal Completion 仅语言驱动)。模型形式化为 $f: I \times C \to V$。

核心创新是把「世界反应性」从视觉质量和显式控制中独立出来作为全新诊断层级,并用「指令只指定触发、不指定后果」的用例构造哲学来测它。这是与已有基准最本质的区别:OmniWorldBench、WBench、WorldOlympiad 虽也评估交互后果,但它们在提示词中显式指定了期望结果(如「对象被推动、变形或阻挡」),等于在答案里给了提示;而 WorldExam 反应性任务只给出导致反应的控制(如「主体向前」),把反应本身(楼梯上要抬升高度、柔性物体要变形、邻近智能体要让路)刻意留空,强制模型推断。这种「触发在输入、反应在评估」的切分,把「显式完成」和「隐含推断」两类被混在一起的能力彻底分开。Goal Completion 进一步推广到目标导向——只给高层目标(如「按高度排列三颗螺栓」),把执行步骤和逐帧运动都留给模型规划。另一关键创新是为相机驱动模型做图像空间位移对齐,解决「相同平移数值诱发不同位移」导致评测不公平的问题。

方法步骤详情

完整流程含用例构造、接口适配、生成、评估四阶段。(1)静态场景用例:Camera Control 和 Scene Revisit 从已有数据集挑第一人称场景配原子控制组合;Camera 用例由 1–3 个单元分配时间占比,Scene Revisit 用「出去 + 反向回来」往返轨迹(时间占比 0.4/0.6)。(2)动态交互用例走四步流水线:任务专属模式库采样意图 → 模式引导 LLM 作曲器展开结构化草稿 → T2I 生成 N 张候选初始图 → 人工筛选(实体可见、布局支持、留足运动空间)→ 图像条件精炼器对齐到选定初始图,固化清单。(3)接口适配:原子单元译成各范式原生格式,语言驱动用「then」连接动作短语。(4)评估:四任务用 VGGT-Ω 几何重建后 3D 评分;其余四任务用 GPT-5.5 对照清单打分;位移对齐先跑校准视频测水平位移 $d_{m,c}$,按 $k_{m,c} = W/(2 d_{m,c})$ 缩放输入平移。分数如 $S_{cam} = 100\sqrt{s_t s_r}$($s_t = \max(0, 1-e_t/0.5)$)。

技术新颖性

技术新颖性在四层。第一是评测哲学:通过「触发在输入、反应在评估」首次把显式完成与隐含推断分开,区别于 Omni-WorldBench/WBench/WorldOlympiad(提示词写明期望后果)。第二是跨接口统一抽象:原子控制单元 + 接口适配让一份用例同时评三种范式,首创「双轨道」机制(静态/动态)避免接口不兼容的不公平。第三是几何评估客观化:四任务全部用 VGGT-Ω 重建到 3D 再评分,组合尺度无关平移误差 $e_t$、旋转误差 $e_r$、往返成功率 $S_{succ}$、PSNR/LPIPS/SSIM,避免纯主观打分。第四是相机驱动位移对齐:作者发现同一 SE(3) 平移在不同模型诱发不同图像位移(直接影响 Camera Control 和 Scene Revisit 难度),用锚点掩膜 + SAM2 跟踪 + $k_{m,c} = W/(2 d_{m,c})$ 精确校准,让相机驱动模型横向对比第一次变得公平。

Overview of WorldExam
Figure 1: Overview of WorldExam
WorldExam taxonomy, tracks, and metrics
Figure 2: WorldExam taxonomy, tracks, and metrics
Test case curation pipeline
Figure 3: Test case curation pipeline
Benchmark statistics
Figure 4: Benchmark statistics
Image-space displacement alignment for camera-driven models
Figure 5: Image-space displacement alignment for camera-driven models
Geometry-based evaluation of Subject Control and Terrain Interaction
Figure 6: Geometry-based evaluation of Subject Control and Terrain Interaction

实验结果

对 20 个模型评测揭示清晰的「范式依赖能力分裂」。静态场景(Table 2):相机驱动里基于 3D 重建再投影的 NeoVerse 97.33、InSpatio-World 85.94 远超用学习嵌入编码位姿的 ReCamMaster 38.64、FantasyWorld 18.46,证明视觉质量与控制精度正交;Scene Revisit 上两者都拿到 1.000 往返成功率。动态交互(Table 4):动作驱动 Subject Control 最精确(LingBot-World 55.47,语言驱动 Veo 3.1 仅 37.28),但优势几乎不向反应性迁移——最好动作驱动 Terrain 仅 27.49、Object 33.75、Physical 33.43,而语言驱动全面领先:Veo 3.1 在 Object 75.96、Social 85.10、Goal 85.30 拔头筹,Vidu Q3 在 Terrain 64.39、Hailuo 在 Physical 63.84 领先。反直觉发现:Kling 2.5 通用视觉最高但 Goal 仅 48.25,证明视觉质量不等于目标执行。消融(Table 3):NeoVerse 平移倍数 0.10×→2.00× 时 Camera Control 98.25→95.32、Photometric Consistency 80.17→62.45,论证位移对齐必要。VLM 评判人类一致性 ρ=0.8614;换 DA3 后端排名稳定。

Comparison with representative world-model benchmarks
Table 1: Comparison with representative world-model benchmarks
Static-scene track evaluation
Table 2: Static-scene track evaluation
Effect of the input translation multiplier on NeoVerse
Table 3: Effect of the input translation multiplier on NeoVerse
Dynamic-interaction track evaluation
Table 4: Dynamic-interaction track evaluation
Human alignment of checklist evaluation
Table 5: Human alignment of checklist evaluation
Effect of the input translation multiplier on NeoVerse
Figure 7: Effect of the input translation multiplier on NeoVerse
Task-level performance across evaluation tracks
Figure 8: Task-level performance across evaluation tracks
查看结构化数据
任务指标本文基线提升
Camera Control(静态场景) Camera Control Score ↑ NeoVerse 97.33(相机驱动最强) FantasyWorld 18.46(学习嵌入类最弱) 3D 重建类相机驱动模型对学习嵌入类领先约 78 分
Scene Revisit(静态场景) Revisit Success ↑ NeoVerse / InSpatio-World 1.000 Hailuo 2.3 0.505(语言驱动最强) 相机驱动 vs 语言驱动空间记忆差距接近翻倍
Terrain Interaction(动态交互) Terrain Interaction Score ↑ Vidu Q3 64.39、Hailuo 2.3 61.57 WorldPlay 27.49(动作驱动最强) 语言驱动反应性比动作驱动领先约 37 分
Social Interaction(动态交互) Social Interaction Score ↑ Veo 3.1 85.10、Vidu Q3 81.91 LingBot-World 60.37(动作驱动最强) 语言驱动比动作驱动领先约 25 分
Goal Completion(仅语言驱动) Goal Completion Score ↑ HappyHorse 1.0 / Veo 3.1 约 85.3 Kling 2.5 48.25(视觉质量最高但目标执行最弱) 视觉质量与目标执行呈负相关,证明二者解耦
VLM 评判人类一致性 Spearman ρ / PLCC ρ=0.8614 / PLCC=0.8583(800 实例) Social Interaction 单任务 ρ=0.7019 最低 证明 GPT-5.5 清单评判与人类判断强相关

局限与改进

作者承认的局限有三:第一,动态交互评测要求可靠的第三人称主体控制,Goal Completion 仅限语言驱动,覆盖面受限于当前接口能力;第二,指标只评估端到端可观察行为,不能判断推理发生在哪里、也无法证明视频生成器内部真学到了因果表示——对闭源商用系统(Veo 3.1、HappyHorse),其专有提示词增强可能本身就参与了场景接地和执行规划,得分难归因;第三,范围仍限于现有接口能表达的行为。我的额外观察:清单评测虽与人类 ρ=0.8614,但 Social Interaction 的 ρ 仅 0.7019 最低,说明该任务主观性最大,结论需谨慎;VGGT-Ω/DA3 重建在快速运动或遮挡下可能不稳,引入「重建误差」被算到模型头上;位移对齐只校准相机驱动模型,未对语言驱动做类似「位移匹配」,可能让语言驱动在 Camera Control 的低分被低估了难度;测试用例初始图由 T2I 合成,可能与真实分布有偏差,影响外部效度。

独立分析的弱点

第一,反应性任务「未声明后果」判定高度依赖人工清单质量,清单遗漏判据会系统性漏检(如 Physical Reaction 清单没列「摆动周期是否合理」,模型可能生成「会动但周期错」的视频得分)。改进:引入物理仿真对照自动生成清单或多模型对抗采样补全判据。第二,几何评估对重建后端敏感——换 DA3 后范式内排名稳定但 Camera Control 绝对分数变化最大(语言驱动相对变化 5.36%),重建误差混入模型分。改进:多后端集成或合成场景用 GT 深度。第三,语言驱动 Camera Control 低分可能部分源于「位移匹配不公」——只有相机驱动做了 $k_{m,c}$ 校准。改进:为语言驱动设计等价位移对齐探针。第四,只评估最终视频不评估中间表征,无法回答「模型是否学到内部因果」。改进:增加干预式探针(扰动初始图障碍物看反应是否随之改变)。第五,Goal Completion 仅限语言驱动、动态交互仅 2 个动作驱动模型合格,样本偏小。改进:随新模型发布扩样重测。

未来方向

作者明确提出:扩展到更广泛接口、更长时序交互、更多干预式设置,以提供对「持久世界理解」更强的测试。基于成果可延伸的方向:第一,把「触发在输入、反应在评估」哲学推广到多智能体协作和长程规划(如让模型在 1000+ 帧里持续维持物理一致与社会反应);第二,构建「干预版」WorldExam——主动扰动初始场景关键物体/约束,对比反应是否合理改变,把「行为正确」升级为「因果理解正确」;第三,把世界反应性作训练信号反向蒸馏进生成模型,用 WorldExam 分数做 RL 或 DPO 奖励,弥补「视觉质量高、反应性差」鸿沟;第四,对闭源模型开发「白盒探针」替代直接归因,分离「提示词增强」与「生成器内在能力」贡献;第五,扩展到第一人称具身任务的真实机器人回放验证,把视频世界模型与可执行物理体打通。其中干预式设置和反应性训练信号最可能催生下一代真正具有「世界理解」的模型。

复现评估

作者承诺公开发布基准数据和评测工具包(项目页 WorldExam.github.io),是复现最大利好。数据侧:1,474 用例 + 模式库 + 初始图提示 + 清单都开源,但动态交互初始图依赖 T2I 生成器 + 人工筛选,复现 N 张候选图用不同生成器会有分布漂移。算法侧:接口适配、几何重建(VGGT-Ω 公开)、VLM 评判(GPT-5.5 需 API 付费)、SAM2 跟踪、变点检测都明确给出,但 VLM 评判依赖 GPT-5.5 闭源,换 VLM 替代会引入评判方差。算力侧:要跑 20 模型 × 1,474 用例,6 个相机 + 7 个动作驱动模型本地权重(分辨率 560×336 到 1280×704,帧 49–177),7 个语言驱动走商用 API,费用不低,单卡可跑本地子集。难度评估:协议严谨、代码/数据开源承诺到位,对有 API 预算和几张消费级 GPU 的团队,复现核心评测(自选几模型 + 全部静态场景)可行;完整复现需中等规模投入,约 1–2 人月。