从生成到仿真:世界模型距离真正的仿真器还有多远 From Generation to Simulation: How Far Are World Models from Being True Simulators?
以传统仿真器八项能力为标尺审计200篇文献,指出状态反馈与物理引擎是结构性缺口
前置知识
世界模型
学习环境时空规律的模型:给定当前状态与动作,预测未来状态的分布,可形式化为映射 $\mathcal{T}: \mathcal{S} \times \mathcal{A} \rightarrow \Pi(\mathcal{S})$。自 Ha 与 Schmidhuber 2018 年用 VAE+RNN 构建首个交互式潜环境以来,经历了潜变量动力学、视频生成、联合嵌入预测(JEPA)三条路线的范式迁移,应用已覆盖游戏引擎、自动驾驶仿真、机器人操作与开放世界探索。
全文的核心命题就是「生成式世界模型能否充当严格意义上的仿真器」,不理解其基本范式与形式化定义,就无法理解八项能力维度上的各项分析与结论。
扩散模型
通过迭代去噪把随机噪声逐步转化为数据(图像/视频帧)的生成模型,是视频生成路线的主力骨干:GameNGen、Matrix-Game、Sora 类系统、Cosmos 世界基础模型均基于它。特点是视觉保真极高、可接受多模态条件,但采样慢、输出随机,且幻觉(物体无故出现/消失)是其系统性问题。
八项能力中的交互(C3)、可控性(C4)、物理约束(C2)的大量代表工作都是在扩散骨干上做的改进,不理解扩散就无法理解这些方法的设计动机。
自回归模型
把观测离散化为 token 后逐帧或逐段预测下一个 token 的生成范式,代表工作有 IRIS、Oasis、Genie、GameGen-X。它天然支持流式实时交互(如 Matrix-Game 系列的 24–40 FPS),但每一步的微小误差会在长时程中不断累积,形成「自回归漂移」——生成越久画面越崩坏。
稳定性(C5)一章的全部技术(Self-Forcing、记忆架构、因果一致性)都是为对抗自回归漂移而生,这是理解该章的前提。
JEPA(联合嵌入预测架构)
不在像素空间重建未来,而在学习的抽象表示空间中预测目标表征的自监督范式,代表是 V-JEPA 系列:在超百万小时互联网视频上预训练 1.2B 参数 ViT,仅用 62 小时机器人数据微调即可零样本操控 Franka 机械臂;V-JEPA 2-AC 潜空间规划每动作约 16 秒,比像素空间规划(约 4 分钟)快约 15 倍,但不产生可读的像素输出。
它是三大路线之一,也是状态反馈一章中「潜表示作为机器侧反馈」策略的代表,其效率优势与可审计性缺陷贯穿全文。
潜变量动力学与 RSSM/Dreamer
在紧凑潜空间中学习环境动力学并在其中「想象」与训练策略的路线:PlaNet 与 Dreamer 系列用递归状态空间模型(RSSM,含确定性与随机性两组潜变量)实现长时程潜空间想象,DreamerV2 用离散潜表征达到 Atari 人类水平,DreamerV3 凭 symlog 预测与正则化在 150+ 环境上免调参稳定训练,DayDreamer 更将其部署到真实机器人在线学习。
这是最早的技术路线,其「在想象中学习」范式是控制决策支持方面的传统强项,也是文中各路线对比的参照系。
3D 高斯泼溅(3DGS)与 NeRF
两类显式/半显式三维表示:NeRF 用 MLP 拟合辐射场、逐视角体渲染;3DGS 用带颜色与不透明度的各向异性高斯基元直接光栅化渲染新视角,速度快且基元自带空间坐标。GWM 以 3D 高斯基元为世界状态做模型基强化学习,Lyra 2.0、WonderWorld、MoVerse 用它构建可导航世界,Gaussian Action Field 用机械爪位姿直接驱动高斯场形变。
显式 3D/4D 路线(25 篇)与资产构建(C1)、几何一致性、可编辑性的讨论全部建立在这些表示之上。
RL 环境接口与闭环评估
传统仿真器(Atari ALE、CARLA、DMControl)通过程序化 API 向智能体暴露 reset(重置环境)、随机种子(复现轨迹)、状态查询(返回所有物体的位姿速度)与奖励信号,支持「算法在环」的策略训练与评估。开环指标(如 FVD)只看生成质量,闭环指标则衡量智能体在环境内多步交互后的任务成功率。
论文以此定义交互(C3)的深度维度,并以「世界模型是否具备这些接口」作为五级状态接口审计(B1–B5)的判定标准。
研究动机
生成式世界模型正被期待取代物理引擎、游戏引擎和强化学习环境,成为新一代数据驱动的通用仿真环境,但幻觉是几乎所有生成模型共有的系统性问题:物体无故出现或消失、长时程 rollout 中几何持续漂移、碰撞与接触行为违反物理直觉、同一动作在不同时刻产生不一致的视觉后果。论文指出其根源在于当前世界模型是条件分布采样器而非物理演化求解器——它们学到的是训练数据中视觉模式的条件分布,而非世界的不变物理定律。具体缺口还有两个:一是信息接口稀疏,163 篇实现论文中只有 45 篇显式报告 RGB 以外的传感器级输出,而传统仿真器通过 API 随时暴露位姿、深度、LiDAR、语义、碰撞事件、奖励与真值标签;二是闭环可复现性缺失,文献中几乎没有关于随机种子控制、确定性执行、容差带与重复运行方差的可比证据。视觉逼真也不等于物理正确:即便在 GameNGen 的人类研究里,也只有 58–60% 的受试者能分辨真实与生成的 DOOM 截图——「看起来像真世界」与「 behaves 像真世界」之间隔着本质鸿沟。
本文的目标是本文要系统回答三个核心问题:(a) 生成式世界模型的生成过程能否成为严格意义上的仿真器?(b) 在每项仿真器能力上,各技术路线分别走到了哪里、距离目标还差多远?(c) 下一步应该在哪些方向发力?为此,作者以传统仿真器(物理引擎 G1、游戏引擎 G2、强化学习环境 G3 三类基线)的八项能力——资产构建 C1、物理引擎 C2、交互 C3、可控性 C4、稳定性 C5、状态反馈 C6、多样性 C7、评估指标 C8——作为路线无关的外部标尺,对 2018 年至 2026 年 6 月精选的 200 篇代表性文献逐篇编码标注,绘制可复现的全语料证据地图,并对其中 163 篇实现论文做五变量状态接口审计(B1–B5),把「世界模型即仿真器」从一个愿景口号,变成有具体维度、可核查数据与明确缺口清单的可执行研究议程。
与已有工作不同的是,已有 16 篇相关综述都以世界模型自身为中心,按架构、功能或应用领域组织文献,只能回答「存在哪些世界模型、它们能做什么」;本文的独特切入是用外部标尺替代内部属性:八项能力直接取自传统仿真器的能力集合,与任何具体技术路线无关,因此潜变量动力学、扩散、自回归、JEPA、显式 3D/4D、occupancy 等异构路线可投影到同一能力空间做定量比较。方法论上还有两个独有机制:其一,全语料证据映射,对 200 篇逐篇标注范式、路线、1–3 个主贡献能力与创新摘要,明确其测量的是研究关注度而非能力达成度;其二,五变量状态接口审计,区分 B1 自我信息、B2 传感器输出、B3 奖励/终止、B4 运行时可查询实体/物理标注、B5 闭环交互,并把「确认缺失」与「证据不足」分开报告,避免把证据不足误判为不存在。这一审计直接量化出全领域最被忽视的短板:B4 接口仅 6/163 篇具备。
核心方法
直觉上,一个合格的仿真器不只是「能生成好看的视频」,还必须能被任意时刻交互、被精确控制、长时间演化不崩坏,并能向外部调用者返回结构化的世界状态。本文按此组织分析:第 3 节先梳理三大技术路线——潜变量动力学(2018 年 VAE+RNN 到 Dreamer 系列的 RSSM)、视频生成(扩散类的 DIAMOND、GameNGen、Matrix-Game 与自回归类的 IRIS、Oasis、GameGen-X)、JEPA(V-JEPA 系列),并指出 2024 年以来三路线相互借鉴、走向混合融合的趋势;第 4 节以八项能力为框架逐项对比,每项能力都从三个角度展开:传统仿真器在该能力上的标尺是什么、各路线做了哪些具体工作、差距的本质原因是什么。证据基础是 200 篇文献的逐篇编码:163 篇实现论文按六个家族划分(潜变量动力学/潜动作 29、自回归 37、扩散 63、JEPA 5、显式 3D/4D 25、occupancy 4),另有 18 个评估基准、16 篇综述与 3 篇其他文献。中心发现先行预告:可控性、交互、稳定性是相对强项,资产构建、物理引擎、状态反馈是跨路线的结构性缺口。
核心创新是用「传统仿真器八项能力」这一外部标尺组织整个领域,与既有综述有三个本质区别。第一,标尺外生且路线无关:C1 资产构建、C2 物理引擎、C3 交互、C4 可控性、C5 稳定性、C6 状态反馈、C7 多样性、C8 评估指标全部取自物理引擎、游戏引擎和 RL 环境的能力集合,任何技术路线都必须在同一坐标系下接受检验,避免了按架构分类时各说各话的问题。第二,作者把严格仿真器形式化为 $\mathcal{T}: \mathcal{S} \times \mathcal{A} \rightarrow \Pi(\mathcal{S} \times \mathcal{F})$,其中 $\mathcal{F}$ 是至少含 B1–B4 的结构化反馈空间,并要求状态演化物理一致且可验证、时间一致无漂移、统计可复现、支持闭环交互评估——这使「差距」变成可操作化的概念。第三,对 163 篇实现论文做 B1–B5 五级状态接口审计,区分「确认存在/确认缺失/证据不足」,并明确排除传感器空间估计、不可读潜向量与仅作输入或训练标签的结构,最终量化出仅 6 篇提供运行时可查询实体/物理标注接口这一被全领域长期忽视的结构性事实。
方法步骤详情
分析按八项能力逐项展开,每项遵循「传统标尺—代表工作—差距本质」三步。C1 资产构建:资产作条件(如 DriveDreamer-2 的语言→轨迹→HDMap→多视角视频流水线)、自生成资产(WonderWorld 单图 10 秒建 3D 场景、GWM 以 3D 高斯为状态)、统一可编辑平台(GigaWorld-0)。C2 物理引擎按约束强度分三级:硬物理(OrbiSim 可微物理核加扩散渲染、PIN-WM 把物理参数当可学习变量)、软约束(GEM-4D 使真实操作 61%→81%、ChronoDreamer 显式预测 3.2 N 级接触力)、物理评估(What-If World 319 对干预)。C3 交互沿对象与深度两维:相机级(GameNGen 约 20 FPS、HunyuanGameCraft 2.0 1080p/60FPS)、物体级(ActWorld 分层动作记忆、WorldCraft 的 TASP 防物体回弹)、算法在环(DIAMOND 在世界模型内训练 RL 智能体)。C4 可控性沿抽象层级:显式控制、语言/多模态(Pandora 任意时刻注入指令)、潜动作(Genie→DiLA 的内容-结构解耦)。C5 稳定性分四层机制:自对抗训练(Self-Forcing 系)、隐式/显式记忆、因果一致性、漂移量化。C6 状态反馈先做 B1–B5 审计,再归纳三策略:多任务辅助输出(TesserAct)、物理推导状态(OrbiSim)、潜表示反馈(V-JEPA 2)。C7 多样性分规模驱动(GenAD 2000+ 小时数据)、组合驱动、参数可控三路。C8 评估分生成质量、闭环具身、物理合理性三个透镜,并总结四大局限。
技术新颖性
技术新颖性体现在四个层面。其一,比较框架本身:用被评估对象之外的 yardstick 组织文献,使「能否成为仿真器」从口号变成八维坐标系里的可测问题,与以架构/功能/领域为中心的 16 篇既有综述形成互补分工而非替代。其二,全语料证据映射可复现:语料标注、证据地图与分析脚本开源在项目页面,20 多条布尔检索式完整列于附录 A,并用 DBLP 与 Crossref 逐篇核验正式发表状态(72/200 已发表),过程中还修正了 2 个错误标识与 3 处出版方信息错误。其三,B1–B5 五级状态接口审计是全新的量化工具:把笼统的「状态反馈」拆解为自我信息、传感器输出、任务信号、运行时实体/物理标注、闭环交互五个可单独判定的接口变量,且明确把 B4 定义为「rollout 过程中可直接查询的命名实体状态或物理参数」,从而与下游感知模型从像素里反推结构的做法划清界限。其四,结论以数据为锚:状态反馈以 22.5%(45/200)的主贡献覆盖率为八能力最低之一,B4 接口仅 6/163,这个「6」成为全文最有力的证据,并直接导出「一等公民状态反馈」这一研究方向。
实验结果
研究注意力严重不均:以主贡献计,可控性 125 篇(62.5%)、交互与稳定性各 80 篇(40.0%)、评估 51 篇(25.5%)、多样性 46 篇(23.0%)、状态反馈 45 篇(22.5%)、资产构建 38 篇(19.0%)、物理引擎仅 34 篇(17.0%),后三者恰是成为合格仿真器最缺的基础能力。状态接口审计(163 篇)更尖锐:B1 自我信息 65、B2 传感器输出 45、B3 奖励/终止 20、B4 运行时实体/物理标注仅 6、B5 闭环交互 87——可查询「物体在哪、质量多少」的接口近乎空白。路线各有 trade-off:扩散保视觉与交互实时性(GameNGen 约 20 FPS 且 58–60% 受试者分不清真假 DOOM 截图,Matrix-Game 3.0 达 720p/40FPS,HunyuanGameCraft 2.0 达 1080p/60FPS);潜变量动力学长于控制决策(DreamerV3 单配置稳过 150+ 环境);JEPA 效率突出(V-JEPA 2-AC 规划约 16 秒/动作、较像素规划约 4 分钟快约 15 倍,UWM-JEPA 盲 rollout 五步精度 0.77 对 0.53);显式 3D/4D 占几何一致性优势。物理软约束收益可量化:GEM-4D 把真实机器人操作成功率从 61% 提到 81%,Motus 光流动作仿真 +15%、真实 +11–48%。但物理因果评估残酷:What-If World 的 319 对干预中无一模型超过 52%,开源最佳仅 28%,隐蔽的质量干预(14.2%)远低于显著的干预(40.4%)。评估侧:World-in-World 证明视觉质量不等于任务成功率,SpatialWorld 上 GPT-5 成功率仅 17.4%。总判断:受限场景下功能替代已可行,严格意义上仍差关键一步。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 状态反馈接口审计(163 篇实现论文) | 具备 B4 运行时可查询实体/物理标注接口的论文数 | 仅 6 篇(3.7%) | B1 自我信息 65 篇;B2 传感器输出 45 篇 | 不适用(审计型结论):暴露出可查询实体状态的接口几乎全领域空白这一结构性缺口 |
| 神经游戏引擎实时交互 | 分辨率 / 帧率 | HunyuanGameCraft 2.0 达 1080p/60FPS;Matrix-Game 3.0(5B 模型)达 720p/40FPS | GameNGen 约 20FPS(DOOM 域、TPU-v5、4 步 DDIM) | 约两年内帧率与分辨率翻倍以上,从概念验证推进到工业级 |
| 潜空间规划效率(V-JEPA 2-AC) | 每动作规划耗时 | 约 16 秒/动作 | 同条件像素生成规划约 4 分钟 | 约 15 倍加速,证明潜空间反馈的工程优越性 |
| 物理软约束对真实机器人操作的影响(GEM-4D) | 真实操作成功率 | 81% | 无 4D 对应约束时 61% | +20 个百分点,量化了几何一致性到物理可用性的因果链 |
| 物理因果理解(What-If World,319 对因果干预) | APEO 配对分 | 无一模型超过 52%,开源最佳 28% | 视觉显著干预(颜色/尺寸变化)40.4% | 不适用(诊断型结论):视觉隐蔽的质量干预仅 14.2%,暴露物理因果短板 |
| 遮挡盲 rollout 鲁棒性(UWM-JEPA) | 五步前向仿真精度 | 0.77 | 参数匹配 LSTM-JEPA 0.53 | +0.24,支持「表示空间预测优于像素重建」的论断 |
| 具身闭环任务评估(SpatialWorld) | 空间推理任务成功率 | 评估 8 个异构仿真后端、760 个人工标注任务 | GPT-5 仅 17.4% 成功率 | 不适用(诊断型结论):最强通用模型在仿真环境内的空间推理仍远低于实用水平 |
局限与改进
作者明确承认的局限包括:语料是精选的 200 篇而非穷举,以 arXiv 为主且 128 篇尚未经同行评审;DeepMind Genie 2/3 等工业级系统只有技术报告或博客、未纳入可检索统计;覆盖率度量的是研究关注度而非能力达成度,各论文间没有统一性能阈值,不能据此给技术路线排成熟度名次;JEPA(5 篇)与 occupancy(4 篇)分母过小,家族比较不具统计意义;长时程稳定性声明(DecMem 分钟级、Matrix-Game 3.0 分钟级记忆一致性、GPT 类驾驶模型 40 秒)缺乏统一评估协议,无法横向比较。我的补充观察有四点:一是逐篇标注由作者团队人工完成,「主贡献能力」判定与 1–3 个标签的粒度不可避免带主观性,会抹平贡献深浅差异;二是八项能力被默认等权,但安全关键应用中物理引擎与状态反馈的权重显然应更高;三是语料止于 2026 年 6 月,这个以月为单位迭代的领域中具体排名会很快过时;四是综述只指出「哪些能力缺、缺多少」,未回答「哪些缺口是数据问题、哪些是架构问题」的因果归因,六条未来方向的优先级与依赖关系也未量化。
独立分析的弱点
独立分析可见五个弱点。第一,覆盖率统计只回答「多少人做了」,不回答「做到什么程度」:125 篇可控性论文可能绝大多数停留在演示级,改进方向是为每项能力引入类似 B1–B5 的操作性定义与分档质量量表,并做跨论文元分析。第二,B4 审计的判定粒度可以更细:6 篇达标系统各自覆盖的实体字段与物理参数范围差异很大,未来应报告字段级覆盖率与一致性保持时长,而非二值判定。第三,缺少与传统仿真器的绝对对照实验设计——既有基准几乎只在世界模型之间互比,FVD、闭环成功率等指标上应同时报告 MuJoCo、CARLA 的基线表现,才能量化「还差多远」。第四,算力与能耗成本几乎没有进入能力权衡的讨论:GameNGen 依赖 TPU-v5,Cosmos 级 14B 模型训练成本高昂,工程选型需要「每仿真秒成本」这类指标,建议把效率作为第九项能力。第五,安全认证视角缺位:未讨论运行时监控、形式化验证或功能安全认证框架如何嫁接到生成式仿真上,而这是机器人与驾驶落地的硬门槛,变形体操作世界模型的 Lyapunov 稳定性证明只是孤例。
未来方向
作者提出六个方向且各配可行性证据:形式化物理——把可微物理引擎(OrbiSim、PIN-WM、PhysBridge)深度融入生成管线,让输出携带逐步可验证的守恒约束,并把认证从刚体扩展到流体与变形体;统一动作接口——多粒度动作表示联合学习(DiLA 的内容-结构解耦、DisCo 的离散基元表明可分性比分辨率更重要),把控制论的反馈-前馈框架移植到高维生成模型,攻克时间组合性难题;一等公民状态反馈——要求数据集与基准把 B2 传感器估计与 B4 运行时实体/物理标注分开评分,并探索把潜表示翻译成可读结构的表示翻译器;长时程稳定性——周期性重置-锚定机制(Lyra 2.0 几何路由、DecMem 稀疏全局记忆)加漂移增长的理论上界与可复现性报告标准;下游效用评估——以「世界模型内训练的策略部署到真实环境的增量成功率」为核心指标,把传统仿真器作绝对基线;跨路线融合——物理+扩散、显式 3D 记忆+隐式视频生成、VLA+世界模型(Being-H0.7 的训练时融合-推理时分离是绕开目标冲突的范例),终极目标是在统一框架下组合六方向、同时满足严格仿真器的全部要求。可延伸方向:信息论多样性度量(条件熵/互信息)、因果干预式物理认证标准化、补齐 B3 奖励与终止信号(仅 20/163)。
复现评估
复现难度:低(作为综述本身)。证据基础完全开源:项目页面 https://github.com/AtongWang/world-model-simulators 维护 200 篇语料的结构化标注、证据地图与分析脚本;附录 A 给出全部检索式(主流路线 M1–M12 与补充能力 S1–S16 的布尔表达式),检索截止 2026 年 6 月 30 日,覆盖 Google Scholar、arXiv、DBLP、Crossref 四源,并沿六篇代表性综述与四项里程碑工作(World Models、DreamerV3、Genie、Cosmos)的引用网络双向扩展。发表状态经 DBLP/Crossref 逐篇核验:72 篇正式发表(含 22 篇 ICML/NeurIPS/ICLR、20 篇 CVPR/ICCV/ECCV、3 篇 Nature),128 篇仍为预印本。复现文中统计结论不需要任何算力;但若要复现所引第三方系统的实验(如 Cosmos 14B、GameNGen 的 TPU 训练)则需要大规模算力,好在多数关键系统(DIAMOND、miniWM、MineWorld、Matrix-Game 系列、DreamerV3)有开源实现可供替代验证,被审计的接口特性(是否输出深度、是否暴露 reset/种子)也可直接从开源代码核对。
论文图表
(a) 八项能力各自的主贡献论文累计数按年份嵌套切片(至 2020/2022/2024/2026),可控性 125、交互 80、稳定性 80 遥遥领先,而资产构建、物理引擎、状态反馈长期停滞在 35–45 篇;(b) 200 篇语料按发表年份拆分为已发表 72 篇与预印本 128 篇,2025–2026 年预印本占绝对主导。
用数据呈现研究注意力在八项能力上的严重失衡,以及领域迭代速度快于综述周期的预印本化趋势,是后续逐能力分析的总动机。
外观/纹理、相机位姿、场景布局三个独立控制轴:可单独扫掠一个因子(如外观从晴天扫到雨/夕/阴)而固定其余两个,把有目的的变化与无约束的随机生成区分开。
C7 参数可控路线(GigaWorld-0 独立控制外观/视角/布局)的示意,展示了管理「多样性-可控性」权衡的机制:让用户结构化指定哪些维度可自由变化。
三个评估透镜:生成质量(视觉保真、时序一致、动作跟随,主要开环——rollout 看起来对吗);闭环具身效用(多步交互、任务成功、策略迁移——智能体能否在模型内外成功);物理合理性(因果干预、物理响应、跨时记忆——rollout 是否服从因果与物理结构)。三者共同把评估目标从表面相似度推向下游仿真效用。
C8 评估体系的总框架图,对照文中总结的四大评估局限(基准碎片化、开环偏差、缺可步进环境属性、缺与传统仿真器的对照),是理解评估生态缺口的钥匙。