Marionette:预测世界状态、渲染几何、绘制外观的交互式游戏世界模型 Marionette: Predicting World States, Rendering Geometry, Painting Appearance
显式276维世界状态加零参数渲染器承担精确几何与控制,神经网络只负责画外观
前置知识
世界模型(world model)
学习环境动力学、能根据当前状态和动作预测未来观测的生成模型。交互式游戏世界模型接收玩家动作流,自回归地产出可玩的视频流,相当于用神经网络替代游戏引擎。控制导向的世界模型(如 Dreamer 系)在隐空间中学习抽象状态供策略规划,状态不必精确可读;而本文需要的状态既要可解释、又要渲染就绪。
本文就是一个游戏世界模型,全文的动机、架构与评估协议都围绕'世界模型的状态应该显式还是隐式'这一核心问题展开,不理解这个概念无法理解其定位。
自回归误差累积(error compounding)
自回归模型训练时见的是真实历史,推理时却要把自己的输出喂回给自己,输入分布逐渐偏离训练流形,每个小误差使下一步输入更离谱,误差随视界复合增长。像素/隐空间视频生成器直接继承这个问题,长 rollout 中一致性崩溃、内容漂移。
这是本文的根本动机:与其训练更强的生成器去'Stay put',不如把反复出现的量换成规则可以约束的显式状态。附录 C 的分析、Q2 实验和负结果全部围绕它。
铰接骨架与运动学姿态
把角色表示为根关节(root)加一组相对关节位置的骨架,姿态即各关节相对根的偏移;根的逐帧位移决定角色在世界的哪里,6D 旋转决定朝向。MPJPE( mean per-joint position error)衡量预测关节与真值的平均欧氏距离,本文用 RA-MPJPE(减去各自的根)只测铰接姿态形状、排除整体平移。
论文的 276 维世界状态就是两套骨架加根运动加武器,状态层所有指标(穿透、滑步、分离距离、可控性探针)都以米为单位在骨架上直接计算。
6D 连续旋转表示
Zhou 等人提出的旋转参数化:不直接存旋转矩阵或四元数,而是存旋转矩阵前两列的 6 个数,解码时用 Gram-Schmidt 正交化把两个 3 维向量恢复成 SO(3) 中的正交旋转矩阵。优点是对神经网络回归友好、连续可微,避免四元数的双覆盖歧义和欧拉角的万向锁。
状态中每个实体的根朝向就用 6D 表示存储,零参数桥接器的第一步就是把它正交化回旋转矩阵,随后才能把根位移旋入世界系并积分出绝对轨迹。
视频扩散模型与 DiT 骨干
在视频隐空间做迭代去噪的生成模型,DiT(Diffusion Transformer)用 transformer 替代 U-Net 作为去噪骨干,是当前大型视频生成器的主流架构。控制条件版本可在姿态图、深度图等结构信号引导下合成视频,姿态引导的角色视频合成已达到生产级质量。
本文观测模型是 Wan2.2-Fun-5B(DiT 骨干),它只承担外观合成、不做几何推断,是三组件中最重的一个,也是保真度对比(FVD)的来源。
FVD(Fréchet Video Distance)
把真实视频与生成视频分别过特征提取器得到特征分布,计算两个高斯分布间的 Fréchet 距离,值越低表示感知与时序质量越接近真实分布。它评估分布层面的质量,不要求逐帧对齐,适合会合理偏离任何单一参考的随机长 rollout。
FVD 是论文唯一的自动观测层指标(FVD16 短片段 + 逐块长 rollout 曲线),'显式状态路由外观不损失保真度'的结论(831 对 799/975)完全建立在它之上。
chunk-relay 分块接力长视频生成
扩散模型单次只能生成固定长度片段,长视频采用自回归接力:生成一个块(本文 81 帧)后用其末尾帧作为下一块的种子条件,逐块续接。外观等长程量只能靠种子帧传播,而几何一致性由块外的显式状态保证。
这解释了论文中外观漂移的根源(观测模型记忆只在种子中传递)与几何不漂移的原因(几何由状态和桥接器逐块精确重建),是理解其局限与修复方案的关键。
研究动机
交互式游戏世界模型(Genie 系、Oasis、Minecraft 类神经游戏引擎等)直接在像素或隐空间自回归外观,姿态、几何、遮挡、物体身份以及控制输入的效果全部隐式地由同一条生成序列维护,一致性和可控性只是涌现性质而非保证。长时程 rollout 时模型反复把自己的输出当输入,误差复合累积,随视界增长退化。论文用 Minecraft 红石电路说明问题:一盏红石灯是否点亮取决于电路的逻辑状态而非邻近像素的外观,训练来预测下一帧的生成器完全可能画出一帧看似合理的画面却无视该逻辑状态。控制接口同样缺失:商业视频生成器(Seedance 2.0、Grok Imagine 1.5)的开放视觉保真度已接近真实素材,却不接受姿态流、动作 token 时间表等逐帧结构化控制——附录对比中 Grok 晚约 3 秒才执行脚本规定的攻击,还把两个角色的外观互换了。评估层面,像素级模型不暴露状态,长时程失败只能靠肉眼或单一 FVD 判断,无法在米制单位下测量世界状态的漂移。
本文的目标是构建一个面向含铰接角色(猎人 vs 怪物)交互式动作游戏的世界模型,把必须精确的部分(世界空间几何、遮挡顺序、米制运动、离散决策逻辑)从神经生成过程中剥离:显式预测可解释的 276 维世界状态 $s \in \mathbb{R}^{276}$,由固定的零参数渲染器把状态变成姿态控制视频,神经网络只负责外观合成。并以此建立两个可检验的性质:(Q1) 控制输入对生成世界有因果权威——覆写动作 token 必须改变身体姿态(实测错配动作流使 RA-MPJPE 上升 31%);(Q2) 长时程行为由状态层决定且可以在状态层修复——保持观测模型完全不动,只对状态施加规则(地形碰撞体、分离上限)就能修复自由 rollout 的角色漂移与地面穿透。同时要求路由外观经由显式状态不产生可测的保真度损失(FVD 831 对录制姿态驱动的 799、对像素自回归基线的 975)。
与已有工作不同的是,已有'结构与外观分离'的工作分两条线:一条把 3D/记忆当缓存或一致性先验,从已生成的像素反推几何,前向动力学仍留在视频隐空间;另一条'先预测结构再渲染'用于驾驶、人体视频、语义体素+学习着色器等场景,但都没有把前向动力学放进显式米制铰接状态、再用零学习参数的图形桥接器产生外观——姿态引导角色合成中姿态是外部输入,而世界模型必须自己预测并 rollout 这个信号、为其错误负责。作者的独特立场来自工具使用隐喻:像语言模型调用计算器一样,必须精确的工作交给确定性工具执行而非生成。最有价值的独特贡献是一个负结果:把地面不穿透约束写成可微损失 $\mathcal{L}_{pen} = \text{ReLU}(H_j + \epsilon - y_j)^2$ 会被优化器'交易掉'——模型靠拉长骨架把脚提出地面,骨长误差从约 3% 涨到 13%;同样的约束改为输入特征加事后投影却稳定有效。由此得到设计准则:中间表示的价值在于规则能否在其上强制执行,而非其紧凑性。
核心方法
直觉:视频是低维世界状态的高维观测,直接学 $p(\text{video})$ 会把物理、身份、控制纠缠在像素空间;显式引入状态 $s$ 后动力学与外观条件独立,$p(\text{video}) = \int p(\text{obs} \mid s)\, p(s_{t+1:} \mid s_{\le t}, \text{control})\, ds$,问题拆成两个良定子问题。技术路线三组件:(1) 两阶段自回归动力学:ActionGPT(4 层、宽 256、约 2.5M 参数)每帧每实体自回归预测一个离散动作 token,并回归根位移与 6D 根旋转;PoseGPT(8 层、宽 512、约 25M 参数)把动作 token 与近期身体状态映射为下一帧姿态,充当'动画播放器'。(2) 零参数图形桥接器 $R(s)$:6D 旋转经 Gram-Schmidt 正交化变旋转矩阵,根位移旋入世界系后累加积分得绝对轨迹,关节 = 根位置 + 旋转后的偏移,得到米制世界系骨架,经确定性跟随相机光栅化为三通道几何缓冲(R=高度、G=逐关节身份、B=逆深度)。(3) 控制条件视频扩散观测模型(Wan2.2-Fun-5B,DiT 骨干)从姿态控制视频加首帧参考图合成 RGB,81 帧块间 chunk-relay 支持长视界。
核心创新是把切分线画在能力边界上:神经生成模型擅长外观与感知合理性、弱于长时程精确记账与离散逻辑,于是几何、遮挡、米制运动全部交给零参数算子——'必须精确的工作由工具执行,不是被生成出来'。与已有方法的本质区别有四:像素/隐空间世界模型里一致性和可控性是涌现的,这里由构造保证——桥接器画的是固定拓扑骨架,怪物不可能变成另一个物种或多出一条腿;姿态引导视频合成中姿态是给定输入,这里状态是被预测的量,模型要承担预测误差;控制被实现为覆写流中的单个动作 token(一次张量赋值,无梯度、无辅助网络),与玩家按键进入模型的位置完全相同,且根平移/旋转通道同样可覆写(米制速度与朝向被精确复现);状态是米制且可检查的,规则可以在状态上强制可行性(把不可行配置投影回可行集)而非鼓励可行性(正则化惩罚)。论文的负结果证明这一区别是实质性的:可微惩罚会被优化器绕过,输入特征加事后投影不会。
方法步骤详情
数据来自商业动作游戏《怪物猎人:荒野》的 WildWorld 录制,同一帧同时携带 RGB 视频与 276D 状态两个同步视图。状态布局:怪物根位移、53×3 根相对关节、猎人根位移、31×3 关节、6 维武器点、两个 6D 根旋转。动力学模型在状态视图训练:1,395 段、20fps、约 $1.6\times10^7$ 帧(227.6 小时),动作词表怪物 173、猎人 689。每步 rollout:ActionGPT 消费 18D 根/旋转流、动作嵌入、动画进度、武器子状态及地形特征(根前方 1m 的 11×11 个 0.4m 格高程 patch,加 11 个关键关节离地间隙,MLP 编码),输出下一动作分布与根运动;可选控制覆写替换动作 token 或根通道;PoseGPT 生成下一帧 258D 姿态;拼装成 276D 状态追加进上下文(注意力窗口 512)。桥接器按闭式几何六步产出姿态控制帧:旋转恢复、根积分、关节放置、地形网格、相机、投影光栅化;推理时碰撞体在渲染前把穿墙/入地的根投影回可行集(爬升超 1.5m 取消水平运动、垂直修正限速 4cm/帧)。观测模型以首帧图像定身份,每块 81 帧生成后末帧作下一块种子接力。
技术新颖性
新颖性有四层。表示层:276 维状态全部米制、对全局位置与朝向不变(根相对关节 + 逐帧根位移),既是可解释的前向预测目标又是渲染就绪的,一个状态同时服务动力学评估(能在米制下测漂移)与照片级合成。架构层:在动力学内部再做一次决策(2.5M)/动画(25M)解耦,两阶段接口只是状态序列,因此 ARDY、Kimodo 等产品级动画模型可直接替换动画半边;决策模型极小使'覆写 token'的控制方式在计算上近乎免费。工程层:零参数桥接器的三通道编码设计精细——地形与骨骼在 R 通道用不相交区间($0.5+0.5\hat{h}$ 对 $0.2\hat{h}$)防止同高塌色、G 通道预留 id 带(0 地形、60–99 武器、105–194 怪物、195–254 猎人)让观测模型无需从形状重建对应关系、B 通道逆深度由深度缓冲解决遮挡;10bit 无色度子采样保住几何精度;多层高度场每格存层列表以支持桥/屋檐,0.5m 内层合并、八邻域三票 2m 内膨胀填充。方法论层:负结果给出可迁移准则——约束只有在模型无法与之交易之处才有效,为世界模型选择中间表示提供了超越紧凑性与重建保真度的判据。
实验结果
Q1 可控性:48 个 held-out 段、温度 0 确定性解码,仅注入的动作流不同——错配流(Force-Shuf)使猎人 RA-MPJPE 从 0.272m 升至 0.357m(+31%),33/48 段 Force-GT < Force-Shuf;按类分解,stationary 膨胀 2.3×(0.24→0.55m)、原地震击 1.8×(0.26→0.46m)、locomotion 仅 1.3×(0.27→0.35m)——姿态随 id 变化大的类膨胀最大,正是'身体执行了错误动作'的签名;Force-GT 0.272 与 Free 0.281 几乎持平,说明自由 rollout 很少偏离录制选择。Q2 长时程:12 个窗口上自由 rollout 双角色从 4.9m 漂移到 21.2m(录制参考 4.8m),每角色在画面中占比从 1.81% 缩到 0.57%,穿透 CFR 0.337、MMP 0.444m(录制 0.082、0.023m);地形碰撞体把 CFR 降到 0.114(-66%),6m 分离上限把末帧距离压到 5.1m,代价是滑步 +7%;每条规则只作用于自己的目标量。观测层:FVD16 831 对基线 975,长视频末块 1013 对 1198;同一观测模型换用录制状态驱动得 799 对预测状态 831;逐块 FVD 至多上升约五分之一。商用对比中只有解耦模型在指令帧执行了 token 切换。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长时程视频生成(观测层) | FVD16(16帧片段,12个16秒rollout,128真实/96生成片段) | 831 [963, 1209] | 端到端像素自回归基线 975 [1101, 1346] | 点估计降低约 14.8%,区间重叠,说明显式状态路由外观无可测保真度损失 |
| 长 rollout 末段质量 | FVD(最终 81 帧块) | 1013 | 1198 | 降低约 15.4%,长视界下优势保持 |
| 状态层可控性(48 段强制动作探针) | RA-MPJPE (m) | Force-GT 0.272±0.135;错配 Force-Shuf 0.357±0.120 | Free 自采样 0.281±0.141 | 错配动作流使姿态误差上升 31%(33/48 段排序成立),token 具有因果权威 |
| 长时程状态物理合理性(12 窗口) | 碰撞帧比率 CFR ↓ | 0.114(加地形碰撞体) | 无规则自由 rollout 0.337(录制参考 0.082) | 穿透帧占比下降 66% |
| 地面穿透深度 | MMP (m) ↓ | 0.157(加地形碰撞体) | 0.444(录制 0.023) | 最大穿透深度下降约 65% |
| 双角色长时程保持交战 | 末帧分离距离 (m) ↓ | 5.1(6m 分离上限规则) | 无规则 21.2(录制 4.8) | 从漂移 21.2m 拉回至接近录制水平 |
| 规则副作用核查 | Foot-skate (m/s) ↓ | 1.22(碰撞体+分离上限) | 无规则 1.14(录制 1.13) | 仅 +7%,规则干预的代价可控 |
局限与改进
作者承认三条局限,都源于显式渲染就绪状态这一设计承诺。其一,外观随视界漂移:姿态控制视频固定了几何、深度与铰接,但对外观不做任何承诺,外观决策全部落在观测模型自身记忆上,仅靠 chunk-relay 种子传播并按自回归量衰减;修复方向是每块重新提供的逐实体持久参考图。其二,状态覆盖不全:AI 伙伴与小怪在 RGB 视图中出现却无录制关节,观测模型在'目标部分未被条件解释'的样本上训练、学会自己补画,推理时表现为状态背后没有内容支撑的生成体;这在采集端可修。其三,观测模型训练用 GT 状态渲染的姿态视频、推理吃生成状态,存在分布偏移,靠泛化跨过,桥接消融(831 对 799)界定了其可观测影响。我的补充观察:动力学只覆盖 27 种怪物中的 1 种(词表 173),多怪物词表近不相交、扩展需重训两个阶段;控制演示全部是脚本注入,没有实时可玩集成与延迟测量;FVD 自助区间两列重叠,'零可测保真度损失'的结论强度有限;分离上限引入 7% 滑步副作用;地形扫描只覆盖角色走过的区域,未观测格子靠膨胀启发式填充。
独立分析的弱点
独立分析五个弱点。泛化窄:单怪物、单武器的 1v1 战斗,扩展到派对玩法(多猎人)要改状态布局并重训两阶段,论文自己承认不同怪物种类的骨架、骨长、运动模式差异使动画先验'仅在最宽松意义上'可迁移;改进方向是按物种条件化的模块化动画先验或词表分头。外观无锚点:每块仅由末帧种子传播,长 rollout 中皮肤/装备渐变无机制阻止;除作者建议的持久参考图外,可把装备/外观 id 纳入状态,使其同样接受规则约束。控制接口是研究级脚本注入而非引擎级实时输入,按键延迟与流式交互性未测;改进是接真实输入设备做端到端延迟剖析与可玩性评估。评估样本量小:12 个渲染窗口、48 段探针,bootstrap 区间宽(如 FVD16 831 的区间 [963,1209] 下界反而高于点估计,说明重采样偏置明显),改进是扩样并报告配对显著性检验。规则工程手工化:1.5m 爬升阈值、4cm/帧限速、6m 上限都是固定常数,对新地图或新行为可能失配;更系统的做法是学习可行性投影,或从引擎碰撞规则半自动导出约束集。
未来方向
作者提出的方向:把动力学扩展到完整多怪物词表(状态侧单怪物是当前最大边界);逐实体持久参考图修复外观漂移;渲染训练目标时扰动 GT 状态,让观测模型学会它将被要求渲染的姿态邻域,与可行性投影组合使用、且都不需要新数据;为 AI 伙伴与小怪录制关节,把'无状态内容'收进状态。基于成果可延伸的工作:把两阶段动力学换成 ARDY/Kimodo 等产品级动画模型(接口兼容、只是状态序列);把 token 覆写接口接到真实输入设备,做可玩 demo 与交互延迟测量;用学习式投影替代手工常数规则;把'规则在可执行处强制'的准则推广到其他结构化状态(语义体素、场景图);把状态层指标体系(米制根漂移、CFR、滑步、分离距离)发展成社区评估协议,缓解长时程世界模型只能靠 FVD 评估的困境;利用显式状态支持反事实分析——同一状态前缀换不同动作流,做可控的对比生成。
复现评估
复现基础较好。数据:基础语料 WildWorld 已公开发布(游戏录像、逐帧动作 id、逐实体状态),本文新增的扫描地形高度场承诺随代码一起发布;训练与评测代码、评估协议(指标实现、种子上下文、视界、控制注入脚本)、数据清单与预处理、所有模型和基线的训练配置都承诺开源。权重:观测模型骨干 Wan2.2-Fun-5B-Control 为 Apache 2.0(HuggingFace 可下载,含 umT5-xxl 与 CLIP 图像编码器),训练框架 VideoX-Fun 同为 Apache 2.0。算力:动力学两阶段仅 2.5M + 25M 参数,重头是 5B 扩散模型的控制条件微调,属单机多卡可承受规模。限制:素材来自《怪物猎人:荒野》(Capcom 版权),仅限非商业学术研究,商用路径受限;运动类结论需看项目页视频(alayalab.github.io/Marionette)才能恰当检查。总体难度:中等——桥接器完全确定性、状态布局在表 3 完整给出,主要门槛在扩散模型微调的算力与游戏录制数据的合规获取。
论文图表