← 返回 2026-07-17

从像素到状态:把交互式世界模型重新思考为游戏引擎 From Pixels to States: Rethinking Interactive World Models as Game Engines

Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li, Kaipeng Zhang 📅 2026-07-15 👍 34 2026-07-22 18:54
交互式世界模型 数据集 游戏引擎 综述调研 视频生成 黑神话悟空

以游戏引擎的动作-状态-观测循环为框架重审交互式世界模型,并发布90小时悟空数据集

前置知识

动作-状态-观测循环(Action-State-Observation Loop)

传统游戏引擎每帧的处理流程:先读取玩家输入动作 $a_t$,再依据游戏规则 $f_{\text{rules}}$ 把当前状态 $s_t$ 更新为下一状态 $s_{t+1}$(检查体力、冷却、boss位置与动画相位是否暴露破绽等),最后从更新后的状态渲染出观测 $o_t$。引擎并不直接产出像素,而是先维护显式状态变量(HP、stamina、cooldown、装备、动画相位等),再从状态渲染。这个循环是本文用来重新审视所有交互式世界模型的组织透镜。

整篇论文的框架都建立在这个循环之上,后续四个分析维度(玩家动作控制、游戏状态动力学、状态-观测持久性、实时交互生成)正是对这个循环四个环节的拆解。不理解这个循环就无法读懂论文的分类法。

扩散Transformer(Diffusion Transformer, DiT)

当前主流视频生成模型的骨干架构,由一个编码条件的语言模型与一个在潜空间合成视频的扩散Transformer耦合而成。按语言模型输出与DiT的交互方式可分为三类:语言模型外部冻结、通过cross-attention被每个DiT块读取(如Wan、Open-Sora);文本表示进入DiT的joint attention(MM-DiT、HunyuanVideo、CogVideoX);语言模型被整合进主干作为独立生成路径(统一语言损失与扩散或流目标,或极端地吸收进next-token预测)。本文讨论的所有交互式世界模型都构建在这些DiT骨干之上。

本文分析的实时交互生成维度(蒸馏、流式、系统级优化)几乎都围绕如何把DiT的多步去噪压缩到交互帧率,理解DiT是读懂维度四的前提。

世界模型(World Model)

学习环境在不同动作下如何演化的系统,通过构建环境内部表示来预测未来状态。在游戏语境下,世界模型接受玩家输入、驱动世界的底层演化、并把结果作为视觉观测交付。按状态存在形式可分为三类:状态与观测缠绕(直接帧预测,无独立状态)、压缩为学习的潜变量(latent dynamics,如Dreamer家族)、显式描述(符号或文本形式的状态,由LLM推理转移)。本文的核心论点是绝大多数现有世界模型把状态隐式化了,而这正是瓶颈所在。

本文用状态如何表示作为世界模型分类的核心轴,理解世界模型的三种状态范式才能跟上维度二(game state dynamics)的讨论。

潜在动作模型(Latent Action Model)

在没有动作标注的情况下,直接从无标注视频中学习动作空间的模型族(如LAT、Yume)。它不依赖外部键鼠信号,而是从视频自身的运动模式中提取离散或连续的潜在动作作为条件。优势是能利用海量互联网视频,原子控制(移动、开火)可从大规模监督中可靠学习;缺点是原始信号不足以确定意图——同一输入在不同游戏状态下可能表达不同意图,使组合操作(如含义超出单次按键的连招技能)更难学习。

这是动作作为马达信号族中的重要分支,也是本文在维度一(玩家动作控制)中讨论的代表方法之一,理解它能看清为什么作者最终主张语义事件表示。

流式与蒸馏(Streaming & Distillation)

把多步扩散压缩到实时帧率的两大技术族。蒸馏把多步双向教师蒸馏为少步因果学生(如CausVid用非对称分布匹配蒸馏,后续有因果教师初始化、流式感知蒸馏、强化学习refinement)。流式把生成重构为因果流,在递增噪声水平上联合去噪滚动窗口(rolling window),或跨块共享噪声水平实现流水线推理。系统级工作则在不改采样器的前提下降低wall-clock成本(全栈训练推理流水线、独立帧生成、硬件-算法协同设计)。

本文在维度四明确区分降低生成延迟与降低条件延迟两类,并指出前者已接近实时而后者仍是盲区。理解蒸馏与流式才能读懂这一关键判断。

研究动机

当前视频生成模型被视为下一代游戏引擎的有力候选,但存在几个根本性问题。首先,主流的状态与观测缠绕设计(如Open-Sora、Wan、GameNGen、WHAM)直接从最近观测窗口预测未来帧,世界规则只能被表达为像素相关性,难以保证空间与逻辑一致性——例如一次攻击究竟击杀还是仅造成伤害,取决于目标剩余血量这种非视觉原因,而latent state方法对此不可靠。其次,视频模型在长时段中无法保持一致性,场景一旦离开视野可能悄然改变;游戏却要求交互结果不可逆、状态在屏幕外继续演化,比如boss离开视野再回来时应处于其第二阶段形态。第三,实时交互存在两种延迟:控制延迟(输入到可见响应,应最小化以优化game feel)与结果延迟(动作到规则主导的结果,应准确,因为攻击含startup、active、recovery阶段,瞬时浮现反而错误),而现有方法把所有延迟当量缩减,未区分二者。第四,学习规则驱动的状态转移需要帧对齐的显式状态标注数据,而这类数据在WildWorld、EgoCS-400K等现有数据集中仍非常稀缺。

本文的目标是本文有两个具体目标。第一个目标是建立统一的分析框架:将交互式世界建模组织到游戏引擎从业者熟悉的动作-状态-观测循环(action-state-observation loop)这一透镜下,沿四个维度——玩家动作控制(player action control)、游戏状态动力学(game state dynamics)、状态-观测持久性(state-observation persistence)、实时交互生成(real-time interactive generation)——系统性地审视现有方法,把每个维度的代表性工作分组归类为若干family,逐一讨论其优势与权衡。第二个目标是直接解决状态感知方法受制的数据稀缺瓶颈:针对黑神话悟空(基于Unreal Engine的AAA动作角色扮演游戏)构建可扩展数据引擎,采集boss战场景的众包游戏视频,提供帧对齐的玩家原始键鼠动作、引擎导出的真实游戏状态、RGB帧与深度图,并把这些数值化动作与状态文本化为slot(槽位)与semantic(语义)双形式标注,作为下一代状态感知游戏世界模型的训练资源。

与已有工作不同的是,本文的独特切入角度是分析师视角加数据基础设施双管齐下。在框架层面,过去相关研究——相机控制视频生成、语言与实体级交互接口、记忆机制、蒸馏与流式技术——通常是各自独立推进的,它们对游戏世界建模的连接与综合意义并不清晰;本文不提出新模型或新算法,而是借用游戏引擎数十年行之有效的动作-状态-观测循环作为组织语言,对整个领域散点工作进行系统化重构,并明确点出真正的瓶颈集中在状态维度。在数据层面,已有数据集(如WildWorld、EgoCS-400K)虽提供部分状态标注,但规模、场景与对齐质量受限;本文聚焦boss战这一高密度交互场景,结合引擎仪表化与众包采集,提供90+小时、1280×720/30FPS的工业级数据,并通过slot加semantic双标注兼顾精度与语义。这种建立认知坐标系加提供训练原料的组合在文献中是独特的。

核心方法

整体思路分两部分。直觉上,作者认为视频生成模型作为下一代游戏引擎的承诺之所以尚未兑现,根本原因在于它们绕过了游戏引擎几十年来行之有效的核心机制:维护显式状态、按规则更新状态、从状态渲染观测,即状态转移 $s_{t+1} = f_{\text{rules}}(a_t, s_t)$ 与观测 $o_t = \text{Render}(s_t)$。技术路线上,作者把循环拆为四个正交维度:①player action control(玩家意图如何表示:几何轨迹、马达信号、语义事件);②game state dynamics(状态如何表示演化:与观测缠绕、压缩为潜在变量、显式描述);③state-observation persistence(长时段观测如何与状态一致:存储过去、估计当下);④real-time interactive generation(输入如何以交互速率转化为观测:降低生成延迟、降低条件延迟)。数据引擎采用ReShade加OBS双路录制叠加引擎侧JSON流,经时间戳对齐、异常过滤、双标注,输出覆盖90+小时、1280×720/30FPS的训练样本。

核心创新点是把游戏引擎的状态循环借作认知框架。这与已有综述和方法的本质区别在于:以往视频世界模型的研究把状态这个概念要么完全省略(直接帧预测,如GameNGen、WHAM),要么藏到学习的潜变量里(latent dynamics,如Dreamer家族),要么只在评估和数据阶段才出现;本文把状态抬升为一等公民,并明确指出整个领域真正的瓶颈恰恰在状态维度——决定累积游戏条件下的结果、在视野外保留后果、在规则定义的时刻浮现效果,这些困难能力都围绕游戏状态展开,而大多数模型把它隐式化了。第二个核心创新是Wukong数据集的slot加semantic双标注:slot caption把固定时间窗内的逐tick记录聚合并文本化为结构化动作状态槽,semantic caption则由Qwen3-VL-235B-A22B-Instruct生成自然语言描述,两者既能作为语言化状态转移的下一状态监督,也能作为生成模型的状态条件。

方法步骤详情

框架部分按四维度分类。维度一player action control三类:几何轨迹(MotionCtrl、CameraCtrl的Plücker射线嵌入)、马达信号(Oasis与Matrix-Game帧级键鼠向量、MineWorld动作token、潜在动作模型从无标注视频学动作空间)、语义事件(场景级、实体级per-agent、时间级per-chunk)。维度二game state dynamics三类:状态与观测缠绕(Open-Sora、Wan、GameNGen、DIAMOND、WHAM)、学习的潜变量(GameGAN、Dreamer lineage)、显式描述(LLM文本模拟器、WildWorld、AnimeGamer)。维度三persistence两类:存储过去(时间索引渐进压缩、空间索引视野重叠与surfel锚点)、估计当下(ActWorld、PERSIST、flow-equivariant)。维度四real-time两类:降低生成延迟(CausVid蒸馏、rolling window流式、全栈优化、硬件协同)、降低条件延迟(Yume-1.5事件切换、DreamX-World可组合指令)。数据引擎两阶段:①众包采集——引擎tick级JSON导出动作状态、ReShade shader分屏RGB加深度、OBS记录帧时间戳、统一配置工具链;②处理与标注——时间戳逐帧对齐、按boss战分段、丢帧卡顿整段丢弃、slot caption时间窗聚合文本化、semantic caption由Qwen3-VL-235B-A22B-Instruct从采样帧加动作状态记录生成。

技术新颖性

新颖性体现在三个方面。第一,组织视角新颖:第一次把分散在相机控制、语言接口、记忆、蒸馏等多条研究线的成果,统一映射到游戏引擎action-state-observation loop的四个维度,使读者能看清哪条线对应循环哪个环节、解决了什么、还差什么。第二,分类法新颖:每个维度不仅按技术族分组,还明确指出每族的代表性论文、优势与权衡——例如维度二明确点出latent state对非视觉原因驱动的视觉变化不可靠;又如维度四区分控制延迟应最小化对结果延迟应准确这一对反向需求,这种区分在以往工作中从未被系统提出。第三,数据新颖:把工业级UE游戏引擎仪表化与众包玩家采集结合,提供1280×720/30FPS、90+小时级别的帧对齐数据,配合slot加semantic双形式标注,第一次让语言化状态转移与状态条件生成两条路线都有可训练数据。这样新颖性是结构性的、框架级的,而非单点模型突破。

The dataset curation pipeline
Figure 2: The dataset curation pipeline

实验结果

作为综述加数据集论文,本文没有常规benchmark实验,核心发现由定性分析结论与数据集统计构成。第一项发现:现有方法在player action control(自然输入控制)与real-time interactive generation(接近实时帧率)两维度已较成熟,但在game state dynamics与state-observation persistence两维度存在根本短板——根据累积游戏条件决定结果、在视野外保留后果、在规则定义时刻浮现效果这些难能力都围绕游戏状态,而绝大多数模型把状态隐式化了。第二项发现:现有方法对延迟处理存在盲区——都把延迟当量缩减,却没区分控制延迟(应最小化,影响game feel)与结果延迟(应准确,因为攻击含startup、active、recovery阶段,瞬时浮现反而错误)。第三项发现是数据贡献:Wukong数据集超90小时、1280×720、30 FPS,含boss战长rollout;记录三类帧对齐真值——原始键鼠动作、引擎导出状态(位姿、动画、技能、HP、stamina、ATK、DEF、装备)、RGB帧与深度图;并附slot caption与Qwen3-VL-235B生成的semantic caption。

局限与改进

作者承认的局限:第一,框架本身是描述性的分析视角,不直接产出可量化的性能提升,论文没有给出用这个框架训练的模型在某指标上提升特定百分比的实验验证。第二,状态作为显式描述这一族在游戏里目前主要作为数据和评估使用,与生成循环的整合很大程度上尚未探索——本文指出了方向但未实现。第三,记忆更新面临高频率交互引起小变化、累积成大分歧、每一步都需要高效可靠的更新决策,对此原则性的grounding仍是开放问题。我自己的观察:数据集局限在单一游戏(黑神话悟空)的boss战场景,泛化到开放世界、解谜、策略类游戏的能力未验证;众包玩家水平参差虽带来多样性,但也可能引入大量低质量战斗样本;semantic caption依赖Qwen3-VL-235B-A22B-Instruct,标注本身存在模型偏差与幻觉风险;论文未给出数据集质量评估指标(如标注准确率、对齐误差)。

独立分析的弱点

弱点一:缺少定量验证。本文提出的四维度框架极具洞察力,但没有用它设计一个端到端模型并在标准benchmark上对比。改进方向:选定一个维度(如game state dynamics),构建显式状态条件生成模型,在Wukong数据集上训练,并在状态一致性指标(如状态预测准确率、后果保留时长)上对比latent-state基线。弱点二:数据集单一性。90+小时听上去可观,但都来自Wukong一款游戏的boss战,引擎、动画系统、状态空间高度同质。改进方向:扩展到多款UE与Unity游戏、多种玩法(开放世界探索、解谜、即时战略),并增加跨游戏迁移实验。弱点三:延迟二分过于简化。控制延迟对结果延迟的区分有价值,但实际游戏中存在大量中间情形(技能前摇可被打断、buff与debuff叠加时机),二元分类无法刻画。改进方向:引入延迟-精度权衡曲线作为评估维度,让模型在连续区间上选择何时浮现结果。弱点四:semantic caption可信度未评估。改进方向:人工抽样校验Qwen3-VL-235B生成的语义描述,报告准确率与幻觉率并提供置信度。

未来方向

作者明确提出的未来方向集中在三句话:将显式游戏状态整合进生成循环、把记忆更新建立在状态转移之上、将结果时机与游戏规则对齐——这三点正好对应分析中暴露的短板。基于本文成果可延伸的方向:第一,构建状态条件扩散世界模型——用slot caption作为DiT的额外条件通道,让生成时能读取HP、stamina、动画相位;第二,构建状态转移大模型——用semantic caption作为下一状态监督,训练一个LLM预测下一tick的状态文本,再驱动渲染;第三,建立交互式世界模型的标准化benchmark——本文的四维度框架天然适合作为评估维度设计,可定义每维度的可测量指标(控制延迟ms、状态一致性百分比、后果保留时长s);第四,把Wukong数据引擎开源化,吸引社区贡献更多游戏与玩法;第五,探索结果时机的规则对齐——把游戏动画曲线(startup、active、recovery帧)作为监督信号,训练模型在正确帧浮现结果。

复现评估

复现评估分两方面。框架部分(四维度分析)几乎完全可复现——所有引用论文都公开,分类法描述清晰,任何研究者都可按此框架重新组织文献;这部分的复现主要是文献综述工作,门槛低。数据引擎部分的复现性需要审慎评估:论文描述了技术栈(ReShade shader分屏、OBS时间戳日志、UE引擎JSON导出、众包工具链)和流程(时间对齐、异常过滤、双标注),但有几个关键信息缺失——是否开源代码与shader未明说、数据集是否公开发布未明说、Qwen3-VL-235B生成semantic caption的具体prompt未给出、众包采集的硬件配置与成本未量化、90+小时的具体条目数与每个boss战的时长分布未给出。算力方面,数据采集本身不需要大量GPU(玩家本地采集),但semantic caption用235B模型生成需要可观推理算力。综合判断:框架部分易复现、数据部分中等难度(需要UE工程能力与黑神话授权)、完全复现90+小时数据需数月协调与资金投入。