← 返回 2026-08-24

WorldMind:面向状态感知 NPC 行为的解耦游戏世界模型 WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin 📅 2026-08-18 👍 14 2026-08-29 18:30
LLM智能体 NPC行为 实时交互生成 游戏世界模型 视频扩散模型

首个把状态重建与 NPC 决策从视频生成中解耦的四层闭环游戏世界模型

前置知识

游戏世界模型(Game World Model)

一类用神经生成模型替代传统游戏引擎的系统:输入历史画面和玩家动作,直接生成后续游戏画面,如 Oasis、Genie、GameNGen、Matrix-Game。它们通常基于视频扩散模型或自回归 Transformer 学习动作条件下的视觉动力学,可在无引擎的情况下实时生成可玩的游戏世界。

本文的场景就是游戏世界模型:WorldMind 用 Wan 2.2 TI2V-5B 作为生成底座,并针对现有模型 NPC 行为与视频生成纠缠的问题提出解耦方案,不理解这个背景就无法理解其动机。

NPC 行为建模(隐式 vs 外部控制)

传统游戏中 NPC 用有限状态机、行为树或 LLM 智能体驱动,需要结构化状态和可执行动作接口。在视频世界模型里,NPC 行为要么隐式地随视频生成涌现(模型从训练数据里学出行为模式,不可控),要么由外部给定控制信号(如技能标签、自然语言指令)条件化生成,决策与游戏状态脱节。

本文的核心批判对象正是这两种范式:隐式和外部控制都没有把 NPC 决策锚定在演化的游戏状态上,WorldMind 的'状态感知'就是针对这一空缺提出的。

视频扩散模型与自回归蒸馏

视频扩散模型通过迭代去噪生成视频片段,但双向扩散太慢无法实时交互。蒸馏技术(如 Causal Forcing、DMD 分布匹配蒸馏)把多步双向模型压缩成少步因果自回归生成器:每步只依赖过去帧,几步前向即可出图,实现实时流式生成。

WorldMind 的 L4 生成层基于 Wan 2.2 TI2V-5B,并按三阶段 Causal Forcing 流水线(AR 训练→CD 初始化→非对称 DMD)蒸馏到约 20 FPS 才能支撑实时闭环交互。

GRU 与时序特征聚合

GRU(门控循环单元)是一种轻量循环神经网络,通过更新门和重置门控制历史信息的保留与遗忘,适合对短时序特征序列做聚合。本文用单层 GRU 把多帧卷积特征聚合成时序状态表示,用于回归距离、角度等几何量。

理解层的几何分支用 ResNet-18 编码 3 帧因果 RGB 帧(偏移 [-4,-1,0]),再用单层 GRU 聚合后预测 boss 与玩家的距离、相对角度、朝向,这是紧凑状态的关键来源。

研究动机

现有游戏世界模型(Genie、Oasis、GameNGen、Matrix-Game 2.0 等)已经能生成视觉连贯、动作可控的游戏视频,但 NPC 行为的处理方式存在根本缺陷:要么隐式纠缠在视频生成中——NPC 行为作为生成动力学的副产品从训练数据的行为模式中涌现(如 COMBAT 从单玩家数据隐式学习),无法显式控制;要么作为外部控制信号显式给定——NPC 动作必须在世界模型之外被预先指定(如 ReactiveGWM 用高层战术标签条件化生成)。这两种表述都没有把 NPC 的响应显式锚定在持续演化的游戏状态上。这个问题在 boss 战中尤其严重:规划一个合适的 boss 行动需要综合考虑快速变化的状态,包括 boss 与玩家的距离、相对角度、boss 的先前列技、每技能的冷却可用性。把状态推断、NPC 决策推理和视觉渲染这三个表示形式和时间尺度都不相同的功能塞进单个生成过程,会显著限制 NPC 行为的响应性。

本文的目标是本文的目标是构建第一个解耦的、状态感知的 NPC 行为游戏世界模型:让 NPC 的行动成为一个基于紧凑状态(compact state)的显式决策,而非视频生成的副产品或外部输入。具体而言,系统要从生成的游戏帧中恢复决策相关的状态信息(几何关系、技能历史与冷却),用语言模型结合技能机制进行短时域战术规划,把规划结果转换成时间对齐的生成条件,再用视频扩散模型实时合成视觉结果,生成的新帧又回流到状态重建,形成闭环。整个系统需支持闭环实时交互(约 20 FPS),同时兼容底层直接操控(Direct Control)和高层导演式指令(Director Control)两种玩家介入方式。

与已有工作不同的是,本文的独特切入角度是把交互世界建模按功能分解为四层——理解层(现在发生了什么)、决策层(NPC 该做什么)、控制层(怎么把决策变成生成条件)、生成层(怎么呈现画面)——再用闭环反馈把它们重新耦合:生成帧回流到理解层,已执行动作更新技能历史。与以往工作相比有三个鲜明差异:一是 NPC 动作通过显式的紧凑状态接口产生,决策与生成彻底解耦;二是决策层刻意使用未微调的通用语言模型,靠技能机制的文本描述做推理而不是模仿数据集动作分布;三是配套构建了带引擎内部状态标注的 BOSS-140K 数据集和状态条件化的自动化采集 agent,解决了状态依赖的 NPC 决策缺乏监督数据的难题。

核心方法

直觉上,WorldMind 让 NPC 像真人玩家一样行动:先看清局面,再决定出招,最后把动作呈现为画面,三者各司其职又循环往复。技术上系统分为四层。L1 理解层从最近 3 帧生成的 RGB 帧中重建几何变量(距离、相对角度、朝向),并从 boss 动作历史中确定性地导出技能历史变量(上一技能、距上次使用的时间、冷却状态),经变量选择后组成紧凑状态 $s_t = (id_b, e^{skill}_t, e^{geo}_t)$。L2 决策层用通用语言模型 Gemma-4-E2B-it(刻意不微调)在文本形式的紧凑状态与各技能机制描述上推理,输出 boss 计划 $p^b_t$,其中每个动作含技能与移动方向,执行时长 $\delta_t = D_{dur}(\ell_t)$ 由查表确定而非语言模型预测,并有确定性冷却检查过滤无法合法释放的动作。L3 控制层把完整动作按执行时长展开成逐时间槽对齐的 '[ACTION] while [MOVEMENT]' 自然语言提示序列。L4 生成层以 Wan 2.2 TI2V-5B 为底座,在 BOSS-140K 上以 batch size 16 训练 70k 步,再经三阶段 Causal Forcing 蒸馏成约 20 FPS 的因果自回归生成器。生成帧回流 L1 闭环,滚动时域策略只提交计划的第一个动作。

核心创新是给 NPC 行为一个显式的、以状态为条件的决策接口,与已有方法形成本质区别:COMBAT 让 NPC 行为隐式地藏在视频生成里,ReactiveGWM 把高层战术标签作为外部条件喂给生成器,两者中动作选择要么与生成耦合要么与状态脱钩;WorldMind 则先从生成观测重建紧凑状态、再显式规划 NPC 动作、最后单独渲染其视觉后果。三个关键设计支撑这一点:其一,紧凑状态只保留决策相关的技能历史与几何变量,消融证明它对 L2 的机制推理已足够;其二,L2 不做微调,避免过拟合 BOSS-140K 的动作分布,靠技能机制的自然语言描述实现可泛化的战术推理,交换描述实验证明决策跟随机制而非技能名;其三,'[ACTION] while [MOVEMENT]' 模板把技能释放与移动两个并发控制维度分开表达,保持纯文本接口的同时提供更细的可控性,并统一支持 Direct 与 Director 两种控制模式。

方法步骤详情

第一步,状态构建:L1 几何分支取偏移为 [-4,-1,0] 的 3 帧因果 RGB 帧,用预训练 ResNet-18 逐帧编码、单层 GRU 聚合,在 boss 身份嵌入条件下由预测头输出连续与离散化的距离、相对角度、朝向等战术属性,训练时用引擎日志做监督、推理时只用生成帧;技能分支由 Action Logger 记录每次 boss 技能与时间戳,Skill Tracker 确定性导出上一技能、time_since 与冷却可用性。两分支候选变量经选择分析后保留最有信息量的部分,组成紧凑状态 $s_t$。第二步,决策规划:L2 把 $s_t$ 和 boss 技能集 $S_t$ 以文本形式连同机制描述、冷却信息交给 Gemma-4-E2B-it,Direct Control 下输出 $p^b_t, r_t = \mathrm{LLM}(s_t, S_t)$,Director Control 下额外以高层指令 $d$ 为条件同时输出玩家计划 $p^p_t$;确定性检查在 Skill Tracker 副本上模拟冷却并剔除非法动作,采用滚动时域只提交第一个动作,其余作暂定。第三步,条件转换:L3 按每技能固定时长把动作短语复制展开到对应数量的 L4 时间槽,每槽与玩家短语配对成单条组合提示,形成逐潜在帧的对齐提示序列。Direct Control 下键鼠事件映射为结构化玩家短语,Director Control 下整段交互由指令描述。第四步,视觉合成:L4 的 Wan 2.2 TI2V-5B 端到端微调(batch 16、70k 步),按 Stage1 因果 AR 扩散教师训练、Stage2 因果一致性蒸馏初始化、Stage3 非对称 DMD 三阶段蒸馏成少步因果生成器,约 20 FPS 实时出帧并反馈 L1 开始下一轮循环。

技术新颖性

技术新颖性体现在四个层面。架构层面:据作者所知这是第一个把状态重建与 NPC 决策从视觉生成中解耦的游戏世界模型,四层结构使 NPC 动作成为显式决策变量,同时保留统一的闭环实时系统,而非松散拼接的流水线。接口层面:紧凑状态 $s_t = (id_b, e^{skill}_t, e^{geo}_t)$ 是一个刻意压缩的中间表示,技能分支完全确定性、推理时不需要引擎状态,几何分支只用生成帧,保证系统可在生成的世界内自洽运转。决策层面:不微调 LLM 是反直觉但关键的选择——推理能力来自对机制文本描述的组合推理而非数据分布拟合,No-desc/Swap 干预实验(移除描述后首技能变化率 52%-90%,交换描述后 Follow 率 69%-79% 均高于 Stay 率 13%-20%)直接验证了机制接地。数据层面:BOSS-140K 提供 144,631 个片段、超 200 小时、3 款游戏 14 个 boss 的帧对齐玩家控制、boss 技能、引擎内部变量与字幕标注,并用状态条件化的游戏 agent 自动采集以覆盖稀有状态依赖交互,这在此前数据集(只有视频+控制)中是缺失的监督维度。

Automated construction of BOSS-140K
Figure 2: Automated construction of BOSS-140K
Overview of the WorldMind framework
Figure 3: Overview of the WorldMind framework

实验结果

论文围绕四个问题展开实验。Q1 紧凑状态重建(Table 1):L1 在三款游戏上都取得低误差——Game A 距离 MAE 0.312(相对误差 2.9%)、角度 MAE 12.66°、距离/角度分箱准确率 0.807/0.702;Hollow Knight 为 0.444、6.7%、2.96°、0.772/0.996;Isaac 为 8.187、8.4%、29.38°、0.904/0.839,说明跨视角、跨空间尺度的几何重建可靠。Q2 机制接地推理(Table 2):移除技能描述后首技能变化率 No-desc Δ 在 Game A/Hollow Knight/Isaac 分别为 52.0/90.0/55.4,交换描述后 Swap Δ 为 83.5/87.0/80.2,且模型选择携带原机制选项的 Follow 率(69.0/73.5/79.3)显著高于保留原匿名名的 Stay 率(16.5/13.0/19.8),证明决策真正跟随技能机制而非技能名称。Q3 全系统闭环(Table 3):在 Game A 上 1 分钟 rollout、每条含 12 个决策点,GPT-5.5 与 Gemini-3.1-pro 双判官各评 3 次取均值——WorldMind 对隐式基线 Wan w/o NPC Control 的偏好率为 71.5%/69.8%,对外部控制基线 Wan w/ NPC Control 为 70.9%/70.3%,即约 70% 成对比较中胜出;动作有效率 74.0%/77.6%(两基线均约 63.6%/70.6%),整段序列契合度 3.85/4.00(满分 5,基线约 3.17-3.28),在动作与长时序两个层面均占优。Q4 跨游戏泛化:在公开的 WildWorld 数据集上决策层表现出部分跨游戏泛化且保持状态敏感性,但紧凑状态重建需要在目标域上适配。消融(Table 4/5):任务训练的 L1 编码器全面优于冻结的 DINOv2-S 与 VideoMAE-B(Game A 距离 MAE 0.312 对 0.722/0.750),向文本状态叠加渲染帧无一致收益(Δ 为 +0.5/-6.5/-8.2),间接证明紧凑文本状态已足够支撑机制接地决策。

Compact-state reconstruction
Table 1: Compact-state reconstruction
Closed-loop NPC behavior evaluation
Table 3: Closed-loop NPC behavior evaluation
Visual encoder ablation
Table 4: Visual encoder ablation
Qualitative examples of boss behavior grounded in the compact state
Figure 4: Qualitative examples of boss behavior grounded in the compact state
查看结构化数据
任务指标本文基线提升
紧凑状态重建(Game A) 距离 MAE(引擎单位,越低越好) 0.312(相对误差 2.9%) DINOv2-S 0.722 / VideoMAE-B 0.750(冻结编码器) 误差降低约 57%-58%
闭环 NPC 行为偏好(Game A,1 分钟 rollout,12 决策点) Ours Pref(LLM 判官成对偏好率,越高越好) 71.5%(GPT-5.5)/ 69.8%(Gemini-3.1-pro) Wan w/o NPC Control(隐式)与 Wan w/ NPC Control(外部控制) 对两类基线均在约 70% 成对比较中胜出
闭环动作有效性(Game A) Action Valid(单步决策被判有效的百分比) 74.0%(GPT-5.5)/ 77.6%(Gemini-3.1-pro) 隐式/外部基线约 63.6%(GPT-5.5)、70.6%/70.9%(Gemini-3.1-pro) GPT-5.5 下领先约 10 个百分点
机制接地技能选择(三游戏) Follow 率(交换描述后选择携带原机制选项的比例) 69.0% / 73.5% / 79.3%(Game A / Hollow Knight / Isaac) Stay 率(保留原匿名选项)16.5% / 13.0% / 19.8% Follow 显著高于 Stay,证明决策跟随机制而非技能名
长时序战术连贯性(Game A) Sequence Fit(整段 rollout 契合度,0-5 分) 3.85(GPT-5.5)/ 4.00(Gemini-3.1-pro) 两基线 3.17-3.28(GPT-5.5)、3.20/3.17(Gemini-3.1-pro) 领先约 0.6-0.8 分

局限与改进

作者层面承认的局限:全系统评估集中在 Game A(帧被模糊保密),Hollow Knight 和 Isaac 只用于 L1/L2 层面评估;跨游戏泛化有限——WildWorld 上决策层可部分迁移,但紧凑状态重建必须做目标域适配;判官评估依赖 GPT-5.5 和 Gemini-3.1-pro 的主观偏好,虽各评 3 次取均值降噪,仍存在 LLM 判官偏差;所有学习组件只以固定 seed 0 训练一次,报告的数字不带种子方差。我自己的观察:其一,Isaac 的角度 MAE 高达 29.38°、距离 MAE 8.187,几何分支在俯视 2D 视角下明显吃力,而闭环中 L1 只能看到 L4 生成的帧,几何预测误差会在多轮循环中累积;其二,L2 收到的是冷却就绪的技能菜单做干预实验,真实闭环中推理延迟(LLM 调用)与 20 FPS 生成如何严格同步文中未充分展开;其三,紧凑状态的变量选择基于离线分析手工筛定,换游戏需要重做这一步,泛化成本被低估;其四,覆盖仅限 2D/2.5D 游戏,3D 场景下几何变量的定义与预测难度会完全不同。

独立分析的弱点

第一个弱点是闭环误差累积:几何分支推理时只能依赖 L4 生成帧,若生成帧出现伪影或实体错位,距离/角度预测会漂移,进而导致 L2 做出错误战术决策,形成雪球效应。改进方向是给几何预测加不确定性估计,让 L2 在置信度低时退回保守策略,或引入轻量循环一致性校验。第二个弱点是评估口径:核心卖点'状态感知响应性'主要由 LLM 判官的主观偏好衡量,缺少客观指标(如玩家血量变化、boss 攻击命中率、应对玩家闪避的反应延迟)来交叉验证。改进方向是设计基于引擎规则的战术评分或让真人玩家做盲测对战。第三个弱点是系统延迟结构未量化:LLM 推理、确定性检查、提示构造与 20 FPS 生成之间的调度细节(如决策点是否每个生成段一次)决定实际交互手感,但论文只报了生成帧率。改进方向是给出端到端延迟分解与决策频率消融。第四个弱点是数据与状态接口强绑定:紧凑状态变量(距离、角度、冷却等)是针对 boss 战手工设计的,迁移到 RPG、即时战略等多实体场景需要重新设计状态空间与机制描述库。改进方向是学习式或可配置的状态 schema。

未来方向

作者方向:将四层框架推广到更多游戏类型与 3D 场景,在 WildWorld 等更大规模数据上解决紧凑状态重建的跨域适配;扩展 Director Control 的指令空间,让高层叙事指令驱动更复杂的多实体编排;扩充 BOSS-140K 覆盖面。基于其成果可延伸的方向:一是把紧凑状态接口与强化学习结合,用世界模型内生奖励训练更强的决策策略,替代纯 LLM 推理并做延迟优化;二是多 NPC 场景,将单 boss 的 $s_t$ 扩展为实体图状态,用图神经网络或多智能体 LLM 协商决策;三是利用机制文本描述的可组合性,实现玩家自建技能的零样本泛化——新技能只需一段文字描述即可被决策层理解;四是把 L1 理解层与视频生成联合训练(目前几何分支只受引擎日志监督),用可微状态预测辅助生成一致性;五是反向应用——用训练好的 WorldMind 作为 boss 设计师工具,自动生成并平衡化 boss 战斗脚本。

复现评估

复现难度评估为高。有利条件:论文细节披露充分——底座为公开的 Wan 2.2 TI2V-5B,训练配置明确(batch 16、70k 步、三阶段 Causal Forcing 蒸馏、固定 seed 0),L1 结构简单(ResNet-18 + 单层 GRU,3 帧输入偏移 [-4,-1,0]),L2 用 Gemma-4-E2B-it 且不微调,决策与控制逻辑是确定性的,项目页 https://teawhite.cn/worldmind_projectpage/ 提供了入口。不利条件:BOSS-140K 依赖游戏引擎内部状态 API 采集,Game A 是未公开的商业游戏且帧被模糊处理,Hollow Knight 与 The Binding of Isaac 虽为可购买游戏但自动化采集需要逆向引擎接口;论文未明确承诺数据集与代码开源;算力上 5B 视频扩散模型的 70k 步微调加三阶段蒸馏需要多卡 A100/H100 级别资源;L3 的键鼠输入映射、技能机制描述模板、变量选择分析均需针对每款游戏人工适配。因此,第三方若要完整复现,最现实的路径是先用 Isaac 等可自动化采集的单一游戏复刻小规模数据集,验证 L1/L2,再考虑全系统闭环。