StatePlay:面向机制一致生成的状态感知游戏世界模型 StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
联合预测游戏内部状态与视觉帧,让世界模型遵守血量/技能条等规则
前置知识
游戏世界模型(Game World Model)
游戏世界模型是一类以玩家动作(如移动、攻击)为条件、预测未来游戏画面与交互环境的生成模型,本质上是把视频生成扩展到动作可控、闭环可交互的场景。代表作 Genie 证明了从无标注视频中学习动作可控动力学即可生成可玩环境,后续 ReactiveGWM、Matrix-Game 3.0、HY-World 1.5 等进一步走向更强交互、更长时序一致性。
本文正是把'游戏世界模型'这一范式作为研究起点,并指出它只关注像素级生成而忽略了规则机制这一根本缺陷,理解该范式才能理解 StatePlay 要补的'另一半'。
流匹配(Flow Matching)
流匹配是一种用于训练扩散式生成模型的损失形式:在干净的潜变量 $x_0$ 上加高斯噪声构造线性插值路径 $x_t=(1-t)x_0+t\epsilon_v$,让网络学习速度场 $v_\theta$ 去拟合真实速度向量 $(\epsilon_v - x_0)$,损失为 $\mathcal{L}=\mathbb{E}\,[\|v_\theta(x_t,t)-(\epsilon_v-x_0)\|_2^2]$。它是 Wan 系视频扩散模型采用的训练目标。
StatePlay 的视觉分支沿用流匹配,而关键创新之一是论证流匹配并不适合离散、规则驱动的状态变量,并改用回归损失,因此必须先理解流匹配才能理解作者的损失设计取舍。
混合专家式 Transformer(Mixture-of-Transformers, MoT)
MoT 是一种为不同模态保留各自专家分支(独立的自注意力与 FFN),同时通过共享的联合注意力(Joint Attention)进行跨模态信息交换的结构。它区别于把所有 token 拼接进同一个骨干网络的'共享式'(Shared)结构,能在保留模态专长的情况下实现交互。
StatePlay 的整个架构就是 MoT 思路:一条 0.76B 状态分支 + 一条 5B 视觉分支,再经联合注意力耦合。理解 MoT 与共享式的差异,是理解第 4.4 节耦合方式消融实验(17.6% 提升来源)的前提。
世界动作模型(World Action Model, WAM)
WAM 由 Ye 等(2026)与 Kim 等(2026)提出,主张同时建模视觉帧与连续动作,让模型既'看世界'又'懂动作',常被视为零样本策略的基础范式。它启发了把额外模态显式纳入世界模型的建模思路。
StatePlay 明确以 WAM 为灵感,把'动作'换成'内部状态'作为新模态加入,因此 WAM 提供了理解作者扩展思路的直接技术脉络。
游戏机制与状态变量(Game Mechanics & State Variables)
游戏机制指由内部状态变量驱动的、决定合法动作与画面演化的规则。以格斗游戏为例,状态变量包括游戏计时器、双方血量(HP)、技能条(Skill Meter):普通攻击只削减血量并增加技能条,必杀技(Super Art)只有在技能条满格时才能释放并释放后清零,任意一方血量归零则本回合结束。
整个论文的目标就是让生成模型遵守这套机制,StatePlay 用这些状态变量做监督并引导帧生成,不熟悉机制概念就无法理解为什么'像素级生成'会违反规则。
研究动机
现有游戏世界模型(如 ReactiveGWM、Matrix-Game 3.0、HY-World 1.5、LingBot-World)把游戏生成简化为像素空间的预测任务,只关注视觉逼真度与动作可控性,却忽视了由内部状态变量驱动的游戏规则。后果是:模型可以画出'看起来对'的对战,却不断违反底层机制——例如 Fig. 1 中红框所示,角色在血量已经为 0 时仍继续攻击,或技能条未满就触发必杀技。作者在零-shot 评测中量化了这种崩溃:即使是表现最好的 ReactiveGWM,其机制保真度在 Gemini-3.1-Pro 评测下也只有 48.0%,在 GPT-5.5 下仅 43.3%,远低于 50%,说明现有方法无法可靠地'按规则玩游戏'。问题根源在于:玩家动作往往直接反映在像素变化上,可以被视觉监督学到,但血量递减、技能条充能、回合终止这些状态动力学无法仅从画面可靠推断,而公开数据集普遍只有帧+动作、缺少显式状态标注,导致模型无据可学。
本文的目标是本文的目标是构建第一个'状态感知'的游戏世界模型 StatePlay,使其在生成视觉帧的同时显式预测游戏内部状态(计时器、双方血量、双方技能条),并让预测出的状态反过来约束帧生成,从而产出机制一致(mechanics-consistent)的可玩 rollout。具体地,作者希望同时达到四点:(1) 状态预测足够精确,使血量/技能条/计时器的归一化 L1 误差足够小;(2) 在最佳基线之上显著提升机制保真度;(3) 不牺牲视觉质量与动作可控性;(4) 提供一套含显式状态标注的数据与评测协议,使'状态感知'这一研究维度可被系统研究。
与已有工作不同的是,StatePlay 的独特切入角度是把'内部状态'从被忽略的隐含因素提升为与视觉并列的一等模态,并从数据与模型两个层面同时补齐。数据层面,作者指出公开数据集缺少同步的'状态–帧–动作'三元组,因此自建基于《街头霸王3》(SF3)的 10,000 段 5 秒、带状态标注的均衡数据集,并按'胜利/失败/必杀成功/必杀失败/普通'五类机制场景做了 40% 关键案例 + 60% 普通案例的均衡。模型层面,不同于 WAM 把动作当作额外模态,StatePlay 把'状态'当作额外模态,并用 MoT 式双分支保留模态专长;损失层面,针对状态变量'低维、规则驱动、时序结构化'的特点,用 Smooth L1 回归取代流匹配。这种'数据+架构+损失'三位一体的设计,是它与同时期 WildWorld、From Pixels to States 等只提供数据集、未说明如何把状态预测用于改善机制保真度的工作的根本区别。
核心方法
整体直觉是:'规则藏在状态里,状态藏在帧里,二者必须相互约束'。StatePlay 同时输出状态序列(计时器、HP、技能条)与视频帧,两路通过共享注意力彼此交互,让预测的状态引导帧生成、又让生成的画面反过来校正预测状态。技术路线上,以 Wan2.2-TI2V-5B(5B)作为视觉主干,附加 0.76B 轻量状态分支,构成 5.759B 总参数的 MoT 式骨干。状态 $s_0$ 与视频潜变量 $x_0$ 训练时都加噪:$s_t=(1-t)s_0+t\epsilon_s$、$x_t=(1-t)x_0+t\epsilon_v$,分别经各自编码器与自注意力得状态表示 $H_s\in\mathbb{R}^{B\times L_s\times C}$ 与视觉表示 $H_v\in\mathbb{R}^{B\times L_v\times C}$($C=3072$、$L_v=9750$、$f=25$ 潜帧),再经联合注意力双向交换信息。动作嵌入 $A'\in\mathbb{R}^{B\times f\times C}$ 在 token 嵌入后立即注入两分支,使玩家动作同时调制视觉生成与状态预测。
核心创新点有三处,且每一处都直接挑战了既有做法的本质。第一,把'状态预测'从隐式变为显式:以往世界模型靠像素监督隐式学规则,StatePlay 把血量/技能条/计时器作为显式监督目标,使模型'知道'何时该结束、何时能放必杀。第二,MoT 双分支而非共享骨干:消融显示 MoT 在机制保真度上比共享式高 17.6%,因为视觉(高维像素细节)与状态(低维、规则敏感的时序量)本属不同模态,强行塞进同一潜空间会互相干扰。第三,状态损失用回归而非流匹配:作者论证状态变量是低维、规则约束、结构化的(如 HP 攻击后递减、技能条充能后必杀时清零),流匹配对其施加高斯扰动并学传输向量场是'杀鸡用牛刀'且引入不必要随机扰动;改用 Smooth L1 回归在状态对齐上提升 12.1%、机制保真度提升 21.6%。这三点共同构成 StatePlay 区别于'像素级世界模型'与'WAM 式动作建模'的本质差异。
方法步骤详情
方法分四步。第一步建数据集:用 Stable Retro 在 SF3 录制对局,从内存提取 5 个状态变量(计时器、双方 HP、技能条),动作 11 维(4 移动+6 普攻+1 必杀),按 5 秒/20 FPS 切片;用 Gemini-3.1-Pro 与状态联合标注五类场景,得 10,000 段均衡样本(关键案例每类 1,000 共 40%、普通 6,000 占 60%)。第二步双分支输入:状态 $s_0$ 加噪 $s_t=(1-t)s_0+t\epsilon_s$ 经 $E_s$、自注意力得 $H_s$;视频 VAE 编码 $x_0$ 加噪 $x_t$ 经自注意力与文本(UMT5-XXL)交叉注意力得 $H_v$($C=3072$)。第三步耦合:动作嵌入注入两分支,联合注意力 $H'_v=H_v+\mathrm{MHA}(H_v,H_s,H_s)$、$H'_s=H_s+\mathrm{MHA}(H_s,H_v,H_v)$ 双向交互,block 重复 $N=30$ 次。第四步训练:视觉流匹配 $\mathcal{L}_{\text{video}}=\mathbb{E}[\|v_\theta(x_t,t)-(\epsilon_v-x_0)\|_2^2]$、状态回归 $\text{SmoothL1}(D_s(H'_s),s_0)$,$\lambda=1$,batch=4、lr $5\times 10^{-5}$、40,000 步、480×832。
技术新颖性
技术新颖性体现在'架构+损失+数据'三处协同创新,且都被消融证明有效。架构上,StatePlay 是首个状态感知的游戏世界模型,其 MoT 双分支让 0.76B 的轻量状态模块可即插即用地加到任意 Wan 类游戏世界模型上(作者强调'可随时集成进不同模型')。损失上,作者首次明确指出'流匹配对低维规则变量的不适配性',并以回归损失替代,这是对 WAM 把流匹配直接搬到所有模态这一默认假设的有力反驳。数据上,SF3 数据集是少数带同步状态标注的公开可用基准,并配套一套四维评测协议(视觉质量 SSIM/LPIPS、动作控制 Move-Acc/Att-Acc、状态对齐归一化 L1、机制保真度 Gemini/GPT 双判官),填补了'如何衡量游戏世界模型是否真的遵守规则'这一方法论空白。与同期 WildWorld、From Pixels to States 相比,StatePlay 不止提供数据,更回答了'状态信息如何被纳入并真正提升机制保真度'这一开放问题。
实验结果
核心发现逐项拆解。状态预测:100 段样本状态对齐 0.947(关键变量平均归一化 L1<0.06)。机制保真度:三次运行 Gemini-3.1-Pro 达 82.3%±0.5、GPT-5.5 达 78.3%±0.5,相对最佳基线 ReactiveGWM(63.7%±2.1/59.7%±0.9)均提升 18.6 个百分点(约 +29% 相对),领先 Matrix-Game 3.0(48.7/58.3)、HY-World 1.5(41.7/38.3)。视觉与动作未牺牲:SSIM 0.378、LPIPS 0.424 略优于 ReactiveGWM(0.376/0.439),Move-Acc 92.5%、Att-Acc 95.0% 与之接近。消融(Table 2):MoT 比共享式机制高 17.6 个百分点;回归比流匹配状态对齐高 12.1%、机制高 21.6%。Table 5 显示状态输入加噪(82.3/78.3)优于广播(78.3/76.0)。定性(Fig. 4/7):ReactiveGWM 技能条满也不触发必杀、血量归零仍战斗,StatePlay 正确触发必杀清零技能条并显示 YOU WIN/LOSE。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 状态对齐(归一化 L1 距离) | State Alignment ↑ | 0.947 | ReactiveGWM 无显式状态(不适用) | 首次为游戏世界模型提供显式状态预测基准 |
| 机制保真度(Gemini-3.1-Pro 判官) | Mechanics Fidelity ↑ (n=3) | 82.3%±0.5 | ReactiveGWM 63.7%±2.1 | +18.6 个百分点(约 +29% 相对提升) |
| 机制保真度(GPT-5.5 判官) | Mechanics Fidelity ↑ (n=3) | 78.3%±0.5 | ReactiveGWM 59.7%±0.9 | +18.6 个百分点 |
| 视觉质量 | SSIM ↑ / LPIPS ↓ | 0.378 / 0.424 | ReactiveGWM 0.376 / 0.439 | 略优且未因状态建模而退化 |
| 动作控制 | Move-Acc ↑ / Att-Acc ↑ | 92.5% / 95.0% | ReactiveGWM 95.0% / 100.0% | 保持接近的可控性 |
| 耦合方式消融 | Mechanics Fidelity (Gemini) ↑ | MoT 82.3% | Shared 64.7% | +17.6 个百分点 |
| 状态损失消融 | State Alignment / Mechanics ↑ | 回归 0.947 / 82.3% | 流匹配 0.845 / 60.7% | 状态对齐 +12.1%、机制 +21.6% |
局限与改进
作者承认三类局限。第一,像素级指示器(血条、技能条图标)仍偶尔出现不一致,即状态预测正确但画面里的血条画错了。第二,当多个机制事件同时发生(例如必杀技恰好与本回合结束重叠)时,视觉生成质量会下降。第三,由于带同步'状态–帧–动作'的公开数据集稀缺,评测仅限于《街头霸王3》这一款格斗游戏,跨游戏类型的泛化尚未验证;作者明确呼吁社区构建更多带状态标注的数据集。我自己的额外观察包括:(1) 所有基线在 StatePlay 自建的数据集与评测协议上被评测,评测协议本身依赖 Gemini-3.1-Pro 与 GPT-5.5 作为视觉判官,存在判官偏置与提示敏感性问题,虽然双判官交叉印证部分缓解,但 78%~82% 的绝对上限仍可能受判官能力制约;(2) 动作控制略低于 ReactiveGWM(92.5 vs 95.0),说明双分支在动作调制上略有稀释;(3) 仅 100 个测试样本、评测维度偏人工判官,统计鲁棒性有限;(4) 状态变量仅 5 个、动作空间仅 11 维,状态空间复杂度低,回归损失的优势是否能推广到高维连续状态(如开放世界 RPG 的物品、任务进度)尚不清楚。
独立分析的弱点
其一,'画对状态 vs 画对像素'脱节:即便状态预测正确,血条/技能条图标仍可能画错,说明双分支在像素细节层耦合不够强,改进方向是 ControlNet 式稠密条件注入或显式 HUD 渲染约束把状态值绘制为像素提示回流监督。其二,机制保真度依赖 Gemini/GPT 判官,Gemini 82.3% 与 GPT 78.3% 的差距暴露评测不稳定,改进方向是用确定性的游戏引擎或程序化规则校验器替代 LLM 判官,尤其在胜负等可程序化判定场景。其三,泛化范围窄:仅 SF3、5 个状态变量、11 维动作,对高维状态(FPS 弹药、RTS 资源)或连续动作(赛车油门)是否最优未知,改进方向是设计分层/分类型状态损失(离散事件分类、连续量回归)。其四,动作控制略降(Move-Acc 92.5 vs 95.0),提示双分支稀释动作条件,改进方向是把动作嵌入更早更密集注入视觉分支或加动作对齐损失。
未来方向
作者明确提出的方向是:构建覆盖更广游戏类型、更大规模、带显式状态标注的数据集,使状态感知世界模型能跨多样规则系统扩展与泛化。基于本文成果可延伸的方向包括:(1) 把 StatePlay 的 MoT 状态分支当作通用插件,迁移到 FPS(弹药/血包)、赛车(氮气/速度)、RTS(资源/建造)等状态语义不同的游戏,验证回归损失与 MoT 耦合的普适性;(2) 将状态预测从'回合制'扩展到'长程任务',引入任务进度、目标状态等更高层语义状态,结合 Matrix-Game 3.0 的长程记忆与 LYRA 2.0 的可探索 3D 世界,做开放世界状态感知生成;(3) 把状态作为强化学习/规划模块的可微接口,让 Agent 直接读取 StatePlay 预测的状态做决策,形成'生成+决策'闭环;(4) 探索状态驱动的可控生成,例如通过显式设置'血量=0'或'技能条满'来强制生成对应机制事件,做机制可控的剧情/关卡生成;(5) 用程序化游戏引擎作为 ground-truth 判官,构造更稳健、可重复的机制保真度基准。
复现评估
复现难度中等偏高,要素披露充分。模型:基于公开 Wan2.2-TI2V-5B、Wan2.2 VAE、UMT5-XXL,状态分支仅 0.76B(占 5.759B 的 13%),超参完整($N=30$、$L_v=9750$、$f=25$、$C=3072$、$K=11$、$\lambda=1$、batch=4、lr $5\times 10^{-5}$、40,000 步、480×832)。数据:基于公开 Stable Retro 采集 SF3,标注规则与提示(Fig. 5/6)给出原文,但 10,000 段带状态切片需自行录制清洗,SF3 ROM 合法性是潜在障碍。代码:项目页 jimntu.github.io/stateplay_page 未明确开源代码/数据,未披露 GPU 数量与时长(估需多卡 H100 量级)。评测:Move-Acc 依赖 SAM2.1+Grounding DINO、Att-Acc 依赖自训 ClipAttackNet(约 5k 片、阈值 0.7)、机制保真度依赖 Gemini/GPT 商业 API,成本与可重复性受限。
论文图表
该图分两部分:上方红框对比展示现有游戏世界模型违反机制的两类失败——角色在血量为零时仍继续攻击、技能条未满就释放必杀技;下方表格从视觉质量、交互性、状态感知、机制一致性四个维度定性比较'先前游戏世界模型'与'StatePlay(本文)',显示前者只有前三项而缺最后一项,StatePlay 四项全占。
这张图最直观地传达了论文的动机:把'看起来对但规则错了'这一抽象问题可视化为具体失败案例,是理解为什么需要状态感知建模的入口。
该图给出用 Gemini-3.1-Pro 标注 NPC 策略的完整提示:先记录可观察事实(是否出拳/踢/跳/投/远程、是否前压、是否受击、是否蹲防、主导距离),再据此将 NPC 归为进攻/控制/防守三类,作为训练集的文本描述。
它揭示了 StatePlay 数据集中文本模态是如何获得的,是复现 NPC 策略条件生成所必需的提示工程细节。