GameWAM:面向电子游戏的世界动作模型 GameWAM: A World Action Model for Video Games
首个统一生成未来画面与键鼠动作的游戏世界动作模型,并发现LASI失效模式
前置知识
世界动作模型(World Action Model, WAM)
同时生成『未来视觉观测』与『可执行动作轨迹』的生成模型。传统策略网络只输出动作、交互式世界模型只在给定动作时预测画面,而 WAM 把两者联合建模:视觉预测为动作学习提供动力学感知的监督信号,模型本身就充当任务策略。代表工作 DreamZero、Fast-WAM。
GameWAM 是第一个面向原生游戏闭环与 GUI 控制的 WAM,其并行视频/动作生成架构与训练目标全部由这一范式推导。
流匹配(Flow Matching)
生成范式:把干净样本 $X^0$ 与噪声 $\epsilon$ 按噪声水平插值 $X^\sigma=(1-\sigma)X^0+\sigma\epsilon$,网络学速度场;推理从高斯源积分到 $\sigma=0$。
GameWAM 的视频与动作两支都靠联合流匹配生成,动作从随机『采样源』出发生成——这正是 LASI 失效模式的物理根源。
扩散 Transformer(DiT)与块因果注意力
DiT 是以 Transformer 为骨干的扩散/流生成模型(如 Wan2.2)。块因果注意力把序列切成时间块,当前块的生成只能看见干净历史前缀加上本块自己的变量,未来块被掩掉,从而支持块级自回归 rollout;已算前缀的层级 K/V 状态可缓存,新观测只做增量扩展。
GameWAM 由并行 Video DiT 与 Action DiT 组成,靠块因果掩码共享前缀 K/V 状态;其块-循环控制、缓存管理与模态解耦都建立在该机制上。
VPT(Video PreTraining)数据
OpenAI 发布的 Minecraft 大规模人类游戏录像数据集,带逐帧鼠标键盘记录,配合逆动力学标注可扩展到海量无标签视频,是 Minecraft 智能体最常用的行为预训练数据源。
本文全部 Minecraft 训练数据由 VPT 录像加工而来(规则流+事件锚定流),外加 MineStudio 脚本 GUI 流;理解数据来源才能正确解读与基线的对比。
离散余弦变换(DCT)
沿时间轴的正交变换 $\hat{X}=CX$($C^\top C=I$),把动作序列分解为按频率排序的余弦系数:$q=0$ 是均值分量,$q$ 越大时间频率越高。低频模式刻画平滑缓慢的成分,高频模式刻画快速抖动。
LASI 的全部因果证据都在 DCT 频域完成:固定条件后干预采样源的低频模式(0-2 阶),证明其因果操纵生成的相机粗运动。
研究动机
现代视频游戏要求智能体在第一人称快速变化的画面上进行像素级原生控制:同一套键鼠物理通道既要支持并发离散按键与连续相机转动(gameplay),又要支持光标移动、点击、滚动(GUI 交互)。现有方案分两类且各有结构性缺陷。其一是策略类智能体(VPT、STEVE-1、ROCKET-1、JARVIS-VLA、OpenHA、Game-TARS 等),把视觉与任务上下文直接映射为离散化、语义化或时间压缩的动作:在 800+ 任务的 MCU 基准上 VPT 平均成功率仅 3.5%,最强的 Game-TARS 也只有 42.5%;且这类方法不显式建模『动作如何改变视觉世界』,动作抽象还削弱了并发按键与连续相机控制所需的细时间-度量结构。其二是交互式游戏世界模型(Genie、GameGen-X、MineWorld、WHAM 等),能按给定动作预测视觉未来,但动作须由玩家或外部控制器提供,模型自身不是任务策略。于是控制模型『选行为而不预测后果』,世界模型『预测后果而不选行为』,两者在游戏开放动力学与重复闭环交互下都无法独立胜任。
本文的目标是本文目标是构建首个面向原生闭环游戏与 GUI 控制的世界动作模型:单一模型从视觉观测、语言指令、本体状态与历史记忆等条件出发,联合生成未来视觉观测与可执行的键盘-鼠标轨迹,并让视觉预测作为动作学习的动力学监督。具体要同时解决三个难题:(1)动作异构——gameplay 与 GUI 复用同一物理键鼠坐标,但语义、尺度、条件分布完全不同,必须避免把相机与光标的统计混进同一分布;(2)时间尺度紧张——视觉子采样与固定 token/缓存预算冲突,加密采样会同时缩短未来前瞻与过去记忆的覆盖范围;(3)长时序闭环——需要比提交执行更长的规划前瞻,同时保持高频重规划反馈。最终在 Minecraft(MCU 800+ 任务)与 ViZDoom 四图上取得有竞争力的闭环成功率,且执行的原生动作步数少于全部对比智能体。
与已有工作不同的是,本文的独特切入角度有三点。第一,范式迁移:WAM 此前只在桌面或室内机器人操作(DreamZero、Fast-WAM)上验证过,本文首次把它带进第一人称视角剧变、世界状态持久、交互模式异构的原生游戏闭环与 GUI 控制场景,并论证游戏是『快变视觉+闭环重交互』机制的可扩展、可精确复位试验田。第二,时间组织:不同于 DreamZero 式块级自回归中预测、执行与瞬态 KV 沿有限块链耦合推进,GameWAM 用块-循环控制把『预测多长($P=16$)』与『执行多短($E=8$)』解耦,配以循环内细粒度 KV 缓存与跨循环持久分层历史,打破加密采样下『前瞻与记忆不可兼得』的权衡。第三,实证发现:作者没有止步于指标提升,而是挖掘并系统量化了生成式控制特有的失效模式 LASI——采样动作源的低频成分在固定条件下因果地操纵相机粗运动,这类『源敏感性』问题在判别式策略中根本不存在,属于生成式策略独有的新故障类别。
核心方法
直觉上,GameWAM 是『既会想象、又会出手』的模型:一边预测『这样做画面会怎么变』,一边生成可执行键鼠动作,视觉预测在训练期作为动力学监督。技术路线:224×224 观测每 2 个原生动作采 1 帧,经冻结 VAE 编码;并行 Video DiT(Wan2.2-TI2V-5B 初始化,宽 3072)与 Action DiT(30 层 24 头、宽 1024,用 Wan2.2 权重适配初始化)在块因果注意力下联合流匹配训练:干净前缀 $\mathcal{P}_{c,k}$ 由 Video DiT 编码成层级 K/V 供两分支共享,模态解耦掩码使两支的噪声变量互不作为条件。动作向量含连续(相机/光标)与离散(按键)坐标,离散量生成后才阈值化;每个动作时间步由路由器在 gameplay/GUI 流预测分支间选择,两模态用各自连续归一化统计。在线采用块-循环:每次规划 $P=16$ 个动作只提交前 $E=8$ 个再重规划;循环内维护瞬态 KV 缓存,循环末把执行观测经 Conv3D 压缩进『最近历史+长期记忆』的持久分层历史(≤40 token)。
核心是与已有方法的三个本质区别。其一,对策略类方法:动作学习显式接受动作条件视觉动力学的联合监督(video co-training),两支梯度都流经共享的干净前缀表征,但推理时动作生成不依赖正在去噪的未来视频(模态解耦掩码)——既保留世界建模收益又免去在线视频去噪。其二,对块级 AR 世界动作模型(DreamZero):预测与提交解耦——计划跨多个执行区间但每步只提交 $E$ 个动作,训练时以 $E$ 间隔锚定重叠 $P$ 步计划并行教师强制,延长预测监督却不延长自回归链、不推迟观测反馈;消融显示 $P=E$ 会使 MCU Mini 平均 ASR 从 50.7 掉到 41.3。其三,对异构原生控制:gameplay 相机与 GUI 光标共享坐标但分布迥异,GameWAM 逐时间步路由($\hat{r}_\tau\in\{0,1\}$)在两套流预测分支间切换并用模态专属归一化,一条轨迹内可自然过渡玩法与界面操作;跨循环记忆采用半衰期先验 $\alpha_\ell(\Delta)=1-2^{-\Delta/h_\ell}$ 的多时间尺度门控更新。
方法步骤详情
分数据、训练、执行三段。(1)数据:VPT 录像逐帧对齐键鼠记录并滤空动作帧;从状态统计检测挖矿/击杀/合成等事件,取 $[t_i-87,t_i+8]$ 共 96 帧窗口,按起点间隔≥64 帧、同类型锚点>96 帧双层去冗余,max-min 公平分配 20 万条预算;MineStudio 脚本生成 GUI 轨迹;三流统一时间线,样本混合 80:5:15,事件邻域采样加密。(2)训练:总损失由视频流、动作流、路由 BCE 与历史预测四项组成(权重 1.0/1.0/0.05/0.5),动作损失按连续/离散分组等权;8×H200 上 2 epochs 共 21,900 步约 22 小时,消耗 2.79B token。(3)执行:编码条件 $\Gamma_{c,k}$ 后从高斯源 10 步去噪得 16 步计划、执行前 8 步,新观测增量入循环 KV 缓存;每 24 个动作为一个循环,末尾把执行观测经 Conv3D 压缩,FIFO 留最近 2 段,溢出段经注意力池化+门控写入 2 尺度×4 槽长期记忆(半衰期 2/4 循环),历史 ≤40 token;每重规划步重采样动作源。
技术新颖性
新颖性在四个层面。(1)动作表示:坚持原生混合动作空间(Minecraft 22 维=2 连续相机+20 二值键;ViZDoom 统一 9 维),连续坐标生成后阈值化而非离散化为语义 token,保留并发按键与连续相机运动的精细时间-度量结构,是与动作语义化 VLA 类方法的实质差别。(2)时间结构:块-循环控制把『计划视野 $P$』『承诺视野 $E$』『上下文生命周期』三者正交化——$E$ 定义执行网格与循环步长,$P$ 只决定预测监督深度,KV 缓存生命周期绑定循环而持久历史跨循环存活;训练期重叠计划复用同一 $E$ 网格,从每条轨迹榨出更多预测覆盖。(3)异构控制建模:逐时间步模式路由+模态专属连续归一化,在单一 Action DiT 内解决『同坐标、异分布』问题,消融证明统一分布使平均 ASR 下降 12.4 个点(50.7→38.3)。(4)失效模式学:把生成模型常见的『源依赖』提升为可因果检验的 LASI 现象,设计了一整套频域干预协议(供体替换、低频置零、对偶源、单次前向增益、模型路径放大、闭环排列检验),对生成式控制社区有独立方法论价值。
实验结果
六组实验。(1)MCU:平均 ASR Mini 50.7/All 46.6 列第一,超 Fast-WAM(同数据复现 40.0/25.2)、Game-TARS(42.5)与 OpenHA(31.5);执行步数最少:138/155/203(Fast-WAM 为 165/234/261)。(2)ViZDoom 四图:全面超 Game-TARS,与 o4-mini、GPT-5 等相当或领先。(3)消融(对照 50.7):去未来视频监督 35.7、粗采样 36.7、无事件锚定 38.0、统一动作分布 38.3、P=E 41.3、无跨循环历史 46.7。(4)掩码对比:模态解耦 12.51 Hz vs 联合耦合 8.12 Hz(1.54 倍)。(5)零样本迁移 VoxeLibre:71/120=59.2%,Chop Tree 85%,Kill Cow 仅 10%。(6)LASI:固定条件下 yaw DCT0 源-输出相关 r=0.890;低频供体替换跟随率 94.8%;低频置零移除 99.25% 方差;模型路径放大 6.897 倍;闭环 300 轨迹、16,707 步对齐居 75 移位之首。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MCU 长时序任务完成(Mini 30 任务) | 平均任务成功率 ASR Mini(%) | 50.7 | Fast-WAM 40.0(同数据复现);OpenHA 36.8 | +10.7 vs Fast-WAM |
| MCU 全集(800+ 任务) | ASR All(%) | 46.6 | Game-TARS 42.5;Fast-WAM 25.2 | +4.1 vs Game-TARS,+21.4 vs Fast-WAM |
| MCU 具身任务交互效率 | 成功 episode 平均原生步数(越低越好) | 138 | Fast-WAM 165;VPT 377 | 较 Fast-WAM 减少 16%,较 VPT 减少 63% |
| MCU GUI 任务 | ASR All(%) | 60.0 | Game-TARS 39.1;OpenHA 32.5 | +20.9 vs Game-TARS |
| ViZDoom 四图(2 战斗 + 2 防御) | 平均 episode 奖励(每图 50 episodes) | 四图均领先或与最强基线相当 | Game-TARS、o4-mini、GPT-5、Gemini-2.5-Pro、Claude-4-Sonnet | 全面超过 Game-TARS |
| 在线执行效率(单卡 H200) | 闭环执行频率(Hz) | 12.51 | 联合视频-动作掩码变体 8.12 | 1.54 倍 |
| 跨游戏零样本迁移(VoxeLibre) | 微平均成功率(6 任务 × 20 episodes) | 59.2%(71/120) | 无迁移基线(诊断性实验) | 首个跨游戏迁移证据 |
局限与改进
作者承认的边界:GameWAM 只是低层闭环控制器,不含符号任务图、背包/配方表示或长视野搜索,需要语义分解、探索或多阶段资源规划的任务超出设计范围;持久历史基本只编码视觉,没有监督『该检索什么信息』;评估限于数字游戏,未验证物理控制;MCU 训练评测偏原子任务,缺少中间决策影响后续状态的长链条行为监督;LASI 诊断确立了四条因果性结论但未定位内部机制,训练时干预要么损害正常动作学习、要么残留源依赖,只能用『每重规划步重采样源』做部署级缓解。我的补充观察:(1)Table 1 中除复现的 Fast-WAM 外基线均取自原始报告,数据与输入差异巨大,『步数最少』只对 Fast-WAM 严格成立;(2)ASR 标准差极大(±32~±38)、Mini 仅 30 任务,统计功效有限,GUI ASR All(60.0)反高于 Mini(43.0)未获解释;(3)224×224 分辨率与每 2 步采 1 帧可能限制远距小目标感知;(4)效率只报 Hz,未报延迟分布;(5)事件锚定流占训练样本 80%,对数据配方的依赖未完全消融。
独立分析的弱点
独立分析的弱点及改进方向:(1)记忆容量小且纯视觉——一个循环仅 24 个原生动作、持久历史 ≤40 token,辅助目标只要求历史能预测当前视觉特征,不区分『对完成任务有用的信息』,长期记忆类任务会失效;应引入任务/动作感知的记忆检索损失,并入背包等本体状态。(2)路由是硬二分类——仅 gameplay/GUI 两模态,加入载具、商店等交互需手工扩展;可改为层次化混合专家或连续模式嵌入。(3)纯模仿学习、无价值函数——失败恢复完全依赖闭环反馈的隐式纠错(合成放错后重摆),对不可逆错误无解;可与世界模型 rollout 结合做测试时验证或搜索。(4)LASI 未根治——重采样只让偏差不相关化($K$ 次复用贡献 $K^2b(Z)$,重采样后方差约 $K\,\mathrm{Var}[b(Z)]$),单步内源敏感性仍在;需在采样器侧做低频去相关。(5)评估统计功效弱——每任务 5-10 次、±30+ 方差下 46.6 vs 42.5 难断言显著,应报告任务级配对检验。(6)步数指标以成功 episode 为条件,失败模式(卡死、原地转圈)的效率代价被隐藏。
未来方向
作者提出的方向:把 GameWAM 与高层规划器配对,保留其作为原生键鼠执行策略,由外部系统负责任务分解与配方知识;设计任务/动作感知的历史目标、显式检索监督与跨循环信用分配;构建具有连贯意图与演化状态上下文的『交互链』轨迹数据集,弥补 MCU 偏原子任务的不足;在物理具身系统验证模态解耦与『动作拟合干扰视觉动力学学习』假说;机制级消除 LASI——在不压制合法平滑运动、条件相容动作多样性与闭环响应性的前提下,阻止随机源结构变成持久低频控制偏置。基于本文成果可延伸:把 LASI 频域诊断做成生成式控制器的在线监控与安全护栏(检测低频偏差的单调累积并触发干预);探索源感知采样(在源空间选择与条件正交的低频成分,权衡重采样成本);把模态解耦掩码与块-循环控制迁移到机器人 WAM(DreamZero/Fast-WAM 谱系);针对 VoxeLibre 暴露的战斗技能泛化短板(Kill Cow 仅 10%)做域随机化或多游戏联合预训练;把事件锚定采样推广到其他事件稀疏的行为数据集。
复现评估
复现条件相当友好。作者承诺公开训练与评测代码、数据处理脚本、数据集、模型权重与配置。附录 A-E 细节密度罕见:架构(Wan2.2-5B 视频骨干+1B Action DiT,VAE 与文本编码器冻结)、时间配置(224×224、每 2 动作 1 帧、$P=16/E=8$、循环 24 动作、历史 ≤40 token)、数据配方(80/5/15 混合、96 帧事件窗口、64/96 帧过滤、20 万条预算、seed 42)与闭环协议(Mini 30 任务、每任务 10/5 次、每图 50 episodes、每步重采样源)。算力门槛:8×H200 约 22 小时(BF16、ZeRO-2、全局 batch 352),单卡 H200 推理 12.51 Hz;有 H100/A100 集群把训练拉长数天即可。VPT 与 MineStudio 公开,ViZDoom 轨迹用 APPO 自采且作者将发布。难度中等偏高——困难不在方法理解而在 Minecraft 环境工程与 MCU 评测搭建,以及 5B 视频骨干的显存需求;LASI 分析协议完整可照抄。
论文图表
对比三类范式:VLA 式策略缺乏世界建模、无法刻画动作对世界的影响;交互式世界模型能按给定动作预测未来但不是任务策略;GameWAM 一个模型同时具备两种能力(并行视频/动作生成+逐步动作路由)。同时示意块-循环 AR 控制(预测多块、只执行短块、再重规划)、分层视觉历史(循环内 KV 缓存、近期历史、跨循环长期记忆)与事件锚定训练采样(锚点附近密、远处疏)。
一图总览论文的方法定位与三大机制,是理解全文叙事的地图。
联合替代方案:允许当前块内同时加噪的视频与动作变量互相作为注意力条件,其余因果规则(干净前缀、排除后续块、教师强制与执行接地)与默认掩码完全一致。
与 Fig.6 配合构成消融 D.2 的两种掩码设计;结论(解耦性能更高且推理快 1.54 倍)依赖对该方案的准确定义。
黑曜石需要长时间持续挖掘:模型对准方块后在多次重规划中稳定维持挖掘行为直至方块破坏。
证明块-循环重规划不会把需要长时间稳定维持的行为碎片化,体现低层动作的时间一致性。
水下环境外观与运动方式迥异:模型仍能朝向鲑鱼、跟踪其三维移动并完成攻击序列。
探测模型对视觉分布偏移(水下渲染与三维运动)的鲁棒性边界。
迷宫中边打边走:受伤后模型主动寻路拾取血包恢复生命,再继续战斗。
说明策略能基于本体状态(血量)的实际变化调整行为,是状态敏感的闭环恢复而非符号化规划。
(a) 低频对齐扰动相对高频扰动的响应几何比在 σ∈{0.20,...,0.80} 上为 4.20-4.58;(b) 匹配噪声水平下解析状态与模型路径状态的 yaw DCT0 源增益对比;(c) 后者相对前者的放大比,在最后测量步 19(σ=0.208)达 6.897 倍。
给出 LASI 的两个关键定量特征:频域选择性(低频特异)与沿生成轨迹后段的系统性放大。
六个消融变体的分类别 ASR(对照完整模型 50.7):仅动作监督 35.7、粗时间采样 36.7、无事件锚定采样 38.0、统一动作分布 38.3、P=E 匹配视野 41.3、无跨循环历史 46.7;其中去掉跨循环历史使具身升至 75.0 但 GUI 跌至 31.0、战斗 34.0。
量化每个设计组件的贡献排序,是判断『哪些机制真正必要』的关键证据。
GameWAM(Wan2.2-5B 视频骨干+1B Action DiT,单阶段,2.79B token:视频 2.27B/动作 0.37B/文本 0.15B)与 OpenHA(Qwen2-VL-7B,两阶段共 3.62B)和 Game-TARS(Qwen2.5-VL-7B,两阶段共 566B)的骨干与 token 消耗对比:OpenHA 约为 GameWAM 的 1.30 倍,Game-TARS 超过 200 倍。
划清训练规模量级:GameWAM 以小两个数量级以上的 token 暴露取得可比性能,说明增益来自机制与数据设计而非算力堆叠。