Game2World引擎:释放野外游戏视频用于世界模型训练 Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
构建G2WEngine数据引擎与免掩码GameCleaner,剥离游戏HUD提升世界模型数据质量
前置知识
世界模型(World Model)
学习环境动态的生成模型:给定历史观测(与动作),预测未来画面如何演化,可用于交互式模拟、可控视频生成与具身智能体训练。近年主流做法是以视频扩散或自回归骨干(如 Wan、Genie、DIAMOND)在海量视频上学习世界动态,游戏因其环境多样、轨迹丰富而成为理想数据源。
本文的最终目标就是为世界模型生产干净训练数据,先导实验直接用微调文本到视频模型来度量数据质量变化,不懂世界模型就看不出去除 UI 的意义。
HUD 与屏幕空间 UI
HUD(Heads-Up Display)指叠加在游戏画面上的界面元素:血条、小地图、背包、任务提示、聊天框、弹窗通知,以及水印和直播叠层。它们属于屏幕空间实体——固定在画面坐标上、不随相机运动,具有强位置先验、持久性与类别化的时间行为(如弹窗短暂出现后消失),是画面中与物理游戏世界无关的部分。
理解 HUD 的类别化时空行为,才能明白通用视频修复为何不能照搬,以及 GameUI-Taxonomy 为何按语义角色与渲染行为组织 21 个类别。
扩散 Transformer(DiT)与流匹配(Flow Matching)
DiT 是把扩散模型主干换成 Transformer 的视频/图像生成架构,在 VAE 潜空间中逐步去噪。流匹配是其训练范式:学习速度场 $v_\theta$ 拟合从高斯噪声 $z_0$ 到数据 $z_1$ 的直线路径,损失为 $\lVert v_\theta(z_t,t,c)-(z_1-z_0)\rVert_2^2$,条件 $c$ 控制生成内容。
GameCleaner 就是一个 DiT,用流匹配目标训练;看懂公式 (2)(3) 的残差注入与损失定义都需要这个背景。
多模态大语言模型(MLLM)与 MLLM-as-a-Judge
MLLM 是同时理解图像/视频与文本的视觉语言模型,能做定位(输出 bbox)、分类与视觉推理。MLLM-as-a-Judge 指用其代替人工为生成结果打分,本文为裁判提供元素级 bbox 检查清单并聚合多次评分(ICC(A,5) 达 0.926)以保证可靠性。
本文 MLLM 一身两职:既是 GameCleaner 的语义条件编码器(取代 T5),又是全部评测的裁判,两处都是方法与实验的核心。
免掩码去除 vs 基于掩码的视频修复
传统视频修复(ProPainter、EffectErase 等)需要预先给定待移除区域的二值掩码,再修补该区域。免掩码设定下模型自己从语义上识别哪些元素属于界面并直接移除,输入只有原视频与文字指令,对未见过的游戏和 UI 布局更通用,也省去了逐帧标注掩码的巨大成本。
mask-free 是本文与全部掩码基线(VACE、EffectErase)对比的核心差异,也是能否规模化清洗互联网视频的关键。
LoRA(低秩适配微调)
一种参数高效微调方法:冻结预训练权重,只在每层旁路增加低秩矩阵乘积 $BA$(秩 $r$ 远小于维度 $d$)参与训练,大幅节省显存与算力,效果接近全量微调。本文在 DiT 模块上使用 rank 64 的 LoRA。
它解释了为何仅需 8 张 H100、3,000 步训练,就能把通用视频编辑底座改造成跨游戏泛化的 UI 去除专家。
研究动机
世界模型的规模化训练受制于交互数据:从封闭模拟器或插桩环境采集多样、长时序的交互轨迹成本高昂,且难以跨域泛化。互联网上的野外游戏视频本是理想替代品——覆盖多样的 3D 环境、视觉风格、视角、任务与玩家行为——但原始录像是对游戏世界的复合渲染,画面中纠缠着屏幕空间的 HUD、菜单、通知、水印与直播叠层。作者的对照实验量化了这种污染的代价:用同一批 5,442 段无 UI 游戏片段的干净版与合成 UI 叠加版分别微调 Wan2.1-T2V-1.3B,UI 叠加使微调后生成视频的整体 VideoReward 下降 6.83%,其中运动质量下降 18.8%、视频质量下降 2.7%,视频本身的美学质量降 8.59%、运动一致性降 4.36%(UI 版 LAION 美学 5.626 vs 干净版 6.109)。而现有视频修复方法面向自然视频中的物理物体、普遍依赖人工掩码,无法处理跨游戏在位置、语义与时间行为上差异巨大的界面元素,导致这片海量数据无法直接喂给世界模型。
本文的目标是本文的目标是把野外游戏视频转化为 world-model-ready 的高质量训练数据,具体拆成四件事。其一,建立统一的 GameUI-Taxonomy,按语义角色与渲染行为组织 21 类游戏界面元素,使 HUD grounding 与去除任务有形式化定义。其二,构建自动化数据引擎 G2WEngine:从 303 款游戏的 1,010 张代表性关键帧中提取并人工校验出 5,132 个 UI 透明资产,另行筛选无界面污染的干净游戏语料,再合成时间上连贯的 UI 叠加视频,最终产出 96K 带精确重建目标的配对样本(720p、30fps,含帧级掩码与 bbox)。其三,构建 Game2World 数据集:96K 合成对之外,再收录 303 款游戏的 1,079 段真实野外片段,用于考察对未知界面的泛化。其四,训练免掩码去除模型 GameCleaner,并配套提出元素级 artifact-adjusted 评测协议与经 6,150 个元素标注校验的 MLLM 裁判,最终证明去掉 UI 能切实提升游戏视频对世界模型训练的价值。
与已有工作不同的是,本文的独特切入是把游戏 UI 去除形式化为界面-世界解耦问题,并把它当作可规模化的数据工程而非游戏特化的编辑任务。它同时区别于三条既有路线:早期游戏世界模型(DIAMOND、Genie 及后续动作条件生成系统)把渲染帧直接当作世界观测,从不分离 HUD 与菜单;视频修复(STTN、E2FGVI、ProPainter 及语言条件删除方法)针对自然视频中的物理物体、需要输入掩码;依赖模拟器特权状态的做法则要求对每款游戏单独插桩。G2WEngine 反其道而行:从真实游戏视频中提取真实 UI 资产,再合成回干净底片,让去除任务拥有像素对齐的重建目标,把无监督难题变成全监督问题;模型侧用 MLLM 取代常规 T5 文本编码器提供视觉-语义理解,使模型无需掩码即可跨游戏识别并移除界面。评测侧则率先指出原始去除率会奖励破坏背景的方法,提出惩罚伪影的 AAR 等指标。
核心方法
方法分数据引擎与去除模型两层。G2WEngine 依次完成:定义统一的 GameUI-Taxonomy;UI 资产提取——GPT-5.6 Terra 对野外代表帧提出 bbox 与类别标签,人工校验后抠成保留元数据的透明资产,从 303 款游戏 1,010 张关键帧得到 5,132 个资产;干净语料筛选——游戏风视频切 5 秒片段并经 CLIP 聚类去重;UI 叠加合成——按类别概率与实例上限组合资产,采样渲染风格、时长与动画参数,持久元素做坐标扰动并经碰撞检测,产出 96K 对 720p/30fps 配对视频与帧级掩码、bbox。GameCleaner 基于 Kiwi-Edit:MLLM 编码源视频 $x_{src}$ 与指令 $y$,latent queries $Q$ 经交叉注意力提取语义并投影为 DiT 条件 $c=\mathcal{P}(\mathrm{CrossAttn}(Q,\mathcal{E}_{MLLM}(x_{src},y)))$,源 VAE 潜变量按 $h_t=\mathrm{PE}(z_t)+\gamma(t)\,\mathrm{PE}_{src}(\mathrm{VAE}(x_{src}))$ 残差注入,以流匹配训练。
核心创新有三点。第一,把去除任务重新定义为界面-世界解耦:HUD 不是普通物体,而是有固定位置先验、持久性与类别化时间行为的屏幕空间实体,需要游戏感知的语义理解与时序一致重建,这从根本上区别于面向自然物体的视频修复。第二,合成式监督闭环:用真实 UI 资产叠加干净底片,让每个训练样本都有像素对齐的重建目标,绕开野外数据无真值的死结,也无需游戏引擎特权信息或人工掩码——这是把任务变成可扩展数据工程的关键,96K 配对样本由此而来。第三,模型上用 MLLM 取代 T5 文本编码器作为条件来源,使模型能从外观与上下文识别哪些元素属于界面,实现免掩码跨游戏泛化;训练时以 20% 概率丢弃参考干净图,让同一模型兼具参考增强与免参考两种推理模式。评测上提出 AAR、BG、Track-Clean 等惩罚伪影的指标,避免原始去除率掩盖背景破坏,裁判与人工的 Cohen's $\kappa$ 达 0.820。
方法步骤详情
①资产提取:GPT-5.6 Terra 对野外游戏帧输出 UI bbox 与 21 类标签,人工验收后转为保留类别、来源与渲染信息的透明资产。②干净语料:游戏风视频按题材筛选、切 5 秒片段、CLIP 聚类去重。③UI 合成:按类别概率与最大实例数采样 UI 组合,瞬态弹窗用长尾分布;每资产采样渲染风格、时长与动画参数,兼容时用录制坐标否则用类别空间锚点;持久元素施加小扰动并经碰撞检测重位;库存面板分解为背景条与独立图标再重组;输出配对视频、帧级掩码、bbox 与元数据。④训练:从 Kiwi-Edit Stage-2/3 初始化,冻结 MLLM 与 connector,DiT 加 rank 64 LoRA,以 $\mathcal{L}_{flow}=\mathbb{E}_{t,z_0,z_1,c}\lVert v_\theta(z_t,t,c)-(z_1-z_0)\rVert_2^2$ 优化,8×H100、batch 32、学习率 $10^{-4}$、3,000 步,随机丢 20% 参考图。⑤评测:2 FPS 采样、统一 1280×720,MLLM 裁判按 AAR/UI/Clean/BG/Uncertain 打分。
技术新颖性
新颖性体现在数据、模型、评测三层。数据层面,G2WEngine 是首个把野外游戏视频工程化为 UI 去除全监督数据的引擎:用真实 UI 资产合成而非凭空生成,保留真实界面的位置先验与渲染特性;合成器可控覆盖静态 HUD 与瞬态弹窗,且能分解重组库存面板等结构化组件,产出 96K 配对样本——这个合成闭环是它区别于所有依赖掩码输入或模拟器特权方法的根本。模型层面,MLLM 语义条件加时间步相关残差注入的组合,让单一 DiT 同时完成识别(哪里是 UI)、移除(抹除并重建被遮挡世界内容)与时序保持;免掩码设定配合 20% 参考丢弃训练,使模型在有无参考图两种模式下都可部署,AAR 消融显示这是性能与鲁棒性的最优平衡点。评测层面,首次为该任务设计元素级指标族(AAR/UI/Clean/BG 与 Box-Micro、Track-Clean 等细粒度统计),用 200 段视频、6,150 个元素标签、2,000 个帧级标签验证裁判与人工一致(removed F1 87.78%、$\kappa=0.820$),并系统量化分辨率对裁判分数的影响——方法学贡献独立于模型本身。
实验结果
先导研究(表 1、2):同一批 5,442 段片段的干净版与 UI 叠加版分别微调 Wan2.1-T2V-1.3B,干净数据使 VideoReward +6.83%(MQ +18.8%、VQ +2.7%),LAION 美学 +8.59%、RAFT 运动 +4.36%。主实验(表 3):GameCleaner(w. Ref)Overall 93.34,超掩码基线 VACE-1.3B(69.37)23.97 分、免掩码 Kiwi-Edit(60.58)32.76 分;野外 AAR 80.05、BG 99.80,超 Aurora 28.86 分;合成集无参考版 AAR 95.36(BG 99.00),超最强时序掩码基线 57.3%;w.o. Ref 版野外 AAR 51.60。细粒度(表 4):野外 Track-Clean 68.12 对 EffectErase 16.12——后者原始去除率 92.00 但 BG 仅 74.55,靠改背景换分。裁判可靠性(表 5):removed F1 87.78%、Cohen's $\kappa$ 0.820,聚合 ICC(A,5) 0.926。消融(图 9):20% 参考丢弃最优(野外 AAR 80.05 vs 0% 的 70.64);数据 60%→100% 时合成 AAR 仅 +2.06、野外 +25.09(54.96→80.05),真实泛化未饱和。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| UI 叠加对世界模型训练的影响(5,442 段对照实验) | VideoReward Overall(越高越好) | 干净数据微调后 0.068,UI 叠加版 -0.009(相对提升 +6.83%,MQ +18.8%、VQ +2.7%) | UI 叠加版训练数据(同批片段合成) | 整体提升 6.83%,运动质量提升 18.8% |
| 合成基准 UI 去除(Game2World-S) | AAR 伪影调整去除分 | 95.36(无参考标准版,BG 99.00) | Aurora 60.62(最强无掩码);VACE-1.3B 59.11(带掩码);Kiwi-Edit 34.68 | 相对最强时序掩码基线提升 57.3% |
| 野外基准 UI 去除(Game2World-W,303 款游戏 1,079 段) | AAR / BG 背景保持 | 80.05 / 99.80(w. Ref);51.60 / 99.60(w.o. Ref) | Aurora 51.19 / 14.00;EffectErase 23.55 / 74.55 | AAR 领先最强基线 28.86 分,BG 高 85.80 分 |
| 合成+野外综合排名 | Overall=(AAR_S+BG_S+AAR_W+BG_W)/4 | 93.34(w. Ref);85.97(w.o. Ref);85.63(标准版) | VACE-1.3B 69.37(最强掩码);Kiwi-Edit 60.58(最强免掩码) | +23.97 分 / +32.76 分 |
| 完整轨迹干净去除(野外) | Track-Clean | 68.12(w. Ref) | EffectErase 16.12(其原始 UI 去除率 92.00 但 BG 仅 74.55) | +51.99 分,证明 artifact-adjusted 指标的必要性 |
| MLLM 裁判 vs 人工标注(200 段视频) | Removed F1 / Cohen's κ | 87.78% / 0.820(伪影一致 85.96%、背景保持一致 78.00%) | 聚合多人评分 ICC(A,5) 0.926、Krippendorff α 0.712 | 达到与人工高度一致水平,支撑无真值野外评测 |
局限与改进
作者承认的局限:训练数据仅约 10 万对,观察到的提升只是有利 scaling 趋势而非确定的幂律,团队正向 100 万规模扩展;对大面积不透明界面、快速变化叠层以及与场景视觉纠缠的 UI,重建仍不完美;下游验证用文本条件视频生成作代理,不是真正的动作条件游戏世界模型,缺少跨游戏可靠的逆动力学或潜在动作模块。我的补充观察:其一,合成到真实的域差明显——合成集 AAR 高达 95.36,而无参考标准版野外仅 48.56,说明合成 HUD 分布未充分覆盖真实界面的透明度、转场与录制伪影;其二,评测链路高度依赖 GPT-5.6 家族(Terra 标注资产、Sol 更新野外标签、裁判打分),存在同源模型偏差与 API 漂移风险,作者自己的分辨率实验(Set 2 野外 AAR 在 800×448 与 1280×720 间相差约 5 分)也印证裁判分数对分辨率敏感;其三,先导实验中 UI 叠加版的 MUSIQ 清晰度反而更高,暴露自动画质指标容易被界面锐利文本带偏;其四,所有片段仅 5 秒,长时序动态覆盖有限,且野外集需要逐帧人工修框,标注扩展成本高。
独立分析的弱点
独立弱点分析:第一,合成-真实域差是最大软肋,免参考推理时野外 AAR(48.56)与合成 AAR(95.36)相差近 47 分,改进方向是在合成器中加入更强的域随机化——半透明混合、开镜转场、压缩伪影、直播水印——并混入少量带伪标签的真实数据做联合训练。第二,评测同源闭环:资产标注与裁判同属 GPT-5.6 家族,闭源模型更新即可能改变排名,改进方向是引入异构开源裁判交叉验证,并公开裁判 prompt、采样协议与全部原始评分。第三,全屏大面积 UI(背包、地图)遮挡的画面信息本身不存在于视频里,任何模型都无法真正复原,改进方向是引入跨片段检索或游戏资产先验做生成式补全,并对不可恢复区域显式输出不确定性。第四,多步扩散推理成本高,难以处理海量数据清洗,可按作者设想做少步蒸馏与 GPU 级优化。第五,工作只覆盖 HUD 去除,未处理菜单、过场、加载界面等整段非世界内容,可用镜头切分与场景分类先过滤再进入去除流程。
未来方向
作者明确提出三个方向:(i) 数据与基准扩展——把 Game2World 扩展到百万级,覆盖更多游戏、UI 类型与录制条件,构建更大更难的基准,并正式检验是否服从 scaling law;(ii) 动作条件世界建模——开发通用动作恢复模块,把清洗后的视频转成观测-动作轨迹,直接训练游戏世界模型,完成数据价值的端到端验证;(iii) 高效 GameCleaner——把模型蒸馏为少步推理,配合推理加速与 GPU 级优化以支撑海量清洗。在此之上可以延伸:把界面-世界解耦推广到直播录屏、软件演示、屏幕共享等一切屏幕空间污染源,形成通用的屏幕内容清洗层;将 taxonomy 与 grounding 能力用于 GUI 智能体的屏幕理解数据构建;在百万级数据上同时拟合数据、模型、算力三个维度的 scaling 关系;以及把清洗语料与 Genie 类潜在动作模型结合,检验游戏世界模型在行为层面的可用性。
复现评估
复现评估:作者承诺代码、数据集与模型将发布于 GitHub(Dongping-Chen/Game2World),论文撰写时发布状态尚未经核实。算力方面,训练为 DiT 上 rank 64 的 LoRA、3,000 步、8×H100 全局 batch 32、学习率 $1\times10^{-4}$,对拥有 8 卡 H100/A100 集群的团队可承受,个人或小团队复现训练基本不可行;数据方面,96K 合成对与 5,132 个资产、21 类标签若完整开源将大幅降低门槛,但 Game2World-W 的 1,079 段野外片段依赖逐帧人工修框(1,079 段对应数千帧级标签),这部分标注成本难以复刻;评测方面依赖 GPT-5.6 Terra/Sol 闭源 API,存在费用、限流与版本漂移问题,作者虽以单日单端点评测和分辨率敏感性研究控制风险,第三方复现打分仍可能有偏差。综合判断:若数据与权重如期落地,用其数据重训替代模型难度中等偏上,严格复现论文评测分数难度高(闭源裁判),但基于其发布数据做下游应用是现实的。
论文图表