ForgeWM:面向少步动作条件视频世界模型的渐进式因果训练 ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
四阶段渐进因果训练将双向生成器蒸馏为1/2/4步世界模型,支持草稿重放精修
前置知识
流匹配(Flow Matching)
一种生成模型训练范式:以噪声水平 $\sigma\in[0,1]$ 为路径坐标,构造噪声-数据插值 $z_\sigma=(1-\sigma)z+\sigma\epsilon$,训练速度预测器拟合目标场 $v^*=\epsilon-z$。相比 DDPM 的离散步数,它给出连续进度坐标,由此可导出清洁预测 $\hat z_\theta=z_\sigma-\sigma v_\theta$。
本文四个阶段的损失全部建立在流匹配上,清洁预测正是一致性与分布匹配阶段所比较的量。
块因果注意力(Block-causal Attention)
把潜变量序列切成块,块内部做双向注意力,而每个块只能注意更早的块。它让自回归生成以块为粒度滚动:生成新块时条件于之前所有已生成块。配合键值缓存(KV cache)可以增量式解码,不必重算历史。
ForgeWM 的因果训练、蒸馏与推理全部使用这种掩码,且额外维护视觉、键盘、鼠标三套缓存来对齐动作窗口。
一致性蒸馏(Consistency Distillation)
训练学生把概率流上任意中间点一步映射到数据端:让冻结教师沿 ODE 用 Euler 步从 $\sigma_i$ 推进到 $\sigma_{i+1}$,学生把自己在 $\sigma_i$ 的清洁预测对齐到教师在推进点的 EMA stop-gradient 输出。
Stage 2 用在线因果一致性蒸馏为少步采样提供初始化,是学生能做到 1/2 步生成的能力来源。
分布匹配蒸馏(DMD)
用一个冻结的真打分器和一个可训练的假打分器在学生样本上的分歧构造梯度方向,把学生输出分布整体拉向教师分布,而不是逐样本回归。方向常用 $\hat z_{fake}-\hat z_{real}$ 并按逐样本绝对偏差做自适应归一化。
Stage 3 依靠它修复教师强制留下的分布失配,是 ForgeWM 质量(尤其少步下)的关键来源。
教师强制与 On-Policy 自展(Self-rollout)
教师强制指训练时把干净真值历史作为条件输入(历史完全准确但不真实);on-policy 指模型条件于自己此前生成的、带误差的历史做 rollout。两者之间存在分布失配(exposure bias),误差会随自回归步数累积。
ForgeWM 四阶段的演进主线就是训练历史分布从干净(Stage 1)逐步过渡到自生成(Stage 3)。
SDEdit 式再噪精修
给已有样本加噪到中间水平,再用生成先验去噪回数据端:能在大致保留原结构的同时修正局部细节。噪声水平越高改动越大、越接近重新生成。
Replay-Time Refinement 把这一思想用在模型自己保存的 rollout 草稿上($r=0.3$、4 次更新),实现不偏离已体验轨迹的质量提升。
研究动机
交互式视频世界模型要求在游戏场景中以低延迟做因果生成,并可靠响应「游戏原生控制」——帧率级到达的离散键盘状态与连续鼠标位移。虽然因果蒸馏已能实现一步或几步视频合成,但把它扩展到交互式世界模型非常困难:离散键盘与连续鼠标必须与时间压缩后的潜块(VAE 每 4 帧压 1 潜帧,3 潜帧的因果块跨 12 个视频帧)在因果训练与自回归 rollout 中保持对齐,同时动作历史和 KV 缓存要和生成的潜块同步更新。少步采样会放大视觉、动作与缓存误差,并在自回归中逐块传播,把保真度、可控性和多块稳定性耦合在一起。现有系统各有短板:Matrix-Game 2.0 每块需 4 次去噪更新,鼠标准确率仅 0.7061;HY-WorldPlay 延迟高达 2164ms、仅 7.54 FPS;而 camera-pose 路线(WorldPlay、minWM 等)把控制简化为相机轨迹,丢掉了按键级接口。
本文的目标是本文的目标是把一个双向(非因果)的动作条件视频生成器改造成「预算特化」的少步因果世界模型:分别训练稳态去噪预算为 1、2、4 步的学生,给出三个明确的质量-延迟工作点。整个适应与蒸馏过程必须完整保留三件事——帧对齐的键盘+鼠标控制接口、动作到潜块的对齐、因果状态更新协议,不能把控制退化为相机位姿编码。部署上提供双路径协议:在线交互使用原生低步数学生保证低延迟;交互结束后可选地对已保存的 rollout 草稿做重放时精修(Replay-Time Refinement),在不偏离用户实际体验轨迹的前提下逼近 4 步参考质量,且不引入第二个检查点或专门训练的 refiner。此外希望同一套训练配方不加架构改动即可迁移到手柄控制的 FPS 游戏域,验证框架的通用性。
与已有工作不同的是,本文的独特切入有四点。第一,与把动作编码成相机位姿或 PRoPE 式位姿编码的路线(WorldPlay、minWM、DreamX-World)不同,ForgeWM 用模块化 ActionModule 在训练、蒸馏、推理全程保留帧率级离散+连续双通路控制。第二,与 AnyFlow 学习灵活测试时预算的 flow-map 不同,它主张预算特化——为每个步数单独训练学生,并把「测试时步数扩展」用冻结一步检查点单独剖析,证明 off-budget 加步基本不提升质量。第三,重放精修复用部署中的同一个一步学生对自己保存的草稿再噪-去噪($r=0.3$、4 次更新、逐块提交),与 SDEdit 从纯噪声重生成不同,保留的是用户经历过的轨迹;与 SANA-WM 的专用 refiner 不同,无需额外模型。第四,评测上提出 KCtrl——反事实相反动作对上的相机轨迹符号测试,替代会被视觉域相似度污染的 GameWorld 键盘准确率。
核心方法
直觉上分三步走:先让模型在干净历史上学会因果执行,再让它学会几步内出图,最后让它在自己生成的有噪历史上保持分布正确。技术路线从 Matrix-Game 2.0 系列的双向动作条件图像到视频生成器出发,以流匹配为目标:$z_\sigma=(1-\sigma)z+\sigma\epsilon$,$\mathcal{L}_{FM}=\mathbb{E}\,w(\sigma)\|v_\theta(z_\sigma,\sigma;c)-(\epsilon-z)\|_2^2$,其中 $c$ 含首帧与动作条件。四个阶段构成一条渐进链:Stage 0 用全片段双向注意力做域适应,产出冻结的域教师(后续当真去噪器);Stage 1 从同一基座出发换上块因果掩码做教师强制因果训练,得到因果教师;Stage 2 做在线因果一致性蒸馏,初始化少步采样;Stage 3 学生自回归 self-rollout,用 Stage 0 真去噪器与可训练假去噪器的分布匹配梯度对齐,分别产出 1/2/4 步学生。双向教师与因果学生共享同一基座初始化,最终在自回归 self-rollout 上「会师」互相监督。训练数据为 GF-Minecraft 的 40,000 条 640×352 片段。
核心创新有三层。第一是「预算特化」哲学:不为单一模型追求任意步数,而是给 1、2、4 步各训独立学生形成明确工作点;论文进一步用冻结的 ForgeWM-1 做 off-budget 步数扫描(1→32 步),发现 Imaging Quality 在 2 步见顶、LPIPS 到 4-8 步后回退、KCtrl 与 Flow Profile 纹丝不动,反证了特化训练的必要性。第二是四阶段沿三个正交维度渐进:时间执行模式(全双向→块因果)、采样目标(FM→一致性蒸馏→DMD)、条件历史分布(干净→自生成),其中 Stage 3 的 on-policy 分布匹配直接消除教师强制的干净历史失配,这是对 Causal Forcing、Causal-rCM 一脉方法在游戏原生控制下的系统化。第三是双路径部署中的 Replay-Time Refinement:对保存草稿在 $r_i=0.3$ 再噪、用同一冻结学生 4 次更新去噪、逐块提交并复用已精修因果前缀与录制动作,Ddraft 仅 0.1970,而从噪声直接重生成的 4 步模型 Ddraft 高达 0.6187——质量追平但轨迹面目全非。ActionModule 的离散(cross-attention 的 K/V)+连续(与视觉特征融合走时间注意力)双通路设计则保证控制接口零损失。
方法步骤详情
Stage 0(输入:动作条件基座与 40k 条 GF-Minecraft 640×352 片段;输出:域教师):全片段双向注意力下做流匹配适应,检查点冻结备用。Stage 1(输入:同一基座;输出:因果教师):换成块因果掩码——块内双向、块间只许看过去;干净与噪声 token 流拼接,噪声块 $i$ 只注意干净块 $j<i$ 和自身,每块抽一个噪声水平,损失 $\mathcal{L}_1=\mathbb{E}\,w(\sigma_i)\|v_\theta(z^{(\sigma_i)}_i,\sigma_i;c_i,z_{<i})-(\epsilon_i-z_i)\|_2^2$。Stage 2(输入:Stage 1 检查点;输出:少步初始化器):生成器、EMA 副本与冻结教师同源初始化,在 $N=48$ 级噪声网格上取相邻对 $(\sigma_i,\sigma_{i+1})$,教师带 CFG 走一步 Euler 到 $\tilde z^{(\sigma_{i+1})}$,学生对齐 $\mathcal{L}_2=\|\hat z_\theta(z^{(\sigma_i)},\sigma_i)-\mathrm{sg}[\hat z_{\bar\theta}(\tilde z^{(\sigma_{i+1})},\sigma_{i+1})]\|_2^2$,三方均条件于干净因果历史。Stage 3(输出:1/2/4 步学生):学生做 $K$ 步自回归 rollout 得 $\hat z$,再噪后算方向 $g=\mathrm{mean}\,(\hat z_{fake}-\hat z_{real})/|\hat z-\hat z_{real}|$,经 $\mathcal{L}_3=\tfrac12\mathbb{E}\|\hat z-\mathrm{sg}[\hat z-g]\|^2$ 更新,假去噪器并行以自身 FM 损失训练;1/2 步学生首块固定 4 步、之后 $K$ 步。部署:在线用原生学生逐块生成并维护视觉+键盘+鼠标三套 KV 缓存;重放时对保存草稿以 $r_i=0.3$ 再噪,同一学生 4 次更新去噪,逐块精修提交。
技术新颖性
技术新颖性体现在四点。其一,控制接口的「全保真」处理是文献中少见的:动作不压缩为相机轨迹或位姿编码,而是按潜块区间分组、保留每个 token 时间窗所需的前置控制,且训练、蒸馏、推理共用同一套对齐与缓存更新协议,这使离散按键与连续鼠标在 12 帧粒度的潜块上依然帧级对齐。其二,四阶段图结构的编排有明确依赖设计:Stage 0 与 Stage 1 并行、共享基座但分别代表「真分布」与「因果执行」,Stage 3 让二者在学生 self-rollout 上相遇,形成闭环监督,避免了离线轨迹数据集。其三,重放精修证明了「refiner 不必单独存在」:默认用冻结 ForgeWM-1 自己精修自己,与四步伴随模型当 refiner 的结果几乎一致(Replay LPIPS 0.6155 vs 0.6157),把 SDEdit 式修正与部署模型统一。其四,评测方法学贡献:KCtrl 符号测试规避了 GameWorld 评分器把控制响应与视觉域相似度混谈的问题,并把「在线交互」与「离线质量」用 Ddraft 与 Replay LPIPS 两个指标干净地分离。
实验结果
主实验在 77 帧 rollout、1000 条配对轨迹上对比 Matrix-Game 2.0 与 HY-WorldPlay(Table 2):七个质量/控制列中六个最佳——ForgeWM-2 的 IQ 0.6865 最高(基线 0.6282/0.6133),ForgeWM-2/4 的 KCtrl 0.9740 并列第一(基线 0.9156),鼠标准确率 0.8268(基线 0.7061/0.5818),ForgeWM-1 延迟 168.2ms、72.10 FPS,比 Matrix-Game 2.0(370.9ms、32.35 FPS)快 2.2 倍、比 HY-WorldPlay(7.54 FPS)快近 10 倍;性能对预算非单调,2 步 LPIPS 0.6171 已优于 4 步基线 0.6443。人工盲测(41 人、615 次选择):ForgeWM-4 视觉质量 68.8%、动作准确 57.6%、时空一致性 55.6%,总偏好 60.7%(Figure 4)。冻结 ForgeWM-1 的步数扫描(1→32 步,Figure 5):IQ 于 2 步峰值、Subj Cons 于 4 步、LPIPS 至 4-8 步后回退,Flow Profile 与 KCtrl 全程稳定——加步主要增加运动幅度与延迟。重放精修(Table 3):Replay LPIPS 0.6155 追平直接 ForgeWM-4 的 0.6168,Ddraft 从 0.6187 降至 0.1970(约 3 倍贴近已体验轨迹);换四步伴随模型当 refiner 为 0.6157/0.1960,几乎不变。配方迁移(Figure 8):CrossFPS 在 7 款游戏宏平均配对 LPIPS 0.656、运动比 1.45。长程(Figure 9):5 条 22 秒 rollout 后期出现方块结构渐失与色斑扩散。
局限与改进
作者明确承认的局限:一是主评测刻意聚焦受控 Minecraft 设定(匹配初始帧与映射控制轨迹),分布外泛化超出研究范围;二是 HY-WorldPlay 控制参数化不同,其有效运动尺度依赖确定性适配器,故只做 Minecraft 定量对比,CrossFPS 仅作为配方迁移的补充而非同等深度评测;三是长时 rollout 存在渐近退化模式,包括方块结构渐失与颜色伪影缓慢扩散;四是 Subject Consistency 指标会偏好保守低运动视频,解读需谨慎,参考对齐的 Flow Profile 更能反映 requested motion 的复现。另有结构性事实:「1 步」「2 步」只是稳态预算,首块仍固定 4 次评估,完整 rollout 的生成器调用次数有这一硬下限。我自己的观察:重放精修 LPIPS 0.6155 只是追平而非超越直接 4 步,质量上限仍受一步学生容量约束;$r=0.3$ 与 4 次更新是手工选定的折中,缺自适应调度;CrossFPS 运动比 1.45 暴露跨域后运动幅度系统性偏强,且 FPS 域缺少 KCtrl/Mouse Acc 的等价控制精度量化;三个预算特化学生意味着三份训练与维护成本。
独立分析的弱点
第一,预算点是离散的:想要 3 步或 1.5 步的质量-延迟折中时没有对应模型,用户只能三选一;改进方向是借鉴 AnyFlow 学习 flow-map 过渡,或在 Stage 3 对每个 batch 随机采样目标预算训练单一多预算模型。第二,重放精修逐块顺序执行,精修块 $i$ 依赖已精修前缀,长视频离线处理无法并行、耗时可观;可改为滑动窗口并行并加边界一致性约束。第三,KCtrl 只测动作符号(方向对错),不度量连续鼠标的幅度保真,Mouse Acc 又依赖在真实帧上训练的 GameWorld 评分器;应引入反事实幅度扫描(把鼠标位移按比例缩放看响应增益)。第四,误差传播只有定性展示:论文承认 22 秒后退化但未量化质量随块数的下降速率,也未与回滚/拒绝采样类机制比较;可为每块估计不确定性并触发局部重放精修。第五,首块固定 4 步使交互启动延迟与「步数」语义含混,宣传的 168ms 不含首块;可对首块也做一致性初始化或缓存典型首块先验。第六,域适应只在 Minecraft 与 FPS 内验证,对物理 AI、机器人操作等视频域的迁移完全未测,ActionModule 对非游戏控制信号的适配成本不明。
未来方向
作者层面提出或隐含的方向:把评测扩展到更广的分布外场景;把四阶段配方推广到更多控制域(CrossFPS 已是第一步);完善长视野退化机制的分析。基于成果可自然延伸的研究:一是把重放精修做成「后台异步精修」,用户继续交互时后台精修早期块,让离线质量与在线体验共存;二是在 Stage 3 的 DMD 中加入动作反事实一致性正则,把 KCtrl 类指标直接写进训练目标,进一步提高控制保真;三是把 ForgeWM 当作策略训练环境(世界模型强化学习),研究精修程度对策略学习质量与成本的影响——Replay 的轨迹保持特性对经验回放天然友好;四是自适应再噪调度,按每块草稿与参考的差异估计动态选择 $r_i$;五是引入场景级长期记忆(如 DreamX 的 geometry-retrieved scene memory)缓解 22 秒外的结构漂移;六是向音频-视频联合或 omnimodal 骨干(对标 Cosmos 3)扩展,让世界模型覆盖更完整感知模态。
复现评估
可复现性中等偏上但依赖外部条件。有利面:基座来自公开的 Matrix-Game 2.0 系列,训练数据是公开的 GF-Minecraft(40,000 条 640×352 片段);论文声明优化超参、分阶段训练细节与消融在附录 A,评测协议(含用户研究招募)在附录 B,CrossFPS 分游戏结果在附录 C;重放精修本身极易验证——只需冻结 ForgeWM-1、$r=0.3$、4 次更新、逐块执行,无任何训练。不确定面:正文页脚虽有 Resources/Page/Code/Models 链接占位,实际开源情况需确认;论文未披露 GPU 数量、训练时长与成本,Stage 3 需同时训练生成器与假去噪器并做自回归 rollout,显存与算力门槛高;评测复现需要搭建 KCtrl 的反事实相反动作对采集流水线、GameWorld 评分器,以及 HY-WorldPlay 的确定性控制适配器,工程量不小。总体判断:拿到官方代码与检查点后中等难度可复现主表;从零全流程复现则需大规模游戏数据采集与多卡训练,难度较高。
论文图表
展示 ForgeWM 在两个控制域的自回归 rollout 结果:上半部分是键鼠控制的 Minecraft,画面上叠加 WASD 离散状态与 LOOK 鼠标视角;下半部分是手柄控制的 FPS 游戏,叠加 FIRE、ADS、JUMP、MOVE 等按钮状态。两域学生均由同一四阶段框架训练。
开篇即界定任务:动作条件因果视频世界模型需要同时支持离散+连续的游戏原生控制。这张图让读者直观看到控制信号如何叠加在画面上、以及同一配方跨域可用的卖点。
五条 22 秒(约定量协议时长 3.5 倍)的 rollout,覆盖不同生物群系、光照时段与持续前进/持续转向控制模式,按等时间间隔采样展示。部分序列后期出现方块结构渐失与颜色伪影缓慢扩散。
诚实地暴露长视野退化模式,是理解本文方法边界与未来工作(长程记忆、误差控制)的必要材料,适合放在局限讨论中。