Matrix-Game 3.5:基于补丁记忆的实时流式交互世界模型 Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory
用3D补丁记忆与分块相机注意力统一长时记忆与相机控制,实现720p实时交互世界生成
前置知识
交互式世界模型
以闭环自回归方式运行的生成式环境模拟器:模型根据用户输入的相机运动、键盘动作或文本指令因果地生成未来观测帧,而新生成的帧又成为后续生成的上下文。与一次性合成短片段的普通视频生成不同,它要求世界是持久的——访问过的场景要能被忠实重建,物体身份在视角变化下保持一致,用户触发的事件要对环境产生连贯而持久的影响。
本文的全部设计(几何记忆、相机条件、静动解耦、蒸馏加速)都围绕长时程闭环交互的一致性与实时性展开,理解这一设定才能理解各组件的动机。
流匹配与视频扩散 Transformer
扩散模型通过逐步去噪生成数据;流匹配是其一种再参数化,让网络直接预测速度场 $v_\theta(x_t, t)$,其中 $x_t = (1-t)x_0 + t\epsilon$ 沿直线路径从噪声走向数据。视频扩散模型(如 Wan2.2-TI2V-5B)把潜在帧序列作为 token,用 3D 时空 Diffusion Transformer 反复去噪,并常用 classifier-free guidance(CFG)增强条件遵循。
本文骨干是 Wan2.2-TI2V-5B,基座训练目标、感知流匹配(PFM)损失、DMD 蒸馏全部建立在流匹配速度参数化之上,公式中的 $v_\theta$ 与 $v$ 都源于此。
RoPE 旋转位置编码
RoPE 把位置信息编码为对 query/key 的旋转:注意力打分 $(R_i q)^\top R_j k$ 只依赖相对位置 $i-j$。视频 DiT 使用 3D 版本,同时编码帧序(时间轴)与行、列空间位置,是预训练权重的核心先验,破坏其布局会损失预训练能力。
tiled PRoPE 的关键卖点就是完全保留 RoPE 布局、把相机投影乘上去而不覆盖时间结构;理解 RoPE 才能看懂 Figure 2 的设计对比与附录 B 的同内容探针验证(直线轨迹下注意力核最大变化仅 1.3%)。
相机内外参与 3D 投影几何
相机由内参矩阵 $K$(焦距、主点)与外参位姿 $T_{cw}$(相机到世界)描述,世界点到图像的投影为 $P = \mathrm{lift}(K)\cdot T_{wc}$。反过来,配合度量深度图可将图像 patch 反投影回 3D 世界坐标,再投影到任意新视角,建立跨视角几何对应;PRoPE 用相对投影 $M_{ij} = P_i P_j^{-1}$ 把相对旋转、平移与内参一起编进注意力。
patch memory 的检索、z-buffer 遮挡融合、运动感知过滤公式 $s_{ij}$,以及 tiled PRoPE 的全部推导都依赖这套投影几何,是读懂方法章节的数学基础。
分布匹配蒸馏(DMD)
一种扩散模型加速技术:训练学生模型做一步或少数几步生成,用一个'假评分器'(fake critic)拟合学生输出分布,再用真实教师对其打分,通过 $\mathcal{L}_{\mathrm{DMD}} = \mathbb{E}\, w(t)\,\mathrm{KL}(q_{\theta,t}\,\|\,p_{\phi,t})$ 让学生分布逼近双向教师分布,把几十步去噪压缩到 1-4 步。CausVid 等工作将其扩展到因果视频生成。
本文两阶段蒸馏的第二阶段(self-rollout DMD)是实现单卡 20 FPS 实时交互的核心,课程式条件引入、学生与评分器 5:1 的更新比等设计都需要 DMD 背景才能理解。
VAE 潜在空间与 latent patch
视频生成不直接在像素上操作:VAE 编码器把帧压缩到低分辨率潜空间(latent),DiT 在潜空间去噪,最后由解码器还原像素。latent 网格的一个 cell 对应图像上一个 patch 区域,序列长度、显存与延迟都以 latent 数计。
patch memory 存储的正是 VAE latent patch(检索无需重新编码);序列长度约 2.3 倍上限、MG-LightVAE 对解码器做 75% 剪枝等设计与延迟分析都基于这一表示。
研究动机
交互式世界模型在闭环自回归中运行——每一步的预测都会变成后续生成的上下文,因此视觉与几何误差会随时间不断累积,导致场景漂移、身份不一致与可控性退化;同时有限的上下文窗口让模型无法直接访问久远的观测,长时程的场景重访(revisit)越来越困难。大的视角变化还提出了更高要求:模型不仅要检索到相关历史信息,还要确定它在当前相机下的正确几何对应。更麻烦的是时间结构上的矛盾——静态环境应当长期持久,动态实体却要随交互与提示演化,两者若混在同一记忆里,同一物体在不同时刻的观测会在融合时产生重复物体、鬼影与错误遮挡。现有方法按记忆存储单元可分为三类:RELIC 等把历史压缩成隐式 latent token,高效但召回完全依赖网络隐式学习;Context as Memory、WorldMem、Matrix-Game 3.0、VMem 等存储整帧并按视场重叠或重建表面检索,但'一帧'是不可分割的单元,只能整体、且只能从其原始视角被召回;点云/3DGS 类显式重建几何约束强,却难以合成未观测到的新内容。记忆、相机控制、动态一致性与提示驱动演化至今基本被当作独立问题分别处理,而一个真正的持久世界模型必须联合回答:记住什么、在新视角下出现在哪、该持久还是该演化。
本文的目标是本文的目标是把 Matrix-Game 系列推向几何感知、长时程一致的实时交互世界生成:在单一自注意力栈内统一长时记忆与几何一致的相机控制,使模型在分钟级 rollout 中能忠实重建访问过的场景、在大幅视角变化下保持物体与角色身份、自然响应提示驱动的事件演化,同时以单张 GPU 支撑 720p、最高 20 FPS 的实时闭环交互。具体约束上,作者希望记忆框架不引入任何额外可学习参数、不修改骨干架构(从而完整继承 Wan2.2-TI2V-5B 的预训练先验);静态场景用显式几何记忆持久化、动态主体用轻量参考表示持续锚定;并通过两阶段蒸馏把高质量双向扩散模型转化为少步全因果生成器,在 SANA-WM 一分钟基准的全部位姿指标上达到可比方法中最优,同时保持重访结构一致性与 VBench 画质。
与已有工作不同的是,本文的独特切入在于把记忆的存储粒度从'整帧'细化到'图像 patch',并反转了记忆的寻址逻辑:一个历史 patch 不是按它'存储在哪里'被检索,而是按它'应该出现在被生成帧的哪里'来寻址——检索到的 patch 继承目标帧的 RoPE 时间戳,并以浮点亚网格空间坐标声明位置(几何不可靠的投影直接丢弃)。配合 tiled PRoPE 把相机投影矩阵平铺叠加到全部 head 通道的时空 RoPE 上,单次 softmax 的注意力打分同时携带相对时间 $\Delta t = i - j$ 与相对投影 $M_{ij} = P_i P_j^{-1}$。这与原生 PRoPE 把一半 head 维度划给相机的不相交划分本质不同,也解决了 DreamX 类方案中单 token 无法同时携带相机位姿与时空位置的问题。此外,作者显式把'静态几何该被记住'与'动态主体该被演化'拆成两个记忆分支(patch memory vs 参考 token 前缀),并用基于深度反投影一致性的运动判据而非语义类别来决定归属——这是以往整帧检索或纯隐式记忆范式都没有做出的划分。
核心方法
直觉上,本文把长时程一致性拆解为三个子问题,并用一套'位姿感知 token 序列 + 统一记忆'同时回答:记住什么(patch memory 保存历史观测的 3D patch 云)、在哪重现(tiled PRoPE 让注意力自带跨视角几何对应)、什么该持久什么该演化(静态观测进 patch memory,动态主体由 4 张参考图的 token 前缀锚定)。技术路线上,模型以 Wan2.2-TI2V-5B 为骨干:每个自回归步把锚帧(anchor)、干净上下文帧、检索到的记忆 patch、参考 token 与待去噪目标帧排进同一序列,每个 token 同时拥有 RoPE 时空坐标与相机位姿;文本提示是唯一走原生 cross-attention 的外部条件。训练在 1280×704 分辨率进行,每样本 21 个目标 latent 帧,序列长度上限约为目标轨道的 2.3 倍。生成时以 chunk 为单位因果推进,每个生成窗口的锚帧是上一窗口的最后一个 latent 帧。蒸馏分两步:先用感知流匹配(PFM)在冻结感知编码器的特征空间做教师强制的因果适配,得到高质量少步因果初始化;再用课程式自回放 DMD 直接优化推理时的自回归行为,最终得到 3 步、单卡 720p 最高 20 FPS 的实时交互生成器。训练语料统一覆盖 Unreal 模拟环境、开放世界游戏与互联网视频,并配备几何(VGGT-Omega + Depth Anything 3 度量尺度)、语义(Gemma 窗口级提示)与身份(YOLO 轨迹 + 多视角参考图)三类自动标注。
核心创新是'补丁记忆 + tiled PRoPE'这对零新增参数的组合。patch memory 把历史 VAE latent patch 用度量深度和相机位姿反投影进统一 3D 空间,目标相机视锥查询该 patch 云,经 z-buffer 只保留离目标相机最近的表面,散布成目标视角对齐的记忆画布;被遮挡或从未观测的区域留空洞并直接从 token 序列中丢弃(不占序列长度),留给扩散模型按当前噪声潜变量、文本与上下文合成——几何证据可靠处复用记忆,未见区域保持生成自由,兼得显式记忆的几何可靠与隐式记忆的生成灵活。tiled PRoPE 则解决把 PRoPE 从新视角合成(NVS)移植到视频生成的适配问题:原生 PRoPE 把一半 head 维度分给相机投影、两个四分之一分给 2D 行列位置,既剥夺骨干预训练 3D RoPE 的时间轴,也无法让单 token 同时携带相机与时空位置;tiled 版本把 4×4 投影矩阵沿对角平铺为 $\mathrm{tile}(P)$ 作用于每个 4 通道组——q 乘 $\mathrm{tile}(P_i)^\top$、k/v 乘 $\mathrm{tile}(P_j)^{-1}$、输出乘回 $\mathrm{tile}(P_i)$——于是时间结构与相机调制在同一个注意力核中共存。二者叠加后,长期记忆与相机控制由同一自注意力栈处理,不改架构、不加参数。为稳定大位移下的数值,所有位姿相对当前窗口首帧重定心,并对平移做方向保持的对数压缩 $\tilde{t} = \frac{\log(1+\|t\|)}{4\|t\|}t$。
方法步骤详情
完整流程如下。(1) 数据标注:VGGT-Omega 分块推理得到尺度不定的位姿与深度,用 Depth Anything 3 度量分支为每块锚定度量尺度,相邻块经 Sim(3) 对齐拼接并施加单一全局尺度,输出相机到世界位姿 $T_{cw}$、内参与度量深度;Gemma-4-26B-A4B 生成窗口级提示(显式压制'无运动'类退化描述);YOLO 分割跟踪产生物体轨迹并按跟踪质量/时长/显著度/居中程度/掩码质量自动识别第三人称可控角色,DINO 特征用于采样互异多视角参考图;最后按重建质量、相机行为、视觉质量、场景适配四轴硬门槛做数据策展。(2) 基座训练:每个目标 latent 帧按贪心覆盖式选择 $f_k = \arg\max_{f\in H\setminus S}\ |C(f)\setminus\bigcup_{s\in S} C(s)|$ 选至多 5 帧历史,patch 经反投影-重投影后按目标视角 z-buffer 融合进记忆画布,无效投影丢弃;有效 patch 以目标帧 RoPE 时间 + 亚网格浮点坐标入列(不可用时回退最近整数格点);YOLO 加几何一致性分数 $s_{ij}=\min(s_{i\to j}, s_{j\to i})$(基于掩码点深度反投影到邻帧的对称方向重叠率)把动态物体从静态记忆中剔除;4 张参考图各占约 1/4 帧预算组成 token 前缀,置于固定间隔的负时间轴 $t_r = -r\Delta_{ref}$ 并继承锚帧相机位姿;训练与推理中主体区域都被真实背景 patch 替换以防外观泄漏,并施加主体区域辅助损失 $\mathcal{L} = \mathcal{L}_{full} + \lambda_{sub}\, \frac{\sum_p M_{sub}(p)\,\|v_\theta(p)-v(p)\|_2^2}{\sum_p M_{sub}(p)+\epsilon}$。优化用 AdamW 恒定学习率 $5\times10^{-5}$、权重衰减 0.01、梯度裁剪 0.5、BF16 + DeepSpeed ZeRO-2,patch memory 在 80% 迭代启用。(3) 两阶段蒸馏:先做教师强制的因果适配(PFM),因果窗口含 1 个干净锚帧 + 7 个各 3 latent 帧的自回归块,用冻结 VAE 解码完整因果链、以冻结 InternVideo2-1B 的全部特征块在感知空间回归,1 万步、lr $5\times10^{-6}$;再做自回放 DMD,学生每 chunk 生成 3 latent 帧、3 步去噪,生成块在线发布到记忆后再查询下一块,仅共享初始记忆/锚帧/提示/轨迹等稳定条件,课程上先蒸馏 CFG 与相机控制、再逐步引入 patch 与上下文记忆,PREFIX 与 chunk 局部上下文在每个去噪子步被加噪到下一调度级(HiAR 式),CFG 尺度 3,共 1 千外层步,学生/假评分器学习率 $2\times10^{-6}$/$4\times10^{-7}$、更新比 5:1。
技术新颖性
技术新颖性体现在四个层面。其一,记忆粒度:在显式几何重建与整帧检索之间确立 patch 级中间粒度(继承 MosaicMem 的思想,但首次将其与位姿感知的自回归流式世界生成深度整合),兼顾几何可靠与生成灵活,天然支持稀疏检索、局部编辑与无全局重建误差累积的记忆更新。其二,几何注入方式:tiled PRoPE 与原生 PRoPE/DreamX 的不相交子空间划分本质不同——相机矩阵被平铺到 RoPE 全部通道上做乘法叠加;附录 B 用同内容探针(两帧内容相同、只差位姿编码)验证 RoPE 时间核几乎不变(直线轨迹下最大变化仅为动态范围的 1.3%),相机项只是按视角相似度重新加权而非覆盖时间结构,这使其成为视频生成中少数不新增可学习参数的相机条件方案。其三,静动解耦判据:不用语义类别而用深度反投影跨帧重叠的对称一致性 $s_{ij}$ 判定静态有效——静止的行人仍可作为空间参照,运动的同类别物体则被剔除,且训练与推理共用同一准则、过滤成本按段摊销(每段一次而非每帧一次)。其四,蒸馏课程:把几何条件记忆本身纳入自回放 DMD 的课程(先 CFG 与相机、后记忆),并只共享稳定外部条件而让学生自持在线记忆、评分器记忆保持冻结,规避了学生与评分器记忆轨迹不匹配这一自回归 DMD 特有的稳定性难题。
实验结果
在 SANA-WM 一分钟基准上(720p、单卡、蒸馏前基座评测),Matrix-Game 3.5 在两个轨迹分割的全部位姿指标上均为最优:Simple 分割旋转误差 R=1.63°、平移 T=1.10m、CMC=1.11,把次优 SANA-WM+refiner 的 R=4.50 降低约 64%;Hard 分割 R=2.70°(次优 8.34,降幅约 68%)、T=1.25、C=1.33,说明困难长程运动下生成相机仍稳定跟随目标轨迹。画质并未因此受损:VBench Overall 为 80.14/80.85,与最强基线相当(LingBot-World 81.82/81.89,但需 8 卡、14B+14B 参数、480p)。重访一致性上,两个分割的重访 SSIM 均最高(0.439 与 0.414,次优 0.366/0.332),PSNR 14.56/14.14 亦居前列,证明 patch memory 带来强结构性场景召回;PSNR/LPIPS 未全面领先的残余差距主要源于像素对齐指标会惩罚合法的场景动态(角色、植被、天气在重访时仍在演化)。时序退化方面,最后 10 秒窗口的成像质量 IQ50-60 为 70.56/71.12,$\Delta$IQ 仅 3.24/2.40,一分钟内未见严重累积退化。定性结果:Figure 8/9 展示游戏与真实场景 60 秒 rollout,红框标出的 60 秒帧区域与 0 秒初始观测高度一致;Figure 10 显示 VLM 逐段改写提示可把一次性注入的火山、狗、火车、UFO 事件自然携带演化,说明记忆与相机条件保留而非抑制了预训练模型的提示遵循能力;Figure 11 消融显示仅去掉参考 token(其余条件与种子固定)后,主角的战术背心、背挂武器、车辆银色饰条等身份细节在 300-400 帧后明显漂移;Figure 12 显示 3 步蒸馏模型在郊区、绿道、中世纪集市、滨水住宅四类场景的一分钟交互中保持清晰细节与连贯几何。系统层面,INT8 量化 + PyTorch 编译、GPU 化记忆检索、75% 剪枝的 MG-LightVAE,使端到端稳态吞吐达单张 H100 上 1280×704、batch 1、最高 20 FPS(含 3 步去噪、在线记忆检索与解码全过程)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 相机控制精度(SANA-WM 一分钟基准·Simple 分割) | 旋转误差 R (°, ↓) | 1.63 | 4.50(SANA-WM + refiner,次优) | 降低约 63.8% |
| 相机控制精度(SANA-WM 一分钟基准·Hard 分割) | 旋转误差 R (°, ↓) | 2.70 | 8.34(SANA-WM + refiner,次优) | 降低约 67.6% |
| 场景重访一致性(Simple 分割) | SSIM (↑) | 0.439 | 0.366(LingBot-World,次优) | +19.9% |
| 场景重访一致性(Hard 分割) | SSIM (↑) | 0.414 | 0.332(LingBot-World,次优) | +24.7% |
| 生成质量(Simple 分割) | VBench Overall (↑) | 80.14 | 81.82(LingBot-World) | 基本持平(-1.68),且为 720p 单卡 vs 480p 8 卡 |
| 长时序稳定性(Hard 分割) | ΔIQ = IQ0-10 − IQ50-60 (↓) | 2.40 | 25.88(HY-WorldPlay)/ 0.31(SANA-WM + refiner) | 显著优于多数基线,略逊于外挂 17B refiner 的方案 |
| 推理效率 | 分辨率 × GPU × 吞吐 | 720p、1×H100、10.9 视频/小时(蒸馏后 20 FPS 交互) | LingBot-World:480p、8 GPU、0.6 视频/小时 | 更高分辨率下吞吐提升约 18 倍 |
局限与改进
作者坦承及可观察到的局限包括:(1) 重访一致性的 PSNR 与 LPIPS 并未全面领先——Simple 分割 LPIPS 0.439 略逊于 SANA-WM+refiner 的 0.479 的水平(更低者更优的意义上两者接近),PSNR 亦低于 LingBot-World 的 14.59,作者将其归因于像素对齐指标惩罚合法场景动态,这一解释缺乏受控实验支撑;(2) patch memory 依赖的度量深度与位姿全部来自外部估计器(VGGT-Omega + Depth Anything 3),几何误差会直接传导进记忆检索与 tiled PRoPE 的投影计算,论文未量化标注噪声对长程召回的敏感度,几何不可靠区域的处理方式只是简单丢弃;(3) 动态分支仅为第三人称游戏中的单一可控角色维护参考 token,多主体以及视野外实体状态持久化尚未解决——角色离开视野后世界如何演化并无机制保证;(4) 序列长度上限约为目标轨道的 2.3 倍,且 3D patch 云随探索持续增长,数小时级开放世界的存储与检索代价未讨论;(5) 20 FPS 实时性绑定单张 H100 与 INT8 量化、3 步蒸馏,消费级 GPU 可达性存疑;(6) 相机轨迹穿墙等失败模式由可选的占用图碰撞避免模块缓解(附录 C),但该模块只调整相机位置、不改变旋转,且依赖逐段深度重注册,本身又引入了对深度估计的另一层依赖。
独立分析的弱点
独立分析有以下弱点。第一,记忆检索开销与实时预算耦合:尽管检索做了 GPU 迁移与深度候选削减,每个生成窗口仍需对 21 个目标 latent 各做视锥查询与 z-buffer 融合,且贪心覆盖选择(式 2)对历史帧集合 H 的复杂度随存量增长,若 patch 云积累数万帧历史,检索会成为瓶颈;改进方向是空间哈希/体素索引或学习式检索器。第二,几何单点故障:深度估计在天空、镜面、透明表面易失效,管道对这些区域仅做'几何不可靠则丢弃'处理,在大量水面或玻璃的关卡中记忆覆盖率会骤降、退化为纯生成,可引入不确定性加权融合或多假设深度。第三,参考 token 只锚定外观而不维护状态:4 张固定参考图在整个 rollout 中不变,无法表达角色被击倒、换装、受伤等自身演化,也没有为非角色动态物体(其他车辆、NPC)提供任何持久表示,可借鉴对象中心表示引入可更新状态 token。第四,评测协议侧重预设相机轨迹,真正的键盘-鼠标动作空间交互与用户研究缺失,'可玩性'仅由定性视频佐证;建议补充动作条件下的身份/场景一致性量化与人评。第五,训练需要 patch memory 在 80% 迭代启用、20% 关闭的混合策略,暗示纯记忆条件训练可能不稳定,其失败机理(如记忆 token 过拟合或条件依赖坍缩)未被剖析。第六,注释管线含 VGGT-Omega、DA3、YOLO、Gemma-26B 等多套大模型,数据工程链条长,小团队复现成本高。
未来方向
作者在结论中明确提出四个方向:给动态实体以持久状态,使主体离开视野后仍连贯演化、视角回归时无缝重现;让生成器自身具备几何感知,联合预测其生成内容的深度与相机位姿,使几何接地与生成互相强化而非依赖外部估计器;扩展到更丰富的具身动作空间与物理交互;以及扩展到更大骨干与更长时域。基于本文成果还可自然延伸:把 patch memory 从只读条件升级为可写、可遗忘的层次记忆(按访问频率衰减或对显著事件固化),支撑小时级开放世界;将运动感知过滤与参考 token 推广到多主体、可交互物体(开门、拾取、推动)的世界状态跟踪;利用'生成即标注'(对自生成内容做自举几何标注)降低对 VGGT-Omega/DA3 标注管线的依赖;把附录 C 的相机碰撞避免从后处理几何校正升级为与去噪联合优化的轨迹策略学习;以及探索把补丁记忆与 tiled PRoPE 迁移到具身机器人操作仿真中,检验其对真实场景深度噪声的鲁棒性。
复现评估
复现条件较好,但训练级复现门槛不低。开源方面:论文提供项目主页、GitHub 代码以及 Base 与 Distilled 两套 checkpoints,骨干为公开的 Wan2.2-TI2V-5B(5B 参数);推理侧的 INT8 量化、PyTorch 编译、MG-LightVAE(75% 剪枝解码器)与在线记忆检索均有描述,单张 H100 即可 20 FPS 交互。数据侧需自建标注管线:VGGT-Omega(几何)、Depth Anything 3(度量尺度锚定)、YOLO 分割跟踪、Gemma-4-26B-A4B-IT(窗口级提示)、DINO(参考采样)、InternVideo2-1B(感知损失编码器),均为公开模型但拼接工程量大;训练语料(Unreal 模拟、开放世界游戏、互联网视频)未公开,需要近似规模的抓取与四轴硬门槛策展。训练超参披露较细:1280×704、21 目标 latent 帧、AdamW 恒定 lr $5\times10^{-5}$、BF16、DeepSpeed ZeRO-2、梯度检查点;蒸馏两阶段分别 1 万步(lr $5\times10^{-6}$)与 1 千外层步(学生 $2\times10^{-6}$ / 假评分器 $4\times10^{-7}$、5:1 更新比、CFG 尺度 3),但未披露训练总 GPU 时数与卡片数。综合判断:基于开源权重的推理与微调复现难度中等;从零复训难度高(受数据与算力制约);评测可直接采用公开的 SANA-WM 一分钟基准协议与指标。
论文图表
相机碰撞避免示例:(a) 某 rollout 段的生成帧,规划输入轨迹(蓝)径直冲向雕像;(b) 度量深度与位姿把已观测表面抬升到统一 3D 世界坐标系并聚合为体素;(c) 累积足够表面观测的体素标记为占用(红),会穿入占用区的规划轨迹被修正为沿场景结构横向推进的调整轨迹(绿),并保持在预设安全边界外。
揭示了一种已知的失败模式(轨迹穿透已生成表面导致 3D 不一致与累积崩溃)及系统的应对机制,是理解系统边界与工程完整性的重要补充。