← 返回 2026-08-25

ReWorld:具备长时程记忆的交互式世界模型 ReWorld: An Interactive World Model with Long-Horizon Memory

Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen 📅 2026-08-24 👍 23 2026-08-30 18:30
KV缓存压缩 交互式世界模型 扩散蒸馏 流式视频生成 相机控制 长时程记忆

用窗口分离训练与位姿地标库,让交互式世界模型兼得精准控制、长时记忆与实时流式生成

前置知识

交互式世界模型

世界模型是对环境建模的生成模型,智能体可在其中'行动'并观察后果。交互式世界模型将用户动作(如按键控制的相机 6-DoF 移动)映射为逐帧视频流,要求同时满足三点:反应(按键后下一帧即响应)、记忆(重访旧地点时画面与此前一致)、流式(以交互速率无界生成)。代表系统包括 Genie 系列、HY-WorldPlay、Matrix-Game 3.0、LingBot-World、Yume-1.5 等,本文与后四者直接对比。

本文的任务设定就是交互式世界模型,'反应/记忆/流式'三大要求之间的结构性张力正是全文要解决的问题,理解这一设定才能看懂为什么需要窗口分离与缓存整合。

KV 缓存与注意力窗口

自回归 Transformer 生成时会把每个 token 的键 K 和值 V 存入 KV 缓存,后续注意力据此读取历史。缓存大小随生成长度线性增长,720p 视频下无界缓存很快耗尽显存(论文中 full-KV 在 k=192 个 latent 后即 OOM)。实际系统必须限制缓存:滑动窗口只保留最近内容(代价是遗忘过去)、或压缩旧内容(代价是保真度损失)。本文用 sink chunk + 近窗 + 位姿检索地标把缓存固定在 $B=12$ 个 chunk。

长时程记忆的核心难题就是'缓存有限但历史无界',chunk-drop 训练、地标库整合与缓存策略消融(Table 6)全部围绕 KV 缓存管理展开。

RoPE 与位姿索引注意力(MRoPE)

旋转位置编码 RoPE 通过对 query/key 做复数旋转,使注意力分数只依赖相对位置。本文采用 Memory-RoPE:每个 latent 帧携带相对相机位姿 $P_f \in SE(3)$,描述子 $c_f=[\mathrm{vec}(R_f);\ t_f]\in\mathbb{R}^{12}$ 经零初始化 MLP 映射为相位偏移 $\delta_f$ 叠加到 RoPE 上,使注意力依赖位姿差而非时间距离——相似视角无论隔多久都互相拉近,缓存因此成为按位姿寻址的隐式空间记忆。

MRoPE 是记忆被'检索'的机制基础:地标按位姿最近邻取回后,靠位姿索引注意力被读取;论文还配以零初始化 SE(3) 残差在 V/O 上补全条件注入。

分块因果流式扩散

标准视频扩散模型对整段去噪,无法流式。ReWorld 基于 Wan2.2-TI2V-5B 双向视频扩散 Transformer,通过分块因果化改造:视频按 latent chunk(每 chunk 4 个 latent 帧,训练窗 L=12 chunks 约 8 秒)自回归产出,chunk 内全注意力、chunk 间因果注意力,每步去噪生成一个 chunk 并把其 K/V 追加进缓存,实现时间箭头上的流式生成。

所有训练(teacher forcing、chunk-drop、混合窗口)和推理(地标检索、缓存整合)都发生在这种 chunk 粒度的因果注意力结构上,必须先理解它。

分布匹配蒸馏(DMD)与 LoRA

DMD 是少步蒸馏方法,让学生分布匹配教师分布;结合 self-forcing rollout,学生从自己的 KV 缓存流式生成,只需文本 prompt 无需真视频。ReWorld 把蒸馏限制在 rank-128 的 LoRA 适配器(2.6 GB)内:骨干冻结、动作与位姿注入通路不加 LoRA,因此同一骨干可在'多步高保真'与'4 步实时'两种模式间切换,适配器还能跨检查点以 2k–4k 步再蒸馏。

实时流式生成(720p、4 步去噪、CFG=1)靠这条蒸馏路线实现,且'控制不受蒸馏影响'的设计依赖 LoRA 限定这一关键细节。

Plücker 坐标

Plücker 坐标用 6 维向量 $[\mathbf{d},\ \mathbf{o}\times\mathbf{d}]$ 表示一条空间直线,其中 $\mathbf{d}$ 是方向、$\mathbf{o}\times\mathbf{d}$ 是矩。本文把 commanded 位姿下所有像素的视线写成 Plücker 射线图,经 MLP 投影后逐 token 加到 patch embedding 上,构成直接动作注入通道,与 MRoPE 的位姿检索通道分工:前者下达命令,后者标记历史内容在哪里被看过。

动作注入是控制精度的来源(Table 7 显示加入后 RotErr 从 17.66° 降到 13.21°),也是控制与记忆相互干扰现象的根源,理解它才能看懂窗口分离的动机。

研究动机

交互式世界模型要同时做到三件事:跟随用户动作、记住已展示的场景、实时流式生成,而现有系统把控制与记忆放在一起训练,存在结构性冲突——控制想要短注意力窗口,记忆想要无界窗口。论文的解耦实验(Table 7)给出直接证据:对仅用 MRoPE 位姿索引的模型(RotErr 17.66°)加入直接动作注入后,所有控制指标都变好(RotErr 13.21°、TransErr 0.204→0.107),但回访 SSIM 却从 0.3898 掉到 0.3376——控制学会了,长程记忆反而退化。部署端还有第二重矛盾:自回归生成的 KV 缓存随 rollout 线性增长,720p 下无界缓存远在记忆真正受考验的时长之前就耗尽显存(full-KV 在 k=192 个 latent 后 OOM),而常用的滑动窗口或压缩策略要么遗忘(k=384 时滑窗 SSIM 仅 0.3476),要么模糊(均值池化仅 0.3541)。

本文的目标是本文要构建动作可控的流式世界模型 ReWorld,在固定 KV 预算下同时达成三个此前相互冲突的目标。其一,控制保真:按键驱动相机做 dolly/strafe/arc 等轨迹时精确跟随,把 240 段基准上的旋转误差做到最低(最终 11.95°);其二,长时程记忆:相机离开又返回(回文轨迹)时能重现出发时的画面,在长达 64 秒、384 个 latent 的 out-and-back rollout 中,仅用 12 个 chunk 的缓存仍能再生起始视图,而此时滑窗早已把证据逐出、full-KV 已内存耗尽;其三,实时性:在 704×1280 分辨率下以 4 步去噪实时流式输出,覆盖照片级、游戏风格与风格化世界。系统以 Wan2.2-TI2V-5B 为骨干,训练数据为 8 个来源、220,724 段度量对齐的位姿标注片段,并通过 LoRA 蒸馏让同一骨干兼有高保真多步模式与实时交互模式。

与已有工作不同的是,本文的独特切入是把控制与记忆的耦合当作'窗口不匹配'问题而非'容量不足'问题来解。已有工作或把相对位姿折进注意力(HY-World 1.5 的两遍设计带来约 2 倍注意力 FLOPs,E-PRoPE 用约 4.5 倍少的 token 做第二遍),或直接注入动作信号;记忆方面则依赖随 rollout 增长的帧档案、外部 3D 重建、或注意力 sink 加滑窗(代价是窗口外全部遗忘)。ReWorld 的做法不同:训练时按窗口拆分两种能力——24 头中 18 个只在最近 12 帧局部窗口内学控制,6 个全局头看全因果历史学检索,并用每步轮换的随机头路由防止能力绑定到特定头;推理时再用'少而完整'的地标整合替代'多而退化'的池化压缩,把整个过去装进 12 个 chunk。这一设计还给出可检验预测:推理时更换缓存策略不应改变控制误差,Sec. 4.5 的实验证实了这一点。

核心方法

ReWorld 把 Wan2.2-TI2V-5B 视频扩散 Transformer 改造成分块因果的流式世界模型:视频按 latent chunk(每 chunk 4 个 latent 帧,训练窗 L=12 chunks 约 8 秒)自回归生成,chunk 内全注意力、chunk 间因果注意力,每 chunk 由一个 6-DoF 相机动作 $a_k$ 驱动。直觉上,系统要解决'当前命令'与'远古记忆'如何共存于同一注意力机制的问题:作者把两条条件通路分开——Plücker 射线图把命令直接注入当前 chunk 的每个 token,MRoPE 用相机位姿为缓存中每个 chunk 建立可检索索引。在此基础上,训练用混合每头窗口加随机头路由把控制(短窗)与记忆(长窗)的学习解耦,用 chunk-drop 让稀疏缓存落在分布内;推理用位姿索引的地标库把无界历史整合进固定 12-chunk 缓存;最后 DMD 蒸馏进 rank-128 LoRA 实现 4 步实时。数据侧用度量对齐的 8 源 22 万段语料保证同一按键在所有数据源上移动相同物理距离。

核心洞察是一个不对称性:动作跟随不依赖窗口大小——无论能看到多少历史,模型都必须正确响应当前命令,而响应所需(当前场景+当前命令)就在短窗之内;检索却只能在长窗下学习——看不到远处的模型没有东西可检索。据此 ReWorld 在每次迭代同时使用两种窗口:24 个注意力头中 18 个局部头只看最近 $w=12$ 帧(3 个 chunk),6 个全局头看全部因果历史。关键补充是随机头路由:从 $|\mathcal{P}|=12$ 个随机六头全局集合构成的池中,每个优化器步切换到下一个分区。为什么必须随机?因为推理时全历史已不存在、所有头读同一个有界缓存,固定分区会让头专门化于部署时无法提供的窗口;随机路由使每个头都在两种角色下训练,任何能力都不绑定特定头,推理时任意头都能读共享缓存而不损失控制。记忆侧的对称设计是:缓存里'少而完整'(每个地标 chunk 全分辨率保留)优于'多而退化'(均值池化在 k=384 时 SSIM 低约 2 个百分点)。

方法步骤详情

流程分四步。第一步数据构造:UE 自动化管线渲染 337 个环境,产出控制集 95,895 段与扩展集 42,536 段(锚点:每 latent 步平移中位数 0.3667),加上 DL3DV、游戏漫游等其余六源共 8 源 220,724 段,按中位数比例 $\sigma_s$ 统一到同一物理尺度,0.2 概率回文增强注入重访证据。第二步训练:latent 帧的相对位姿 $P_f\in SE(3)$ 经零初始化 MLP 变成 RoPE 相位偏移,命令位姿经 Plücker 射线图注入 patch embedding;24 头按 1:3 分局部(w=12 帧)/全局并每步轮换 12 个随机分区;训练窗随机 drop 到 sink+5 个幸存 chunk。第三步推理:缓存为 1 个 sink + 5 个近窗 + 6 个位姿最近地标($B=12$),老化 chunk 按里程计规则进入容量 $K=30$ 地标库,满员逐出最冗余者。第四步实时化:DMD 蒸馏进 rank-128 LoRA(2.6 GB),4 步去噪、CFG=1,720p 流式。

技术新颖性

技术新颖性有五点。第一,窗口分离训练加随机头路由是不加参数、损失或模块的配方就实现控制与记忆解耦,并给出可检验预测(换缓存策略控制误差不变),Table 7 证实:路由版控制 RotErr 12.94° 略优于不路由的 13.21°,同时把重访 SSIM 从 0.3376 恢复到 0.3752。第二,MRoPE 把位姿当检索索引用在既有注意力 pass 内,代价仅一个小 MLP 加两个线性层;对比 HY-World 1.5 的独立相机感知 pass(约 2 倍注意力 FLOPs)与 E-PRoPE 的减 token 第二遍,注意力核与每头窗口完全不动(Table 1)。第三,地标库的里程计准入只看相机走了多远、不查重访记录,保证回程路径照常入库(模拟显示若对全库去重,远端重访覆盖率仅约 64%),满员时逐出位姿最近邻距离最小的成员。第四,chunk-drop 把推理时稀疏非连续缓存变成分布内输入:不加 CD 时 k=384 SSIM 0.3387,加后达 0.3752。第五,LoRA 限定蒸馏让 2.6 GB 适配器可跨检查点迁移,骨干的高保真多步模式完整保留。

Overview of ReWorld.
Figure 2: Overview of ReWorld.
Mixed per-head attention windows, routed from a pattern pool.
Figure 3: Mixed per-head attention windows, routed from a pattern pool.
Memory consolidation under a fixed KV budget.
Figure 4: Memory consolidation under a fixed KV budget.
Real-time distillation. A caption-domain DMD LoRA plugs into the frozen backbone; the control path carries no LoRA.
Figure 5: Real-time distillation. A caption-domain DMD LoRA plugs into the frozen backbone; the control path carries no LoRA.
The four-stage data pipeline.
Figure 6: The four-stage data pipeline.

实验结果

四组实验支撑结论。(1)相机可控性(40 图 × 6 轨迹,240 段/方法):ReWorld 总体 RotErr 11.95°、TransErr 0.102、CamMC 0.332 全部最佳,优于 SANA-WM(13.02°)等六基线;palindrome 轨迹 RotErr 0.64° 次优。(2)长时程记忆(回文 NIAH,k=96 latent 约 16 秒):SSIM 0.384、LPIPS 0.332、DINO 0.932、ORB 0.379;HY-WorldPlay 达 0.427 但路径仅 210 px(本文 615 px),其余基线 0.194–0.313;Figure 8 定性显示重访布局完好。(3)生成质量:VBench 七维均值 0.850 最高(次优 0.844),时间一致性第一梯队且动态度 0.912。(4)消融:CD 与 RH 叠加把 k=384 SSIM 从 0.3387 提到 0.3752;缓存策略上地标整合 0.3752 优于滑窗 0.3476 与池化 0.3541,full-KV 上限 0.4231 但 k=192 后 OOM。

The eight-source joint training corpus.
Table 2: The eight-source joint training corpus.
Camera controllability on the 40-image × 6-trajectory benchmark (240 clips per method).
Table 3: Camera controllability on the 40-image × 6-trajectory benchmark (240 clips per method).
Long-horizon memory against the six interactive world-model baselines on the palindromic revisit bench.
Table 4: Long-horizon memory against the six interactive world-model baselines on the palindromic revisit bench.
VBench quality on the seven video-intrinsic dimensions.
Table 5: VBench quality on the seven video-intrinsic dimensions.
Revisit SSIM on the long-rollout memory test at four rollout lengths k.
Table 6: Revisit SSIM on the long-rollout memory test at four rollout lengths k.
Control–memory decoupling study: control metrics on the long-rollout memory test for the three fusion variants.
Table 7: Control–memory decoupling study: control metrics on the long-rollout memory test for the three fusion variants.
Constructed palindrome trajectories.
Figure 7: Constructed palindrome trajectories.
Qualitative memory comparison on a strafe-and-return rollout.
Figure 8: Qualitative memory comparison on a strafe-and-return rollout.
Inference cache policies, qualitatively.
Figure 9: Inference cache policies, qualitatively.
查看结构化数据
任务指标本文基线提升
相机可控性(40 图 × 6 轨迹 = 240 段/方法) RotErr 旋转误差(°,越低越好) 11.95 13.02(SANA-WM,次优) 降低 1.07°,相对约 8.2%,七方法最佳
相机可控性 CamMC 相机运动一致性(越低越好) 0.332 0.354(LingBot-World,次优) 降低 0.022,同时 TransErr 0.102 亦为最佳
长时程记忆(回文 NIAH,k=96 latent ≈16 秒) Revisit SSIM(越高越好) 0.384(路径长 615 px) 0.427(HY-WorldPlay,但路径仅 210 px);其余基线 0.194–0.313 在约 2.9 倍执行路径下仍处第一梯队,DINO 0.932 接近最佳
视频生成质量(VBench 七个视频内在维度) 七维均值(越高越好) 0.850 0.844(Yume-1.5)/ 0.842(HY-WorldPlay) 七方法最高,且动态度 0.912 远高于一致性导向的 HY-WorldPlay(0.733)
消融:训练配方(720p、20k 步从头训练) Revisit SSIM @ k=384 0.3752(chunk-drop + 随机头路由) 0.3387(base)/ 0.3463(仅 CD)/ 0.3565(仅 RH) +0.0365(约 +10.8%)
消融:推理缓存策略(同一预算 B=12) Revisit SSIM @ k=384 0.3752(地标整合 + 位姿检索库) 0.3476(滑窗+sink)/ 0.3541(均值池化)/ 0.3629(无库静态地标) 较滑窗 +8.0%;full-KV 上限 0.4231 但 k=192 后 OOM 不可部署
消融:控制-记忆解耦 RotErr / Revisit SSIM 12.94° / 0.3752(Routing 完整配置) 17.66° / 0.3898(仅 MRoPE);13.21° / 0.3376(动作+MRoPE 不路由) 在不牺牲控制(13.21°→12.94°)的前提下把回访 SSIM 从 0.3376 恢复到 0.3752

局限与改进

作者明确承认的局限在结论段:记忆仅以相机位姿为键,动态场景(人物走动、物体位移)和非导航式交互尚未覆盖——地标是静态快照,重访时呈现的是'过去的冻结画面'。我自己的观察有五点:其一,内存评测依赖 Sim(3) 加朝向对齐,方法间执行路径长度差异巨大(HY-WorldPlay 仅 210 px,本文 615 px),论文虽报告路径长度但只作描述性说明,跨方法公平性有限;其二,自建回文 NIAH 协议与训练时的回文增强同构,存在'考题即练习题'的循环风险,非回文式随机重访未测;其三,地标库容量 K=30 在小时级或大范围探索下的可扩展性未验证;其四,训练语料 63% 为 UE 合成渲染,真实世界泛化程度没有单独报告;其五,VBench 分数在归一化到统一 32 帧/1280×704/16 fps 后计算,与各方法原生输出的公开数字不可直接比较,且动态度与重访指标都偏好低运动 rollout,需联合解读。

独立分析的弱点

独立分析五个弱点。第一,静态位姿键控在动态世界失效:地标库存的是冻结快照,若重访时场景已变化(门被打开、光照改变、NPC 移动),模型会'记忆倒放';改进方向是给地标附加时间戳与语义标签,检索时结合生成式条件(重照明、动态物体先验)而非直接复用 K/V。第二,里程计准入假设沿途样本稠密冗余,但原地环视(位移小、视角变化大)会被误判为冗余而漏存关键地标;改进是把平移里程换成位姿流形上的测地距离或视角熵判据。第三,随机头路由的可解释性与容量上限不清晰:6/24 全局头比例、池大小 12 均为经验值,推理时'谁记得远处内容'取决于训练末段的随机状态;改进是做检索容量随全局头比例的标度实验,或引入显式路由正则。第四,评测与训练同构:回文 NIAH 对应回文增强、控制基准的 6 条规范轨迹对应 UE 六种轨迹模式,对分布外指令(自由组合的连续摇杆输入)鲁棒性未知;改进是构建众包真实游玩轨迹评测集。第五,蒸馏只用另一域 248K 条通用长 caption(VidProM 扩展),域差距对实时模式质量的影响未量化。

未来方向

作者提出的方向是:把整合机制扩展到动态场景与更丰富的非导航交互——这要求地标从静态位姿键控升级为能处理移动物体与光照变化的世界状态表示。基于本文成果可延伸的研究还有:(1)混合记忆架构,把 KV 空间地标库与显式 3D 表征(3DGS/NeRF)结合,用地标做检索入口、3D 表征做几何一致性校验,有望把重访上限从 full-KV 的 0.4231 再往上推;(2)语义化检索,当前按位姿最近邻取 6 个地标,可扩展为位姿加语义混合键控,支持'回到有红门的地方'这类语言查询,让世界模型成为可查询的空间记忆;(3)跨会话持久化,把地标库落盘存档,实现'上次玩到的地方'级别的长期记忆与场景接续生成;(4)作为 RL 环境模拟器,本文的实时 4 步生成与 11.95° 控制误差为智能体训练提供了低成本可交互环境;(5)地标库机制本身是模型无关的缓存管理策略,可移植到其他自回归视频模型甚至长上下文 Transformer 上验证泛化性。

复现评估

复现评估:论文未提及开源代码或权重,项目页以视频演示为主,完整复现属于高难度。数据侧成本极高:需要 UE 自动化渲染管线(337 个环境、130,986 段原始渲染)、494.7 小时跨 168 款游戏的录像及 VIPE/MegaSaM/Qwen-VL 标注、DL3DV 与 RealEstate10K 等公开集重处理。不过附录 A.2 给出全部 per-source 尺度除数(UE σ=100、DL3DV 0.1923、RealEstate10K 0.2273 等)与后验审计(各源中位数增量比 0.92–1.21),数据管线复现细节异常充分。算力侧:基于 Wan2.2-TI2V-5B 的两阶段训练(480p 预训练 + 720p warm-start)、消融显示单次从头训练 720p/20k 步、DMD 蒸馏 2k–4k 步再蒸馏,需多卡 A100/H100 级别数周投入。相对易复现的是评测协议:40 图 × 6 轨迹基准、回文 NIAH(k=48/96/192/288/384)、VBench 归一化流程描述详尽。综合判断:评测可复现,系统复现需团队级资源。