Wonder:打造更优的视频世界模型 Wonder: Video World Model Done Better
实时相机可控的视频世界模型,支持图像与视频条件的长程交互探索
前置知识
视频扩散模型(Video Diffusion Model / DiT)
扩散模型通过「逐步加噪—逐步去噪」学习数据分布。视频扩散模型以扩散 Transformer(DiT)为骨干,在 3D VAE 潜空间对视频 token 去噪,文本提示经交叉注意力注入。Wonder 基于开源 Wan2.1-I2V-14B 双向视频扩散模型。
Wonder 整体框架建立在「双向扩散教师 → 因果自回归学生」的蒸馏范式上,理解扩散去噪、潜空间、VAE 编解码是读懂其训练流程的前提。
自回归视频生成与自蒸馏(Self-Forcing)
把双向视频扩散模型改造成因果(单向)生成器,使其能像语言模型一样按 chunk 滚动生成并复用 KV cache。Self-Forcing 在训练时让学生在自己生成的 rollout 上训练,缩小训练-推理的 exposure bias。Wonder 在此基础上做 ODE 初始化与 DMD 蒸馏。
Wonder 的 Stage 2 完全围绕「把教师蒸馏成 4 步因果学生」展开,sparse context forcing、混合学生、GAN 控制正则都是对自蒸馏流程的修正。
分布匹配蒸馏(Distribution Matching Distillation, DMD)
通过最小化「加噪真实数据分布」与「学生自生成分布」间的反向 KL 散度来蒸馏:把学生 rollout 加噪后送冻结双向教师和可训练 critic 估分,分数差作为梯度更新学生。DMD2 进一步附加 GAN 目标增强高频细节。
Wonder 蒸馏框架直接建立在 DMD 之上,论文观察到 DMD 分数残差主要监督高频纹理、对低频相机运动监督不足,这正是 GAN 控制正则要解决的问题。
相机位姿与 Plücker 射线表示
相机控制传统上用 6-DoF 外参(旋转+平移)或 Plücker 射线嵌入(每像素一条射线的方向与力矩)作条件。隐式方法把位姿经 MLP/RoPE 注入 token;显式方法从输入重建点云再重渲染。前者数据饥渴且不精确,后者精确但受限于已观测视角。
Wonder 提出的「像素空间坐标场」正是为同时克服隐式与显式两类方法缺陷,是论文核心创新之一,理解这条技术脉络才能体会其设计动机。
KV Cache 与稀疏注意力
自回归生成中模型把已生成的 key/value 缓存起来避免重复计算。世界模型需要长期记忆支持「重访」一致性,但密集注意所有历史 KV 会让每步延迟随上下文线性增长。稀疏注意力通过只选取相关子集来降低开销,Wonder 用池化摘要做检索。
Wonder 的稀疏全保真记忆机制是第二大创新——保留全部 KV 但用池化 query-key 摘要选取常数大小的记忆块,是理解其「延迟恒定」的关键。
研究动机
视频生成正从「固定时长片段合成」转向「交互式视觉世界建模」,应用于游戏创作、虚拟制作和机器人等场景。这些场景要求模型从初始条件(图像/视频/文本)构建一个持久的视觉环境,并允许用户或智能体通过控制信号探索它。然而可控性、记忆和实时效率三者常常对模型架构和训练流程提出相互冲突的要求,难以同时满足。现有方法各只解决部分问题:相机可控生成器(如 ReCamMaster、ViewCrafter)虽能精确跟随轨迹,但是双向、固定长度、计算昂贵,不适合低延迟交互或分钟级 rollout;自回归视频扩散与蒸馏方法(如 Self-Forcing、Causal Forcing)虽提升了流式效率,但只关注视频续写,不显式处理精确相机跟随、持久空间记忆或一致性重访;近期的交互世界模型系统则各有新权衡——抽象位姿/射线条件在蒸馏后会发生漂移,基于重建的控制受限于已观测视角,密集历史注意力使延迟随 rollout 长度增长,压缩或滑窗记忆则丢失视觉细节。结果是现有系统仍难以同时做到精确控制、忠实长期记忆和稳定实时推理。
本文的目标是本文目标是构建一个通用视频世界模型 Wonder,实现实时、相机可控的世界探索。具体而言:给定单张图像(I2V 模式)或一段条件视频(V2V 模式),Wonder 要构建一个「可玩」的世界,让用户能交互式地移动相机去导航、发现未见区域、并实时地在长时段上重访先前观察过的区域。在性能指标上,作者要求系统能以 16 FPS 合成分钟级视频,且在历史增长时保持稳定的每步推理延迟;同时要求精确的相机跟随、连贯的几何/外观/动力学长期一致性,并支持开放式生成(探索超出输入视角的区域)以及视频条件下的动态内容保持(即对源视频「重新拍摄」时保留主体运动)。
与已有工作不同的是,本文的独特切入角度是「系统级协同设计」。与以往把「控制表示—记忆机制—蒸馏策略」三阶段几乎相互独立优化的系统不同,Wonder 把整条流水线视为耦合系统进行联合重设计,使可控性、持久性和效率能从双向教师一路传递到实时学生。具体体现为三处协同:相机条件被设计成「视觉证据」而非抽象嵌入,从而更容易穿透少步蒸馏;记忆机制采用「全保真存储 + 稀疏检索」解耦存储与注意力开销,并配套 sparse context forcing 训练让学生在与推理一致的稀疏记忆条件下学习;蒸馏阶段用混合学生(MoS)补偿容量损失、用 GAN 控制正则提供低频相机监督,二者协同对抗多样性下降和相机漂移。这种端到端的耦合视角是区别于 RELIC、LingBot-World、DreamX-World 等已有工作的核心。
核心方法
Wonder 采用经典的「教师→学生」两阶段范式,但把每个环节都重新设计。直觉上:先用一个强大的双向扩散教师学会「精确跟随相机 + 多模态输入」,再把它改造成因果自回归的少步学生以实现低延迟流式生成,最后通过蒸馏把教师能力尽可能完整地搬到学生里。Stage 1 在 Wan2.1-I2V-14B 上构建相机条件教师:用新的「像素空间坐标场」把相机运动渲染成与目标帧空间对齐的视觉条件,并以多时长(5s→10s→20s)多任务(I2V+V2V)方式训练。Stage 2 把教师蒸馏成 4 步因果学生:先用 sparse context forcing 做 ODE 初始化(让模型在与推理一致的稀疏记忆约束下预热),再用 DMD 做分布级蒸馏,并叠加混合学生(MoS)与 GAN 控制正则两项改进。最后配合运行时优化(kernel 编译重放、KV cache、FlashAttention-3、序列/张量并行、滚动滑窗缓存)实现分钟级实时推理。
核心创新有三点且彼此协同。其一,像素空间坐标场:区别于隐式(位姿经 MLP/RoPE 注入,数据饥渴、蒸馏后易漂移)与显式(点云重渲染,精确但受限于已观测视角、不可流式)两类方法,Wonder 构造合成相机空间——内部稠密 3D 网格支架编码平移/视差,外部有色球面贴图编码旋转——用轻量渲染器沿目标轨迹渲染像素对齐条件帧(150 FPS),编码后与含噪潜变量按通道拼接送入 DiT。该「半显式」表示兼有渲染精确性与导航灵活性,且因具显式视觉语义而更耐少步蒸馏。其二,稀疏全保真记忆:历史 KV cache 全保留不压缩,用池化摘要做相似度选取,每步只激活常数大小记忆块(首块 + 最近 $r{=}2$ 块 + top-k 中间块),用全分辨率 key/value 注意,激活上下文与 rollout 长度无关。其三,混合学生 + GAN 控制正则:4 步采样用 $G_1/G_2/G_3$ 分管粗结构、精修、最终重建并共享 KV cache;GAN 正则在冻结教师特征空间对低频相机一致性做对抗监督,弥补 DMD 对低频监督不足导致的相机漂移。
方法步骤详情
流程分四阶段。(1)数据:从公开数据集与自渲染 UE/Blender 环境收集视频,经裁剪、过滤、VLM caption、Depth Anything 3 位姿估计与离散化、增强与质检,得静态/动态数据集。(2)Stage 1 双向教师:以「可选源片段 + 目标片段」表示输入,目标首帧作干净 anchor、其余帧加噪,mask 区分源/目标,像素坐标场条件仅对目标轨迹提供;按 5→10→20s 渐进训练,长时长用 YaRN 外推 RoPE,混合时长调度提吞吐。(3)Stage 2 因果学生:基于 self-forcing,先做 ODE 初始化回归 4 个去噪步的预计算教师轨迹,期间用 sparse context forcing 随机丢弃非局部历史边(仅保留自注意、首帧与最近上下文);再做 DMD 蒸馏,rollout 加噪后送冻结教师与 critic 取分数差作梯度,叠加 MoS 与 GAN 控制正则。(4)推理:滚动滑窗缓存组织 KV cache 为 [sink, top-k, recent],按相对距离重映射帧索引避免未见位置编码,多 GPU 并行实现 16 FPS 分钟级生成。
技术新颖性
技术新颖性体现在三方面。其一,坐标场是「半显式」新类别:不依赖输入重建(故在未见区域仍有效),又把平移/旋转/视差编码为像素对齐稠密视觉证据,比 Plücker/RoPE 抽象几何更易被 DiT 解读、更耐少步蒸馏。其二,稀疏记忆解耦「存储」与「注意力计算」:区别于压缩历史(损失保真)、几何检索(依赖可靠相机几何、对反向重访脆弱)、滑窗(丢细节),Wonder 用全保真 KV + 池化摘要检索,并用 sparse context forcing 让学生在训练时就面对与推理一致的稀疏记忆条件,使该能力稳定涌现。其三,蒸馏两项改进互补:MoS 借鉴 Wan2.2 去噪阶段 MoE 思路,按阶段分配容量却共享 KV cache,做到零额外延迟提容量;GAN 控制正则针对 DMD 失败模式(学生偏离相机、生成更快运动直至模糊崩塌),用冻结教师低频特征差分图 + register token 判别器专门监督,避免直接 $\ell_2$ 回归导致的分布收缩。Wonder 是首个把控制/记忆/蒸馏作为耦合系统联合优化的实时世界模型。
实验结果
在自建 I2V 基准(1000 张图像,每张配 5 条轨迹)与 V2V 基准(500 段含动态主体视频,每段配 6 条 retreat/follow/free 轨迹)上评估。视觉质量用 VBench 五项指标,相机跟随用 Depth Anything 3 与 ViPE 双模型估位姿并平均、经 Umeyama 对齐后算平移/旋转 RPE。I2V(Table 1):Wonder 平均分 0.8558 最高,成像 0.7113;平移 RPE 0.0132、旋转 RPE 0.0784 均最低——相对最强基线(0.0174 / 0.1155)分别降约 24% 与 32%。V2V:相比唯一开源长程基线 Inspatio-World(平均 0.8374、平移 0.0436、旋转 0.2470),Wonder 平均分升至 0.8527,平移 RPE 降至 0.0187、旋转降至 0.1119。定性上(Fig. 9)多数先前方法重访时不一致,RELIC 与 LingBot-World 长 rollout 下退化,Wonder 保持一致;以 16 FPS 实现分钟级 rollout 且延迟随历史稳定。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 图像到视频世界建模(I2V)—视觉质量 | VBench 平均分(成像/美学/动态/运动/闪烁五项均值)↑ | 0.8558 | DreamX-World 0.8385 / SANA-WM-Streaming 0.8415(次优) | 平均分 +0.0143 over 次优;成像质量 0.7113 居首(次优 DreamX 0.6891) |
| 图像到视频世界建模(I2V)—相机平移跟随 | 平移 Relative Pose Error(RPE)↓ | 0.0132 | LingBot-World-Fast 0.0174(次优) | 平移 RPE 从 0.0174 降至 0.0132,相对降幅约 24% |
| 图像到视频世界建模(I2V)—相机旋转跟随 | 旋转 Relative Pose Error(RPE)↓ | 0.0784 | SANA-WM-Streaming 0.1155(次优) | 旋转 RPE 从 0.1155 降至 0.0784,相对降幅约 32% |
| 视频到视频世界建模(V2V)—视觉质量 | VBench 平均分 ↑ | 0.8527 | Inspatio-World 0.8374(唯一开源长程基线) | 平均分 +0.0153;成像 0.6981 vs 0.6756、运动平滑 0.9855 vs 0.9794 |
| 视频到视频世界建模(V2V)—相机跟随 | 平移/旋转 RPE ↓ | 平移 0.0187 / 旋转 0.1119 | Inspatio-World 平移 0.0436 / 旋转 0.2470 | 平移 RPE 降约 57%、旋转 RPE 降约 55% |
| 实时性 | 生成帧率 / rollout 长度 | 16 FPS,分钟级(>60s)rollout,延迟随历史稳定 | 多数基线为流式但延迟随上下文增长 | 稀疏记忆使激活上下文恒定,实现延迟不随 rollout 增长 |
局限与改进
作者承认的局限:V2V 长程对比只有一个开源基线 Inspatio-World,比较面较窄;相机跟随精度依赖 Depth Anything 3 与 ViPE 两个位姿估计模型来评估,评估本身受估计误差影响;为支持训练时长之外的更长生成,依赖滚动滑窗缓存与位置重映射,超长 rollout 的稳定性主要靠经验性工程而非理论保证。我的观察:(1)合成数据(UE/Blender)占训练数据相当大比重,真实世界域泛化(如极端光照、复杂非刚体运动)可能未充分覆盖;(2)稀疏检索用固定的 top-k 与 $r=2$ 预算,对需要密集全局一致性的场景(如精细重复纹理、强遮挡重访)可能召回不足;(3)坐标场是合成的球面/网格支架,对非刚性、可形变场景的语义性有限;(4)14B×3(MoS)参数量在推理端对显存与多 GPU 依赖较高,单卡实时性未明确报告;(5)论文未提供与 Genie 3 等闭源前沿的直接对比,仅在开源流式世界模型范围内领先。
独立分析的弱点
弱点一:相机控制条件依赖一个固定的合成几何支架(球面环境贴图 + 稠密 3D 网格),对场景几何是「与场景无关」的,无法表达场景特有深度结构,在强透视/窄通道场景可能给出歧义线索;改进方向是把坐标场与轻量单目深度或场景表征(如 3D Gaussian / NeRF-lite)自适应结合。弱点二:稀疏检索的 top-k 与最近 $r=2$ 是静态超参,对需要密集全局一致性的场景(精细重复纹理、强遮挡重访)可能召回不足;改进方向是引入可学习检索预算或分层记忆。弱点三:V2V 仅与 Inspatio-World 对比,缺少与新兴 V2V 重拍方法(ReCamMaster、ViewCrafter 系列)在长程设定下的公平对比;改进方向是构建统一长程 V2V 评测协议。弱点四:MoS 用三个 14B 生成器,显存与训练成本高(32×H200、global batch 64),中小团队复现门槛大;改进方向是探索参数共享 MoS 或动态路由。弱点五:GAN 控制正则依赖冻结教师特征空间,若教师本身对某类相机运动泛化弱则该正则也无法补救;改进方向是用多教师或自监督几何一致性补充监督。
未来方向
作者明确提到的延伸:分钟级以上的超长 rollout、更高分辨率与帧率、把 Wonder 作为视频重拍的强基线。基于成果可延伸的方向:(1)把稀疏全保真记忆 + sparse context forcing 范式推广到任意需要长程上下文一致性的自回归生成(长视频叙事、具身智能体记忆);(2)将坐标场从纯合成几何升级为「场景自适应」表示,融合单目深度/3DGS 以处理非刚体与精细几何;(3)引入更丰富的动作接口(物体级交互、语义可控生成)走向通用世界模拟器;(4)面向机器人,用 Wonder 作为可交互「世界模型先验」做策略学习与仿真训练;(5)研究可微的检索机制,让记忆选取与生成联合端到端优化;(6)探索更轻量的蒸馏目标替代 GAN(如一致性损失)以提升训练稳定性。
复现评估
复现评估中等偏难。有利因素:基座 Wan2.1-I2V-14B 开源;位姿估计用开源 Depth Anything 3;评测基准(VBench、Umeyama 对齐、双模型 RPE)描述清晰;提供了项目主页 wonder-world-model.github.io。不利因素:论文为技术报告,截至写作未明确发布代码/权重;合成数据流水线(UE 导航、Blender 时空渲染、VLM 层次化 caption、VLM 质检)工程量大且部分依赖闭源/商业工具;训练需 32 张 NVIDIA H200、global batch 64,配合 FSDP2+序列并行+张量并行+梯度检查点+replayed back-prop,算力门槛高;MoS 涉及三个 14B 学生联合蒸馏,调试复杂;GAN 控制正则的超参与教师特征层选择需经验调参。整体上,熟悉视频扩散蒸馏的团队能依据描述复现主流程,但完整达到论文指标需相当工程投入。
论文图表
展示 Wonder 的两大能力:给定单张图像将其变为可导航的世界(用户可移动相机探索可见区域及输入视角之外合理的未见区域,I2V);给定一段视频构建保留源运动、同时允许自由改变相机轨迹的动态世界(V2V 相机可控的 4D 视频探索)。整体强调实时 16 FPS、像素空间坐标控制、稀疏注意力记忆三大卖点,并对比了 Wonder 与 I2VDual、ModalityV2V 等设定的差异。
这是全文的总览图,一张图概括了论文要解决的问题、两种推理模式和三大卖点(实时、像素空间控制、稀疏记忆),是建立全局认知的最佳入口。