世界中的世界:用世界模型探索视频世界 World in World: Explore the World with World Models
训练免调推理时接口:把异构视觉证据转为干净视觉状态,驱动冻结世界模型探索视频世界。
前置知识
自回归视频世界模型
以自回归方式持续预测下一帧观测的视频生成模型:给定初始观测和相机或动作指令,滚动生成后续潜帧,并维护一个干净状态缓存记录已定稿的帧。用户可在 rollout 中途改变相机位置或动作,模型据此继续探索,常用于交互式内容创作、虚拟制作和具身智能仿真。
本文全部方法都建立在因果世界模型的干净状态缓存和原生自注意力之上,不理解这一机制就无法理解证据如何被模型读取。
干净视觉状态与 K/V 缓存
扩散模型在时间步 $t=0$ 时输入的清晰帧称为干净状态。把证据帧连同相机、时间编码在 $t=0$ 做一次前向,即可从每层自注意力提取键 $K$ 和值 $V$ 并缓存;生成时当前 query 通过注意力直接读取这些缓存特征,相当于让模型“看见”证据内容。
WiW 的统一接口就是把各类证据转成干净视觉状态并缓存其 K/V,这是理解方法核心的前提。
无分类器引导(CFG)
扩散模型中常用的引导技术:用条件预测与无条件预测之差乘以强度系数来强化条件的影响。本文把这一思想下放到注意力响应级别,对每路证据独立放大其相对原生响应的互补分量,而不用整条去噪网络做两次前向。
论文的 EWA 是注意力级 CFG 的变体,理解经典 CFG 才能明白 EWA 为何有效且零额外计算。
RoPE 旋转位置编码
通过对 query 和 key 施加与相对位置相关的旋转来编码位置信息,使注意力得分自然携带相对位置项。视频模型中通常沿时间轴应用,让不同帧的 token 感知彼此在事件中的时间距离。
WiW 通过设置证据 token 的 RoPE 时间坐标来告诉模型每路证据对应录制事件的哪个时刻,实现事件同步。
3D 反投影与重投影
利用估计的深度把 2D 像素提升回 3D 点(反投影),再用目标相机的内外参把这些点投到目标视图(重投影),得到新视角下内容应出现的位置、可见性掩码和深度,是单目视频新视角合成的常用手段。
目标视图场景证据正是由 DepthCrafter 深度加投影式 (2) 构造的,是整个框架中最关键的证据来源。
Plücker 相机编码
用视线方向与其矩联合表示像素级相机射线的参数化方式,把相机内外参编码为逐像素特征,广泛用于相机可控视频生成以精确描述视点变化。
消融显示去掉源相机 Plücker 条件会使旋转误差从 1.7823° 升到 1.8811°,说明源视图相机信息是必要补充。
研究动机
自回归视频世界模型已经能支持交互式长时程生成,但控制手段依然碎片化:相机控制方法把轨迹表示为射线、位姿或 Plücker 编码并训练专用条件模块;源视频重渲染方法(如 ReCamMaster 固定生成 81 帧、TrajectoryCrafter 生成 49 帧)需要额外训练源视频输入分支;长期一致性则依赖显式几何记忆或持久状态。结果是每引入一种新证据(观测、几何、历史)都要重新设计接口甚至重新训练,无法直接叠加。更棘手的是,大幅视角变化会暴露源视频中从未观测到的主体表面,需要生成先验去补全;多次回访又要求恢复早已被滚动缓存淘汰的早期外观。现有方法很难在同一框架内同时满足事件同步、空间对齐和长时程一致这三类要求。
本文的目标是本文的目标是在完全不训练、不改动任何参数的前提下,让同一个冻结的因果视频世界模型接受多种异构视觉控制证据,从而自由探索一段给定视频所刻画的动态世界。具体而言:给定记录了动态事件的源视频和一条目标相机轨迹 $C$,模型要在新视角下重渲染该事件,保持其外观与时间进程;相机大幅移动时利用生成先验补全新暴露的场景和人体表面;相机回访时从历史中恢复早期生成的布局与外观。作者将该方法 World in World(WiW)实例化在公开的 LingBot-World 2.0 causal-fast 检查点上,在 DAVIS 和 OpenVid-1M 上评估相机控制精度、感知质量与时序一致性,并展示子弹时间、视频稳像、视频编辑、跨实例 K/V 共享和人体动作迁移等应用。
与已有工作不同的是,作者的关键观察是:带干净状态缓存的因果视频模型天然存在一个统一的视觉信息入口——原生自注意力。生成过程中模型本来就把初始观测和最近定稿的输出当作“干净视觉状态”读取,并用相机与时间编码标注其视点和时刻。既然如此,外部控制信息不必经过新的条件模块,而可以直接转换成同一表示:带相机位姿、事件时间和空间有效区域标注的干净视觉状态。这把“扩展世界模型控制”从模型适配问题重新定义为视觉证据的构造与编排问题。与同期把扭曲观测作为伪历史的 Warp-as-History 相比,WiW 进一步统一了几何渲染、历史检索等多种证据类型,并在注意力内部补上两个正交机制:解决“读哪里”的对应引导路由(CGAR)和解决“用多强”的证据级注意力 CFG(EWA),形成完整的训练无关控制框架。
核心方法
WiW 把可控生成分解为三个互补子问题:构造有用的视觉证据、定位相关证据、调节证据影响力。整体流水线(Fig. 2)是:先用 DepthCrafter 估计源视频深度并跟踪持久点轨迹;将源观测按深度反投影再重投影到目标相机,得到目标视图布局证据;用可渲染的主体表示(人体时为 LHM++ 头像加 SMPL-X 姿态参数)渲染目标视角的几何证据;把被滚动缓存淘汰的定稿状态的每层干净 K/V 存入历史库,按目标视图覆盖率和视线方向相容性检索 top-$K_{ret}$ 个多样状态。所有证据通过转换器 $\Psi_b(E_b; C, s) = (X_b, P_b, \omega_b, \gamma_b(s))$ 统一为带视觉内容、相机时间信息、token 级支持权重 $\omega_{bj}\in[0,1]$ 和通道激活 $\gamma_b(s)\in\{0,1\}$ 的干净视觉状态。原生注意力块保留 18 个潜帧槽位:6 个源锚点、8 个近期历史、4 个当前块,其余证据作为临时辅助注意力块,本块定稿后即移除。
核心创新是把“控制”翻译成冻结模型已经会读的语言。已有方法为每类控制训练专用路径,WiW 则把源观测、目标视图投影、几何渲染、生成历史都表达为干净视觉状态,直接通过原生自注意力读取——不引入任何可学习模块。在此统一接口上再配两个注意力内机制:其一,对应引导注意力路由 CGAR,用持久点身份加几何建立查询与源视频 token 的对应,把路由项加进注意力得分 $\ell^{corr}_{ij}=q_i^\top k_j/\sqrt{d_h}+\log\beta_{ij}$,解决大视角变化和重复纹理下外观匹配的歧义;其二,证据级注意力 CFG(EWA),在同一去噪前向中比较仅读原生块与加证据 $e$ 的注意力响应 $o_0$ 与 $o_e$,只放大证据相对原生方向的互补分量:$\hat{o}_e=o_e+g_e\max(0,\cos(o_e,o_0))\,(o_e-\mathrm{Proj}_{o_0}(o_e))$,各证据独立控制强度 $g_e$,且复用同一次前向的注意力输出,不增加任何额外网络前向(零额外 NFE)。
方法步骤详情
第一步,源视频预处理:估计逐帧深度 $D^{src}$(DepthCrafter)和带持久身份的点轨迹。第二步,目标视图场景证据:按式 (2) 将源像素反投影到 3D 再从源相机重投影到目标相机 $C_m$,得到目标视图 RGB、可见性掩码 $M^{proj}$ 和深度 $Z^{proj}$,由可见性与几何可靠性换算 token 级支持权重 $\omega^{proj}$。第三步,渲染几何证据:人体主体用 $G_m=(A,\Theta_m)$,$A$ 为 LHM++ 重建的头像、$\Theta_m$ 为逐帧 SMPL-X 参数,$\mathrm{Render}(G_m, C_m)$ 输出新暴露表面的形状外观提案,并经深度对应把头像对齐到场景坐标系,剔除主体边界附近不可靠的背景投影。第四步,历史检索:归档被淘汰定稿状态的每层干净 K/V 及位姿、时间索引,按目标视图覆盖率与视线方向相容性选多样的 top-$K_{ret}$ 子集。第五步,编码与读写:证据在 $t=0$ 前向一次提取干净 K/V,RoPE 设置时间坐标,$\omega$ 缩放未归一化注意力,$\gamma_b(s)$ 控制激活的去噪阶段。第六步,CGAR 路由(式 (4))与 EWA 调节(式 (5))作用于同一次去噪前向,定稿输出进入滚动缓存并归档。
技术新颖性
技术新颖性体现在四个层面。第一,表示层:把异构控制统一为“相机+时间+空间支持标注的干净视觉状态”,复用骨干的 Q/K/V 投影并保留原生文本、相机条件通路,这是与 ReCamMaster、Wonder 等专用条件分支的本质区别。第二,机制层:CGAR 把持久点身份的对应关系写成注意力 logits 的加性项 $\log\beta_{ij}$,在注意力内部做几何硬定位,而非依赖易歧义的外观相似度;EWA 把 CFG 思想下放到注意力响应级别,只放大去掉原生方向投影后的互补分量、用 $\cos(o_e,o_0)$ 门控、用原生响应范数限幅,避免过度引导破坏生成质量。第三,效率层:EWA 复用同一次去噪前向的注意力输出与归一化结果,引导零额外 NFE;干净 K/V 也只需一次 $t=0$ 前向。第四,系统层:同一接口原生支持跨实例 K/V 共享——把一个生成实例的缓存 K/V 作为另一实例的视觉证据,实现两个生成体之间的“通信”,这是传统专用条件框架无法做到的。
实验结果
定量结果(Table 1,DAVIS+OpenVid-1M):WiW 七维 VBench 平均分 85.192 最优,超过次优 UniWorld-View(84.295);RotError 2.8326° 显著低于所有基线(CameraAnything 3.1868°、UniWorld-View 4.1958°),TransError 0.068622 并列最优;PSNR 23.1511、SSIM 0.787205、LPIPS 0.121664 全面领先,PSNR 比 InSpatio-World 的 20.6855 高约 2.47 dB;美学 56.556、背景一致性 92.627、平滑 97.749、动态 98.750(与 TrajectoryCrafter 并列)均最佳或并列。消融(Table 2,DAVIS):去掉目标视图扭曲代价最大,RotError 从 1.7823° 升至 6.1158°(约 3.4 倍)、TransError 从 0.053291 升至 0.581847(约 10.9 倍);去 Plücker 使 RotError 升至 1.8811°;单独去 CGAR(1.7828°)影响小于去 EWA(1.9944°),皆去则 2.0346°。Fig. 5、6 定性消融表明扭曲保结构、渲染几何补全新暴露人体表面、历史检索支撑回访一致性;Fig. 3 显示逆时针环绕、右转、下转、右移、前进等运动下主体与场景一致性均优于六个基线。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 相机控制视频重渲染(DAVIS+OpenVid-1M) | VBench 七维平均 Overall(越高越好) | 85.192(Aesth 56.556、Bg 92.627、Smooth 97.749 等五项第一) | UniWorld-View 84.295(次优) | +0.897 |
| 相机跟随精度 | 旋转误差 RotError(°,越低越好) | 2.8326 | CameraAnything 3.1868 | 降低 0.354°(约为次优的 89%) |
| 相机跟随精度 | 平移误差 TransError(越低越好) | 0.068622 | UniWorld-View 0.068705 | 并列最优 |
| 图像保真 | PSNR(dB,越高越好) | 23.1511 | InSpatio-World 20.6855 | +2.47 dB |
| 图像保真 | SSIM(越高越好) | 0.787205 | UniWorld-View 0.770554 | +0.0167 |
| 图像保真 | LPIPS(越低越好) | 0.121664 | UniWorld-View 0.121668 | 并列最优 |
| 消融:目标视图扭曲(DAVIS) | RotError / TransError | 完整方法 1.7823° / 0.053291 | 去掉扭曲 6.1158° / 0.581847 | 扭曲贡献约 3.4 倍旋转、10.9 倍平移的误差降低 |
局限与改进
作者承认的局限较少,可从文中推出:证据构造依赖一串外部模块——DepthCrafter 深度、持久点跟踪,人体场景还需 LHM++ 与 SMPL-X,任何一环的误差都会经投影污染下游证据;渲染几何证据主要针对人体主体设计,非人物场景缺少同等的可渲染表示;定量评估只在 LingBot-World 2.0 causal-fast 一个骨干上进行,18 槽位(6 源锚点+8 历史+4 当前)的划分是否通用未知。我自己的观察:其一,相机误差用 Depth Anything 3 与 ViPE 从生成视频反估,估计器自身的系统性偏差会影响指标可信度;其二,超参数众多($g_e$、$\beta_{ij}$、$K_{ret}$、$\omega$、$\gamma$ 调度),论文未给出敏感性分析;其三,除重渲染外的应用(子弹时间、编辑、K/V 共享、动作迁移)只有定性展示,没有数字支撑;其四,历史库要归档所有被淘汰状态的每层 K/V,显存开销随 rollout 长度线性增长,长时程探索的代价未量化。
独立分析的弱点
独立分析几个弱点。第一,流水线重、级联误差:深度估计错误会直接产生错误的重投影布局,而 $\omega$ 掩码只能按可见性与几何可靠性降权,无法纠正系统性深度漂移;改进方向是引入不确定性感知的多假设投影证据,让模型在注意力中对冲突证据自动投票。第二,CGAR 依赖跟踪质量:快速运动、遮挡和出画会导致点轨迹断裂,此时回退到纯外观注意力,恰是论文声称要解决的歧义场景;可结合自监督对应或光流做兜底。第三,EWA 的逐证据强度 $g_e$ 缺乏理论分析,“先投影去除再放大”在 $o_e$ 与 $o_0$ 高度相关时可能放大噪声,建议做逐层、逐步的强度调度搜索。第四,人体中心化:非人物体(车辆、动物)没有 LHM++ 级别的可渲染先验,补全能力退回纯生成先验,视角大幅变化时一致性无保障。第五,评估范围窄:只有帧数对齐后的重渲染指标,缺少数百帧级长时程回访一致性的定量协议,而长时程一致性恰是历史检索机制的核心卖点。
未来方向
作者方向上展示了 K/V 共享实现两个生成实例间的“跨模型通信”,这天然延伸为多智能体世界模型协作:多个实例分管不同区域或事件,通过交换缓存证据维持全局一致。基于本文成果还可延伸:其一,把手工构造的证据(深度投影、渲染几何)替换为轻量可学习证据生成器,或对 $\gamma_b(s)$ 的激活调度做可微搜索;其二,扩展证据类型到文本、音频、物理约束,检验“干净视觉状态”接口的通用性上限;其三,在分钟级长 rollout 上研究历史库的分层检索与压缩,控制显存增长;其四,把训练无关接口蒸馏进模型(类似 Wonder 的因果学生思路),在保留零训练灵活性的同时降低推理开销;其五,动作迁移目前限于人体,可推广到物体交互与世界状态的因果编辑;其六,对 EWA 建立与经典 CFG 类似的理论刻画,给出强度 $g_e$ 的选取准则。
复现评估
复现基础较好:骨干使用公开的 LingBot-World 2.0 causal-fast 检查点,依赖的 DepthCrafter、LHM++、SMPL-X、Depth Anything 3、ViPE、VBench 以及 DAVIS、OpenVid-1M 数据集均为公开资源,方法全程免训练,只需推理期工程。项目页为 https://chenxi-song.github.io/worldinworld,但论文正文未明确承诺开源代码,这是最大的不确定点。算力上,单张高端 GPU 应可运行:骨干冻结,主要开销来自每块证据的 $t=0$ 前向(干净 K/V 提取)、历史库显存占用和点跟踪等前置模块。难度评估为中高:接口本身清晰(辅助注意力块+logits 加项+响应级修正),但 18 槽位划分、$g_e$、$\beta_{ij}$、$K_{ret}$ 等超参以及 $\omega$ 与 $\gamma$ 的具体调度论文未给全,严格复现指标需要作者放码或补充实现细节;消融表明最关键的组件是目标视图扭曲,优先复现它即可拿到大部分收益。
论文图表
首图展示方法概览:左侧是一段记录事件的源视频,用户沿自选相机轨迹“打开场景、移动相机”,右侧生成任意新视角的视频。下方四个图标出四大能力:用户指定轨迹的任意视角探索、保持录制事件动态的事件一致生成、超越源视频范围的新观测区域合理补全、回访并恢复此前视觉状态的时序一致性。
一图概括论文的任务定义与四个核心能力承诺,是理解“在给定视频的世界内探索”这一叙事的入口。