EchoWM:开放且可进入的全模态世界模型 EchoWM: Open and Enterable Omnimodal World Models
以相机意图为统一接口,边导航边联合生成720p视频、环境音与语音的可进入世界模型
前置知识
世界模型
世界模型指能对环境状态建模并根据动作预测未来状态变化的生成模型。与'输入提示词→输出固定视频'的普通生成模型不同,世界模型把用户或智能体的连续输入视为动作,逐块推进环境演化,使生成内容成为可持续交互、探索的动态环境。典型结构包括条件编码器(动作/文本/参考帧)、时空生成骨干(多为扩散 Transformer)和自回归记忆机制。
本文的 EchoWM 就是一个世界模型,理解'条件→未来状态'的生成范式及其与普通视频生成的区别,是读懂全文的前提。
6-DoF 相机轨迹与 SE(3)
6 自由度(6-DoF)指相机在三维空间中的位姿:3 个平移分量加 3 个旋转分量。相机第 $t$ 帧的位姿可用李群 $T_t \in SE(3)$ 表示,相对轨迹定义为 $\Delta T_t = T_0^{-1} T_t$,即以初始帧为参考的刚体变换。这种表示摆脱对全局坐标系的依赖,同时保留平移的方向与幅度,是本文统一交互接口的数学基础。
论文把所有用户控制(离散键盘命令、连续位姿)统一映射为相对 6-DoF 轨迹,不掌握 SE(3) 与相对位姿就无法理解其核心接口设计。
流匹配与扩散 Transformer
流匹配是扩散模型的一类训练目标:网络预测把噪声拉向数据分布的速度场 $v_\theta(x_\sigma, \sigma)$,损失形如 $\mathbb{E}\|v_\theta - (\epsilon - x)\|^2$,推理时沿速度场做多步积分去噪。现代视频/音频生成骨干普遍采用 DiT 式多模态联合架构,视频与音频各有 latent 流,通过交叉注意力耦合实现声画同步。
EchoWM 的骨干是预训练的音视频联合扩散 Transformer(LTX-2.3 系),其全部训练目标(AV-CPT、SGF、DMD)都建立在流匹配之上。
Plücker 坐标与 UCPE
Plücker 坐标把相机每条像素光线表示为方向 $d$ 与矩 $m = o \times d$($o$ 为相机中心),是相机条件生成的常用编码;问题是矩项显含相机中心,会随世界坐标原点改变。UCPE(统一相机位置编码)改为在注意力内部直接建模相对射线几何:对任意全局刚体变换 $G$,$(GT_i)^{-1}(GT_j) = T_i^{-1} T_j$,成对几何不随坐标系变化。
EchoWM 用 UCPE 的相对射线分支把轨迹注入视频自注意力,这是它与 Plücker+独立相机编码器方案对比的关键技术点。
教师强制与 Self-Gradient Forcing(SGF)
教师强制指训练自回归模型时用真实历史作条件;推理时模型只能用自己生成的历史,这种曝光偏差会造成误差累积。SGF 先无梯度跑一次自回归 rollout 并记录中间噪声状态,再以可微方式并行重建因果上下文的 K/V 表示,使后续块的损失能穿过重建的注意力上下文回传,从而训练模型适应'自己的历史'而不必反向传播整个串行采样过程。
EchoWM 第四阶段用音视频 teacher forcing + 短/长视程 SGF 把双向扩散模型改造成稳定的流式自回归生成器,这是长时程生成不崩的关键。
DMD 分布匹配蒸馏
分布匹配蒸馏把多步扩散模型压缩成少步采样器:维护一个冻结的 real-score(代表真实数据分布)和一个可训练的 fake-score(跟踪当前生成器分布),用得分差 $\langle s_{fake} - s_{real}, \bar{x} \rangle$ 指导少步生成器逼近参考分布。本文用它把多步音视频模型蒸馏成 4 步因果模型 EchoWM-Flash。
理解 DMD 才能看懂 Flash 变体如何在 4 步内生成音视频、以及为何蒸馏后交互能力反而略升而质量只轻微下降。
KV 缓存与 sink-plus-FIFO 策略
自回归 Transformer 推理时缓存历史 token 的键值(K/V)以避免重复计算,但无限增长会爆显存。sink-plus-FIFO 策略保留固定数量的'沉子'块(长期前缀)加最近 $R$ 个块的滑动窗口,使每层注意力可见的历史块数上界为 $S + R$,配合 RoPE 重定基可任意长滚动;由于上层 FIFO 表示已吸收下层更早信息,梯度可沿多层路径触及窗口之外的历史。
EchoWM 的长视程训练与流式推理都依赖这一有界缓存设计,是理解其多轮续接与视觉记忆机制的基础。
研究动机
现有交互式世界模型与音视频生成模型各缺一半能力。交互式世界模型(Genie 3、Matrix-Game、LingBot-World、SANA-WM、DreamX-World 等)能响应连续或离散控制生成 720p 画面,但输出基本是'无声'的视觉滚动——脚步、碰撞、环境声与语音全部缺失,而声音恰恰是交互沉浸感与物理反馈的核心(脚步和碰撞揭示物理反馈、环境声传达空间动态、语音把画面主体接入叙事);其交互接口也常与特定域绑定,键盘动作语义依附于特定控制器或环境。另一边,Movie Gen、Veo 3、LTX-2.3 等原生音视频联合生成模型有声音,却不提供对生成世界的连续几何控制,用户无法'走进'所生成的世界。论文 Table 1 对比了 11 个代表性模型在 7 项能力(高分辨率视频、第一+第三人称、连续轨迹、离散键盘、环境音、背景音乐、语音)上的原生支持,没有任何一个全部覆盖:最接近的 Happy Oyster 仍缺连续轨迹交互,LTX-2.3 音频齐全却不支持任何视角交互。此外,游戏、仿真、网络视频等异构数据源在度量尺度与控制语义上严重不一致——同样的'前进 1 米'在不同来源数值上不可比,朴素归一化会抹掉位移幅度或在续接边界引入虚假的速度突变。
本文的目标是本文要构建一个'可进入的全模态世界'(enterable omnimodal world):给定一段参考观测(空条件、单帧参考图或同步音视频前缀)、一份结构化世界描述(场景、风格、视角、主体等字段),以及一条用户控制序列(离散键盘命令或连续位姿),单一模型能在连续导航过程中同步生成 720p 视频、环境音、背景音乐与语音,同时支持第一人称(轨迹即观察者运动)与第三人称(轨迹编排相机-角色协同演化)交互,并通过多轮续接把单次生成扩展为可长期演化的体验。量化目标是在公开世界模型基准上达到最优:WBench Navigation 排名第一,SANA-WM-Bench 简单/困难轨迹双榜视觉质量第一,并在 961 帧长时程滚动和多轮交互中保持视觉与控制一致性。
与已有工作不同的是,独特切入在于把交互原语从'控制某个角色/载具'改为'相机意图'(camera intent)——一个与受控对象无关的观察意图接口:同一条相对 6-DoF 轨迹,在第一人称场景中直接就是观察者自我运动,在第三人称场景中则由数据驱动地编排角色移动、载具位移、相机跟随与取景,无需视角专属控制器、显式角色轨迹或相机 rig 参数。第二,针对异构数据尺度问题,采用数据集级(而非逐片段)的鲁棒分位数标定,把位移幅度保留为用户可感的控制量。第三,承认'音视频质量'与'轨迹可靠性'在不同数据源中不可兼得,构建四源互补数据引擎并把训练拆成能力对齐的四阶段课程,让每个阶段在监督最可靠的子集上学对应能力,而非寻找单一理想数据源。这三点组合把'生成媒体'与'世界模拟'两条此前平行发展的路线缝合进一个系统。
核心方法
直觉层面:让模型学会'用户想如何观察和穿越这个世界',而世界自身决定这个意图如何实现为画面与声音。技术路线分四层。(1)接口层:媒体上下文 $M$(空/参考帧 $I_{ref}$/音视频前缀)、结构化文本 $C$(scene、style、viewpoint、subject、sound、speech 字段)与用户控制 $U_{1:T}$ 共享相机意图接口;键盘状态 $u_t$ 经固定映射变成当前相机系下的 6-DoF 增量 $\xi_t = [v_t^\top, \omega_t^\top]^\top$,逐帧积分 $T_t = T_{t-1} \mathrm{Exp}(\hat{\xi}_t)$ 后转为相对轨迹 $\Delta T_t = T_0^{-1} T_t$,连续位姿输入则绕过离散映射直接做坐标转换。(2)几何层:用数据集级标定 $s_{\text{global}} = Q_{0.9}(\{m_i\})$ 把所有训练与推理轨迹的平移归到统一米制尺度。(3)骨干层:在预训练音视频联合扩散 Transformer 上加一条 UCPE 相对射线相机分支,经零初始化投影注入视频自注意力;音频流不直接接收轨迹条件。(4)训练层:四阶段课程——AV-CPT 建立音视频先验、Action-SFT 冻结主干只训轨迹分支、Joint-FT 低学习率联合巩固、自回归后训练(teacher forcing + SGF + DMD)适配流式长时程生成。推理支持双向多轮尾窗续接与带持久 KV cache 的因果流式两种模式。
核心创新有三。其一是'相机意图'统一视角语义:与以往为第一/第三人称分别设计控制器或显式相机 rig 不同,EchoWM 让参考观测与静态 viewpoint 字段确定初始观察配置,轨迹只规定后续演化,'相机怎么跟随角色'这一耦合完全从第一/第三人称游戏与电影视频数据中学出——同一接口零修改地跨越人类、动物、载具、机器人等主体。其二是全局平移尺度标定:逐片段归一化会抹平位移幅度并让续接边界出现速度跳变,取语料最大位移又对重建离群值敏感,于是用训练集上每片段最大平移 $m_i = \max_k \|\Delta t_{i,k}\|_2$ 的 90 分位数 $s_{\text{global}}$ 做一次性全局标定(超出者整条剔除而非截断),使'走多快、走多远'成为保留幅度信息的用户控制量。其三是能力对齐的课程式训练:音视频监督与轨迹监督天然分布在数据集不同子集——语音丰富的素材运动幅度小(中位数 3.9),控制干净的素材运动幅度大(中位数 12.7),因此按'每个阶段用最干净的信号'原则拆分数据混合与可训练参数组,避免多目标在脏数据上互相拖垮。
方法步骤详情
完整流程如下。第一步,数据引擎:汇总内部脚本化游戏录制、人工游玩网络游戏视频、Unreal Engine 仿真与通用网络视频四源;AV 路径做镜头边界检测后直接切短片段,几何路径先保留约 1 分钟连续窗口,用 ViPE 框架结合 VGGT-Omega(长序列时序一致几何)与 MoGe-2(逐帧米制深度)做度量位姿恢复并优化逐帧内参,经 SLERP 旋转/线性平移插值对齐回原帧率,再做重建可靠性、时序抖动、运动合理性三重轨迹过滤;同时用 Qwen3-Omni 与 Gemini-3-Pro 生成结构化标注(scene/style/viewpoint/subject/narrative/speech/sound),并在轨迹训练阶段剔除 narrative 等含运动描述的字段以防'文本运动泄漏'——否则模型会从文字而非轨迹推断目标运动。第二步,接口与标定:所有控制统一为相对 6-DoF 轨迹,按 $s_{\text{global}}$ 归一平移,旋转不变。第三步,轨迹注入:由标定位姿与内参构造参考系射线方向 $d_{t,s} = R_t \, \mathrm{norm}(K_t^{-1} p_s)$,建立局部射线坐标系得到射线到参考系变换 $D_i$;一半通道用 $G_i = I_{d/8} \otimes D_i$、另一半保留时空 RoPE 的并行相机注意力,经零初始化输出投影融入主干。第四步,四阶段训练:AV-CPT 在 AV-rich 混合上以 $\mathcal{L}_V + \lambda_A \mathcal{L}_A$ 全参微调;Action-SFT 冻结主干,仅训相机分支 QKV 与零初始化输出投影 $\phi$,只用静态文本字段并禁用音频损失;Joint-FT 在均衡高质量小子集上低学习率联合更新 $(\theta, \phi)$;AR 后训练先做块级因果掩码的音视频 teacher forcing,再以短视程 SGF+DMD 建立 4 步自回归能力,最后长视程 SGF 在多段自生成轨迹上用 sink-plus-FIFO 有界上下文训练。第五步,推理:双向模式每轮取上轮音视频尾部作干净上下文;流式模式维护视频/音频/相机三套 sink-plus-FIFO KV cache 并重定基 RoPE 与相机编码。
技术新颖性
与已有工作的本质区别:条件表示上,CameraCtrl、MotionCtrl 等用稠密 Plücker 射线特征加独立相机编码器,其矩项 $m = o \times d$ 显含相机中心导致绝对坐标依赖,EchoWM 采用 UCPE 把成对相对射线几何直接写进注意力,配零初始化残差分支即插即用且不破坏预训练通路;控制语义上,ABot-World、Hunyuan-GameCraft 等以键盘/手柄动作为条件,动作语义绑定特定控制器,且从观测相机运动反推动作存在歧义(同一位移可由不同输入、控制器动力学或镜头平滑规则产生,第三人称下尤甚),EchoWM 直接以相机轨迹为监督——帧级动作日志只覆盖受控采集数据,而相机轨迹可从更广泛的视频恢复,且天然连续(含垂直运动、roll、平移-旋转耦合);记忆机制上,WorldMem、Context-as-Memory 等显式检索历史视角带来检索开销,EchoWM 用有界 sink-plus-FIFO 缓存并利用多层因果注意力的逐层梯度路径,让损失监督超出单层窗口而不回传串行 rollout;生成范式上,把 Diffusion Forcing、Self Forcing、OmniForcing 的因果化思路扩展到'音视频双流+轨迹条件+DMD 蒸馏'的组合,并对视频自注意、音频自注意、A2V、V2A、UCPE 五处注意力统一施加块级因果掩码。
实验结果
(1)WBench Navigation(158 例官方划分):多步 EchoWM 以平均 81.7 排名第一(质量 81.5、场景设定 79.4、交互 87.2、一致性 89.8、物理 70.6),超过 HiDream-O1-World(80.9)、Alaya-EVOKE(80.8)、LingBot-World fast v2(79.4)、Genie 3(73.9);4 步因果蒸馏版 EchoWM-Flash 平均 81.0,交互分 87.9 为全场最高,说明蒸馏几乎不损失控制响应。(2)SANA-WM-Bench 短视程(241 帧):Simple/Hard 两榜 VBench Overall 均第一(83.91/83.96),Simple 上平移误差 $T$=0.160 与 CMC=0.162 均最低、旋转误差 0.523° 与 SANA-WM(0.489°)相当;Hard 上 SANA-WM 位姿更准(R 1.248° vs 1.697°)但视觉质量低约 2.2 分。(3)961 帧长视程(多步模型):Simple 上 VBench 81.36,$T$=0.918、CMC=0.927、回访 PSNR 15.10 dB 均最佳,$\Delta$IQ 仅 0.02;但旋转误差从 241 帧的 0.523° 升至 3.22°,Hard 上达 12.05°,位姿漂移仍是主要瓶颈。(4)961 帧因果模型对比:EchoWM-Flash 两榜 VBench 最高(80.13/81.06),旋转误差 5.009°/14.221° 大幅优于 Evoke 的 9.859°/20.097°,回访 PSNR 14.41/14.04 最高;Figure 14 显示其首窗/均值/最小窗成像质量均更高,而部分基线 $\Delta$IQ 小只是因为全程质量就低。(5)200 例自建 WMB 用户研究:总体偏好对 LingBot-World-v2 为 46.50% vs 21.57%,对 HappyOyster 为 63.13% vs 27.06%;但 embodied robot 语义跟随仅 8.67%、自然室外仅 2.50%(对比 HappyOyster),暴露真实域短板。(6)定性结果:从生成轨迹做 3D 重建显示多视角空间一致性;对训练中未出现的 2D/2.5D 游戏与机器人环境零样本泛化良好;波形+频谱图验证环境音、音乐、语音与画面同步;多轮回访实验显示场景布局与主体身份基本保留。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 交互式世界生成(WBench Navigation,158 例) | 五维平均分(0-100) | 81.7(EchoWM)/ 81.0(EchoWM-Flash) | HiDream-O1-World 80.9;Genie 3 73.9 | +0.8(对次优模型),对 Genie 3 +7.8 |
| 导航与动作跟随(WBench Interaction 维度) | Interaction 得分 | 87.2 / 87.9(Flash,全场最高) | HY-World 1.5 (AR-distill) 86.8 | +1.1 |
| 短视程轨迹跟随(SANA-WM-Bench Simple,241 帧) | VBench Overall | 83.91 | DreamX-World 82.42;SANA-WM 81.75 | +1.49 |
| 短视程相机平移精度(SANA-WM-Bench Simple) | 相对平移误差 T / CMC(越低越好) | 0.160 / 0.162 | SANA-WM 0.194 / 0.195 | 约降低 17% |
| 长视程生成(961 帧,多步模型,Simple) | 回访 PSNR / 平移误差 T | 15.10 dB / 0.918 | LingBot-World 14.59 dB / 2.01;SANA-WM 14.16 dB / 1.59 | PSNR +0.51 dB,T 约降 42% |
| 长视程因果流式生成(961 帧,Flash,Simple) | VBench Overall / 旋转误差 R | 80.13 / 5.009° | Evoke 80.11 / 9.859° | R 约降 49%,VBench 并列最高 |
| 长视程因果流式生成(961 帧,Flash,Hard) | VBench Overall / 旋转误差 R | 81.06 / 14.221° | Evoke 80.75 / 20.097° | R 约降 29%,VBench +0.31 |
| 人评总体偏好(200 例自建 WMB) | 偏好票占比 | 对 LingBot-World-v2 46.50%;对 HappyOyster 63.13% | LingBot-World-v2 21.57%;HappyOyster 27.06% | 分别领先 24.9 / 36.1 个百分点 |
局限与改进
作者承认的局限:交互范围仅限能被相对 6-DoF 轨迹表达的导航与视角动作,不建模跳跃、攻击、操作、机器人指令等任意演员意图,也没有游戏引擎的规则、碰撞状态与确定性转移;缺乏显式持久 3D 记忆,多轮续接中几何、主体身份、世界状态与音频都可能漂移;交互幅度受全局轨迹过滤器约束,对更大平移、更高速度、异常旋转的泛化未经验证;网络与游戏视频的位姿估计虽经过滤仍不完美,且误差可能与场景内容、运动模糊相关。我自己的观察:Hard 轨迹 961 帧下旋转误差升至 12.05°,困难路径上的长时程漂移依然显著;用户研究中 embodied robot 与自然室外场景的语义跟随对 HappyOyster 大幅落后(8.67% 与 2.50%),说明以游戏为主导的数据混合削弱了真实域的语义控制能力;音频流不受轨迹直接条件、无显式动作-声音对齐目标,物理反馈声(脚步/碰撞)与运动的因果一致性缺乏保证;$\Delta$IQ 指标可能被'全程低质量'稀释(作者自己也承认需结合绝对质量解读);自建 WMB 基准的完整协议未公开,第三方独立复评存在门槛。
独立分析的弱点
独立分析四点弱点。其一,动作空间天花板:相机意图无法表达'开门、拾取、攻击'等语义动作,这对真正的游戏可玩性是硬伤,改进方向是引入分层的语义动作 token(类似 RT-2 式动作词汇表)与相机意图并行条件化,或用动作日志预训练一个意图编码器。其二,长时程位姿漂移:旋转误差随视程成倍增长(Simple 上 0.523°→3.22°,Flash 下达 5.009°,Hard 上 12.05°–14.22°),根源是没有持久 3D 表征,可引入在线 SLAM 式位姿闭环、关键帧地图记忆或回访一致性损失。其三,域不均衡:训练语料约 79.7% 为第三人称、仅 12.2% 含语音、以游戏渲染为主(Figure 3),导致真实室外与具身机器人场景的语义跟随薄弱(人评仅 2.5%/8.67%),应扩充带位姿记录的真实世界第一视角采集并提高 speech-rich 子集占比。其四,音频-运动因果缺失:轨迹只进视频流,脚步声、碰撞声与实际运动仅靠跨模态注意力隐式耦合,可设计以恢复轨迹为条件的音频对齐辅助损失,或利用 UE 仿真中天然对齐的物理事件-声音对做显式监督。此外,位姿恢复依赖 VGGT-Omega/MoGe-2 的质量,运动模糊或滚动快门场景可能引入系统性偏差,值得增加不确定性加权。
未来方向
作者明确留下的方向:为世界状态增加显式持久 3D 记忆以抑制多轮漂移;扩大可交互的位移/速度/旋转范围,覆盖全局过滤器之外的轨迹;利用数据引擎中已保存但暂未使用的原生动作日志(论文明确说其'为未来交互建模保留')开展意图级交互建模。基于本文成果可自然延伸的方向包括:把相机意图与语义动作组合成分层控制接口,实现'走到门前+开门'式复合指令;将生成世界用作具身智能与机器人策略的无限仿真器(论文已展示零样本机器人场景泛化,Figure 17);在 Flash 的 4 步蒸馏基础上进一步压向实时帧率,支持真正在线可玩;引入多智能体/多用户共享世界状态实现社交型进入式媒体;把 UE 仿真管线扩展为自动课程生成器,主动采样困难轨迹(急转、高速、贴近障碍)以缓解 Hard 场景漂移;以及探索动作-声音显式对齐目标,让物理声学反馈成为可验证的世界一致性信号。
复现评估
开源情况:代码已在 GitHub(jd-opensource/JoyAI-Echo)发布,配有项目主页;评测所用 WBench Navigation(158 例)与 SANA-WM-Bench 均为公开基准,WBench 对比表覆盖 20 余个模型,横向可比性好。不利因素:训练数据的核心——内部脚本化游戏采集与 UE 仿真——难以原样复现;通用网络视频管道依赖 Qwen3-Omni 与 Gemini-3-Pro(其一为商业 API)做结构化标注,位姿恢复依赖 ViPE+VGGT-Omega+MoGe-2 三个外部模型;论文未披露模型参数量、GPU 数量、训练时长与数据绝对规模(Figure 3 只给比例:第三人称 79.7%、含语音 12.2%、28605 条轨迹样本等),从零训练成本大概率在数百卡 GPU 量级。对研究者的现实路径是:下载官方权重做推理与下游微调(例如复现消融中的尺度控制实验或域外泛化测试,仅需单机多卡),或在开源权重上做改造研究;完整复现训练属于高难度数据工程。综合评级:推理与微调复现中等偏低,全流程复现高。
论文图表
开篇总览图:上半部分展示开放域世界泛化(室外、室内、游戏、水下、奇幻等)与第三人称的主体控制(人类、动物、机器人、汽车)及可控参与、同步模态;下半部分展示原生音视频生成能力——环境音、背景音乐、画外音/画内语音均可多轮续接或切换。
一图概括 EchoWM 的能力全景(输入三要素、双视角交互、音视频同步、多轮续接),是理解论文目标与系统边界的入口。
961 帧因果模型对比:EchoWM-Flash 两榜 VBench 最高(Simple 80.13 / Hard 81.06),R=5.009°/14.221°、T=1.592/1.735、PSNR 14.41/14.04 dB 均显著优于 Evoke(80.11/80.75,R 9.859°/20.097°)与 SANA-WM±Refiner、LingBot-World-v2。
证明 DMD+SGF 蒸馏后的 4 步流式模型在长视程上仍全面领先因果基线,是'少步不塌、长滚不漂'结论的关键证据。