← 返回 2026-08-27

JoyAI-Echo-1.5:面向持久故事与交互世界的长时程音视频生成 Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang 📅 2026-08-24 👍 19 2026-09-01 18:30
6-DoF相机控制 世界模型 分布匹配蒸馏 自回归流式生成 记忆机制 超分辨率 长视频生成 音视频联合生成

以跨镜头音视频记忆、6-DoF轨迹控制与自展开蒸馏训练,把音视频生成扩展为持久故事与可交互世界

前置知识

整流流(Rectified Flow)与速度预测

扩散生成的一种形式化:把干净数据 $z_0$ 与高斯噪声 $\epsilon$ 沿直线路径插值 $z_\sigma = (1-\sigma)z_0 + \sigma\epsilon$,网络学习回归目标速度 $u = \epsilon - z_0$,采样时从噪声出发沿速度场积分回到数据分布。相比 DDPM 噪声预测参数化,路径更直、步数更少,是当前视频扩散模型(如 LTX 系列)的主流选择。

本文所有训练目标(记忆条件联合训练、teacher forcing、DMD 蒸馏、SR 教师)都建立在整流流的速度回归与噪声插值约定之上,不熟悉该记号就无法读懂公式 16、27、29、49。

分布匹配蒸馏(DMD)

一种把多步扩散模型压缩成 few-step 生成器的蒸馏框架:用冻结的教师网络作为真实分数 $s_{real}$,用一个可训练的 fake 分数网络 $s_{fake}$ 跟踪学生生成分布,两者的分数差构成梯度,把学生的输出分布拉向教师分布。学生的干净预测会被重新加噪到辅助噪声水平 $\sigma$ 后送给两个分数网络评估。

论文把多步音视频骨干蒸馏成 8 步学生、再在 SGF 中蒸馏成 4 步因果生成器,全部依赖 DMD;其音频能量漂移、记忆退化、任务权重等设计都是对 DMD 失败模式的修补。

RoPE(旋转位置编码)

通过对注意力的 query/key 做与相对位置相关的旋转变换,使注意力得分只依赖 token 间的相对距离。因为只改坐标不改内容,可以把不同 token 组指派到互不重叠的坐标区间,实现「同一序列内多个逻辑时间轴」的隔离。

本文用不连续 RoPE 偏移区分当前目标(<500)、历史记忆(中心 500, 550, 600…)与预置记忆(≥5000),是记忆条件可组合且无需专用注意力掩码的关键机制。

6-DoF 相机位姿与 SE(3)

相机在三维世界中的完整状态由 3 个平移加 3 个旋转共 6 个自由度描述,外参矩阵 $T_t \in SE(3)$ 把相机坐标映射到世界坐标。相邻位姿的相对运动可用矩阵对数映射到 6 维旋量坐标 $\xi_{ij} = \mathrm{Log}(T_i^{-1}T_j)^\vee$,便于回归与插值。

世界模型变体的全部控制接口都建立在相对 6-DoF 轨迹上:键盘输入、游戏日志、视频反解位姿最终都被统一成这种几何表示再注入模型。

Teacher Forcing 与自展开训练(Self-Forcing/SGF)

自回归训练的经典困境是曝光偏差:训练时模型总看真实历史,推理时却要看自己生成的历史。Teacher forcing 在训练时喂干净历史做因果化初始化;Self-Forcing 进一步让模型在自生成 rollout 上训练,但通常把历史 KV 缓存当作不可导的 detach 状态;SGF(Self-Gradient Forcing)则用两次前向在单次可微重建中恢复穿过历史上下文的梯度。

第 5 节的自回归化完全按「teacher forcing → 短视程 SGF → 长视程 SGF」递进,这是模型能在 60 秒自生成历史上保持稳定的核心训练技术。

KV 缓存与 Attention Sink

自回归 Transformer 为每个历史 token 缓存 key/value 向量避免重复计算,但缓存随生成长度线性增长。Attention Sink 策略保留序列开头一小段永久前缀(sink)作为注意力锚点,配合 FIFO 窗口只保留最近的若干块,使缓存大小有界且与生成长度无关。

本文的流式生成用 sink-plus-FIFO 有界缓存(公式 32-33),并证明逐层堆叠可以形成超出单层窗口的多跳梯度路径,这是理解长视程 SGF 的前提。

MeanFlow 平均速度场

流匹配模型预测瞬时速度 $v(x_t, t)$,采样需要多步数值积分;MeanFlow 改为建模区间平均速度 $u(x_t, r, t) = \frac{1}{t-r}\int_r^t v\,d\tau$,使得任意区间 $[r,t]$ 的解就是一次减法 $x_r = x_t - (t-r)u$。训练通过 MeanFlow 恒等式(含 JVP 项)把区间积分转成局部回归目标。

第 7 节的超分辨率用 MeanFlow 把步数从「训练时绑死」变成「推理时旋钮」,同一套权重支持 1、2、4 或任意步采样,是理解其 SR 设计的核心。

研究动机

现有视频生成模型本质上仍围绕固定时间窗设计:主流联合音视频系统(如 LTX-2.3/2.5、JavisDiT++)一次只生成约 10 秒的镜头,长视频靠逐镜头拼接,角色面部结构、发型、服装与说话人音色在镜头之间频繁漂移或遗忘;把生成视频当作交互世界时,模型在以自己生成的历史为条件时会出现误差累积导致的外观漂移与结构崩塌,且各数据源的动作监督严重异构——UE 渲染有精确相机位姿、内部游戏只有动作日志没有位姿、网络视频既无动作日志也无遥测,控制器专属的动作空间互不兼容、相对运动幅度尺度失配,无法统一驱动一个世界模型。此外前代 JoyAI-Echo-1.0 的记忆机制按声学能量挑短音频窗口,能量最大的窗口可能被背景音乐主导,错误的说话人线索会在自回归展开时被反复强化;而为了实际落地,few-step 蒸馏(如 DMD)把采样步数在训练时绑死,超分辨率 teacher 需要几十步求解器,难以同时满足交互延迟与离线画质。

本文的目标是本文目标是构建统一音视频生成系统 JoyAI-Echo-1.5,把视频生成从「孤立片段」推向「持续故事 + 可探索世界」,具体拆成四个子目标。其一,长视频变体要在跨镜头、跨场景条件下持久保持角色外形与声音身份,并支持文本、图像、记忆三种条件的任意可组合输入,让 T2AV/I2AV/MT2AV/MTI2AV 四种生成模式共用一个模型接口。其二,世界模型变体要把任意来源的导航输入统一转换为校准的度量 6-DoF 相机轨迹,通过几何感知通路注入,实现控制器无关、第一/第三人称共享的精确相机控制。其三,训练管线要把双向多步扩散骨干改造成因果 few-step 流式生成器,在受限算力预算下对自生成历史的误差累积保持鲁棒,支撑 60 秒以上乃至 10 分钟的连续生成。其四,配套 Director Agent 负责剧本规划、镜头级记忆检索与准入,以及一个步数可在推理时任意调节的超分辨率模块,构成端到端可交付系统。

与已有工作不同的是,本文的独特切入有三点。第一,对「记忆」的重新构造:训练单元不是视频片段而是身份组——同一常驻角色在场景不相交镜头中的全部观测集合 $G_k$,这迫使模型抽取持久身份证据而非复制内容;视觉记忆压缩为单帧 latent,音频记忆则取语音过滤后的整段镜头音频(而非能量最大短窗),并用不连续 RoPE 坐标把目标(<500)、历史记忆(中心 500, 550, 600…)与预置记忆(≥5000)放到互不重叠的时间轴区域,从而删除 v1.0 的专用音频自注意力掩码与槽位配对跨模态掩码,让四种条件组合天然可组合。第二,对「控制」的几何统一:不学任何控制器语义,而是把键盘指令、游戏动作日志与视频反解位姿全部映射为相对 6-DoF 轨迹,用数据集级 90 分位尺度 $s_{global}$ 校准平移幅度,经 UCPE 以射线局部坐标系注入平行注意力头,第一/第三人称共享同一通路。第三,对「训练分布」的对齐:不同于把 KV 缓存当作不可导状态的 Self-Forcing,SGF 在单次可微前向中重建自生成 rollout,使后续块的损失能监督前文如何写入因果记忆,并以 sink-plus-FIFO 有界缓存把这一机制扩展到远超训练时程的长视程生成。

核心方法

直觉上,这篇论文给同一个音视频生成骨干装上三样东西:记忆(让角色跨镜头不忘)、控制(让用户能开车逛世界)、延续(让模型在自己的错误上继续稳定生成)。技术路线分六条线展开。(1) 数据:两阶段课程,Stage I 用身份中心语料构建「记忆-目标」样本对训练跨镜头记忆检索;Stage II 用高分辨率(720×720、1280×720、720×1280 三种画幅均衡)、无字幕、中文增强、带单/多镜头结构化字幕的语料维持通用 T2AV/I2AV 质量并学习转场建模。(2) 长视频记忆条件:每个记忆槽是一帧视觉 latent 加语音过滤后的整段音频 latent,RoPE 分区隔离角色,联合训练四种条件配置;再用分布匹配蒸馏压成 8 步学生,视频分支全参微调、音频分支走 LoRA,配合粗到细两阶段噪声调度、记忆随机退化与任务自适应音频权重。(3) 世界模型:UE 渲染、内部游戏、网络视频三种来源统一为度量 6-DoF 轨迹,全局尺度校准后经 UCPE 几何通路注入,按 AV-CPT → Action-SFT → Joint-FT 三阶段课程训练。(4) 自回归化:先用音视频 teacher forcing(FlexAttention 块级因果掩码 + LoRA)初始化因果生成器,再短视程 SGF(两次前向 + DMD 蒸馏成 few-step),再长视程 SGF(多段 rollout、sink-plus-FIFO 缓存、逐层多跳梯度、灰斑正则),并引入只写过去的循环因果记忆。(5) Director Agent 把用户意图展开成剧本,逐镜头执行规划-提示增强-生成-审查-记忆准入循环。(6) MeanFlow 任意步超分辨率模块负责最终交付画质,小文本与小人脸在其原生分辨率上先退化再被修复。

核心创新在三处与已有方法的本质区别。其一,记忆的「可组合统一条件化」:v1.0 及此前工作把记忆当作附加模块,需要专门的音频自注意力掩码和槽位配对的跨模态掩码;v1.5 改用 RoPE 坐标分区(目标低于 500,第 $i$ 个历史记忆的视听分量共享中心 $\mu_i = 500 + 50(i-1)$,预置记忆 $\rho_j \geq 5000$),加上「记忆 token 保持干净零噪声、不计入预测损失」两个属性来区分角色,删除所有硬掩码,使记忆与首帧图像条件可同时提供,MT2AV 与 MTI2AV 无需独立模型。其二,世界模型的「控制器无关几何接口」:先前世界模型多绑定具体动作空间(W/A/S/D、手柄键值),本文把一切输入统一为相对 6-DoF 轨迹事件流 $E_P = \{(t, P_t)\}$,经全局尺度校准后用 UCPE 注入——几何本身不区分第一/第三人称,由文本静态视角场决定观察者与主体的关系,一套参数服务两种视角。其三,训练的「rollout 感知」:SGF 与 Self-Forcing 的关键差异是把生成上下文写入 KV 的计算在 Forward 2 中以梯度重建,后续块损失可反传到「前面生成的内容如何被编码为因果记忆」,覆盖视频/音频自注意力、A2V、V2A 与 UCPE 五条注意力通路;配合 sink-plus-FIFO 有界缓存与逐层多跳梯度路径,把该监督扩展到远超单层窗口的时间范围,且完全不保留串行 rollout 的反传计算图。

方法步骤详情

长视频变体流程:数据上,从影视与网页视频做身份发现、场景分组与质量过滤(感知质量、拉普拉斯方差清晰度、OCR、光流、DINOv2 去重),得到身份组 $G_k = \{S_{k,n}\}$;每次迭代选一个目标镜头并采样 $K$ 个其余镜头做记忆,视觉取一帧过视频 VAE,音频取整段过语音过滤 $F_{speech}$(MSST 实现)再过音频 VAE;记忆与首帧图像的有无独立随机化,形成 T2AV/I2AV/MT2AV/MTI2AV 四配置;RoPE 上目标低于 500,第 $i$ 个记忆的视听分量共享中心 $\mu_i = 500+50(i-1)$,音频坐标整体平移对齐中心,预置记忆放 $\rho_j \geq 5000$;训练目标是带掩码的整流流联合速度回归(公式 17)。蒸馏上,DMD 转成 8 步学生:先大 timestep-shift 大学习率立视频结构,再小 shift 细化音频;视频全参微调、音频与跨模态注意力走 LoRA;视觉记忆先做低层统计校准、训练中随机退化(学生与 fake score 同看退化记忆、real score 看原记忆);音频权重按任务取 $\lambda_a = 0.25$(T2AV/I2AV)或 $0.10$(MT2AV);另加对数域 RMS 能量损失与复用冻结教师特征的扩散判别器。世界模型变体:UE 数据同步记录 RGB、键盘、内参与度量位姿(1 个第一人称 + 4 个第三人称相机随机采样);内部游戏从视频反解位姿并对齐动作日志;网络视频以约 1 分钟窗口用度量深度辅助的 ViPE 管线重建轨迹,旋转 SLERP、平移线性插值回帧率;全部按 $s_{global} = Q_{0.9}(\max_k \|\Delta t_{i,k}\|_2)$ 做全局尺度校准;UCPE 以 $G_i = I_d/8 \otimes D_i$ 缩放平行注意力头、零初始化投影加回主自注意力;课程为全骨干 AV-CPT(禁用轨迹)→ 冻结骨干只训 $\phi$ 的 Action-SFT(视觉去噪、删运动叙事与音频字段防信息捷径)→ 低学习率 Joint-FT。自回归化:teacher forcing 用 FlexAttention 块级因果掩码(公式 28)+ LoRA;SGF Forward 1 无梯度跑完整 rollout 记录退出步与噪声 latent,Forward 2 在五条注意力通路(视频/音频自注意力、A2V、V2A、UCPE)上并行可微重建并做 DMD(公式 31);长视程将多段 rollout 首尾帧共享拼接,KV 用 sink-plus-FIFO 缓存($|H_i^m| \leq S_m + R_m$),每段 DMD 损失求和(公式 35),并用稀疏背景时间正则(公式 36-38)抑制灰斑伪影;因果记忆取严格早于当前块的泄漏自由前缀 $C_i$,块级状态空间扫描 $s_t = \sigma(\delta) \odot s_{t-1} + (1-\sigma(\delta)) \odot e_{u_t}$、$y_t = g_t \odot s_t$ 以限幅残差写入。SR 阶段:Wan2.1 VAE 潜空间通道拼接低清条件 $y = (1-\alpha)z_{LR} + \alpha\epsilon_y$($\alpha \sim U(0.3, 0.6)$),AIGC 时序一致退化、文本条件退火;MeanFlow 用中心有限差分估 $du/dt$(约 2.0 倍步时),零初始化区间分支无损热启动,推理按 shift 2.0 网格任意 $K$ 步采样。

技术新颖性

技术新颖性可从四个维度评估。(1) 记忆表示:以「身份组 + 场景不相交观测」组织监督信号,明确抑制内容复制、强迫模型抽取持久身份证据,这比常见的「时间相邻帧延续」更难也更有泛化价值;语音过滤整段音频相对能量选窗,消除了背景音乐泄漏这一隐蔽失败模式,且视觉-音频槽位保序使外观与音色证据天然配对。(2) 训练目标的模态定制:对数域 RMS 能量约束直接对治 DMD 在稠密音频信号上的潜空间能量漂移(响度失控、削波、金属音),基于冻结教师特征的轻量判别器以极低成本获得局部对抗信号;任务自适应音频权重(MT2AV 取 0.10 而非 0.25)承认了记忆条件下音频目标更易学这一不对称事实,属于少见细粒度的模态/任务级蒸馏调参。(3) 长视程 SGF 的「多跳上下文梯度」是论文最有理论趣味的点:sink+FIFO 只约束单层直接可见的 K/V 集合,堆叠层间梯度可沿 $\mathcal{L}_i \to KV_j^{(\ell)} \to KV_h^{(\ell-1)}$ 传播到直接窗口之外,在计算量有界的前提下监督远距离记忆写入,且生成 latent、采样决策与串行 KV 轨迹全程 detach,与完整 rollout 反传有本质区别。(4) 工程化的 SR:把 MeanFlow 区间平均速度与零初始化分支结合得到「无损热启动 + 任意步数」组合,并明确论证对 $u_\theta$ 再接 ODE 校正器既冗余(减法已是精确区间积分)又不正确(校正器假设预测瞬时速度)。局限在于这些组件多为已知技术(RoPE 分区承袭 ShotStream、UCPE/SGF/DMD/MeanFlow 均有出处)的系统性组合与调优,单点算法突破相对有限。

Two-stage data construction pipeline of JoyAI-Echo-1.5
Figure 1: Two-stage data construction pipeline of JoyAI-Echo-1.5
Overview of memory-conditioned long-form generation and few-step acceleration in JoyAI-Echo-1.5
Figure 2: Overview of memory-conditioned long-form generation and few-step acceleration in JoyAI-Echo-1.5
Illustration of the causal attention masks used in streaming post-training
Figure 3: Illustration of the causal attention masks used in streaming post-training
Overview of the Director Agent workflow
Figure 4: Overview of the Director Agent workflow
Qualitative effect of the SR stage on generator outputs
Figure 5: Qualitative effect of the SR stage on generator outputs

实验结果

论文做了三组核心实验。第一组是长视频音视频生成:在遵循 v1.0 协议的 100 个故事、3000 个镜头基准上,与联合生成(JavisDiT++、LTX-2.3/2.5)、级联系统(ShotStream/StoryMem+MMAudio)和原生长视频(HappyOyster Directing 模式)比较,JoyAI-Echo-1.5 在 7 项指标中 6 项最佳:ViCLIP 跨镜头视觉一致性 0.8264(较 v1.0 的 0.8026 提升 0.0238)、Self-CIDS 角色身份一致性 0.7937(+0.0144)、Voice 说话人一致性 0.8524(+0.0395)、Imaging 0.7467、CLIP 文本对齐 0.2868、Whisper 词级语音 Recall 0.9674,仅 Aesthetic 0.5705 居第二。GSB 人评对 HappyOyster 五维全胜:音视频同步 48.4% vs 20.3%、故事指令遵循 38.6% vs 17.7%、对话/背景音频遵循 39.2% vs 23.5%、记忆/身份一致性 24.8% vs 15.7%(相似率 59.5%)、音频质量 44.4% vs 33.3%;Fig. 6 展示了 Director Agent 驱动的 10 分钟战时疏散故事案例,跨频繁转场仍保持角色身份与场景连贯。第二组是 WBench Navigation 158 例多轮评测:未蒸馏双向模型平均 81.7 排第一,4 步因果蒸馏版 81.0 排第二,领先第三名 HiDream-O1-World 的 80.7;未蒸馏版 Consistency 89.8 次高,而蒸馏版 Interaction 87.9 反而超过未蒸馏版的 87.2,说明 few-step 因果化几乎不损失交互响应。第三组是 SANA-WM-Bench:241 帧短视程上 VBench 83.91(Simple)/83.96(Hard)双 split 最高,Simple split 平移误差 0.160 与 CMC 0.162 最低,但 Hard split 旋转误差 1.697° 落后 SANA-WM 的 0.489°;961 帧(60 秒 @16FPS)长视程上未蒸馏版 Simple split R 3.22°、重访 PSNR 15.10 dB 最佳,Hard split R 恶化到 12.05° 暴露位姿漂移;因果版在 961 帧上 VBench 80.13/81.06 均列第一并取得最佳重访一致性(PSNR 14.41/14.04 dB),Fig. 11 显示其首窗/均值/最小窗 IQ 全面高于 Evoke 与 SANA-WM+Causal Refiner(竞争者 ∆IQ 更小只是因为整体 IQ 本来就低)。自建 WMB 200 例人评(132 第三人称 + 68 第一人称,覆盖游戏/机器人/户外/室内/驾驶)中,对 LingBot-World-v2 总体优选 46.5% vs 21.6%,对 HappyOyster 总体 63.1% vs 27.1%、时空一致性 57.7% vs 10.4%、视觉美学 52.9% vs 23.8%,但语义遵循(13.63% vs 29.44%)与运动质量(18.94% vs 24.56%)两项输给 HappyOyster。

Representative abbreviated examples of the four caption formats used in JoyAI-Echo-1.5
Table 1: Representative abbreviated examples of the four caption formats used in JoyAI-Echo-1.5
Quantitative comparison of baseline methods
Table 2: Quantitative comparison of baseline methods
Human evaluation based on Good-Similar-Bad (GSB) pairwise comparisons between JoyAI-Echo-1.5 (long-video variant) and HappyOyster
Table 3: Human evaluation based on Good-Similar-Bad (GSB) pairwise comparisons between JoyAI-Echo-1.5 (long-video variant) and HappyOyster
Comparison on the 158-case WBench Navigation split
Table 4: Comparison on the 158-case WBench Navigation split
Short-horizon comparison on SANA-WM-Bench using the first 241 frames of each trajectory
Table 5: Short-horizon comparison on SANA-WM-Bench using the first 241 frames of each trajectory
Long-horizon comparison on the full SANA-WM-Bench trajectory under the official 961-frame setting
Table 6: Long-horizon comparison on the full SANA-WM-Bench trajectory under the official 961-frame setting
Human evaluation based on GSB pairwise comparisons between JoyAI-Echo-1.5 (world model variant) and Happy Oyster
Table 8: Human evaluation based on GSB pairwise comparisons between JoyAI-Echo-1.5 (world model variant) and Happy Oyster
Human evaluation based on GSB pairwise comparisons between JoyAI-Echo-1.5 (world model variant) and LingBot-World-v2
Table 9: Human evaluation based on GSB pairwise comparisons between JoyAI-Echo-1.5 (world model variant) and LingBot-World-v2
Qualitative visualization of a 10-minute long audio-visual sequence generated under the Director Agent
Figure 6: Qualitative visualization of a 10-minute long audio-visual sequence generated under the Director Agent
Qualitative comparison between JoyAI-Echo-1.5 and JoyAI-Echo-1.0 under the same long-form story
Figure 7: Qualitative comparison between JoyAI-Echo-1.5 and JoyAI-Echo-1.0 under the same long-form story
Qualitative comparison of the undistilled bidirectional multi-step JoyAI-Echo-1.5 on representative WBench Navigation cases
Figure 8: Qualitative comparison of the undistilled bidirectional multi-step JoyAI-Echo-1.5 on representative WBench Navigation cases
Multi-turn comparison of JoyAI-Echo-1.5-Causal against representative few-step autoregressive world models on WBench Navigation
Figure 9: Multi-turn comparison of JoyAI-Echo-1.5-Causal against representative few-step autoregressive world models on WBench Navigation
Causal long-horizon generation of JoyAI-Echo-1.5-Causal on representative cases
Figure 10: Causal long-horizon generation of JoyAI-Echo-1.5-Causal on representative cases
Imaging quality comparison on the Simple- and Hard-Trajectory splits
Figure 11: Imaging quality comparison on the Simple- and Hard-Trajectory splits
Qualitative comparison of 961-frame (60-second at 16 FPS) causal rollouts on representative SANA-WM-Bench trajectories
Figure 12: Qualitative comparison of 961-frame (60-second at 16 FPS) causal rollouts on representative SANA-WM-Bench trajectories
查看结构化数据
任务指标本文基线提升
长视频跨镜头视觉-语义一致性(100 故事/3000 镜头) ViCLIP 相似度 0.8264 JoyAI-Echo-1.0:0.8026(次优为 ShotStream+MMAudio 0.7988) +0.0238
跨镜头角色身份一致性 Self-CIDS(GroundingDINO+Torchreid+FaceNet) 0.7937 JoyAI-Echo-1.0:0.7793(次优为 StoryMem+MMAudio 0.7491) +0.0144
跨镜头说话人音色一致性 3DSpeaker Voice 相似度 0.8524 JoyAI-Echo-1.0:0.8129(次优为 ShotStream+MMAudio 0.7945) +0.0395
语音内容保真度 Whisper 词级 Recall 0.9674 LTX-2.5:0.9545(次优) +0.0129
WBench Navigation 多轮交互世界建模(158 例) Average 综合分 81.7(未蒸馏,第一);81.0(4 步因果版,第二) HiDream-O1-World:80.7(第三) +1.0
SANA-WM-Bench 短视程(241 帧)视觉质量 VBench Overall 83.91(Simple)/ 83.96(Hard) DreamX-World:82.42 / 82.03(均为次优) +1.49 / +1.93
SANA-WM-Bench 长视程 60 秒因果 rollout(961 帧) VBench Overall 80.13(Simple)/ 81.06(Hard) Evoke:80.11 / 80.75(均为次优) +0.02 / +0.31
世界模型人评(自建 WMB,200 例) GSB 总体优选率 63.1%(对比 HappyOyster);46.5%(对比 LingBot-World-v2) HappyOyster:27.1%;LingBot-World-v2:21.6% +36.0 / +24.9 个百分点

局限与改进

作者明确承认的局限是困难长视程轨迹上的累积旋转漂移:Hard split 961 帧下旋转误差从短视程的 1.697° 恶化到 12.05°,且因果蒸馏相对未蒸馏模型带来轨迹精度与重访一致性的中度退化(WBench 平均 81.7→81.0,Consistency 从 89.8 大幅降到 77.5)。我的补充观察有五点。其一,WBench 的 Setting 维度(79.4)明显落后于 Kling 3.0(91.0)、Wan 2.7(91.4)与 Cosmos3-Super(91.6),Physical 70.6 也低于 HiDream-O1-World 的 72.1,说明场景/主体贴合与物理合理性并非其最强项,第一名的含金量主要来自一致性与交互。其二,人评中语义遵循与运动质量输给 HappyOyster,暴露轨迹控制与语言驱动运动之间的张力。其三,系统级组件众多(Director Agent 的 LLM 规划、VLM 记忆准入、MSST 语音过滤、SR 级联),论文未给这些组件的独立消融,最终收益难以干净归因到某个模块。其四,因果记忆一节自述只解决「FIFO 淘汰后重访」的部分问题,循环状态 $M_i$ 的容量、写入策略与检索方式仍较粗糙(作者自己列出了后缀、FoV 检索等替代方案但未展开实验细节)。其五,评测包含较多自建基准与协议(3000 镜头基准、WMB、部分指标自定如 Recall 替代 v1.0 的 accuracy 并重评所有方法),跨工作可比性受限。

独立分析的弱点

独立分析如下。弱点一:长 rollout 的几何漂移。Hard split 60 秒旋转误差 12.05° 意味着相机轨迹与指令逐渐脱钩,根因是误差在自回归中单向累积而无闭环校正;改进方向是引入重定位感知的训练信号,或在推理时周期性做位姿再锚定(利用已知轨迹与生成帧做轻量特征对齐并反馈修正)。弱点二:记忆的容量与形式太薄。每个身份只存一帧视觉 latent 加一段音频 latent,几何布局、物体状态、多角色关系都没有持久表示,长故事中道具连续性、门的开合等状态必然漂移;改进方向是把场景级记忆升级为轻量 3D/语义图或物体中心状态表,并配合视场(FoV)检索写入。弱点三:语言控制与轨迹控制的失衡。为迫使模型跟随轨迹,Action-SFT 阶段删掉运动叙事文本且 Joint-FT 也不恢复该字段,这很可能是人评中语义遵循(13.63%)大幅落后的直接原因;改进方向是在 Joint-FT 中以小比例恢复运动描述,并显式学习文本-轨迹冲突消解策略。弱点四:few-step 蒸馏的一致性代价。WBench Consistency 从 89.8 掉到 77.5,说明 4 步采样在多轮世界状态保持上有实质损失;可探索把 MeanFlow 式任意步思想用于世界模型本体,让交互场景用 1-2 步、关键镜头用更多步,而不是训练时绑死步数。弱点五:系统复杂度过高。训练横跨两阶段数据课程、三阶段世界模型课程、DMD、双 SGF、SR 师生等七八个阶段,任何一环的分布偏移都会向下游传导,复现与调试门槛极高;改进方向是模块化消融与更紧凑的课程设计。

未来方向

作者明确提出的方向:更强的几何一致性、持久的世界状态表示、更可靠的开放交互。基于本文成果可自然延伸的方向包括:其一,把 5.5 节的因果记忆 $M_i$ 与世界模型结合实现「回访不重置」——相机绕一圈回到原地时场景保持一致,这需要记忆模块支持空间索引与 FoV 检索,作者已列出这些替代方案但尚未展开;其二,将 MeanFlow 任意步思想反哺主生成器,替代当前 DMD 固定 8 步/4 步蒸馏,让同一套权重同时服务交互延迟与离线质量;其三,让 Director Agent 与世界模型闭环——Agent 不仅规划镜头,还在生成世界内探索、收集记忆并改写剧本,走向真正的生成式开放世界;其四,多说话人对话记忆:当前语音过滤记忆以单说话人场景为主,群像剧需要说话人分离与音色-角色归属;其五,把 SGF 的 rollout 感知训练推广到更广的模态对(音乐视频、配音动画)与更长的训练 rollout;其六,建立并公开 WMB 与 3000 镜头长视频基准的统一评测协议,缓解该领域评测碎片化问题。

复现评估

开源情况:代码仓库 github.com/jd-opensource/JoyAI-Echo 与项目页已公开,但截至论文撰写未见完整的训练权重与数据发布承诺;论文未披露主干模型参数量、总训练 GPU 时与数据规模,只给出了零散数字(如 SR 教师约 10.4k 优化步、WBench 158 例、WMB 200 例)。数据方面:影视/网页视频身份组、内部游戏数据、UE 渲染数据均不可外部复现,但关键工具链是公开的——语音过滤用 MSST(Music-Source-Separation-Training)工具包,位姿恢复用度量深度辅助的 ViPE 管线,评测基准 WBench 与 SANA-WM-Bench 均公开可得。算力方面:视频分支全参微调加上多阶段课程、DMD、双 SGF 与 SR 师生训练,估计需要大规模 GPU 集群与数周量级训练。复现难度评级:推理复现中等(若开源权重,可直接在公开基准上验证 WBench/SANA-WM 数字);训练复现困难——FlexAttention 块级掩码、分片数据并行下手工中心有限差分 JVP(含双精度差分与随机状态钉扎等细节)、逐阶段数据混合比例与退化校准等大量实现依赖内部基础设施。对研究者更现实的路径是基于开源代码复现评测,或在公开骨干上重新实现记忆条件化、SGF、UCPE 等核心思想做受控比较。