← 返回 2026-07-22

AlayaWorld:交互式长时程视频世界模型 AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao 📅 2026-07-20 👍 57 2026-07-27 18:30
3D记忆 世界模型 扩散Transformer 自回归生成 蒸馏加速 视频生成

基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成

前置知识

流匹配与扩散Transformer(DiT)

流匹配训练网络预测速度场 $v_\theta(z^\tau,\tau)\approx\epsilon-z$,沿连续噪声水平 $\tau$ 把高斯噪声输运到数据分布;DiT 用 Transformer 替代 U-Net 作为去噪骨干,靠全自注意力建模时空依赖,是当前视频生成的主流架构。

AlayaWorld 的骨干是 LTX-2.3 的约13B视频 DiT,论文三个训练阶段的全部损失(flow-matching、DMD、一致性蒸馏)都建立在这套公式之上,不熟悉就无法读懂第3节。

自回归潜空间块生成

因果 VAE 把视频编码成潜帧序列并按 $K=4$ 潜帧分块,模型按 $p_\theta(z_{1:N}|\pi_{1:N},y_{1:N})=\prod_{i=1}^{N} p_\theta(z_i|z_{<i},\pi_{\le i},y_i)$ 逐块生成,每块只看过去、绝不泄漏未来信息。

这是'世界逐秒展开'的基本形式,论文的记忆机制、相机控制、蒸馏全部作用在这个块级自回归循环上。

深度重投影与前向溅射

已知某帧像素深度 $D_j(u)$ 可把像素反投影为 3D 点,再用目标相机位姿重投影:$u'=\pi_i\pi_j^{-1}(u, D_j(u))$;前向溅射把源像素'泼'到目标视图,用 z-buffer 按最近深度解决遮挡冲突。

空间记忆正是靠这一步把'以前看过的地方'渲染进当前视角,是实现跨视角、跨重访一致性的几何基础。

分布匹配蒸馏(DMD)

维护真实数据评分 $s_{real}$ 与学生样本评分 $s_{fake}$,以评分差为梯度方向 $\nabla_\theta D_{KL}(p_{\theta,\tau}\|p_{data,\tau})$,把多步教师的输出分布压进少步学生,而不逐点对齐样本。

这是论文把每块约30步采样压到4步的核心技术之一,其 real/fake 两个评分共用同一骨干、仅靠 critic LoRA 开关切换,是很有辨识度的工程设计。

RoPE 位置编码与 sink 帧

RoPE 在注意力内为 token 注入相对时序/空间位置;本文把一张固定不动的潜帧钉在 RoPE 时序位置 0,称为 sink,作为跨所有生成块共享的全局身份与外观锚点。

理解前缀 token 序列 $S_i=[s;h_i;g_i;n_i;z^ au_i]$ 的组织方式、以及 sink 取远帧以防模型绕过相机控制直接外推的设计,都需要先懂 RoPE。

一致性蒸馏与 self-forcing++

一致性蒸馏约束相邻噪声水平的预测一致:$\mathcal{L}_{cm}=\mathbb{E}\,d(G_\theta(z^\tau),G_{\theta^-}(z^{\tau'}))$,$\theta^-$ 为 EMA 目标;self-forcing++ 让学生沿自己 rollout 的轨迹对齐教师。

二者与 DMD 共同构成蒸馏目标 $\mathcal{L}_{DMD}+0.5\mathcal{L}_{cm}$,是蒸馏后块与块之间续写无缝、不闪烁的关键。

研究动机

现代 3A 游戏的世界构建依赖漫长而紧密耦合的生产管线:概念设计、资产制作、动画、物理、渲染、玩法编程、测试与优化,任何个性化、快速演化乃至'无边界'的交互世界都因此昂贵到不可行。视频世界模型试图绕开资产管线,直接从文本、图像和用户控制生成可交互环境,但要真正可用,四个能力缺一不可:交互(准确响应相机轨迹与用户意图)、一致性(跨视角与延迟重访时保持空间结构与视觉身份)、稳定性(长自回归 rollout 不累积模糊、光照漂移与几何畸变)、效率(低生成延迟)。现有开源模型难以同时满足:本文实测对比中 Matrix-Game 2.0 的亮度一致性仅 0.2963、WAN 2.2 的锐度保持仅 0.3428,长程生成普遍漂移;而常规多步采样模型每块需约 30 步去噪,延迟过高、无法支撑实时交互。

本文的目标是本文的目标是构建 AlayaWorld:一个开源的交互式长时程视频世界模型,在单一自回归框架内同时实现交互、一致性、稳定性与效率四大紧耦合能力。具体指标包括:基于 15B 级视频扩散 Transformer,以 24 fps 生成 540p 与 720p 视频;在连续相机轨迹与可动态切换文本提示下,以短潜块(每块 K=4 个潜帧、约对应 1 秒视频)自回归合成世界;上下文保持有界——固定 sink 帧、6 帧压缩时序历史、至多 10 帧渲染空间记忆加最近帧——使每块计算成本近似恒定,rollout 时长原则上无界;通过离散自回归蒸馏把每块采样从约 30 步压到 4 步;最终在 iWorld-Bench 的生成质量、轨迹遵循与记忆能力三个维度上取得最佳综合表现。项目被定位为全栈开源的长期基础设施。

与已有工作不同的是,与既有工作相比,本文的独特切入有三点。其一,不追求无限增长的上下文,而设计'有界视觉上下文':全局 sink 锚点、压缩时序记忆、几何对齐的空间记忆(把过去观测按单目深度重投影进当前视角)、最近帧 I2V 条件,四流与加噪目标帧拼成单序列送入一个自注意力 DiT,前缀在最后一个 Transformer 块后被切掉,从而用恒定计算量支撑原则上无界的生成。其二,抗漂移不靠外部正则,而用模型自己的失败经验训练:Helios 漂移模拟在潜空间退化上下文,'误差库'则收集自身 rollout 的预测残差并回放,让模型在训练中直接见到推理时的失败模式。其三,提出离散自回归蒸馏公式,把 DMD、self-forcing++ 与一致性蒸馏组合起来,相比 Causal-rCM 的连续时间公式避免了 JVP 计算,且蒸馏时保留完整的相机控制与记忆栈。

核心方法

直觉上,AlayaWorld 把世界生成当成'带记忆的逐秒续写':每步只生成约 1 秒(K=4 个 VAE 潜帧)的潜块,但生成时能同时看到全局身份锚、压缩的近期动态、按几何重投影的历史画面和最近一帧,因此既连贯又有长期记忆。技术上,模型以 LTX-2.3(22B 多模态,去掉音频模块后约 13B 视频 DiT)为骨干,对第 $i$ 块构造前缀 token 序列 $S_i=[\,s;\ h_i;\ g_i;\ n_i;\ z^\tau_i\,]$:sink 帧、时序记忆 $h_i=H_\phi(w_i)$(对最近 $L=6$ 潜帧滑窗压缩)、空间记忆 $g_i$(按目标相机位姿渲染的过去观测)、最近帧 $n_i$ 与加噪目标帧。整段序列经全(非因果)自注意力处理后切掉前缀,只对目标段去噪。训练分三阶段:双向预训练建立世界域先验,自回归训练接入相机控制与双记忆并用抗漂移策略稳定长 rollout,后训练蒸馏把约 30 步教师压成 4 步学生。每块推理循环为:读控制信号、建前缀、采样、流式解码并更新缓存、推进下一块。

核心创新是'有界上下文 + 几何对齐空间记忆 + 自误差驱动抗漂移 + 离散蒸馏'的组合。空间记忆沿用 GEN3C 思想维护显式缓存 $B=\{(I_j, D_j, \pi_j)\}$(历史帧、Depth-Anything-3 深度、位姿),对每块用贪心最大覆盖检索至多 10 帧,按 $u'=\pi_i\pi_j^{-1}(u, D_j(u))$ 前向溅射到目标视角,z-buffer(遮挡容差 $\delta=0.1$)解决遮挡,融合成 $\tilde I_i$ 与覆盖掩码 $M_i$;$M_i$ 进一步作为自注意力 key 偏置,让未观测区域被'忽略'而非被'信任'——这是与单纯图像 warp 的本质区别。抗漂移方面,Helios 模拟在潜空间对记忆 token 施加噪声/降采样模糊/饱和偏移退化,误差库把自身重构残差 $\delta=\hat z_0-z_0$ 分桶回放为 $z\leftarrow z+\gamma\delta$。sink 帧训练时取距目标至少 8 个潜帧的远帧,防止模型绕过相机控制直接外推。相机条件与空间缓存共享同一位姿源,保证二者一致。

方法步骤详情

阶段一(双向预训练):全参数微调 LTX-2.3,24fps、540p/720p、最长 20 秒片段,混合 image/video/text 条件, 文本随机丢弃,用随时长自适应的 sigma-shift 调度并以低 σ 精修收尾。阶段二 2a(历史预训练):冻结骨干,LoRA 训练压缩模块 $H_\phi$,历史帧按 $\tilde z_i=(1-\sigma_i)z_i+\sigma_i\epsilon_i$($\sigma_i\sim U(0.2,1)$)加噪,flow-matching 目标下重建目标窗。阶段二 2b(全栈微调):解冻骨干,同时训练相机控制(每帧相对位姿增量 $\Delta\pi$ 逐轴 Fourier 嵌入、6 分量过 MLP 得 $c_{cam}$,经 AdaLN 注入 $e\leftarrow e+c_{cam}$)、时序记忆、空间记忆与 next forcing 头($\mathcal{L}=\mathcal{L}_{flow}+0.5\mathcal{L}_{nf}$);抗漂移用 Helios 退化(噪声、缩放 $r\sim U(0.9,1)$、饱和 $\alpha\sim U(0.3,1.7)$)与误差库互斥调度、带 warm-up。阶段三(蒸馏):学生为冻结骨干上的 LoRA,记忆冻结;DMD 双时间尺度训练 critic LoRA,self-forcing++ 在学生自 rollout 上对齐教师,一致性蒸馏在 50 步网格约束 EMA 目标,总目标 $\mathcal{L}_{DMD}+0.5\mathcal{L}_{cm}$,约 30 步压到每块 4 步。推理循环:读相机轨迹与提示、建前缀、采样、流式解码并更新缓存、推进下一块,每块约 1 秒视频。

技术新颖性

技术新颖性体现在四个层面。第一,上下文架构:不同于交叉注意力库或无限 KV 缓存,四流前缀(sink/时序/空间/最近帧)与目标帧拼成单序列做全自注意力,前缀用后即弃,配合 sink 固定在 RoPE 时序位置 0,实现常数成本、原则上无界的 rollout。第二,空间记忆的注入方式:GEN3C 只在像素域 warp,本文把覆盖掩码变成注意力 key 偏置,让 Transformer 显式区分'已观测'与'未观测'像素,几何证据与生成先验在特征层融合。第三,抗漂移训练:现有长视频方法多依赖简单噪声增强,本文的误差库按块长与噪声水平分桶存储并回放自身残差,与 Helios 模拟经 warm-up 互斥调度,是'从自身错误中学习'的具体化。第四,离散自回归蒸馏:相较 Causal-rCM 的连续时间公式无需 JVP;DMD 的 real/fake 两个评分共用同一骨干、仅靠 critic LoRA 开关切换并以双时间尺度更新,省掉一整个评分网络;self-forcing++ 保证蒸馏后块间续写无缝。蒸馏阶段保留完整控制与记忆栈、只训 LoRA,也是少见的完整做法。

Representative training samples from the seven data sources, grouped by source type.
Figure 2: Representative training samples from the seven data sources, grouped by source type.
Training stages.
Figure 3: Training stages.
Formulation.
Figure 4: Formulation.

实验结果

在 iWorld-Bench(480p、每块 4 步采样,评测前把基准指令语义保持地改写为训练提示风格)上,与 NVIDIA Cosmos、HunyuanVideo-1.5、WAN 2.2、YUME 1.5、Matrix-Game 2.0、HY-World 1.5 对比,综合最佳。生成质量:亮度一致性 0.9492(次优 HY-World 1.5 为 0.8051)、色温约束 0.9379(0.7819)、锐度保持 0.8361(0.6634),大幅领先,说明漂移、光照波动与清晰度退化被有效抑制;图像质量 0.6620 略低于 Cosmos 的 0.6778。轨迹遵循:运动平滑度 0.9924(0.9921)与轨迹精度 0.7985(0.7472)均为最佳。记忆能力:记忆对称性 0.8871(0.8481)与轨迹对齐 0.7018(0.6776)均最佳,验证双记忆在离开—返回闭环轨迹上保留外观与空间结构。基线中最弱的是 Matrix-Game 2.0(亮度一致性仅 0.2963)与 WAN 2.2(锐度保持 0.3428)。另有 WorldMark/World Model Arena 人类盲测 Elo 评分;定性上展示相机导航、块中途提示切换触发施法/战斗事件、重访一致与 0-60 秒稳定 rollout。

Training data composition.
Table 1: Training data composition.
Per-segment annotation tracks.
Table 2: Per-segment annotation tracks.
Results on iWorld-Bench across three evaluation dimensions.
Table 3: Results on iWorld-Bench across three evaluation dimensions.
Qualitative results of camera-controlled generation.
Figure 5: Qualitative results of camera-controlled generation.
Qualitative results of prompt-driven actions.
Figure 6: Qualitative results of prompt-driven actions.
Qualitative results of consistent world generation under leave-and-return trajectories.
Figure 7: Qualitative results of consistent world generation under leave-and-return trajectories.
Qualitative results of long-horizon autoregressive generation.
Figure 8: Qualitative results of long-horizon autoregressive generation.
查看结构化数据
任务指标本文基线提升
长时程生成-亮度一致性 Brightness Consistency(0-1,越高越好) 0.9492 HY-World 1.5:0.8051 +0.1441(约+17.9%)
长时程生成-色温约束 Color Temp. Constraint 0.9379 HY-World 1.5:0.7819 +0.1560(约+20.0%)
长时程生成-锐度保持 Sharpness Retention 0.8361 HY-World 1.5:0.6634 +0.1727(约+26.0%)
生成质量-图像质量 Image Quality 0.6620 NVIDIA Cosmos:0.6778 -0.0158(该单项未超过最佳基线)
轨迹遵循-轨迹精度 Trajectory Accuracy 0.7985 HY-World 1.5:0.7472 +0.0513(约+6.9%)
轨迹遵循-运动平滑度 Motion Smoothness 0.9924 HY-World 1.5:0.9921 +0.0003(微弱领先)
记忆能力-记忆对称性 Memory Symmetry 0.8871 HY-World 1.5:0.8481 +0.0390(约+4.6%)
记忆能力-轨迹对齐 Trajectory Alignment 0.7018 HY-World 1.5:0.6776 +0.0242(约+3.6%)

局限与改进

作者明确承认:AlayaWorld 对世界的理解主要停留在视觉观测、估计几何与视觉记忆层面,对物体状态、物理因果与长期任务结构的把握仅限于'可见后果'。此外图像质量单项(0.6620)不敌 Cosmos(0.6778),单帧保真仍有差距。我自己的观察还有几点:其一,评测前用自动流程把基准指令改写成自家训练提示风格,虽称语义保持,但与训练分布对齐可能引入评测偏差;其二,空间记忆质量完全依赖 Depth-Anything-3 单目深度,深度误差会进入缓存并随重投影传播,每块至多 10 帧的缓存上限在复杂场景可能不足;其三,定量评测在 480p 进行,与宣称的 720p 能力有差距,长时程指标也缺少非闭环场景的系统扫描;其四,222,147 段训练数据中内部来源(MUGEN、GameVerse、GenEvent 合计约 152,042 段、约 68%)无法被外部审计,域偏置难以评估。

独立分析的弱点

独立分析四个弱点。第一,缺乏持久物体状态:空间记忆只缓存外观与深度,不建模物体级状态与物理,用户'开了门'或'熄了灯'后离开再返回,重投影画面可能与用户操作矛盾,改进方向是引入物体级语义记忆或场景图,并与几何缓存对齐更新。第二,深度依赖链脆弱:每块生成都要跑 VAE 流式解码与 Depth-Anything-3 估计,深度误差、动态物体(行人走动)都会污染缓存,改进方向是动态/静态分离缓存、给缓存帧加不确定性权重并随时间衰减。第三,交互延迟链路长:尽管采样压到每块 4 步,每块仍需解码、深度估计、缓存检索与溅射渲染,15B 骨干在消费级硬件上难以保证实时,可探索更小的学生骨干或把深度/缓存网络小型化、流水线化。第四,评测协议偏自利:提示自适应改写与自家训练风格一致,建议补充不改写提示的原协议结果、公布更多第三方 arena 的长期 Elo 数据,并在 720p 分辨率重跑 iWorld-Bench。

未来方向

作者把 AlayaWorld 定位为全栈、开源、长期的 extensible 基础,面向'生成式现实',暗示会持续扩展。基于本文成果可直接延伸的方向:其一,把物体状态、物理因果与任务结构显式建模进世界记忆,超越'只记住看见过的东西';其二,扩展控制模态,从相机轨迹加文本提示扩展到键盘/手柄离散动作、多智能体交互与物理干预;其三,把 LTX-2.3 中被移除的音频模块接回,实现视听一体的世界模型;其四,空间记忆可升级为持久 3D 表示(如基于缓存的神经场或 3DGS),支持任意视角回访与更长程的记忆;其五,把 DMD + self-forcing++ + 一致性蒸馏的组合推广到其他自回归世界模型,并进一步压到 1-2 步;其六,利用 arena 的真人偏好数据做 RLHF 式后训练,直接优化人类感知的一致性与质量而非代理指标;其七,探索记忆检索的全局语义索引,使'回到某个具体地点'之外的语义级重访(如'回到有喷泉的广场')也可控。

复现评估

复现门槛较高但诚意可见。有利因素:论文明确宣称全栈开源,项目页、GitHub 代码与演示视频齐备;骨干 LTX-2.3 有公开 checkpoint;iWorld-Bench 与 WorldMark/World Model Arena(warena.ai)公开可评;数据管线描述极详细——六类过滤门槛(不低于 720p、时长不低于 3 秒、24-65fps、H.264/HEVC/AV1、黑边率不超 0.10、UI 覆盖率不超 0.04)、单次 NVDEC 解码加 RAFT 光流的特征缓存、每源约 200 段切片标定阈值、Kimi-K2.6/Gemini/Gemma 标注后端。不利因素:222,147 段数据中 MUGEN(21,436)、GameVerse(124,116)、GenEvent(6,490)三个内部来源合计约 68% 无法外部获取;未披露 GPU 数量、训练时长与蒸馏成本,15B 级三阶段全参数训练估计需数十卡级投入;提示自适应改写细节需等开源代码。总体:开源后可较顺利推理与微调,从头完整复现训练属大厂级工程。