AlayaWorld:交互式长时程视频世界模型 AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成
前置知识
流匹配与扩散Transformer(DiT)
流匹配训练网络预测速度场 $v_\theta(z^\tau,\tau)\approx\epsilon-z$,沿连续噪声水平 $\tau$ 把高斯噪声输运到数据分布;DiT 用 Transformer 替代 U-Net 作为去噪骨干,靠全自注意力建模时空依赖,是当前视频生成的主流架构。
AlayaWorld 的骨干是 LTX-2.3 的约13B视频 DiT,论文三个训练阶段的全部损失(flow-matching、DMD、一致性蒸馏)都建立在这套公式之上,不熟悉就无法读懂第3节。
自回归潜空间块生成
因果 VAE 把视频编码成潜帧序列并按 $K=4$ 潜帧分块,模型按 $p_\theta(z_{1:N}|\pi_{1:N},y_{1:N})=\prod_{i=1}^{N} p_\theta(z_i|z_{<i},\pi_{\le i},y_i)$ 逐块生成,每块只看过去、绝不泄漏未来信息。
这是'世界逐秒展开'的基本形式,论文的记忆机制、相机控制、蒸馏全部作用在这个块级自回归循环上。
深度重投影与前向溅射
已知某帧像素深度 $D_j(u)$ 可把像素反投影为 3D 点,再用目标相机位姿重投影:$u'=\pi_i\pi_j^{-1}(u, D_j(u))$;前向溅射把源像素'泼'到目标视图,用 z-buffer 按最近深度解决遮挡冲突。
空间记忆正是靠这一步把'以前看过的地方'渲染进当前视角,是实现跨视角、跨重访一致性的几何基础。
分布匹配蒸馏(DMD)
维护真实数据评分 $s_{real}$ 与学生样本评分 $s_{fake}$,以评分差为梯度方向 $\nabla_\theta D_{KL}(p_{\theta,\tau}\|p_{data,\tau})$,把多步教师的输出分布压进少步学生,而不逐点对齐样本。
这是论文把每块约30步采样压到4步的核心技术之一,其 real/fake 两个评分共用同一骨干、仅靠 critic LoRA 开关切换,是很有辨识度的工程设计。
RoPE 位置编码与 sink 帧
RoPE 在注意力内为 token 注入相对时序/空间位置;本文把一张固定不动的潜帧钉在 RoPE 时序位置 0,称为 sink,作为跨所有生成块共享的全局身份与外观锚点。
理解前缀 token 序列 $S_i=[s;h_i;g_i;n_i;z^ au_i]$ 的组织方式、以及 sink 取远帧以防模型绕过相机控制直接外推的设计,都需要先懂 RoPE。
一致性蒸馏与 self-forcing++
一致性蒸馏约束相邻噪声水平的预测一致:$\mathcal{L}_{cm}=\mathbb{E}\,d(G_\theta(z^\tau),G_{\theta^-}(z^{\tau'}))$,$\theta^-$ 为 EMA 目标;self-forcing++ 让学生沿自己 rollout 的轨迹对齐教师。
二者与 DMD 共同构成蒸馏目标 $\mathcal{L}_{DMD}+0.5\mathcal{L}_{cm}$,是蒸馏后块与块之间续写无缝、不闪烁的关键。
研究动机
现代 3A 游戏的世界构建依赖漫长而紧密耦合的生产管线:概念设计、资产制作、动画、物理、渲染、玩法编程、测试与优化,任何个性化、快速演化乃至'无边界'的交互世界都因此昂贵到不可行。视频世界模型试图绕开资产管线,直接从文本、图像和用户控制生成可交互环境,但要真正可用,四个能力缺一不可:交互(准确响应相机轨迹与用户意图)、一致性(跨视角与延迟重访时保持空间结构与视觉身份)、稳定性(长自回归 rollout 不累积模糊、光照漂移与几何畸变)、效率(低生成延迟)。现有开源模型难以同时满足:本文实测对比中 Matrix-Game 2.0 的亮度一致性仅 0.2963、WAN 2.2 的锐度保持仅 0.3428,长程生成普遍漂移;而常规多步采样模型每块需约 30 步去噪,延迟过高、无法支撑实时交互。
本文的目标是本文的目标是构建 AlayaWorld:一个开源的交互式长时程视频世界模型,在单一自回归框架内同时实现交互、一致性、稳定性与效率四大紧耦合能力。具体指标包括:基于 15B 级视频扩散 Transformer,以 24 fps 生成 540p 与 720p 视频;在连续相机轨迹与可动态切换文本提示下,以短潜块(每块 K=4 个潜帧、约对应 1 秒视频)自回归合成世界;上下文保持有界——固定 sink 帧、6 帧压缩时序历史、至多 10 帧渲染空间记忆加最近帧——使每块计算成本近似恒定,rollout 时长原则上无界;通过离散自回归蒸馏把每块采样从约 30 步压到 4 步;最终在 iWorld-Bench 的生成质量、轨迹遵循与记忆能力三个维度上取得最佳综合表现。项目被定位为全栈开源的长期基础设施。
与已有工作不同的是,与既有工作相比,本文的独特切入有三点。其一,不追求无限增长的上下文,而设计'有界视觉上下文':全局 sink 锚点、压缩时序记忆、几何对齐的空间记忆(把过去观测按单目深度重投影进当前视角)、最近帧 I2V 条件,四流与加噪目标帧拼成单序列送入一个自注意力 DiT,前缀在最后一个 Transformer 块后被切掉,从而用恒定计算量支撑原则上无界的生成。其二,抗漂移不靠外部正则,而用模型自己的失败经验训练:Helios 漂移模拟在潜空间退化上下文,'误差库'则收集自身 rollout 的预测残差并回放,让模型在训练中直接见到推理时的失败模式。其三,提出离散自回归蒸馏公式,把 DMD、self-forcing++ 与一致性蒸馏组合起来,相比 Causal-rCM 的连续时间公式避免了 JVP 计算,且蒸馏时保留完整的相机控制与记忆栈。
核心方法
直觉上,AlayaWorld 把世界生成当成'带记忆的逐秒续写':每步只生成约 1 秒(K=4 个 VAE 潜帧)的潜块,但生成时能同时看到全局身份锚、压缩的近期动态、按几何重投影的历史画面和最近一帧,因此既连贯又有长期记忆。技术上,模型以 LTX-2.3(22B 多模态,去掉音频模块后约 13B 视频 DiT)为骨干,对第 $i$ 块构造前缀 token 序列 $S_i=[\,s;\ h_i;\ g_i;\ n_i;\ z^\tau_i\,]$:sink 帧、时序记忆 $h_i=H_\phi(w_i)$(对最近 $L=6$ 潜帧滑窗压缩)、空间记忆 $g_i$(按目标相机位姿渲染的过去观测)、最近帧 $n_i$ 与加噪目标帧。整段序列经全(非因果)自注意力处理后切掉前缀,只对目标段去噪。训练分三阶段:双向预训练建立世界域先验,自回归训练接入相机控制与双记忆并用抗漂移策略稳定长 rollout,后训练蒸馏把约 30 步教师压成 4 步学生。每块推理循环为:读控制信号、建前缀、采样、流式解码并更新缓存、推进下一块。
核心创新是'有界上下文 + 几何对齐空间记忆 + 自误差驱动抗漂移 + 离散蒸馏'的组合。空间记忆沿用 GEN3C 思想维护显式缓存 $B=\{(I_j, D_j, \pi_j)\}$(历史帧、Depth-Anything-3 深度、位姿),对每块用贪心最大覆盖检索至多 10 帧,按 $u'=\pi_i\pi_j^{-1}(u, D_j(u))$ 前向溅射到目标视角,z-buffer(遮挡容差 $\delta=0.1$)解决遮挡,融合成 $\tilde I_i$ 与覆盖掩码 $M_i$;$M_i$ 进一步作为自注意力 key 偏置,让未观测区域被'忽略'而非被'信任'——这是与单纯图像 warp 的本质区别。抗漂移方面,Helios 模拟在潜空间对记忆 token 施加噪声/降采样模糊/饱和偏移退化,误差库把自身重构残差 $\delta=\hat z_0-z_0$ 分桶回放为 $z\leftarrow z+\gamma\delta$。sink 帧训练时取距目标至少 8 个潜帧的远帧,防止模型绕过相机控制直接外推。相机条件与空间缓存共享同一位姿源,保证二者一致。
方法步骤详情
阶段一(双向预训练):全参数微调 LTX-2.3,24fps、540p/720p、最长 20 秒片段,混合 image/video/text 条件, 文本随机丢弃,用随时长自适应的 sigma-shift 调度并以低 σ 精修收尾。阶段二 2a(历史预训练):冻结骨干,LoRA 训练压缩模块 $H_\phi$,历史帧按 $\tilde z_i=(1-\sigma_i)z_i+\sigma_i\epsilon_i$($\sigma_i\sim U(0.2,1)$)加噪,flow-matching 目标下重建目标窗。阶段二 2b(全栈微调):解冻骨干,同时训练相机控制(每帧相对位姿增量 $\Delta\pi$ 逐轴 Fourier 嵌入、6 分量过 MLP 得 $c_{cam}$,经 AdaLN 注入 $e\leftarrow e+c_{cam}$)、时序记忆、空间记忆与 next forcing 头($\mathcal{L}=\mathcal{L}_{flow}+0.5\mathcal{L}_{nf}$);抗漂移用 Helios 退化(噪声、缩放 $r\sim U(0.9,1)$、饱和 $\alpha\sim U(0.3,1.7)$)与误差库互斥调度、带 warm-up。阶段三(蒸馏):学生为冻结骨干上的 LoRA,记忆冻结;DMD 双时间尺度训练 critic LoRA,self-forcing++ 在学生自 rollout 上对齐教师,一致性蒸馏在 50 步网格约束 EMA 目标,总目标 $\mathcal{L}_{DMD}+0.5\mathcal{L}_{cm}$,约 30 步压到每块 4 步。推理循环:读相机轨迹与提示、建前缀、采样、流式解码并更新缓存、推进下一块,每块约 1 秒视频。
技术新颖性
技术新颖性体现在四个层面。第一,上下文架构:不同于交叉注意力库或无限 KV 缓存,四流前缀(sink/时序/空间/最近帧)与目标帧拼成单序列做全自注意力,前缀用后即弃,配合 sink 固定在 RoPE 时序位置 0,实现常数成本、原则上无界的 rollout。第二,空间记忆的注入方式:GEN3C 只在像素域 warp,本文把覆盖掩码变成注意力 key 偏置,让 Transformer 显式区分'已观测'与'未观测'像素,几何证据与生成先验在特征层融合。第三,抗漂移训练:现有长视频方法多依赖简单噪声增强,本文的误差库按块长与噪声水平分桶存储并回放自身残差,与 Helios 模拟经 warm-up 互斥调度,是'从自身错误中学习'的具体化。第四,离散自回归蒸馏:相较 Causal-rCM 的连续时间公式无需 JVP;DMD 的 real/fake 两个评分共用同一骨干、仅靠 critic LoRA 开关切换并以双时间尺度更新,省掉一整个评分网络;self-forcing++ 保证蒸馏后块间续写无缝。蒸馏阶段保留完整控制与记忆栈、只训 LoRA,也是少见的完整做法。
实验结果
在 iWorld-Bench(480p、每块 4 步采样,评测前把基准指令语义保持地改写为训练提示风格)上,与 NVIDIA Cosmos、HunyuanVideo-1.5、WAN 2.2、YUME 1.5、Matrix-Game 2.0、HY-World 1.5 对比,综合最佳。生成质量:亮度一致性 0.9492(次优 HY-World 1.5 为 0.8051)、色温约束 0.9379(0.7819)、锐度保持 0.8361(0.6634),大幅领先,说明漂移、光照波动与清晰度退化被有效抑制;图像质量 0.6620 略低于 Cosmos 的 0.6778。轨迹遵循:运动平滑度 0.9924(0.9921)与轨迹精度 0.7985(0.7472)均为最佳。记忆能力:记忆对称性 0.8871(0.8481)与轨迹对齐 0.7018(0.6776)均最佳,验证双记忆在离开—返回闭环轨迹上保留外观与空间结构。基线中最弱的是 Matrix-Game 2.0(亮度一致性仅 0.2963)与 WAN 2.2(锐度保持 0.3428)。另有 WorldMark/World Model Arena 人类盲测 Elo 评分;定性上展示相机导航、块中途提示切换触发施法/战斗事件、重访一致与 0-60 秒稳定 rollout。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长时程生成-亮度一致性 | Brightness Consistency(0-1,越高越好) | 0.9492 | HY-World 1.5:0.8051 | +0.1441(约+17.9%) |
| 长时程生成-色温约束 | Color Temp. Constraint | 0.9379 | HY-World 1.5:0.7819 | +0.1560(约+20.0%) |
| 长时程生成-锐度保持 | Sharpness Retention | 0.8361 | HY-World 1.5:0.6634 | +0.1727(约+26.0%) |
| 生成质量-图像质量 | Image Quality | 0.6620 | NVIDIA Cosmos:0.6778 | -0.0158(该单项未超过最佳基线) |
| 轨迹遵循-轨迹精度 | Trajectory Accuracy | 0.7985 | HY-World 1.5:0.7472 | +0.0513(约+6.9%) |
| 轨迹遵循-运动平滑度 | Motion Smoothness | 0.9924 | HY-World 1.5:0.9921 | +0.0003(微弱领先) |
| 记忆能力-记忆对称性 | Memory Symmetry | 0.8871 | HY-World 1.5:0.8481 | +0.0390(约+4.6%) |
| 记忆能力-轨迹对齐 | Trajectory Alignment | 0.7018 | HY-World 1.5:0.6776 | +0.0242(约+3.6%) |
局限与改进
作者明确承认:AlayaWorld 对世界的理解主要停留在视觉观测、估计几何与视觉记忆层面,对物体状态、物理因果与长期任务结构的把握仅限于'可见后果'。此外图像质量单项(0.6620)不敌 Cosmos(0.6778),单帧保真仍有差距。我自己的观察还有几点:其一,评测前用自动流程把基准指令改写成自家训练提示风格,虽称语义保持,但与训练分布对齐可能引入评测偏差;其二,空间记忆质量完全依赖 Depth-Anything-3 单目深度,深度误差会进入缓存并随重投影传播,每块至多 10 帧的缓存上限在复杂场景可能不足;其三,定量评测在 480p 进行,与宣称的 720p 能力有差距,长时程指标也缺少非闭环场景的系统扫描;其四,222,147 段训练数据中内部来源(MUGEN、GameVerse、GenEvent 合计约 152,042 段、约 68%)无法被外部审计,域偏置难以评估。
独立分析的弱点
独立分析四个弱点。第一,缺乏持久物体状态:空间记忆只缓存外观与深度,不建模物体级状态与物理,用户'开了门'或'熄了灯'后离开再返回,重投影画面可能与用户操作矛盾,改进方向是引入物体级语义记忆或场景图,并与几何缓存对齐更新。第二,深度依赖链脆弱:每块生成都要跑 VAE 流式解码与 Depth-Anything-3 估计,深度误差、动态物体(行人走动)都会污染缓存,改进方向是动态/静态分离缓存、给缓存帧加不确定性权重并随时间衰减。第三,交互延迟链路长:尽管采样压到每块 4 步,每块仍需解码、深度估计、缓存检索与溅射渲染,15B 骨干在消费级硬件上难以保证实时,可探索更小的学生骨干或把深度/缓存网络小型化、流水线化。第四,评测协议偏自利:提示自适应改写与自家训练风格一致,建议补充不改写提示的原协议结果、公布更多第三方 arena 的长期 Elo 数据,并在 720p 分辨率重跑 iWorld-Bench。
未来方向
作者把 AlayaWorld 定位为全栈、开源、长期的 extensible 基础,面向'生成式现实',暗示会持续扩展。基于本文成果可直接延伸的方向:其一,把物体状态、物理因果与任务结构显式建模进世界记忆,超越'只记住看见过的东西';其二,扩展控制模态,从相机轨迹加文本提示扩展到键盘/手柄离散动作、多智能体交互与物理干预;其三,把 LTX-2.3 中被移除的音频模块接回,实现视听一体的世界模型;其四,空间记忆可升级为持久 3D 表示(如基于缓存的神经场或 3DGS),支持任意视角回访与更长程的记忆;其五,把 DMD + self-forcing++ + 一致性蒸馏的组合推广到其他自回归世界模型,并进一步压到 1-2 步;其六,利用 arena 的真人偏好数据做 RLHF 式后训练,直接优化人类感知的一致性与质量而非代理指标;其七,探索记忆检索的全局语义索引,使'回到某个具体地点'之外的语义级重访(如'回到有喷泉的广场')也可控。
复现评估
复现门槛较高但诚意可见。有利因素:论文明确宣称全栈开源,项目页、GitHub 代码与演示视频齐备;骨干 LTX-2.3 有公开 checkpoint;iWorld-Bench 与 WorldMark/World Model Arena(warena.ai)公开可评;数据管线描述极详细——六类过滤门槛(不低于 720p、时长不低于 3 秒、24-65fps、H.264/HEVC/AV1、黑边率不超 0.10、UI 覆盖率不超 0.04)、单次 NVDEC 解码加 RAFT 光流的特征缓存、每源约 200 段切片标定阈值、Kimi-K2.6/Gemini/Gemma 标注后端。不利因素:222,147 段数据中 MUGEN(21,436)、GameVerse(124,116)、GenEvent(6,490)三个内部来源合计约 68% 无法外部获取;未披露 GPU 数量、训练时长与蒸馏成本,15B 级三阶段全参数训练估计需数十卡级投入;提示自适应改写细节需等开源代码。总体:开源后可较顺利推理与微调,从头完整复现训练属大厂级工程。
论文图表
展示 AlayaWorld 在多样化场景(城市街道、室内、奇幻等)中进行交互式世界模拟的效果拼图,直观呈现模型'输入文字/图像/控制即可生成可探索世界'的愿景。
放在论文首页,一图定调:它是读者理解 AlayaWorld 到底'做出什么样的世界'的最快入口,也定义了后文四个能力(交互、一致性、稳定性、效率)所要支撑的最终体验。