Alaya-EVOKE:从线性开销监督到无尽世界 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
外置相机位姿索引的几何记忆,配合长时程教师蒸馏,实现三步生成、小时级不间断的交互世界模型
前置知识
流匹配与扩散去噪
扩散/流匹配模型通过迭代去噪把高斯噪声逐步转化为数据分布的样本,每一步都要完整前向一次去噪网络(函数评估)。生成质量与步数正相关,标准视频模型常需几十步采样,这也是交互式应用延迟高的根源。
Evoke 的部署形态是每 chunk 仅 3 次网络评估的少步学生模型,理解去噪步数与延迟/质量的权衡是理解本文动机的前提。
分布匹配蒸馏(DMD)
一种少步蒸馏目标:用教师分数 $s_{real}$ 与可学习的批评者分数 $s_{fake}$ 之差 $\Delta s = s_{fake} - s_{real}$ 作为学生输出的更新方向,把学生的输出分布直接拉向教师分布,而不需要逐步回归噪声目标。配合 $\nu = \mathrm{mean}_\Omega[|\hat{x}_0 - s_{real}|]$ 做归一化以稳定梯度尺度。
Evoke 的核心训练目标就是 DMD,且创新在于把打分窗口从短片段扩展到 30 秒全窗口,这是全文「监督时域」概念的载体。
Self-forcing(自迫使 rollout)
训练时让学生以自回归方式条件于自己之前生成的帧(而非真值帧)继续生成,模拟推理时的误差累积路径,从而在训练中就暴露并修正 rollout 漂移。Evoke 的训练序列由 1 个真值前缀 chunk 加 20 个自生成 chunk 组成。
长时程监督之所以有效,依赖于 self-forcing rollout 产生的真实扰动历史——这是论文分析退化漂移与内容漂移的基础设定。
Classifier-Free Guidance(CFG)
扩散模型中同时训练有条件与无条件分支,推理时用两者的分数差外推以增强文本条件的影响,代价是每次去噪要做两次前向(双倍算力)。去除 CFG 的模型单步成本减半,但通常需要蒸馏时补偿条件强度。
Evoke 学生完全不用 CFG,3 次评估即完成一个 chunk,这是其达到 2.11 秒/1.5秒视频低延迟的关键,也是与其他系统对比时必须注意的差异点。
DiT 与 KV cache 上下文增长
扩散 Transformer(DiT)是当前视频生成的主流骨干。自回归长视频系统通常把历史帧或累积的 key-value cache 保留在去噪器上下文里,注意力是二次复杂度,每步成本随会话时长增长,窗口化/缓存淘汰则要丢弃信息。
本文要解决的首要系统级问题正是这个:如何让持久世界状态不依赖不断增长的去噪器上下文,理解 KV cache 增长问题才能理解外置世界状态库的动机。
单目深度反投影与 warp 条件
用单目深度模型估计生成帧的深度,在已知相机内外参下把像素反投影回三维世界空间形成点云/几何;当相机移动后,可把这些已有几何投影(warp)渲染回当前视角,作为像素级条件注入生成器,让重访区域被显式恢复而非重新编造。
Evoke 的世界状态库正是由逐 chunk 的深度反投影几何构成,读取即按共视度选源视图做 z-buffer 批量投影,这是其持久空间记忆的全部机制。
线性注意力
把标准注意力的 $O(N^2)$ 计算改写为以递归全局状态(固定大小的 summary 状态)累积历史信息的线性复杂度形式 $O(N)$,代价是丢失精确的逐 token 检索能力,保留的是压缩后的全局统计。
Evoke Teacher 的稀疏注意力中,线性注意力全局状态负责让每个 chunk 以常数成本感知全部远距离历史,是把 30 秒监督窗口做到可行的核心组件。
研究动机
交互式世界模型必须同时满足三件事:回到看过的场景要保持一致(持久记忆)、镜头操作与文本指令要即时生效(低延迟)、会话时长要从几秒延伸到分钟甚至小时(长时程)。现有系统把这两个重担都压在去噪器上:用额外上下文帧或不断增长的 KV cache 保存历史,导致每次去噪的代价随会话历史线性甚至超线性增长;窗口化和缓存淘汰只能靠丢弃信息来封顶成本,检索与流式条件化也仍受限于去噪器侧有限的上下文预算。另一边,交互延迟要求推理压缩到个位数去噪步数,这通常靠从慢速教师蒸馏实现——但常规教师用双向二次注意力、训练片段很短、整条序列只用单一全局 prompt,学生因此被教师的监督范围封顶:短窗口监督对远距离时刻之间没有任何联合约束(场景身份、物体外观、空间布局可以各自局部合理地渐变漂移,即内容漂移),单一 prompt 的教师也从未演示过会话中途新引入的指令应该如何影响正在进行的 rollout。
本文的目标是本文的目标是构建一个能不间断运行到小时级、支持持续相机与文本控制、且计算成本与会话时长无关的交互式世界模型。具体拆成两个互补目标:其一,把持久世界状态从去噪器中外置出去,使去噪器上下文长度、位置编码范围和单步算力在会话不断增长时保持恒定(最终做到每 chunk 1.5 秒视频在单张 H200 上 2.11 秒完成、连续生成两小时不重置);其二,重新设计教师,使其监督显式覆盖长时程一致性与动态条件响应两类能力,并通过蒸馏把这些能力迁移给三步、无 CFG 的学生,而不仅仅把教师当作加速的来源。
与已有工作不同的是,本文的独特切入点是把一个系统级问题拆解并重新分配归属:持久状态和可迁移能力不必都由部署的去噪器承载。具体而言有两个反常规的设计立场。第一,与把记忆压缩进 KV cache 或检索 memory token 放回去噪器不同,Evoke 把场景几何完全外置为按相机位姿索引的世界状态库,读取由相机几何直接决定而非学习检索。第二,与把蒸馏仅视为加速手段不同,Evoke 把教师本身当作可设计的变量,显式提出并操纵两个教师侧设计轴:监督时域(supervision horizon)和条件调度(conditioning schedule)。论文还给出一个关键的概念区分:退化漂移(曝光增长、饱和度偏移、纹理退化)改变局部统计,短窗口即可检测;内容漂移(场景身份、物体外观、空间布局渐变)在每个短窗口内都合理,只有联合对比足够远的时刻才能发现——前者该由长时程监督解决,而空间重访不一致(相机回到看过的表面)本质是「那个特定观测需要被再次提供」,该由几何记忆解决。这个「时间漂移归监督、空间重访归记忆」的分工是全文方法设计的逻辑骨架。
核心方法
Evoke 把长时间生成形式化为一个有界递归过程:每次递归步生成一个 chunk,包含 $F=9$ 个 latent 帧(36 个像素帧,24fps 下 1.5 秒),条件包括重采样到 24fps 的相机轨迹 $P^k$(camera-to-world 外参与内参)和可逐步变化的文本条件 $c^k$。递归接口显式分离瞬态去噪器上下文与持久几何世界状态:$$r^k = \mathrm{Read}(M^k, P^k), \quad x^k \sim p_\theta(\cdot \mid r^k, h^k, c^k), \quad M^{k+1} = \mathrm{Write}(M^k, x^k, P^k)$$ 其中 $h^k$ 是有界局部历史(最近 19 个 latent 帧,约 3.2 秒,按 16/2/1 分为长中短三层),$M^k$ 是世界状态库。由于两者都有固定预算,延长会话只增加递归调用次数,不增加任何单次调用的上下文长度、位置跨度或算力足迹。教师基于 14B 的 Wan2.2 A14B 扩散 Transformer,用 chunk 稀疏注意力实现 30 秒长窗口监督,训练流程分三阶段:Stage 1 相机控制(warp 条件 + flow matching 损失),Stage 2 少步蒸馏,Stage 3 长时程蒸馏(long-distill,6×8 GPU 上 1981 步),最后经短程 post-distill 延续得到发布的学生。
核心创新有三层。第一,状态外置与位姿寻址:世界状态库按 chunk 独立插入新生成的几何(对生成 chunk 的 12 帧用单目深度模型估计深度,再用已知内外参反投影到世界空间),刻意不做跨长序列的深度融合以避免尺度漂移和渲染伪影;读取时按目标视角的共视度对存储源视图排序,选出至多 8 个足够不同的源,经 z-buffer 批量投影得到视角对齐的 warp 观测和逐像素可见度掩码——召回由相机几何直接决定,不依赖学习检索。第二,教师即设计变量:现有蒸馏工作把教师视为固定的高质量分数来源,Evoke 则显式改造教师的注意力结构(每个 query chunk 只访问首帧全局 sink、带 1 帧重叠的局部上下文、空间压缩的近邻帧、按重要性选择的少量远帧、以及线性注意力累积的全局状态,共五类有界信息源,使注意力成本随序列长度从二次降为线性)和条件调度(caption 按 12 秒分段映射到对应 latent chunk,使单条 rollout 内部就包含 prompt 切换)。第三,监督时域与梯度时域解耦:chunk 间历史 detach,每个反向图只覆盖单 chunk,但教师与批评者仍联合为完整 31.4 秒 rollout 打分——本地更新来自定义在全窗口上的分布差异,既压住激活显存又保留长程训练信号。
方法步骤详情
具体训练与推理流程如下。Stage 1 相机控制:在 warp 条件(历史帧与几何渲染)下用 flow matching 损失训练学生的相机可控生成能力,使用 Sekai 视频数据集加内部数据。Stage 2 少步蒸馏:把相机可控模型压缩为每 chunk 三次函数评估的学生。Stage 3 长蒸馏:从 1 个真值前缀 chunk $x^{gt}_0$ 出发,self-forcing rollout 20 个生成 chunk,共 $21 \times 9 = 189$ 个 latent 帧、753 个像素帧、约 31.4 秒,构造 rollout 需 60 次学生前向(每 chunk 3 次评估);教师与批评者共享同一骨干(Wan2.2 A14B,按采样 timestep 选择高噪/低噪 expert),加 LoRA 即为批评者、去掉即为教师,保证两类分数在同一 expert 内计算;二者联合为全部 189 帧打分,生成损失为 $\mathcal{L}_{gen} = \tfrac{1}{2}\|\hat{x}_0 - (\hat{x}_0 - \Delta s)^{\mathrm{detach}}\|^2 / \nu^2$,其中 $\Delta s = s_{fake} - s_{real}$,$\nu = \mathrm{mean}_\Omega[|\hat{x}_0 - s_{real}|]$;掩码 $\Omega$ 排除真值前缀和第一个生成 chunk $x_1$(教师把首帧按图像模型分布处理而学生在做视频延续,直接匹配会造成边界闪烁)。同时保留 warp 条件的监督损失作为相机可控性的正则。推理时:学生在 12×20、24×40、48×80 的由粗到细 latent 金字塔上各做 1 步、共 3 步无 CFG 去噪;几何条件只在最粗阶段注入以确立大尺度空间结构;可见度低于 0.5 的像素赋 $\sigma=1$(不含视觉信息),支撑区域 $\sigma \in [0, 0.135]$,并按 patch 池化可见度剪除不支撑的 history token。世界状态库长期运行保留 2160 像素帧(90 秒几何),每 3 帧摄取 1 帧,活跃源池至多 720 帧。
技术新颖性
技术新颖性体现在三处。其一,把「会话时长」与「单步成本」的解耦提升为一个显式的系统级问题并给出完整方案:有界递归接口 + 外置几何存储 + 复用同一局部位置布局(持久状态通过相机位姿而非时间位置访问,rollout 不再撑爆训练时见过的位置范围),这与在去噪器内做窗口化/缓存淘汰/检索的路线在机制上根本不同——那些方法仍在有限去噪器上下文预算内做取舍。其二,「监督时域」被提炼为教师侧的显式设计变量,并用对照实验证明其可迁移性:两个仅教师时域不同、其余配方完全相同的学生,光度稳定性显著分离(Wilcoxon $p=0.016$);同时论文诚实地做了归因分析,检测性扫描显示窗口超过 $W=2$ 个 chunk 后可检测性变化很小,5749 步训练日志中 teacher-critic 打分的随机波动大于系统性漂移分量,因此收益应归于整体训练过程而非简单的窗口长度检测阈值。其三,「时间内容漂移归监督、空间重访不一致归显式记忆」的机制分工原则,明确了长监督窗口不能替代不可用的观测、存储几何也不能决定未观测内容的演化,为后续世界模型设计提供了清晰的分析框架。
实验结果
实验覆盖四个维度。基准性能:在 WBench 导航 split(158 例)上 Evoke 以平均 80.8 位列第一(第二名 HiDream-O1-World 80.7,均为非步数对齐比较);分组看,视频质量组均 82.79、场景设置组均 83.76、物理组均 72.06 均为最佳,一致性组均 86.87 与最强者 86.86 基本持平;最大增益出现在场景级一致性(74.68)与因果保真(82.44),与持久场景状态和长时程生成的设计重心吻合;导航(78.63)与透视(69.74)相对偏弱。通用视频质量:仅 3 步无 CFG 即在 VBench-2.0 得 66.77(超过 Veo 3 的 66.72,列公开榜 top-10 第一),VBench-Long 得 85.11(第 7,落后榜首 IPOW 的 88.26,略高于 Veo 3 的 85.06)。速度与有界性:单张 H200、384×640、完整 VAE 解码、无 KV cache/编译/量化加速,每个 1.5 秒 chunk 扩散墙钟 2.11 秒;完整仪表化路径(含几何渲染与视频 I/O)约 4.01 秒,几何路径比跳过它的一步多花约 1.84 秒(且随 warp 覆盖伸缩——未观测空间更便宜)。长会话:8 条 65.5 分钟连续 rollout(各 2619 chunk、每条 94281 帧)显示光度统计在初始瞬态后平稳、几乎无后续漂移,内容描述子相似度稳定在余弦 0.523——与真实视频相隔 60 秒自比的水平相当;Figure 1 展示了 7 条两小时不重置 rollout。教师消融:长时程教师蒸馏的学生亮度稳定在开场的 101%,短时程对照衰减到 74%,8 条 clip 中 7 条改善(Wilcoxon $p=0.016$),而锐度完全不分离——收益被诚实地限定为曝光稳定性。位姿召回:在 21 组受控对照中 20 组符合预测,保留窗口覆盖重访间隔时比不覆盖高 2.3–3.2 dB,平台为 15.4–17.8 dB(可识别而非像素级重建)。定时文本控制:48 个时刻表上,未锚定内容的指令实现率 67%(上限 83%),而已被世界状态库锚定的内容仅 4%(上限 17%)——文本只能支配自由演化的内容,几何记忆会抵抗改写已锚定的观测。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 交互世界模型综合评测(WBench 导航 split,158 例) | 五组平均分 Average | 80.8(第 1) | HiDream-O1-World 80.7;LingBot-World v2 fast 79.4;Kling 3.0 79.0 | +0.1(与第二名差距极小,作者自己声明不可过度解读) |
| WBench 视频质量组均(6 指标) | 组内平均分 | 82.79 | 最强对照 81.77 | +1.02 |
| 通用视频生成(VBench-2.0 公开榜) | Total | 66.77(3 步、无 CFG) | Veo 3 66.72(多步默认采样) | +0.05,列 top-10 第一(非步数对齐) |
| 长视频生成(VBench-Long 公开榜) | Total | 85.11 | 榜首 IPOW 88.26;最近邻 Veo 3 85.06 | -3.15(落后榜首),+0.05(对最近邻),排第 7 |
| 长时程教师消融(配对长 rollout) | 开场亮度保持率 | 101%(长时程教师学生) | 74%(短时程教师学生,其余配方完全相同) | 8 条 clip 中 7 条改善,Wilcoxon p=0.016 |
| 空间重访召回(相同相机位姿的 12 秒窗口对比) | 重访 PSNR | 保留窗口≥离开时长时高 2.3–3.2 dB,平台 15.4–17.8 dB | 保留窗口短于离开时长(召回接近远位姿地板) | 21 组对照中 20 组符合预测转变 |
| 会话中途定时指令(evocation,48 个时刻表) | 指令实现率 | 未锚定内容 67% | 锚定内容仅 4% | 揭示文本控制与几何记忆的交互边界 |
| 推理速度(384×640,单张 H200) | 每 1.5 秒 chunk 扩散墙钟 | 2.11 秒(3 步、无 CFG) | 多步系统(默认采样器)通常数十秒量级 | 完整路径约 4.01 秒,几何路径多 +1.84 秒 |
局限与改进
作者承认的局限:几何世界状态主要保留粗略场景结构,物体身份、外观和局部细节的细粒度一致性有限;当前只建模静态几何,缺少动态世界状态(物体运动、状态转移及其长期演化);几何召回的 15.4–17.8 dB 平台意味着「可识别」而非像素保真的重建;保留预算(90 秒几何)决定了这是覆盖范围内的持久召回而非对所有去过地点的永久记忆;导航与透视两类指标相对较弱,反映相机控制路径的不足。我自己观察到的局限:其一,2.11 秒生成 1.5 秒视频仍慢于实时(完整路径约 4 秒),且长时程稳定性分析中关键的小时级曲线是 $n=1$ 的单次运行,作者也自述「这是稳定性声明而非保真声明」;其二,核心的匹配比较(教师时域消融)只证明了光度稳定性的迁移,内容描述子不显著分离,长时程监督的收益机制(检测性扫描不支持窗口长度解释)仍是开放问题;其三,所有基准对比都不是步数对齐的(Evoke 3 步无 CFG 对多步系统),VBench 评测还有单采样、改变片段时长、prompt 增强等四处已声明的协议偏差,0.05 量级的领先不具备统计意义;其四,锚定内容 4% 的改写率是双刃剑——持久记忆同时限制了用户对世界的编辑能力。
独立分析的弱点
独立分析以下弱点。第一,世界状态库本质是有界缓存而非真正记忆:超过 90 秒保留窗口的重访在系统看来等于从未去过,Figure 7 显示只保留 1.5 秒几何时返回视角损失 0.173 的覆盖率,黑带区域必须靠模型重新补全——对「探索一大圈再回来」的开放世界场景(如游戏)这是硬伤,改进方向是分层记忆(近期精确几何 + 远期语义/布局摘要)或对冷区域做降精度持久化(如稀疏 3DGS)。第二,完全缺失动态世界状态:物体运动、门的开合、昼夜变化都无法被几何库表示和恢复,重访时动态元素只能靠模型即兴重造,改进方向是引入场景流或物体级状态机、动态高斯等随时间更新的显式表示。第三,文本控制与几何记忆相互制约:指令只能影响「自由空间」,无法替换已锚定内容(4% 实现率),用户不能说「把刚才那栋房子改成塔楼」,改进方向是为锚定区域提供显式的编辑/失效接口,把几何库从只读变为可写。第四,评估方法偏弱:内容一致性是与自身开场段的余弦相似度(自比指标),小时级稳定性 $n=1$,教师消融的归因机制不透明;改进方向是构造带真值重访的受控基准、多 seed 统计、以及对长时程收益的机制级消融。
未来方向
作者明确提出的方向:更丰富的物体级或语义世界表示,以提供更强的长期身份一致性;把持久世界从静态几何扩展到动态状态——物体运动、状态转移及其长期演化的显式表示与持续更新;进一步推理加速以实现真正的实时交互,包括更高压缩率的视频 VAE、更高效的少步生成器、更低成本的几何条件注入。基于其成果可自然延伸的方向:其一,语义-几何混合记忆,在点云之上叠加物体图或场景图,使有限的 90 秒窗口之外的召回成为可能;其二,跨会话持久世界——世界状态库 $M$ 的显式读/写接口天然支持保存与加载,可构造跨天延续的持久虚拟世界;其三,把 timed prompt schedule 的条件调度接口推广为事件驱动的世界脚本(API 触发的事件注入),服务 agent 训练环境;其四,监督时域作为设计变量的结论(收益饱和、约 30 秒足够)值得在其他自回归生成任务(长音频、机器人操作序列)上验证其普适性;其五,几何路径 +1.84 秒的成本占比过高,warp 渲染与最粗阶段 token 注入的联合加速(如把投影直接搬进注意力或用 latent 级几何条件)是明确的工程优化点。
复现评估
复现条件中等偏上。有利因素:代码已开源(github.com/SII-YuanyangYin/Evoke),项目页(evoke-world.github.io/Evoke)提供演示;骨干与数据大多公开——教师基于 14B Wan2.2 A14B,学生基于 Helios,训练数据为公开的 Sekai 数据集加内部视频数据;核心组件(单目深度估计、z-buffer 投影、线性注意力、DMD)均为成熟技术;推理侧单张 H200 即可运行 3 步无 CFG 学生,384×640 下每 chunk 2.11 秒扩散墙钟。不利因素:长蒸馏阶段需要 6×8 共 48 张 GPU 跑 1981 步(外加相机控制和少步蒸馏两个前置阶段),算力门槛高;内部视频数据不可得,可能影响分布外场景的复现效果;长会话稳定性结论基于 $n=1$ 至 8 条 rollout 的自建评测协议,第三方完全复现这些指标需要自建 65.5 分钟评测管线;论文声明了 VBench 评测的四处协议偏差,复现榜单数字需按附录 E 的细节对齐。总体而言,推理复现容易,训练复现需要可观的 GPU 预算和工程能力。
论文图表
两个蒸馏配方完全相同、仅教师时域不同的三步学生的对照:(a) 短时程学生亮度稳定在开场的 74%,长时程学生为 101%;(b) 8 条 clip 中 7 条改善(Wilcoxon p=0.016);(c) 亮度区分两学生最明显,锐度完全不能区分。
全文最关键的单项消融:直接证明「教师监督时域」这一设计变量可迁移光度稳定性给学生,同时诚实地把结论限定在曝光稳定性而不外推到内容一致性。
附录展示:4 条由教师(而非学生)生成的 4 分钟 rollout,每条由 12 个各持续 20 秒的指令驱动,覆盖魔法森林、火星出舱、海洋潜水、废墟重生四个场景,每条指令都在自己的时段内产生可见效果且全程不重置。
在教师自身的时域上验证条件调度接口的扩展性,说明逐 chunk prompt 切换不是学生蒸馏的特例而是教师层面的通用能力。
附录定性汇总:9 条会话覆盖四类场景——自我中心动作与操作、电影感场景与风格、具身与工业场景、定时事件(指令在片段后三分之一触发),每行沿 clip 均匀采样 5 帧,左下角为交互 demo 的摇杆 overlay。
展示方法的通用性与覆盖面:从骑行、揉面到海底管道检测和火箭发射定时事件,说明该框架不局限于单一内容域。