MiniWorld:从零训练视频世界模型的可复现框架 MiniWorld: Democratizing the Training of Video World Models from Scratch
轻量可复现的流式视频世界模型框架,单机8卡数日即可从零训练
前置知识
视频世界模型(Video World Model)
视频世界模型是一种根据历史观测和控制信号自回归预测未来观测的系统。与仅捕捉外观和运动的普通视频生成模型不同,世界模型学习的是智能体动作下环境演化的底层动力学,能够保持长期一致的持久状态预测,是具身AI和交互式仿真的基础构件。本文将其形式化为下一个状态预测问题:给定观测帧 $x_{1:h}$ 和未来动作 $c_{h+1:T}$,生成未来视频序列 $x_{h+1:T}$。
本文的整个框架就是围绕这个任务构建的,理解其与普通条件视频生成的本质区别(强调因果动力学而非视觉外观)才能抓住论文定位。
流匹配与修正流(Flow Matching / Rectified Flow)
流匹配将生成过程建模为从噪声分布到数据分布的连续流。修正流是其简化形式:给定数据样本 $x$ 和高斯噪声 $\epsilon$,构造线性插值 $z_\tau = (1-\tau)x + \tau\epsilon$,$\tau\in[0,1]$,并训练模型预测速度场 $v^*(x,\epsilon)=x-\epsilon$。推理时从纯噪声出发,逐步积分学到的速度场恢复目标样本。本文所有建模都在预训练Wan2.2 VAE的潜在空间中进行,并使用50个离散时间桶和logit-normal分布采样时间步。
这是MiniWorld训练目标的数学基础,理解速度场预测和去噪轨迹才能理解后面的分块噪声调度与异步去噪。
Diffusion Forcing 与分块噪声调度
Diffusion Forcing不给序列中每个token使用统一的噪声水平,而是为每个时间单元分配独立扩散时间步,从而避免显式展开下一块预测并支持异步去噪。本文在此基础上进一步施加非递减约束 $\tau_1 \leq \tau_2 \leq \cdots \leq \tau_M$,即越靠后的块噪声越大,反映推理时过去已收敛而未来仍不确定的状态,同时大幅压缩异步扩散轨迹的搜索空间,提升优化稳定性。
本文的核心创新之一(CoPP调度器)正是建立在Diffusion Forcing之上,不理解这点就难以理解两阶段训练和流式推理的设计动机。
块因果Video DiT与AdaLN-LoRA条件化
Video Diffusion Transformer用3D patch embedding把潜在体素转成视觉token,扩散时间步、机器人动作、相机位姿通过统一调制框架注入。块因果自注意力把序列划分为时间有序的块:同块内token双向注意以保留丰富时空交互,跨块严格因果以满足自回归流式生成。动作条件化采用AdaLN:动作编码器产出嵌入 $e_a^t$ 和调制向量 $m_a^t$,并引入AdaLN-LoRA让各层共享调制分支、只学一个零初始化的低秩残差 $M_\ell(e)=M_{shared}(e)+W_{up}^\ell\sigma(W_{down}^\ell e)$,以极小参数开销增加条件化容量。
这是MiniWorld的主干架构和动作注入机制,是理解为什么模型能同时做到因果流式生成和强动作可控性的关键。
滚动KV缓存与异步流水线推理
推理时序列被分为已收敛的提交历史和仍在去噪的活跃窗口。完成去噪的块的KV对被提交到滚动缓存:缓存由一个永久保留的sink锚帧加定长FIFO组成,超出容量时丢弃最旧块。由于块因果结构保证已提交块永不被修改,其缓存表示可安全复用而无需重算。同时多个未来块可处于不同扩散时间步,在活跃窗口内并行去噪形成流水线。RoPE重新平移则把保留键的位置重新索引到训练见过的范围内,避免外推。
这是本文推理效率的核心来源,直接解释了2.20倍吞吐提升和首块延迟15.2倍降低的实验结果。
研究动机
从零训练视频世界模型对大多数研究者来说代价过于高昂。当前主流做法是把预训练的双向视频扩散模型(如Wan)通过微调、蒸馏、强化学习等后训练技术改造成自回归世界模型。这条路径虽然能复用大模型强大的视觉生成能力,但需要复杂的多阶段优化管线和巨大算力。更根本的问题在于双向预训练与因果流式推理在结构上不匹配:固定窗口延续范式中,训练时历史上下文总是来自真实视频,而推理时被自身预测取代,导致预测误差逐步累积并向未来传播,即曝光偏差(exposure bias);同时窗口长度固定使早期观测逐渐被丢弃,没有显式的长期世界状态维持机制,造成时间漂移和长程一致性退化。这些因素叠加,使得即使有MAGI-1、SkyReels-V2等证明端到端自回归预训练可行的工作,社区仍缺少一个轻量、透明、完全可复现的从零训练基线。
本文的目标是本文的目标是提供一套可在适度算力下从零端到端训练流式视频世界模型的可复现方案。具体而言,作者希望构建一个完整的、覆盖数据预处理、模型训练、流式推理和评估的最小管线,使整个模型能在单台8卡服务器上数日内训练完成,把流式世界模型研究从依赖大规模基础设施和专有数据集的门槛中解放出来。同时该方案要通过对齐训练与部署,在保持训练简单性的同时实现稳定的、动作条件化的长horizon生成,并跨机器人动作控制(DROID)与相机位姿控制(RE10K)两类模态验证其泛化能力。
与已有工作不同的是,与绝大多数近期工作不断堆高模型规模、提升自研数据质量、依赖复杂后训练不同,MiniWorld的独特切入角度是明确把简洁性、透明性和可复现性置于规模扩张之上。它不改造双向视频扩散模型,而是直接基于动作条件的下一状态预测公式从头训练,从根本上缩小训练与推理的差距;它放弃专有数据和复杂的多阶段后训练,只交付一条最小但完整的端到端管线。在已有自回归扩散工作(如基于AR-Diffusion的非递减噪声调度、Diffusion Forcing)基础上,本文把这些技术组合成一个可被普通研究者复现并扩展的紧凑实验平台,从而填补了'可研究但不可复现'的空白。
核心方法
MiniWorld的直觉是:与其事后修补一个双向视频扩散模型,不如直接用与部署一致的因果自回归公式训练。整体技术路线为:视频经预训练Wan2.2 VAE编码为潜在表示(时间压缩4倍、空间压缩16倍、48通道),动作/相机位姿转成与潜在帧对齐的条件信号;潜在序列被划分为时间有序的块(latent chunk size=2),用一个单流的块因果Video DiT以修正流目标在潜在空间训练;块内token双向注意以保留时空交互,跨块严格因果。每个训练序列的各块被赋予独立且非递减的扩散时间步,由Chunk-oriented Probability Propagation(CoPP)调度器采样;流匹配损失仅在预测块集合 $\Omega$ 上计算,历史观测块作为条件被排除在优化外。两阶段续训先在21/46帧短片段上学局部动作条件动力学,再在125/253帧长序列上扩展因果上下文。推理采用滚动KV缓存加异步流水线去噪,使活跃注意力窗口与生成长度解耦,实现有界计算下的任意长视频生成。
核心创新点是把训练目标与流式自回归部署直接对齐,并通过若干工程化但关键的技巧让这种对齐变得稳定且廉价。本质区别有三:第一,块因果注意力既保留块内双向的丰富建模能力,又强制跨块因果,使同一模型能同时支持并行去噪和流式生成;第二,非递减分块噪声调度 $\tau_1 \leq \cdots \leq \tau_M$ 加上CoPP,让模型在训练时就接触到'过去更干净、未来更模糊'的真实推理状态,并允许未来多块异步并发处理;第三,AdaLN-LoRA用一个共享调制分支加每层零初始化低秩残差来表达动作条件化,以近乎零的额外参数获得更强的层间适应性。这三者配合两阶段续训和滚动KV推理,共同把'从零训练流式世界模型'从一个昂贵工程问题变成一个数日即可完成的可复现配方。
方法步骤详情
分训练与推理两条线。训练:(1)视频resize到240×320编码进Wan2.2 VAE潜在空间;DROID的7维动作按分位归一化 $a \leftarrow 2(a-q_{0.01})/(q_{0.99}-q_{0.01})-1$ 裁到$[-1,1]$,每4个拼成28维潜在帧token;RE10K相机参数按NeRF转光线方向、15频带编码后4帧拼成720通道。(2)随机选锚块从logit-normal采样时间步,在非递减约束下向邻块传播得到合法分块时间步。(3)算流匹配损失 $\mathcal{L}_{FM}$,仅在预测块集合上回归速度场 $v^*=x-\epsilon$,随机混合两种上下文模式。(4)两阶段续训:短horizon用Muon、batch 64、lr $1\times10^{-4}$ 训21帧再46帧;长horizon batch 8、lr warmup到$2\times10^{-5}$ 训125帧再253帧,10%概率丢动作支持CFG。推理:序列分提交历史与活跃去噪窗口,每步按欧拉法更新各块,完成块提交进sink锚帧加定长FIFO的滚动KV缓存并做RoPE重新平移,多块在窗口内异步并行去噪。
技术新颖性
技术新颖性体现在'整合'而非单点突破,但每一处都服务于训练-推理对齐这一主旨。架构上,块因果Video DiT把双向块内建模与因果跨块依赖统一到单一注意力模式,避免了事后加因果掩码的双向改造。调度上,把AR-Diffusion的帧级FoPP扩展为块级CoPP,在保留FoPP平衡采样性质的同时让模型接触多样的合法块级扩散轨迹,并施加非递减约束进一步稳定优化。条件化上,AdaLN-LoRA首次把共享调制+零初始化低秩残差的思路引入动作条件化,显式解耦语义条件与特征调制。训练上,两阶段续训不做目标函数改动、只暴露更长因果上下文,配合时间步平移,用最小改动获得长horizon能力。推理上,滚动KV缓存+RoPE重新平移+流水线去噪的组合,让推理窗口与生成长度解耦,并支持吞吐与质量的灵活权衡。整体没有依赖专有数据或复杂后训练,使方案高度可复现。
实验结果
四组核心发现。主结果:MiniWorld-1B在DROID上几乎全面提升——Trajectory Accuracy +249%、Depth Accuracy +238%、LPIPS +216%、SSIM +125%、外观类 +26%~82%、VLM判官分 +63%~78%;RE10K上更温和但仍广泛(Photometric Smoothness +89%、Depth +55%、Subject Consistency +50%、PSNR +34%、LPIPS +27%),证明同一架构可跨动作控制与相机控制迁移。消融:CFG平均+5.5%而保真几乎不变;253→381帧外观保留约94%、动力学约96%,几何与保真退化更明显;8块在飞窗口+KV缓存相比32块全窗口质量几乎不变,sink锚帧多为中性。吞吐:8块在飞+KV把稳态输出从3.31提到7.29 FPS(2.20倍,DiT 0.41→0.91块/秒,VAE非瓶颈),首块延迟74.0→4.86秒(15.2倍)。缩放:0.5B→1B→3B单调提升,3B相对0.5B动态+22%、深度+18%、图像质量+14%、光流+12%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DROID机器人动作条件世界建模 | 相对双向短视频基线的几何/保真提升 | Trajectory Acc +249%, Depth Acc +238%, LPIPS +216%, SSIM +125% | 双向短视频基线(29帧滑动窗口,归一化为1) | 几何与保真类指标2倍以上提升 |
| RealEstate10K相机条件场景预测 | 相对基线的一致性与保真提升 | Photometric Smoothness +89%, Depth +55%, PSNR +34%, LPIPS +27% | 双向短视频基线(归一化为1) | 跨模态广泛提升,幅度较温和 |
| 流式推理吞吐(DROID 1B) | 稳态输出FPS / 首块延迟 | 7.29 FPS,首块延迟4.86秒 | 32块全窗口:3.31 FPS,74.0秒 | 吞吐2.20倍,首块延迟15.2倍降低 |
| 模型缩放(RE10K) | 相对0.5B的各项生成质量 | 3B:动力学+22%, 深度+18%, 图像质量+14%, 光流+12% | MiniWorld-0.5B(归一化为1) | 从0.5B到3B单调提升 |
局限与改进
作者承认的局限有:实验所用模型与数据规模相对前沿视频基础模型仍较有限,评测域仅覆盖有限范围的世界动力学;尽管长horizon漂移被显著降低,但预测误差在超长rollout中仍会累积,尤其在复杂交互场景中,因此MiniWorld应被视为可复现基线而非性能上限。我自己进一步观察到:所有主结果都以一个'双向短视频基线'为参照并归一化为1,缺少与Genie 3、Cosmos、MAGI-1、SkyReels-V2等真正大尺度世界模型的绝对值横向对比,'competitive'的定位证据偏弱;外观类绝对质量可能仍不如那些大双向生成器,作者也承认后者在追求极致感知质量时更优;评估指标多为WorldArena风格的代理指标和相对提升,缺乏端到端下游任务(如下游策略学习成功率)的验证;动作条件化仅在DROID(低层机器人动作)上做强验证,对更高层、离散或语言动作的泛化未做检验。
独立分析的弱点
弱点一:评估的可信度与可比性不足。主结果用自建的'双向短视频基线'做归一化,回避了与既有大规模系统的正面比较,读者难以判断绝对水平。改进方向是补充与Genie 3、Cosmos、MAGI-1等在同一评测协议下的绝对值对比,并引入下游控制任务的成功率作为端到端指标。弱点二:长horizon误差累积虽被缓解但未根除,381帧实验显示几何与保真退化最敏感。改进方向是把作者点名的self-forcing、强化学习微调等训练-测试对齐目标真正落地,并研究显式的世界状态压缩/记忆机制。弱点三:条件化模态偏窄,主要验证低层连续机器人动作和相机位姿,对离散动作、高层指令、多智能体动作缺乏验证;可在动作编码器处引入更通用的多模态条件接口。弱点四:仅Wan2.2 VAE一种潜在空间,未分析VAE选择对世界建模的影响,且VAE被认定为非瓶颈但仅在当前规模成立,规模再放大后可能需重新审视。改进方向是做VAE消融与潜在空间表示学习(如几何对齐)的探索。
未来方向
作者明确给出三个方向:一是数据扩展与精选,构建更广覆盖、更高质量的视频-动作语料(含游戏、仿真、真实世界),并开发世界模型专用的数据管线(质量过滤、精选、智能体驱动的训练-采集反馈闭环);二是训练-测试对齐,包括监督微调、强化学习、长horizon self-forcing等显式抑制自回归漂移、提升rollout鲁棒性的策略;三是高效部署,涵盖更有效的内存管理与历史压缩、少步蒸馏和模型量化以降低推理延迟与算力。基于本文成果可延伸的方向还包括:把块因果+滚动KV推理迁移到离散动作/语言条件的世界模型;用MiniWorld作为可控数据生成器反哺具身策略训练并研究其闭环效果;将CoPP调度器与几何表示学习(如论文相关的Geometry Forcing)结合以进一步提升3D一致性;以及在sink锚帧、历史压缩比等记忆结构上做更系统的设计,从'中性'走向'有益'。
复现评估
复现性是本文最大卖点与核心优势。作者已发布完整训练与推理代码库、预训练检查点和实现细节(代码 github.com/zhao-yian/MiniWorld,模型 HuggingFace zhaoyian01/MiniWorld)。数据用公开DROID与RealEstate10K,潜在空间用公开Wan2.2 VAE,训练用Muon、bf16、单台8卡服务器数日完成;关键超参齐全(latent chunk size=2、短horizon batch 64 lr $1\times10^{-4}$、长horizon batch 8 lr warmup到$2\times10^{-5}$、50个训练时间桶、logit-normal Pmean=0 Pstd=1、10%动作丢弃、CFG scale 2、MiniWorld-1B在50个held-out视频上做253帧rollout)。难度需8张GPU和一定扩散/分布式工程经验,但相比动辄百卡的前沿模型门槛已大幅降低,主结果(0.5B/1B)对多数研究组可达;仅3B与长horizon续训需较多GPU时,整体可复现性评级很高。
论文图表