← 返回 2026-07-22

ABot-World-0:单张桌面GPU上的无限交互式世界推演模型 ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo 📅 2026-07-21 👍 299 2026-07-27 18:30
世界模型 交互式仿真 动作控制 实时推理 扩散蒸馏 视频生成

键盘可控、单卡实时的视频世界模型,可连续推演数十小时

前置知识

视频世界模型 (Video World Model)

世界模型不是生成孤立的视频片段,而是学习一个“可进入、可控制、可持续演化”的生成环境:给定历史观测帧和用户动作,预测下一时刻的视觉状态,再把预测结果当作下一步的输入,从而闭环地推演出长时序交互轨迹。它必须同时优化视觉保真度、可控性、状态持续性、延迟和显存,是一个系统级问题。

本文的数据、训练、部署三层设计都围绕“把世界模型做成实时、可长期交互的闭环系统”展开,理解这个范式才看得懂为什么要蒸馏、做长程对齐和全栈加速。

双向 vs 因果(自回归) 视频生成

双向视频扩散模型用双向注意力让每一帧都能看到过去和未来,整段视频联合去噪、视觉一致性好,但必须整段一起算、无法流式输出;因果(自回归)模型则强制每段新内容只能看过去已生成的帧,可逐段流式生成、延迟低,但会逐步累积误差。本文先训双向教师,再蒸馏成因果学生。

核心训练流水线“双向教师→因果学生→LongForcing”就是为了兼顾双向模型的质量与因果模型的实时性,这是读懂方法章节的主线。

蒸馏与分布匹配蒸馏 (ODE Distillation / DMD)

蒸馏指把多步迭代去噪的扩散模型压缩成少步模型以降低延迟,常用 ODE 蒸馏学习从中间噪声潜变量到干净端点的流映射;分布匹配蒸馏(DMD)不追求逐帧对齐,而是让生成分布整体逼近参考分布。本文用 ODE 蒸馏压步数,再用 LongForcing 在学生自推演的长轨迹上做分布级对齐。

LongForcing 是论文的关键创新,理解“为什么要做分布匹配、和逐帧蒸馏有何区别”,才能领会它如何缓解长程漂移。

自回归漂移 / 曝光偏差 (AR Drift / Exposure Bias)

自回归生成中每一步都把上一步的预测当作输入,一旦出现微小误差,就会逐步累积、把状态推到训练时很少见的位置(曝光偏差),表现为画质退化、身份漂移、动作停滞或坍缩成静态帧。长视频生成最大的难点就是抑制这种漂移。

LongForcing、参考角色记忆、有界 KV 缓存等几乎所有技术贡献都针对自回归漂移,理解漂移机制就理解了论文的动机主线。

KV 缓存与低比特量化 (KV Cache & Quantization)

Transformer 推理时把历史的 Key/Value 张量缓存复用以避免重复计算,但长程流式生成会让 KV 缓存无限增长成为显存瓶颈;低比特量化(如 FP8/MXFP6/MXFP4)把权重和/或激活压到更低位宽,提升算力和带宽效率。本文用有界局部上下文 KV + 量化让单卡部署成为可能。

论文反复强调“少步采样不等于实时交互”,全栈协同(轻量 VAE、低比特 DiT、高效注意力、有界 KV)才是单卡 16FPS 的关键,不懂这些系统手段就理解不了部署章节。

研究动机

构建可交互的“世界”而非“视频片段”,是一个系统级难题,必须同时优化四个耦合瓶颈:数据、意图表达、漂移抑制、实时部署。具体到数据:被动网络视频有视觉多样性却几乎没有同步控制信号;游戏录像有精确输入但风格狭窄;仿真有几何可控性却需要刻意设计轨迹——任何单一来源都无法支撑广覆盖的可控世界模型。意图表达上,主流方法要么用估计的全局相机位姿(长程累积位姿会越界训练分布、周期重锚定又引入跨段不一致),要么用学习到的隐动作(与用户真实意图脱节)。漂移上,自回归长程推演会因曝光偏差逐步退化成画质下降、身份漂移、动作停滞甚至坍缩成静态帧。部署上,仅靠少步采样无法实时——当去噪步数被压到极限,瓶颈转移到分块潜变量解码、注意力计算、上下文显存和带宽上,单张消费级显卡很难装下整套高分辨率生成+解码栈。

本文的目标是把动作条件视频世界模型做到“单张桌面 GPU、实时、可长期交互”的工程目标。具体可量化指标为:在单张 NVIDIA RTX 5090 上输出 720P(1280×704)流式视频,吞吐达 16 FPS,动作到首帧延迟 1.2 s,峰值显存约 19 GiB。在能力层面,单一模型要同时支持第一人称场景漫游和第三人称角色操控,用原始键盘动作作为统一控制接口;要在 WorldRoamBench 的动作可控性、轨迹跟随、视觉质量、物理合理性和时序记忆上达到与最强对手可比的竞争力;并在小时级(60 分钟)乃至天级(24 小时)超长推演中仍保持场景连贯、身份一致、动作活跃,不坍缩成噪声或静态帧。

与已有工作不同的是,已有工作(Genie/Oasis/GameNGen/Cosmos 等)大多在单一轴上做强,仍不能作为一个“本地、持久、可实时交互”的世界模拟器。本文的独特切入角度有三点:第一,把数据生产从“一次性采集”变成与训练耦合的闭环伺服系统(WorldExplorer 根据训练反馈动态再平衡采集比例),并用 14 项确定性检查 + VLM 语义评估最大化有效数据比例;第二,用“原始键盘 + 参考角色记忆”作为统一、有界的控制通道,既覆盖场景漫游也覆盖角色操控,且第三人称身份用四方向缩略图 + 正脸合成的身份记忆 token 持续锚定;第三,把长程漂移重新理解为分布偏移问题,提出 LongForcing 在学生自推演的长轨迹上做分布级对齐,而不是过度锚定初始帧。这些选择把“控制通道”变成了动力学模型本身的一部分,而非外部后处理接口。

核心方法

直觉上,作者像在训练一个“可无限滚动的游戏画面发生器”:玩家按键盘画面就跟着变,按得越久世界越要稳。技术路线分四层。数据层:从 AAA 游戏、仿真引擎(UE + ABot-3DGS 重建的真实街景)、网络视频三类来源采集带同步动作的轨迹,WorldExplorer 用导航智能体 7×24 小时自主探索并用训练反馈闭环补齐薄弱场景,再经 14 项确定性检查 + VLM 语义筛选。模型层:在 Wan2.2 骨干上全参数微调得到动作条件双向教师 $p_\phi^{bi}(v_{1:T}\mid v_0, a_{1:T}, c)$,8 维多热键盘向量(WASD+IJKL)打包成 32 维 token 经 Action Control Adapter 加性注入 $\hat{z}=\text{PatchEmbed}(z)+F_\psi(\tilde{a})$;参考角色图经同一 VAE 编码成身份记忆 token 前置,配负时间 RoPE 与非对称注意力。训练层:教师强制→ODE 蒸馏→LongForcing 三阶段把双向教师渐进蒸馏成可少步、抗漂移的因果学生。部署层:LightVAE + SageAttention2 + FP8/低比特 + Fast-RoPE + 有界 KV 缓存 + 显存感知调度联合优化。

全文最核心的洞见是“少步蒸馏并不等于实时交互,长程稳定本质是分布偏移问题”,作者把问题拆成两条互锁的主线。其一,控制与一致性的统一:抛弃估计的全局相机位姿或学习到的隐动作,改用原始键盘作为唯一有界动作接口,并通过参考角色记忆把第三人称角色的“长相”持续注入,使控制通道本身成为世界动力学的一部分。其二,长程稳定性的重新建模:传统蒸馏只在固定因果条件下学局部转移,无法覆盖学生自推演后真正到达的“长程上下文”,于是误差越滚越大;LongForcing 与之本质不同——它让学生在自己生成的长自推演轨迹上训练,并用一个扩展视野的双向教师在分布层面做监督(DMD 阶段),从而把“训练分布”扩展到长程自推演区域,在不强行锚定初始帧的前提下抑制漂移。这条“分布级长程对齐”路线,是和 Self-Forcing、Causal Forcing、Diagonal Distillation 等已有工作的根本区别。

方法步骤详情

步骤1 采集:导航智能体用“未探索区域→附近搜索→前进兜底”的多阶段策略遍历导航网格,毫秒级时间戳同步采集 RGB(1920×1080)、位姿、控制与环境元数据,跨模态对齐误差 <33ms@30FPS;仿真侧用 UE/3DGS 重建街景,把平移/旋转位移投影到相机基并二值化成离散动作。步骤2 过滤:14 项检查分三阶段——文件完整性(配对/帧数/分辨率/丢帧)、视觉-几何-游戏状态(VLM 查 UI/过场/死亡、几何跳变、动作-标签对齐)、元数据质量作软权重。步骤3 标注:游戏走运行时 API 拿真值动作、仿真用确定性轨迹、网络视频用位姿伪标签,统一同一动作表征;VLM 生成场景描述(不含相机运动)、语义标签与四方向角色缩略图+正脸合成。步骤4 双向教师:Wan2.2 全参微调 + 时序增强 + 长序列训练。步骤5 蒸馏三阶段:教师强制(干净历史+因果掩蔽)→ODE 蒸馏(冻结阶段一,损失 $\mathcal{L}_{\text{ODE}}=\mathbb{E}\,\lVert f_\theta(z_s^c, s, C_t)-\text{sg}(z_0^c)\rVert_2^2$ 压多步为少步)→LongForcing(扩展视野教师下对学生长自推演做 DMD 分布匹配)。步骤6 部署:分块流式(每块 3 潜帧→12 视频帧)叠加全栈加速。

技术新颖性

新颖性体现在四个方面。动作接口上,绝大多数交互式视频工作要么估计 6-DoF 相机外参、要么注入 Plücker 射线/视锥特征、要么学隐动作,且都依赖全局坐标系下累积位姿;本文用相对当前角色/相机的离散键盘增量控制,天然有界、天然对齐实时用户输入。身份保持上,参考角色记忆用负时间 RoPE + 非对称注意力(视频 token 看记忆、记忆不看视频),把静态身份与动态轨迹在位置编码层面解耦,比多帧注意力 sink 等做法更直接。训练范式上,把已有“双向→因果”蒸馏链路扩展出 LongForcing,首次把“扩展视野教师”的分布级监督显式覆盖到长程学生自推演上下文,区别于仅在固定噪声调度上做对齐的 Diffusion Forcing / Rolling Forcing。系统层面,论文反复用 Table 2 证明“单一算子加速不够”——Base 和仅加 SageAttention2 都 OOM,必须 VAE+低比特+RoPE+KV 联合,这种“全栈协同才能单卡实时”的实证结论本身也是贡献。

数据流水线总览:三类来源→代理驱动采集→多阶段质量过滤→结构化标注→训练反馈闭环
Figure 2: 数据流水线总览:三类来源→代理驱动采集→多阶段质量过滤→结构化标注→训练反馈闭环
训练流水线总览:双向教师→教师强制→ODE 蒸馏→LongForcing
Figure 3: 训练流水线总览:双向教师→教师强制→ODE 蒸馏→LongForcing
ABot-World-0 模型架构:动作控制 + 参考角色记忆注入预训练视频 DiT
Figure 4: ABot-World-0 模型架构:动作控制 + 参考角色记忆注入预训练视频 DiT

实验结果

部署是头号结果:单张 RTX 5090、1280×704、batch=1,优化后最高 16 FPS、动作到首帧 1.2 s、峰值显存 ≤19.3 GiB。系统消融(Table 2)证明“实时”是协同而非单算子——Base 与仅加 SageAttention2 均直接 OOM;引入 LightVAE 后首次可行(9.117 FPS、20.491 GiB);加 FP8 后 DiT 时间从 1191 降到 845 ms、FPS 升到 12.405、显存降到 15.925 GiB;加 Fast-RoPE 升至 13.269 FPS;换 MXFP4 达 15.831 FPS。WorldRoamBench(Table 3)上 5B 模型严格准确率 0.5266、部分准确率 0.7290、轨迹分 0.6752、美学 0.5039、物理机制 0.5223、记忆 0.5041,整体与 Genie 3、HappyOyster 同档且多项领先,明显超过 14B 的 LingBot-World 与 8.3B 的 HY-World 1.5。LongForcing 消融(Figure 10,60s 推演)显示对比 Causal-Forcing 基线,后半程保持更高 HPSv3、更低饱和/模糊/patch 重复,误差累积更少。定性上小时级(5 条 60 分钟)与天级(4 条 24 小时)采样帧仍保场景结构与活跃动作;OOD 控制(Figure 8)统一接口能驱动训练分布外的场景+角色;物理交互(Figure 9)涌现推箱子、水面扰动、雪地脚印、墙壁阻挡、栏杆不穿透等合理效果,且无符号化物理规则监督。

单张 NVIDIA RTX 5090 上的部署设置与运行包络
Table 1: 单张 NVIDIA RTX 5090 上的部署设置与运行包络
单卡 RTX 5090 上各优化变体的系统级分解
Table 2: 单卡 RTX 5090 上各优化变体的系统级分解
WorldRoamBench 在动作/视觉/物理/记忆子维度的定量对比
Table 3: WorldRoamBench 在动作/视觉/物理/记忆子维度的定量对比
小时级(60 分钟)长程生成示例,5 条独立推演的时间戳关键帧条带
Figure 5: 小时级(60 分钟)长程生成示例,5 条独立推演的时间戳关键帧条带
天级(24 小时)长程生成示例 Set I
Figure 6: 天级(24 小时)长程生成示例 Set I
天级(24 小时)长程生成示例 Set II
Figure 7: 天级(24 小时)长程生成示例 Set II
跨域(OOD)控制泛化:训练分布外的场景与可控角色
Figure 8: 跨域(OOD)控制泛化:训练分布外的场景与可控角色
物理交互示例:物体碰撞、水面扰动、雪地脚印、墙壁阻挡、栏杆碰撞不穿透
Figure 9: 物理交互示例:物体碰撞、水面扰动、雪地脚印、墙壁阻挡、栏杆碰撞不穿透
LongForcing vs Causal-Forcing 在 60s 推演上的逐帧对比
Figure 10: LongForcing vs Causal-Forcing 在 60s 推演上的逐帧对比
查看结构化数据
任务指标本文基线提升
WorldRoamBench 动作严格准确率 Strict Accuracy 0.5266 (5B) Genie 3 0.4700 较 Genie 3 +0.0566,仅略低于榜首 HappyOyster(0.5317)
WorldRoamBench 动作部分准确率 Partial Accuracy 0.7290 (5B) Genie 3 0.6608 较 Genie 3 +0.0682
WorldRoamBench 轨迹跟随 Trajectory Score 0.6752 (5B) Genie 3 0.6719 略高于 Genie 3(+0.0033)
WorldRoamBench 物理机制 Mechanics 0.5223 (5B) Genie 3 0.5454 略低于 Genie 3(-0.0231),仍优于 LingBot-World(0.2777)
单卡部署吞吐 FPS @ RTX 5090, 1280×704 最高 16 FPS (MXFP4 配置 15.831) FP8 配置 12.405 FPS FP8→MXFP4 帧率 +27%,且峰值显存从 15.925→17.148 GiB
长程稳定性(60s 自推演) HPSv3 / 模糊 / 饱和 / patch 重复 LongForcing 后半程更高 HPSv3、更低模糊/饱和/重复 Causal-Forcing 基线 后半程视觉误差累积显著减少

局限与改进

作者承认的局限:键盘加性注入只适合离散明确的控制信号,对隐动作、连续相机轨迹或语义指令可能需要更复杂的条件化;LongForcing 虽能缓解漂移,但论文未给分钟级以上的定量画质指标——天级推演只有采样关键帧的定性展示,没有 FVD/PSNR,“24 小时不坍缩”只能算视觉证据而非严格度量;KV 量化、低比特只是“探索性”配置,对画质(FVD/aesthetic)的精确影响未报告,MXFP4 在复杂场景下的细节损失未被量化。我的观察:WorldRoamBench 的 Memory 维度只有 0.5041,明显低于 Genie 3(0.6073) 与 HappyOyster(0.6309),时序记忆其实是相对短板,与“长程稳定”宣传存在张力;多项得分也非全面最优(HappyOyster 在 Partial Acc、Trajectory、Aesthetic、Memory 上更高);物理交互只是“涌现的合理效果”,无真实物理基准对比,无法判断是否真符合刚体/流体规律;模型规模、训练算力、数据规模等关键数字全文未披露,复现与公平比较困难。

独立分析的弱点

弱点1——Memory 维度落后。WorldRoamBench 时序记忆仅 0.5041,落后 Genie 3(0.6073) 与 HappyOyster(0.6309),说明有界 KV 缓存虽省显存却牺牲了长程回顾能力;改进方向是引入多尺度记忆(局部稠密 KV + 全局稀疏/向量量化记忆)或 Slow-Fast Memory,把“漂移抑制”与“长程记忆”解耦。弱点2——长程评估缺定量度量。天级推演只有关键帧定性图,缺 FVD/PSNR 随时间曲线;改进方向是把 60s 评估协议延伸到分钟/小时级并报告漂移速率。弱点3——物理真实性不可验证。涌现的“推箱子/水面/脚印”无任何与真实物理引擎或标注碰撞的对比;改进方向是引入物理合理性基准(如与仿真器对齐的穿透/接触度量)。弱点4——激进量化画质代价未量化。MXFP4 达 15.831 FPS 但对美学/成像分影响未报告;改进方向是量化感知训练(QAT)并在精度-速度曲线上给画质等高线。弱点5——关键工程数字缺失(参数、训练卡数、数据时长),影响复现与公平比较;改进方向是补 full transparency table。

未来方向

作者明确提出的方向:更丰富的动作与语义事件需要更结构化的条件化;多尺度 LongForcing 与持久场景记忆可进一步提升长程一致性;更高效的解码与上下文管理可把高分辨率实时生成推广到更多消费级硬件;并提到量化感知训练是未来可改善速度-显存-质量权衡的方向。基于成果可延伸的方向:第一,把 WorldExplorer 的训练反馈闭环从“补数据”升级为“主动学习+课程学习”,让采集与课程调度共享同一弱点诊断信号;第二,把参考角色记忆从“静态四视图”扩展为可编辑角色库,支持运行时角色切换与风格迁移;第三,LongForcing 的分布匹配思想可推广到“多教师”——用不同视野/模态的教师做集成监督;第四,当前键盘动作是 8 维离散,可融合连续摇杆/触控以拓展精细操控;第五,把这套世界模型作为 embodied-AI/agent 学习的廉价模拟器,验证生成环境能否替代真实仿真器训练强化学习策略。

复现评估

复现难度较高但部分友好。利好面:论文给出 GitHub 仓库 https://github.com/amap-cvlab/ABot-World(截至报告时未明确权重是否已释出),推理侧部署细节披露充分——分辨率 1280×704、batch=1、每块 3 潜帧→12 视频帧、各优化算子(SageAttention2/LightVAE/FP8/Fast-RoPE)的逐一开关与对应 FPS/显存(Table 2)非常透明,单卡 RTX 5090 即可跑推理。关键困难:①依赖大量 AAA 游戏数据与专有 ABot-3DGS 重建街景(明确标注 non-public assets),这部分他人无法获取,只能用仿真+网络视频子集近似复现;②WorldExplorer 的训练反馈闭环、VLM 标注、14 项检查的具体阈值均无代码/配置细节;③模型规模虽给 5B,但训练算力、训练步数、数据总时长、教师 Wan2.2 的具体版本全未披露,复现训练几乎不现实。结论:推理端可一定程度复现/复用思路,训练端基本不可复现,适合作为“系统设计参考”而非“可重训基线”。