← 返回 2026-09-10

可编程世界模型 Programmable World Model

Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu, Muyao Niu, Siqi Yang, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang, Zhixiang Wang 📅 2026-09-09 👍 94 2026-09-12 18:30
3D场景理解 世界模型 交互式环境 可控视频生成 生成式渲染

用可执行程序维护显式世界状态,把视频模型降级为纯粹的生成式渲染器

前置知识

视频世界模型

以生成式视频模型为底座、根据历史画面和用户动作逐块预测后续观察的交互式系统,如 LingBot-World、YUME。它把'想象下一秒世界长什么样'建模为条件视频生成,通常以像素级目标训练,追求画面逼真与动作响应,但一般不显式维护世界事实。

本文的出发点正是这类模型:它们画面越来越真实,却缺乏持久世界状态与可编程规则,理解这一背景才能明白论文要补的短板。

3D 定向包围盒(OBB)

用中心位置 $p$、尺寸 $d$、旋转矩阵 $R$ 描述实体的有向长方体包围盒,比轴对齐包围盒更能贴合物体朝向。本文进一步为其挂上持久 ID、语义类别、世界系速度、血量等属性,构成'状态增广 OBB',作为共享世界坐标系下的实体级几何脚手架。

OBB 是全文最核心的中间表示:状态引擎维护它、编译器投影栅格化它、渲染器消费它,理解它就理解了状态与像素之间的接口。

ControlNet 式旁路控制

在冻结的预训练扩散主干旁挂一个可训练副本分支,把条件信号(边缘、深度、本文的 OBB 控制图)编码为逐层特征 $r^{(\ell)}$ 并注入主干 $h^{(\ell)}_{main} \leftarrow h^{(\ell)}_{main} + r^{(\ell)}$,在不破坏生成先验的前提下引入精确结构控制。

本文渲染器正是用 Structured Spatial ControlNet 把世界状态注入预训练视频模型,必须先懂'冻结主干+可训旁路'这一范式。

生成式渲染

用生成模型替代传统光栅化/路径追踪管线:输入 G-buffer、粗几何 proxy 或结构化控制信号等显式场景条件,让扩散模型补全纹理、材质、光照与精细动态。代表工作包括 DiffusionRenderer 与 AlayaRenderer 系列。

本文把视频模型定位为'渲染器'而非'世界',其可行性建立在生成式渲染能从粗结构信号合成逼真画面这一前提之上。

块自回归长程生成

把长视频切成若干帧块(chunk),块内做双向去噪、块间只因果传递上下文。本文每块额外接收多尺度时间历史(近/中/远分辨率递减的潜变量加首帧锚点)与几何对齐空间记忆(用深度把历史帧抬入世界系再重投影),支撑 897 帧级别的长程滚动。

世界状态要跨遮挡、跨视角、跨长时程保持一致,长程生成机制是引擎状态在画面上'不漂移'的工程保障。

编码代理

由 VLM 驱动的智能体,把自然语言指令翻译成可执行代码或程序。本文中它读取初始 3D 布局与用户描述,生成引擎可读的世界程序:实体初始状态、实体间关系、事件触发器与胜负目标,用户还能通过追加指令修改世界行为。

'可编程'三个字靠它落地:没有代理把需求写成程序,引擎就只剩几何壳子而无游戏逻辑。

研究动机

现有交互式视频世界模型(LingBot-World、YUME 等)主要以像素级生成目标训练,能合成逼真画面,但作为'世界引擎'存在三个硬伤。其一,控制接口停留在相机轨迹、动作或高层提示,无法直接点名并操纵某个具体实体。其二,缺少显式、持久的全局状态:屏幕外实体、血量、背包、任务进度等非视觉信息只隐式埋在生成上下文里,一旦被遮挡、相机大角度转动或长时程滚动,实体就可能凭空消失或'死而复生'。其三,用户无法编程世界演化规则——提示词说'门会被撞开'并不能形成一条可执行、可验证的规则。论文用自建 CombatStateBench 量化了缺陷:让 LingBot-World-V2 与 YUME 通过提示词切换接收状态转移后,可见存活角色计数准确率仅 40.75% 和 32.00%,死亡事件视觉实现率低至 8.00% 和 58.00%,说明隐式状态承载不了世界事实。

本文的目标是本文目标是构建把'世界状态演化'与'视觉观察生成'解耦的可编程世界模型:由轻量引擎按可执行程序确定性维护权威世界状态(含屏幕外实体与非视觉属性),预训练视频模型只负责把状态'渲染'成逼真画面。具体要同时做到三件事:一是实体级直接控制,用户可点名某角色并修改其状态;二是持久一致的世界状态,跨遮挡、跨视角、跨长时程不漂移;三是用户可编程的世界规则,例如定义击中扣血、血量归零倒地、全灭获胜等机制。最终愿景是:给一张参考图加一段自然语言描述,就能得到机制预设好、可持久游玩的游戏;并以 CombatStateBench 客观度量生成画面与引擎状态的吻合度,本文达到 94% 计数准确率与 98% 状态准确率。

与已有工作不同的是,论文的独特切入是从'表示谱系'出发做设计决策:候选表示从文本描述、2D 框/掩码,到粗 3D proxy、完整 3D 场景与 G-buffer,控制力与数据/推理成本同步增长,且存在训练-推理错配——训练时表示从已实现动态中提取,推理时却要从高层状态转移正向构造出结构轨迹,表示越细错配越重。作者论证文本太弱(无几何约束)、完整 3D 太强(系统必须自行解决肢体轨迹等高维动态,退化为传统动画/物理模拟问题),于是选定状态增广 3D OBB 作为中间抽象:既可在共享世界坐标系确定性重投影,又把精细外观与关节运动交给生成先验。与 StatePlay(模型自己预测状态,误差累积)和 MASS(学习型 Logic Engine 推进状态,转移会出错)不同,本文用确定性规则引擎加确定性状态编译器连接状态与像素,使状态可编程、可编辑、可验证。

核心方法

整体直觉是:'世界该记住什么事实'不该让视频模型硬背,而应由外部程序记账。技术上是一个四组件闭环 $s_t \xrightarrow{a_t,F} s_{t+1} \xrightarrow{C_{t+1},P} M^{ctrl}_{t+1} \xrightarrow{G} I_{t+1}$:VLM 编码代理把初始 3D 布局与自然语言描述写成引擎可读的世界程序;轻量引擎执行 $s_{t+1}=F(s_t,a_t)$ 维护权威状态;确定性状态编译器 $P$ 把状态增广 3D OBB 沿目标相机 $C_{t+1}$ 投影并栅格化为身份/语义/方向三张像素对齐控制图;以 LingBot-World-v1 为底座的生成式渲染器 $G$ 通过 Structured Spatial ControlNet 消费控制图,冻结主干、只训控制分支。长程采用块自回归生成,配合多尺度时间历史与几何对齐空间记忆。训练数据靠自动数据引擎从 Cyberpunk 2077、Forza Horizon 6、GTA V 的无 HUD 游戏视频中恢复监督。

核心创新是把世界状态从生成模型内部搬到外部引擎,并用一个'刚好够用'的表示连接两者。已有方案要么让模型隐式记忆状态(LingBot-World、YUME),要么让模型预测状态(StatePlay),要么用学习型逻辑引擎推进状态(MASS),状态演化都不可靠或不可验证;本文引擎按显式规则确定性执行 $s_{t+1}=F(s_t,a_t)$,状态可直接编程、编辑与验证。表示上选择状态增广 3D OBB:位置、尺寸、朝向加持久 ID、语义、血量等,是支撑实体持久性、世界空间一致性与状态相关变化的最小充分统计量。编译器不像 RenderFormer 那样直接把结构 token 映射成图像,而是显式解析相机投影与实体-像素对应,栅格化出身份图 $M^{id}$、语义图 $M^{sem}$、方向图 $M^{dir}$;其中方向取自实体世界速度旋转到相机系后量化出的 7 态(前/后/左/右/静止/上/下),从源头区分物体自运动与相机引起的表观运动。

方法步骤详情

①初始化:3D 检测器从初始观察 $I_0$ 恢复可见实体及 OBB,构成 $E_0$。②代理编程:VLM 编码代理结合布局与用户描述生成世界程序,指定属性 $A_0$、关系 $Q_0$、规则 $R_0$(击中扣血、血量归零倒地、全灭获胜),实例化 $s_0=(E_0,A_0,Q_0;R_0)$。③执行:校验动作、施加效果、解析事件,得 $s_{t+1}=F(s_t,a_t)$。④控制编译:$M^{ctrl}=P(s_{t+1},C_{t+1})$,深度感知栅格化三张图:身份图用 $K$ 个可学习身份嵌入(同序列槽位固定),语义图用文本编码,方向图由世界速度旋到相机系量化出的 7 态嵌入,通道拼接。⑤渲染:ControlNet 逐层注入 $h^{(\ell)}_{main}\leftarrow h^{(\ell)}_{main}+r^{(\ell)}$,主干冻结、分支可训。⑥长程:后续块接收近/中/远多尺度时间历史与几何对齐空间记忆(深度抬入世界系再重投影)。⑦数据引擎:ViPE 估位姿深度、Qwen3-VL 发现类别、SAM3 分割跟踪、WildDet3D 估 OBB,生成条件图。

技术新颖性

技术新颖性体现在四个层面。架构层面:把'可执行世界程序+确定性引擎'与'生成式渲染器'系统性解耦,状态演化从统计学习问题变成程序执行问题,可验证、可回滚。表示层面:提出状态增广 3D OBB 并系统论证训练-推理错配——训练时表示描述已实现的动态,推理时要从高层状态转移正向构造结构轨迹,表示越细(关节模型、动态 3D)越接近高维动画/模拟难题,OBB 是控制力与可构造性的平衡点。接口层面:确定性状态编译器输出身份/语义/方向三张像素对齐控制图,身份槽位在序列内固定以建立持久实例对应,方向图基于世界坐标系速度而非图像位移,显式解开相机-物体运动歧义。数据层面:ViPE+Qwen3-VL+SAM3+WildDet3D 串联的自动数据引擎从无标注游戏视频恢复 OBB 轨迹监督,为可编程生成世界提供了可扩展的数据路径,这是超越单点模型贡献的基建性工作。

Overview of the programmable world model
Figure 1: Overview of the programmable world model
Architecture of the programmable world model
Figure 3: Architecture of the programmable world model

实验结果

在 50 段 CombatStateBench 片段上,以 Qwen3.6-27B 为盲评 RGB 裁判,本文全面领先。Count Accuracy 在 400 帧采样上达 94.00%,比 LingBot-World-V2 的 40.75% 高 53.25 个百分点,比 YUME 的 32.00% 高 62.00 个百分点;State Accuracy 在 50 次死亡事件上达 98.00%,基线仅 8.00% 与 58.00%。基线即使用提示词切换接收状态转移,仍频繁'该死的没死、该活的消失'。VBench 四项视频质量亦最优:Imaging 67.62 优于两个基线、Subject Consistency 94.74(+12.87/+2.39)、Background Consistency 96.98(+5.09/+3.35)、Temporal Stability 99.00(+2.15/+0.24),提升状态一致性的同时未牺牲画质。定性:牛头人新场景验证泛化;大角度转相机后揭示视野后方 3 个角色;赛车场景验证跨类型;人车异构同场景;897 帧自回归序列中 NPC 渐入仍稳定。

Video quality and world-state evaluation on 50 CombatStateBench clips
Table 1: Video quality and world-state evaluation on 50 CombatStateBench clips
Additional qualitative results shown at five selected time steps
Figure 5: Additional qualitative results shown at five selected time steps
查看结构化数据
任务指标本文基线提升
世界状态一致性:可见存活角色计数(CombatStateBench,400 采样帧) Count Accuracy 94.00% LingBot-World-V2 40.75% / YUME 32.00% +53.25 / +62.00 个百分点
死亡事件视觉实现(CombatStateBench,50 次死亡事件) State Accuracy 98.00% LingBot-World-V2 8.00% / YUME 58.00% +90.00 / +40.00 个百分点
帧级清晰度与整体视觉质量(VBench) Imaging Quality 67.62 LingBot-World-V2 67.46 / YUME 64.10 +0.16 / +3.52
前景实体外观与结构稳定性(VBench) Subject Consistency 94.74 LingBot-World-V2 81.87 / YUME 92.35 +12.87 / +2.39
背景场景跨帧稳定性(VBench) Background Consistency 96.98 LingBot-World-V2 91.89 / YUME 93.63 +5.09 / +3.35
时序闪烁抑制(VBench temporal flickering) Temporal Stability 99.00 LingBot-World-V2 96.85 / YUME 98.76 +2.15 / +0.24

局限与改进

局限可从评测与表示两方面看。评测上,CombatStateBench 仅 50 个片段、聚焦战斗死亡一类事件,场景由同一数据引擎重建、由代理按规则演化,与训练分布同源,可能高估泛化;两项指标都是全局宽松指标,只数活人数、查死没死,不考察实例级对应与定位精度;VLM 裁判本身可能误数密集小目标;基线因缺乏状态接口被迫用提示词切换,部分差距来自接口而非骨干能力。表示上,OBB 无法表达关节姿态、局部形变与软体动力学,方向仅 7 态量化且不含速度幅值,碰撞等物理效果全靠规则近似;身份嵌入槽数 $K$ 固定,同时可跟踪实体数有上限;初始布局依赖现成 3D 检测器,小目标或密集遮挡下会失准;训练数据仅三款游戏,动漫、真实影像等风格泛化未验证;897 帧长程演示中多实体入场的稳定性也只是'合理'而非严格一致。

独立分析的弱点

独立分析有五个弱点。其一,身份嵌入库 $K$ 固定:开放世界里实体数不可预知,超出容量即无法维护持久身份,可改用层级化或可扩充分配策略。其二,7 态方向量化太粗,无法表达速度大小与曲线运动,可替换为连续速度嵌入或局部轨迹样条。其三,规则程序由编码代理生成,程序写错则画面再完美、世界逻辑也是错的,且论文缺乏对程序正确性的验证机制,应引入形式化验证或单元测试(如死亡不变量、碰撞一致性断言)。其四,物理语义全靠规则枚举,缺少真实物理引擎的连续碰撞与动量守恒,混合轻量物理求解器会更可信。其五,评测指标宽松且依赖单一 VLM 裁判,对'死而复生''瞬移'等细粒度错误不敏感,可补充基于检测器的实例级指标并用人工评测校准裁判可靠性。

未来方向

作者指出的大方向是'状态可执行可验证、外观保持生成式'的世界模型。可延伸方向包括:一、多人世界引擎——动机部分已提到背包、任务进度等非视觉状态对多人共享世界至关重要,可把权威状态扩展为可同步、可回滚的复制状态机;二、状态语言升级,支持物理事件、经济系统、任务逻辑等更丰富的非视觉属性与因果链;三、数据引擎从三款游戏走向开放域视频,结合自监督一致性校验扩大训练分布;四、混合架构:引擎在需要时调用精确物理求解,生成模型负责外观补全,兼得确定性与表现力;五、交互接口扩展到语音/文本的实时世界编辑,以及基于世界程序的自动化游戏测试与程序化内容生成;六、评测侧构建覆盖库存、任务、物理事件的多维基准,超越战斗死亡单一场景。

复现评估

复现难度中高。开源情况:论文给出项目页与代码仓库,正文明确了架构组件、公式与训练策略(主干冻结、ControlNet 分支与跨块条件参数可训),CombatStateBench 共 50 个片段并配自动一致性校验器(重投影、深度、几何、接地、时序连续性等检查),指标定义与 VLM 提示协议描述清晰。但外部依赖链长:需要 LingBot-World-v1 预训练底座与 AlayaWorld 的几何对齐空间记忆(未必全量开源),数据引擎还需串联 ViPE、Qwen3-VL、SAM3、WildDet3D 四个模型。训练数据来自 Cyberpunk 2077、Forza Horizon 6、GTA V 的无 HUD 游戏录像,涉及采集与版权成本;视频扩散微调需要多卡高端 GPU 与数天量级训练。若只复现评测,可尝试官方权重跑 CombatStateBench;若从头训练,算力与游戏数据是主要门槛。