代码世界模型:以编程智能体为世界大脑 Code World Model: Coding Agent as World Brain
编程智能体用代码维护世界状态,代理视频驱动视频模型渲染高保真开放世界
前置知识
世界模型(World Model)
对环境状态及其在动作与事件驱动下如何演化的计算建模。给定当前状态 $S_t$ 与动作 $A_t$,世界模型预测下一状态 $S_{t+1}$ 及对应观测 $O_{t+1}$,可用于预测、规划与智能体训练。经典形态包括基于潜变量的 RSSM 系列,以及直接生成未来视频帧的生成式世界模型。
本文的最终目标就是构建开放式世界模型,全文的状态分解与演化公式(式 1-4)都建立在世界模型的标准形式化之上,不懂这一框架无法理解作者的问题定义。
视频世界模型
把世界演化直接建模为条件视频生成:以文本、动作或历史帧为条件,由扩散 Transformer 等视频生成模型自回归地产生未来观测。代表工作包括 Genie、GameNGen、Oasis、LingBot-World 等,它们从海量游戏与真实视频中学习外观、运动与交互的生成先验。
本文正是针对视频世界模型“只见观测结果、不见演化规则”的根本缺陷提出改进,相关工作对比与定性基线几乎全部来自这一方向。
编程智能体(Coding Agent)
以大语言模型为核心的智能体,能够自主阅读代码库、规划任务、编写与修改代码、运行测试并根据执行反馈迭代。近年其在长周期软件工程与游戏开发任务上的能力快速提升,可以把高层意图转译为可执行、可复用、可持续演进的程序。
本文让编程智能体担任“世界大脑”,负责解释事件、推断后果并维护世界程序,理解其工作方式是理解整个框架的前提。
Proxy 代理表征与代理视频
本文提出的粗粒度世界状态表征:用简单原语(胶囊人体、线框车辆、低多边形植被、包围盒等)编码相机、实体位置姿态、轨迹与空间关系,经确定性编译器轻量光栅化成一段 proxy 视频,作为视频模型的逐帧时空条件,仅占目标视频 1/16 的视觉 token 量。
proxy 是连接代码世界与视觉生成的核心接口,是本文最重要的技术贡献,所有训练数据构建与实验都围绕它展开。
LoRA 低秩适配
一种参数高效微调方法:冻结预训练模型的原始权重,为每层注入低秩矩阵对,只训练增量 $\Delta W = BA$(秩为 $r$)。可训练参数量远小于全量微调,能在有限算力下把大模型适配到新任务而性能损失很小,是当前大模型定制的标准手段。
本文用 rank-128 LoRA 微调 MiniMax-H3 全部 50 个 transformer 块,仅约 5.96 亿可训练参数就完成 proxy 条件适配,读懂训练设置需要这一背景。
研究动机
现有视频世界模型(如 Genie、GameNGen、Oasis、LingBot-World 2.0 等)把世界演化建模为动作或文本条件下的视频生成,直接从海量视觉数据中学习动态先验,视觉质量与动作可控性已相当出色。但作者指出一个根本性缺陷:视频只记录世界演化的可观测结果,而支配这些结果的世界知识、常识规则、实体关系与后果传播机制是隐性的、不可直接观测的。以游戏视频为例,每一帧其实都由固定的游戏代码执行渲染而成,可执行逻辑在渲染后被丢弃,模型只能通过稀疏的视觉后果间接推断规则;许多关键状态变化发生在画面之外,或超出模型的时序上下文。当前视频模型的训练上下文窗口通常不足一分钟,而需要推理的因果过程在世界时间尺度上可能跨越数天数年。扩大视频训练数据只提供更多“观测到的结果”,并不能直接揭示底层机制,因此现有模型尚无法支撑后果持久、连贯演化的开放式交互世界。
本文的目标是本文的目标是构建一种能同时具备两种互补能力的世界模型:其一是持续维护并运行一个完整世界,依据世界知识与规则推断事件的后果,并让这些后果在长期演化中持久存在,即使相关实体当前不在视野内——例如玩家刺杀城主后,城内秩序、阵营关系与众多 NPC 的行为应持续连锁变化;其二是保留视频模型生成丰富外观、运动与细粒度动态的能力,把演化中的世界渲染为高保真、开放式的视觉观测。为此作者提出 Code World Model 框架:由编程智能体充当“世界大脑”,通过可执行且可修改的代码治理世界状态与运行机制;引入 proxy 作为世界状态与视觉生成之间的可编程接口;用视频模型作为视觉后端。当前原型在约 5.6 小时 GTA V 游戏数据上微调 MiniMax-H3,验证框架两大核心组件的可行性。
与已有工作不同的是,本文的独特切入是功能分解:把“世界如何演化”与“世界看起来如何”彻底解耦。与主流视频世界模型把全部状态压进视觉历史或隐式记忆不同,本文让编程智能体通过持久代码显式持有世界状态;与生成式 3D 世界模型需要构建完整几何、资产与渲染管线不同,本文只要求智能体用简单原语拼出粗粒度 proxy。作者通过实验发现,即便 LingBot-World 2.0 这类大规模训练的世界模型配备了专门相机条件通路,纯文本条件仍无法精确控制相机轨迹与实体运动;而完整 3D 构建成本高且过早约束视觉实现。proxy 介于两者之间:以视频模态承载帧级时空约束,把外观留给视频模型。此外,智能体做稀疏复杂推理、代码做密集高频执行的“双频解耦”组织,既不同于让 LLM 逐步模拟代码执行的路线,也不同于只交付游戏成品的编程智能体造游戏路线。
核心方法
核心直觉是“代码决定世界发生什么,视频模型决定它看起来如何”。形式化上,世界状态被分解为可执行状态 $S_t^{exe}$(世界程序、实体属性、规则、关系、事件历史等)与视觉状态 $S_t^{vis}$(外观、运动等需跨帧一致的信息),即 $S_t = (S_t^{exe}, S_t^{vis})$。演化由两条耦合路径驱动:智能体-代码联合转移 $S_{t+1}^{exe} = T_{AC}(S_t^{exe}, A_t)$ 处理动作 $A_t$,其中代码按既有规则高频执行确定性更新,编程智能体只在事件解释、机制选择与修订等稀疏时刻介入;视频模型则生成 $S_{t+1}^{vis} \sim G_\theta(S_t^{vis}, S_{t+1}^{exe})$。工程上,可执行状态经确定性编译器渲染成粗粒度 proxy 视频,与结构化文本一起条件化微调后的 MiniMax-H3(Ref2VA 骨干,rank-128 LoRA,约 5.96 亿可训练参数),逐帧生成 1344×768、24 FPS 的观测,并带有状态与视觉反馈回路支持持续交互与后续演化。
最核心的创新是 proxy 条件接口。它把当前观测必须服从的相机、实体位置、姿态、轨迹与空间关系组织成粗粒度可编程表征,由确定性编译器轻量光栅化成 proxy 视频。与文本条件相比,proxy 以视频模态给出时空组织良好的约束,视频模型更易解读;与学习型 3D 生成器或完整 3D 构建相比,proxy 的每个控制信号都可追溯到代码维护的世界状态,对编程智能体是白盒、可寻址、可局部编辑的。设计上刻意只保留“最小充分”状态:不表达纹理、材质、精细光照,把外观与细粒度动态留给视频模型的先验。实现上 proxy 采用目标视频 1/4 的空间分辨率(336×192 对 1344×768),仅增加 1/16 的视觉 token,推理开销可忽略。作者把该设计形式化为“可构建性与接地强度”的条件带宽权衡,并把“智能体自主开关与调节 proxy”留作该范式的设计空间。
方法步骤详情
方法分四步。第一步,构建配对数据:同步录制 GTA V 目标视频与运行时状态(相机、实体位置朝向、尺度、布局、交互关键状态),用代码自动生成像素级实例图绑定身份与文本;157 段实录约 5.6 小时,切成 9,420 个 5 秒片段,目标为 124 帧、1344×768、24 FPS 视频,对齐 proxy 为 124 帧、336×192 的对数深度加语义 ID 图;真实侧在 KITTI-360 上用标定 3D 重建与物体标注离线编译对齐 proxy。第二步,训练:以 MiniMax-H3 Ref2VA 为起点,对全部 50 个 transformer 块施加 rank-128 LoRA(约 5.96 亿参数),8 张 H800 上训 3 个 epoch 共 3,534 步,学习率从 $2\times10^{-5}$ 余弦衰减至 $1\times10^{-6}$。第三步,建世界:GPT-5.6 Sol 基于游戏引擎模板改写代码,用与训练一致的原语构建可玩、可录制 proxy 的交互世界。第四步,推理:GPT Image 2 生成首帧外观锚,视频模型 Euler 采样 20 步生成 124 帧窗口,长视频以 34 帧重叠滚动拼接。
技术新颖性
技术新颖性体现在四个层面。范式层面,首次把“编程智能体+持久代码”确立为世界模型的治理中枢:世界状态显式可执行,视频模型退居视觉后端,这与以观测序列为中心建模的视频世界模型有本质区别。接口层面,proxy 是一个新的条件模态设计点:既非文本也非完整 3D 渲染,而是可由代码确定性编译、可逐帧寻址的时空约束,且无需动作标签或相机位姿标注即可从游戏与真实视频(KITTI-360)构建训练对,大幅降低数据成本。系统层面,智能体与代码在频率上解耦:代码高频处理位置、碰撞、冷却、伤害等密集更新,智能体只在目标变化或机制失效时改写世界程序,使世界状态演化速率独立于模型推理频率。数据层面,同一次运行时记录可重新编译成不同覆盖度与粒度的 proxy,并附带像素级实例图实现身份、文本与图像区域的精确绑定,这也是当前视频模型能学会跟随粗糙原语的关键。
实验结果
本文目前只提供定性证据,但指向明确。其一,仅用约 5.6 小时 GTA V 游戏(9,420 个 5 秒片段、3,534 步 LoRA 训练)微调后,MiniMax-H3 能紧密跟随从编程智能体构建的简单交互世界中录制的 proxy:Fig. 4 展示了五个截然不同的文本提示(美式复古魔法学院的杖舞、霓虹雨夜集市的船战、水墨云海中的蝠鲼之舟、蒲公英信使奔跑、修道院钟铃朝圣者),每例六个时间有序帧的上行 proxy 与下行 RGB 逐帧对齐,显示模型在保留丰富视觉细节与动态的同时,准确复现实体位置、动作轨迹、场景布局与相机运动。其二,项目页的定性对比显示,相比仅用文本或低维动作/相机信号的条件接口(如 LingBot-World 2.0 等动作条件世界模型),proxy 提供更精确、更灵敏的逐帧控制,控制粒度与现代 3D 游戏相当。其三,帧级 proxy 条件的额外开销可忽略:336×192 的 proxy 仅贡献目标视频 1/16 的视觉 token。其四,KITTI-360 实验证明无需动作标签也能从真实录像离线编译对齐的 proxy-观测对。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 代理条件下的可控视频生成(游戏世界) | 定性跟随度:实体位置/动作轨迹/场景布局/相机运动与 proxy 的一致性 | MiniMax-H3 经 5.6 小时 GTA V 数据、3,534 步 rank-128 LoRA 微调后紧密跟随 proxy 约束,同时保留丰富视觉细节与动态 | 文本/动作/相机条件世界模型(如 LingBot-World 2.0、Genie 类系统) | 实现与现代 3D 游戏相当粒度的逐帧实体与相机控制(定性对比,论文未报告量化数值) |
| 真实视频 proxy-观测对构建(KITTI-360) | 对齐质量:相机运动、空间对齐与遮挡一致性(定性验证) | 由标定 3D 重建与物体标注离线编译对齐 proxy,经共享深度缓冲光栅化,无需任何动作标签 | 依赖动作语义标注与连续相机轨迹估计的传统数据构建方式 | 显著降低标注负担:动作与相机的视觉效果直接编码在 proxy 视频中,无需独立标签 |
局限与改进
作者明确承认两点局限:一是受算力限制训练规模很小,生成质量有限,且未实现自回归实时生成;二是当前编程智能体仍难以可靠地从零实现复杂游戏机制,原型并未展示完整开放世界游戏或模拟器的自主构建。我自己的观察还有几点:全部结果均为定性展示,没有量化指标(如实体位置误差、轨迹遵循度)、没有用户研究,也没有与基线在统一协议下的公平对比;系统强依赖闭源组件(GPT-5.6 Sol、GPT Image 2、MiniMax-H3),成本与可复现性受限;训练数据几乎全部来自 GTA V 单一游戏域,对真实世界风格的泛化只在提示词层面展示;长视频推理采用 124 帧窗口加 34 帧重叠拼接,误差累积与外观漂移未被量化;proxy 带宽(336×192、每片段 11 个采样帧)是固定设计,智能体自主调节仍停留在设想层面。
独立分析的弱点
第一个弱点是评测缺位:既然 proxy 的卖点是精确时空控制,就应建立代理遵循度的量化基准,例如实体位置/尺度的逐帧误差、轨迹 L2 距离、布局 IoU、相机路径误差等,并用固定的 proxy 与提示词做跨方法对比;目前读者只能凭项目页视频主观判断。第二个弱点是智能体-代码闭环未获实验验证:论文展示了代码智能体能用模板拼出简单世界,但“根据执行反馈改写世界程序、后果跨场景持久化”这一核心主张(如刺杀城主后的连锁演化)没有任何实验支撑,需要一个带隐藏状态演化的事件链测试床来验证。第三个弱点是条件带宽固定:对简单场景 proxy 可能过重,对复杂大战斗可能不足,应让智能体按场景选择实体子集、分辨率与条件帧率。第四个弱点是数据域单一且受版权限制:5.6 小时 GTA V 录像难以再分发,可探索 Minecraft 等开放版权游戏与更大规模真实视频的混合训练,并补充域外泛化实验。
未来方向
作者提出的方向包括:扩大训练规模以提升生成质量;实现自回归实时生成,结合流式生成、因果蒸馏与全栈推理优化的进展;随着编程智能体能力增长,让其从零设计、实现、测试并维护复杂世界机制;让智能体自主决定 proxy 的开关、实体选择、空间粒度、分辨率与条件帧率,在控制能力提升后让 proxy 在部分情境下退化甚至消失。基于本文成果还可延伸:把该世界模型用作具身智能体与 VLM 的可扩展训练环境,利用真实视频 proxy 让生成分布贴近部署域;为智能体-代码循环引入单元测试与世界一致性校验,提高规则可信度;扩展到音频与多模态观测、多智能体对抗与社会模拟;建立“世界演化正确性”评测(后果持久性、跨场景因果链召回),推动世界模型从视觉仿真走向因果仿真。
复现评估
复现难度较高。项目页为 https://buaacyw.github.io/cwm/,论文未提及开源代码、数据或模型权重。关键组件多为闭源或受限:编程智能体用 GPT-5.6 Sol,首帧外观锚用 GPT Image 2,视频骨干是 MiniMax-H3 官方 Ref2VA checkpoint;训练需 8 张 H800 GPU、BF16 混合精度、FlashAttention-3,3 个 epoch 共 3,534 步,估计单次实验成本不低。数据方面,5.6 小时 GTA V 录像受版权限制几乎无法再分发;KITTI-360 公开可得,但其 3D 重建、标定与标注管线需要自行复现。对学术团队而言,可行的最低成本路径是:用开源视频模型替换骨干、用开放版权游戏重建配对数据管线、用开源编程智能体驱动世界构建,但 proxy 编译器、像素级实例图生成、窗口拼接等工程细节均需从头实现,总体属于中高难度复现。
论文图表