代码即世界:面向物理推理的可执行世界表示与智能体发现 Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
前置知识
可执行世界表示(EWR)
用结构化代码显式描述物理世界的表示形式,形式化为 $p=(C,E,A)$:物理构成 $C$(物体、几何尺寸、质量、摩擦、重力等)、动态演化 $E$(初始状态、关键事件、仿真时长)与视觉外观 $A$(相机、材质、光照)。代码可编译为 MuJoCo 等仿真器的参数,执行后产出完整状态轨迹与渲染视频。
这是全文的核心对象:智能体发现循环搜索的就是它,下游的物理监督数据也由它生成,理解论文的一切都建立在这个表示之上。
溯因推理(Abductive Reasoning)
从不完全、含噪的观测出发,在假设空间中搜索“最能解释证据”的假设,并遵循简洁性原则的推理方式。科学史上从日心说到牛顿定律的发现过程都体现了这种最佳解释推断,与演绎、归纳推理不同。
论文把世界表示建模为溯因式的假设搜索:每个可执行世界是一个可检验假设,通过仿真执行、渲染验证与证据比对不断修正,这是方法设计的思想来源。
视觉语言模型(VLM)
在大规模图文与视频文本数据上训练的多模态模型,能识别物体、描述运动并回答问题,如 Qwen3-VL、InternVL、MiniCPM-V、Gemini、ChatGPT 等系列。
本文的下游应用是训练 VLM 完成定量物理推理:论文先用监督微调再用强化学习训练出 Code-as-World-VL-4B/9B/27B,并与上述 VLM 基线系统比较。
GRPO(组相对策略优化)
一种无需价值网络的强化学习算法:对每个提示采样一组回答(本文为 16 个 rollout),以组内奖励的相对优势作为策略梯度信号。论文 27B 变体训练用 AdamW 学习率 $5\times10^{-6}$、权重衰减 0.01、bf16 参数。
第二阶段训练用 GRPO,奖励结合数值精度 $r_{\text{num}}=\exp(-|\hat y-y|/(|y|+\epsilon))$ 与单位、格式辅助奖励,是模型获得世界空间推理能力的关键。
MRA(平均相对准确率)
QuantiPhy 使用的评测指标:对每个样本在十级递增严格的相对误差阈值 $\Theta=\{0.1,0.2,\ldots,0.95\}$ 上统计命中并求平均,预测越接近真值得分越高;无法解析为有限数字的回答所有阈值都不命中、得 0 分。
论文所有 QuantiPhy 结果(Table 1、Table 4)都用 MRA 报告,且是四个子集的宏平均,理解它才能正确解读 58.6 这类数字的含义。
Sim-to-Real(仿真到真实迁移)
用视频生成模型(Wan2.2-VACE 配合内部视频生成模型)以仿真渲染为条件重绘视频,在保持物理轨迹与场景结构不变的前提下注入逼真的物体、材质、背景与光照。
文本驱动的可执行世界依靠它获得视觉真实性,是数据管线的最后一环;论文还用 JEDi、TRAJAN 等指标专门评测它不破坏运动保真(Table 2)。
研究动机
现代视觉语言模型虽能识别物体、叙述运动、解释多种物理现象,但“描述现象”不等于“恢复产生现象的机制”。论文将此概括为现象–机制二分:像素级视频生成只优化未来帧预测,无需区分场景变化来自相机运动还是物体运动、物体是被暂时遮挡还是已消失,多个互相矛盾的内部解释可以产生同样视觉合理的未来,而视觉合理的未来不一定是物理正确的未来;3D 重建能复现几何与外观,却不能回答物体为何在失去支撑后下落、如何与其他物体交互——可重建不等于可解释;自然语言虽然紧凑且可组合(如“一个人拿起杯子”保留了实体、动作与语义关系),却难以用少量离散 token 精确编码连续量,如精确轨迹、接触关系和摩擦、质量等物理参数。在下游任务上,定量物理推理要求模型从单目视频推断物体的真实尺寸、位移、速度、加速度等度量量,但真实视频几乎从不携带这些底层物理量标注,导致这类能力无法规模化训练。
本文的目标是论文想回答“什么形式的表示才能捕捉、理解和推理物理世界”:构建一种既像语言一样语义紧凑、又像重建一样结构化、还能像生成模型一样刻画时间演化的表示——把物理构成、动态演化与视觉外观表达为可执行代码;再给出从文本描述或真实视频自动发现这种表示的方法;最后验证这些经过验证的可执行世界能否作为可扩展的物理监督,训练 VLM 完成需要真实世界尺度的定量推理,并在 QuantiPhy 基准上超越领先的专有模型。
与已有工作不同的是,已有工作把世界表示当作一次性预测问题(直接从观测回归场景参数、生成描述或重建几何),本文的独特切入是把表示过程形式化为受溯因推理启发的智能体发现过程:代码的可执行、可被智能体操作的特性使每个表示成为一个可检验的世界假设——提出假设、在仿真器中实例化执行、渲染出预测观测、与证据比对验证、依据差异迭代修正。这把“预测”变成“带仿真反馈的搜索”,让物理机制成为智能体可直接查询、干预和验证的外部接口,而非隐含在网络权重中。
核心方法
直觉上,好的物理表示应显式回答“世界有什么、如何演化、看起来如何”。技术路线分三步:首先定义可执行世界表示 $p=(C,E,A)\in\mathcal{P}_{exec}$,其中物理构成 $C$ 描述物体、几何尺寸与质量、摩擦、重力等属性(地板、桌面等环境结构也是静态物理实体,可参与支撑与碰撞),动态演化 $E$ 描述初始状态、时序变化、关键事件与仿真时长,视觉外观 $A$ 描述相机、背景、材质、光照等只影响呈现而不改变物理过程的因素;代码经编译实例化为仿真器就绪参数 $\theta$,由 MuJoCo 执行得到完整状态轨迹 $\tau$。其次,对输入 $\xi$(文本或视频)先用模态适配器构造证据 $\eta$:文本抽取实体、空间关系、物理事件与预期结果;视频用 SAM3 提取实例掩码与图像平面轨迹、VGGT-Omega 估计深度与相机几何、SAM3D 生成物体网格,把候选世界重新投影回输入视角做一致性校验。最后运行最多 $K=5$ 轮“提出–实例化–执行–渲染–验证”循环,搜索与证据一致且足够简洁的世界。
核心创新是把每个候选 EWR 当作可执行、可证伪的世界假设而非一次性输出,且验证信号来自仿真执行本身:状态轨迹 $\tau$ 被渲染成 RGB,对视频输入还投影出深度图、实例掩码与图像平面轨迹,在选定关键帧上与真实证据逐项对比(文本输入则主要检查语义与物理约束),帧级差异聚合为结构化反馈 $\Delta$,指导下一轮只局部修改相关组件。与已有方法的本质区别在于:one-shot 生成没有这种“执行–观测–诊断–修正”的闭环;独立采样(Best-of-5)虽消耗相同预算却无法复用前次尝试的错误信息;而像素生成或 3D 重建以复现观测为目标,这里优先追求的是物理等价——世界构成、约束与演化的一致性——而非像素级复制。世界编辑(改物理量、改相机)与外观合成(视频生成)的分离也由此自然成立。
方法步骤详情
算法 1 给出完整流程。第一步证据构造:文本经 InterpretText 得到语义证据;视频经 Depth/Segment/Track 得到 $\eta=(\xi, D, M, Q)$(原始帧、深度、掩码、轨迹)。第二步进入循环,最多 $K=5$ 轮:(1) 提出/更新——智能体基于 $\eta$、当前假设与上轮反馈 $\Delta$ 调用 ModifyEWR 修改 $p=(C,E,A)$;(2) 实例化——CompileEWR 将代码编译为符合仿真器接口的参数 $\theta$;(3) 执行——RunSimulation 产生状态轨迹 $\tau$,显式记录物体状态、接触、碰撞与事件结果;(4) 渲染/投影——Render 得预测 RGB 帧 $\hat X$,Project 得 $(\hat D,\hat M,\hat Q)$;(5) 验证——SelectFrames 选关键帧,CompareAndDiagnose 逐帧比对得 $\delta$ 并聚合为 $\Delta$;(6) 接受判定——Accept 则返回 $(p,z)$,否则继续,预算耗尽则拒绝;全程用 $z$ 记录每轮假设与验证结果。文本世界获得后再经 Wan2.2-VACE 与内部视频生成模型做 sim-to-real 渲染。仿真器侧支持动画引擎(运动学轨迹描述)与物理引擎(力学、接触、约束推导运动)两种共享同一接口的可互换后端,Figure 13 展示了真实的 scene.json 与 SDK 代码。
技术新颖性
技术新颖性体现在四个层面。表示层面:系统论证了像素、3D、语言三类表示的互补与缺陷(细节/结构/语义各据一角但分别缺失结构、机制、连续量),提出用代码统一承载语义、结构与连续物理量,并给出 MuJoCo 上 scene.json + SDK 的工程实现。方法论层面:把世界表示从“预测问题”重构为“智能体发现问题”,与已有的代码世界模型、程序化场景生成路线不同——那些工作主要处理静态结构或虚拟环境,本文处理的是从真实含噪观测抽象物理机制这一更难的反问题。系统层面:动画/物理双引擎共享同一接口,使证据与引擎可灵活配对;验证指标(Visual Alignment 融合轮廓/深度/RGB 加权,Traj-ADE、Accuracy@2%D)独立于循环内部的验证信号,避免自我评价失真。应用层面:验证过的 EWR 直接产出带精确世界坐标标签的 VQA 数据(1,585 条文本驱动 + 988 条视频驱动),用 GRPO 以数值精度奖励训练 VLM,形成“表示发现→数据生成→模型训练”的完整闭环。
实验结果
核心结果在 QuantiPhy-validation(159 道带真值的定量问答,按 2S/2D/3S/3D 四个子集取宏平均 MRA)。Table 1 显示:Code-as-World-VL-27B(Reasoning)平均 58.6(2S 48.7、2D 62.4、3S 60.5、3D 62.8),超过所有专有与开源模型;9B 直接回答版 55.4(2S 55.0、2D 52.9、3S 55.6、3D 58.1)已超过最强专有基线 Gemini-3.1 Flash(54.8);4B 版 50.6 领先开源最佳 Qwen3-VL-32B(40.2)约 10.4 分,也超过 ChatGPT-5.1(48.4)。Figure 9 展示参数量与 MRA 的 scaling 关系。Table 3 的图像空间评测中,9B 完整版在 RefCOCO 68.3、RefCOCOg 65.6、RefCOCO+ 66.4、RefCLEF 61.9、GOT-10K 26.6,全面超过 MiniCPM-V 4.5(RefCOCO 55.6)与 Qwen3-VL-32B(49.1/15.8),且世界空间训练反哺图像测量能力(完整版优于仅第一阶段版本)。Figure 5 显示 5 轮智能体发现在匹配预算下于 Visual Alignment、Object IoU、Traj-ADE、Accuracy@2%D 上优于 Best-of-5;Figure 11 证明换用物理引擎后结论不变且五项指标全部占优。Table 4 数据源消融:4B 从仅图像空间的 44.2 提升到全量 50.6,9B 从 50.9 到 55.4,证明文本驱动(精确监督)与视频驱动(真实分布)互补。Table 2 显示 sim-to-real 后 JEDi 从 3.000 降到 1.484、TRAJAN 从 406.87 降到 185.32(更接近真实分布),而 Traj-ADE 基本不变(1.682→1.677)、Accuracy@2%D 仅从 78.81 降到 77.49,即视觉逼真化不以牺牲运动保真为代价。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| QuantiPhy-validation 定量物理推理(宏平均) | MRA | 58.6(Code-as-World-VL-27B Reasoning) | Gemini-3.1 Flash:54.8 | +3.8 |
| QuantiPhy-validation(9B 直接回答档对比) | MRA | 55.4(Code-as-World-VL-9B) | Gemini-3.1 Flash:54.8;ChatGPT-5.1:48.4 | +0.6(超过全部专有模型) |
| QuantiPhy-validation(4B 对开源模型) | MRA | 50.6(Code-as-World-VL-4B) | Qwen3-VL-32B-Instruct:40.2 | +10.4(8 倍参数差距下反超) |
| RefCOCO 图像空间物体尺寸测量 | MRA | 68.3(Code-as-World-VL-9B) | MiniCPM-V 4.5:55.6 | +12.7 |
| GOT-10K 视频运动量测量(速度/加速度) | MRA | 26.6(Code-as-World-VL-9B) | Qwen3-VL-8B-Instruct:18.9 | +7.7 |
| 文本驱动 sim-to-real 视频分布真实性 | JEDi MMD(越低越好) | 1.484 | 仿真器直接渲染:3.000 | 降低约 50.5% |
局限与改进
作者明确承认两点:其一,真实环境的物理条件极其复杂,即使看似简单的刚体运动也对地形、接触几何、材料属性等隐因素敏感,当底层过程超出仿真器建模范围时,发现循环可能收敛到“局部合理”但机制上并不准确的 EWR;其二,QuantiPhy 只覆盖物理理解的一个小子集——单目尺度校准下的尺寸、位移、速度、加速度,且运动设置相对受限,未涉及相机运动、旋转、形变、遮挡、流体、刚体长时程多物体动力学;此外 Code-as-World-VL 只学习已验证可执行世界产生的结果监督,假设构造、仿真、诊断与迭代修正仍外置于模型。我的补充观察:世界级训练数据规模很小(1,585+988 条 VQA),评测集仅 159 题,宏平均下的小差距未必统计显著;基线中的异常值(如 ChatGPT-5 Pro 仅 19.5、MiniCPM-V 4.5 在 3S/3D 得 0.0)暗示数值答案解析脆弱可能影响对比公平性;27B 版本同时改变了模型规模与推理协议,其提升无法单独归因于推理链本身;视频驱动抽象在数据过滤阶段就排除了大幅相机运动与严重剪辑的视频,对真实复杂场景的适用范围存疑。
独立分析的弱点
独立分析至少有五个弱点。第一,感知链路依赖外部模型(SAM3、VGGT-Omega、SAM3D、CoTracker),深度与分割误差会直接传播进 EWR,在长视频、运动模糊或透明物体场景会被放大,改进方向是把感知不确定性显式编码进验证判据而非只比对中值误差。第二,发现循环在固定预算 $K=5$ 内从单一假设出发贪心修正,容易陷入局部最优(作者亦承认),可引入多假设并行搜索或基于不确定性的探索策略。第三,GRPO 奖励以数值相对误差为主而世界级数据仅约 2,573 条,存在奖励劫持与过拟合评测分布的风险,可扩充数据规模并引入过程级验证,例如要求模型预测仿真器状态再比对。第四,物理 regime 局限于刚体动力学,碰撞形变、流体、摩擦生热等常见现象无法表达,正如作者在 7.1 节所述需要接入流体、可变形体等专业仿真器并让编码智能体学会正确组合调用。第五,训练与评测中的世界尺度依赖数据集提供的参考量先验,模型并未学会在无参考物时主动估计真实尺度,开放场景应用可能失效,可加入无参考尺度推断或跨视频尺度一致性训练。
未来方向
作者提出的方向包括:把范式扩展到更广的物理现象——流体、布料与可变形体、燃烧、断裂、弹塑性、气体动力学,让代码成为连接数十年图形学与计算物理成果的通用接口;以及更广的物理能力——用可执行世界训练模型进行实体接地、物理关系推断、自我验证的推理,为视频生成器提供维护物体身份与几何的持久状态以实现物理一致的长时程生成,支撑 System-2 式的具身智能体在执行前构建显式世界模型、推演候选动作的未来后果。基于本文成果还可延伸:把发现循环内化为模型原生能力,例如训练 VLM 直接调用仿真器并从验证反馈的强化信号中学会“做实验”;用过程奖励监督推理轨迹中的测量与校准步骤,而非只用最终数值的结果奖励;把 EWR 作为可验证奖励来源扩展到干预预测与反事实推理任务;以及把视频驱动抽象与在线感知结合,使机器人能在部署过程中持续构建、修正并复用世界模型。
复现评估
复现条件总体较好但有关键缺口。代码已在 GitHub 开源(mirros-lab/code-as-world),评测基于开源的 QuantiPhy-validation(159 题)与公开的 RefCOCO/RefCOCO+/RefCOCOg/RefCLEF、GOT-10K;训练配置披露充分:4B/9B 用 8 张 NVIDIA H100,两阶段课程(先 SFT 后 GRPO),27B 用 AdamW 学习率 $5\times10^{-6}$、权重衰减 0.01、每 prompt 16 个 rollout、全局 batch 16、bf16、评测取第 60 步检查点,采样温度 1.0、top-p 0.95、最大 6,144 token,所有模型统一采样 16 帧输入。数据统计也公开:图像空间 73,335 条 QA(GOT-10K 派生 46,763 条 + 指称数据集派生 26,572 条),世界级 1,585 条文本驱动 + 988 条视频驱动。主要缺口在于数据管线依赖 SAM3、VGGT-Omega、SAM3D、Wan2.2-VACE 和一个未公开的“内部视频生成模型”,且语言规范与视频筛选都有人工审核环节,端到端重建世界级数据难度较高。总体判断:用官方代码与公开数据复现模型训练和评测属中等难度,完整复现数据生成管线属中高难度。
论文图表
总览图:一个由 JSON 代码定义的三球场景(含 objects 的质量字段、右手坐标系与米制单位、mesh 与碰撞配置等),同一可执行世界支撑三类下游应用——接地物理推理(求蓝球离开斜坡时的速度,答案 0.7 m/s)、物理一致的视频生成(改变速度、质量做反事实推演)、具身智能(预判红色下落小球的轨迹并提前移动到正确位置)。
一图说明“代码即世界”的表示要素与三大应用方向,是理解论文定位的最佳入口。
并列对比像素/视频、3D 重建、自然语言与 Code-as-World 四类表示:像素细节丰富但无结构(观测成因歧义),3D 有几何结构但无机制,语言紧凑有语义但无连续状态;代码同时具备结构、连续量、语义与物理机制,图中还展示多米诺骨牌的可执行代码片段(质量 0.12、惯量对角 [0.008,0.006,0.002]、盒形碰撞、摩擦 [0.95,0.02,0.003] 等)。
清晰呈现论文的问题动机与代码表示相对三类既有表示的差异化优势。
五个指标随循环轮次(1–5 轮)的变化曲线,实线为智能体循环(从第 1 轮 one-shot 起步),虚线为匹配预算的 Best-of-5:Visual Alignment、Object IoU、Accuracy@2%D 随轮次上升,Traj-ADE、Velocity-ADE 下降,且在五次评估的匹配预算下多数指标优于 Best-of-5。
定量证明迭代发现比独立采样更有效利用算力,是发现循环有效性的核心实验证据。
伪代码:输入证据 $\xi$、LLM 智能体 $A$、迭代预算 $K$;先按模态构造证据 $\eta$(文本走 InterpretText,视频走 Depth/Segment/Track 得 $\eta=(\xi,D,M,Q)$),然后循环 $K$ 次:ModifyEWR 提出/更新 $p$→CompileEWR 得 $\theta$→RunSimulation 得轨迹 $\tau$→Render/Project 得预测证据→对选定帧 CompareAndDiagnose 聚合 $\Delta$→Accept 判定,返回验证通过的 EWR 或拒绝,并全程记录假设与验证轨迹 $z$。
方法的精确形式化描述,是实现与复现发现循环的权威依据。