PhiZero:围绕物理语言构建的物理世界模型 PhiZero: A World Model Built Around Physical Language
从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
前置知识
物理世界模型 (Physical World Model)
一类旨在模拟真实物理世界如何随时间演化的生成模型,输入当前画面(首帧)和动作/文本条件,输出未来视频。与单纯追求画质不同,它强调生成的状态转移要符合物理规律(碰撞、重力、流体、光学等)。
读懂本文需要理解作者为何批评现有视频世界模型'只学像素、把动力学埋在高维预测器里',进而引出'把世界演化显式化'这一动机。
Finite Scalar Quantization (FSQ)
一种将连续特征离散化的方法:把特征投影到低维空间,每个维度按预设标量级别取整(本文用 $(8,5,5,5,5,5)$,词表大小 $K=8\times5^5=25000$)。它用笛卡尔积构造词表,无需单独学习码本,训练稳定且避免 codebook collapse。
它是把转移特征变成离散'物理语言单词'的关键算子,决定了表示的容量与稳定性。
Q-Former
一种基于可学习 query 的跨注意力模块(最初用于 BLIP-2)。本文用共享的 transition-level Q-Former,对相邻两个潜在状态 $(x_i,x_{i+1})$ 联合注意,抽取 32 个转移特征,专门建模'变化'。
理解'局部时间归纳偏置'与'只编码状态转移而非外观'的设计需要先了解 Q-Former 的工作方式。
Flow Matching / 扩散模型
本文扩散解码器用 flow-matching 目标训练:构造 $x_\tau=(1-\tau)x_0+\tau\epsilon$,学习速度场 $v_\psi$ 去匹配 $(\epsilon-x_0)$,即 $\mathcal{L}_{\text{FM}}=\mathbb{E}\,\lVert v_\psi(x_\tau,\tau;I_0,P_c)-(\epsilon-x_0)\rVert^2$。
理解渲染路径如何把紧凑物理语言条件 + 首帧还原成高保真视频,以及为何预训练生成先验能补全细节。
视觉语言模型 VLM (Vision-Language Model)
在大规模图文数据上预训练、能同时理解图像与文本并自回归生成 token 的模型。本文用 Qwen3-VL-4B 初始化 Reasoner,复用其视觉语义与常识先验来预测物理语言序列。
本文把 VLM 的显式符号推理能力嫁接到物理世界建模,这是理解 'reason-then-render' 的关键。
研究动机
当前主流的物理世界模型(如 Cosmos、Sora、Wan、Veo 等)主要通过在像素空间直接预测未来视频来学习世界动力学。这种做法把世界的演化规律隐式地埋藏在高维视觉预测器内部,导致模型虽然能生成视觉上逼真的画面,却常常产生物理上不一致的结果。例如在论文的定性实验中,Wan2.2-5B 在“网球撞击橡皮鸭”场景里让橡皮鸭纹丝不动,完全不产生碰撞应有的位移;重力下的形变、连锁反应、动态阴影等下游物理后果也经常缺失。与此同时,自然语言虽是大语言模型成功的基石,但它过于粗糙,无法忠实刻画视觉经验中复杂、连续、细粒度的状态转移(如液体流动、弹性形变、光线变化)。世界模型若要支撑 Physical AI,就必须从“看起来对”提升到“物理上对”,而像素空间的端到端预测恰恰难以显式地建模与约束这种物理正确性。
本文的目标是本文目标是构建一个真正围绕“世界如何演化”来组织的物理世界模型。具体来说,作者希望从大规模无标注的野外视频中,通过自监督方式学习出一种紧凑、离散、可被显式推理的“物理语言”(physical language)——它专门刻画相邻世界状态之间的转移模式,并与视觉外观解耦。在此表示之上,PhiZero 采用“先推理、后渲染”(reason-then-render)范式:先用一个推理器根据当前画面与动作意图预测出未来的物理语言序列,再用扩散解码器把该序列渲染成视频。这样世界演化本身成为显式的推理目标,而非像素预测的副产物。作者还希望物理语言能成为一个通用接口,既能做物理视频生成,也能做物理合理性判别,甚至支持细粒度动作控制、交互式滚动以及跨本体/跨域的零样本迁移。
与已有工作不同的是,本文的独特切入点是“把人类的认知机制显式建模出来”。人类并不会逐像素记忆视觉结果,而是从视觉经验中抽象出可泛化的演化规律,并用语言组织、显式推理。已有工作要么直接在像素空间做生成(动力学隐式),要么从视频中学习与特定任务/本体绑定的潜在动作(latent action),要么借助物理仿真器注入显式约束或预定义物理变量。PhiZero 则另辟蹊径:它不依赖仿真器、不绑定特定本体,而是从开放域野外视频里自监督地学一种通用的、外观无关的“状态转移语言”,并把它同时当作生成目标和理解判据。这种“学一种面向物理世界的‘语言’、再用 VLM 推理它”的视角,把世界模型从纯视觉生成推向显式物理推理,是区别于既有路线的本质创新。
核心方法
PhiZero 的整体思路可类比“人类看视频→抽象出规律→用语言推理→再想象出画面”。技术上也分成推理与渲染两条路径,核心是把未来建模分解为 $p_{\theta,\psi}(V,z\,|\,I_0,c)=p_\theta(z\,|\,I_0,c)\,p_\psi(V\,|\,I_0,z)$,其中 $I_0$ 是首帧(当前世界状态)、$c$ 是文本动作意图、$z$ 是离散物理语言、$V$ 是未来视频。渲染路径由“物理语言 Tokenizer + 扩散解码器”组成:Tokenizer 把一段视频的状态转移压缩成离散符号序列,扩散解码器在首帧与该序列条件下重建/生成视频;推理路径由“物理语言 Reasoner”组成,它用预训练 VLM 从首帧和动作意图自回归地预测物理语言序列。两阶段训练、数据课程与纯噪声预热等技巧共同保证物理语言既紧凑又富含动力学信息。最终该表示天然成为生成、判别、控制、迁移的统一接口。
核心创新是“物理语言”这一中间表示及其配套的“先推理后渲染”范式,与已有方法有本质区别。第一,Tokenizer 不像普通视频分词器那样压缩整段视频外观,而是用 transition-level Q-Former 专门建模相邻潜在状态之间的转移,并借 FSQ 把每个转移离散化,从而让瓶颈只编码“变化”而非静态外观。第二,外观信息由干净的首帧直接供给,扩散解码器(Wan2.2-5B)的预训练生成先验负责补全高频细节,二者合力使仅 256 个离散符号就足以表达 33 帧、$512\times896$ 分辨率视频的状态演化。第三,用预训练 VLM(Qwen3-VL-4B)做 Reasoner,复用其视觉语义与常识先验来“读懂”画面和动作意图,再预测物理语言——这把 LLM 的显式符号推理能力嫁接到了物理世界建模上。这种“离散转移语言 + VLM 推理 + 扩散渲染”的组合是全新的。
方法步骤详情
训练分四步。(1) 数据:约5万小时野外视频+1千小时仿真视频,经去重与画质/分辨率/时长/转场过滤得约1万小时预训练数据;再以美学、运动幅度、VLM可观测性二次过滤并入仿真,得约500万条4秒片段(Tokenizer SFT与Reasoner预训练)及约100万条运动丰富片段(Reasoner SFT)。(2) 训练Tokenizer:视频经Wan2.2 VAE编码,对每对相邻潜状态用共享Q-Former(32 query)抽转移特征,FSQ(级别$(8,5,5,5,5,5)$、词表25K)离散化,33帧编码成长度$(9-1)\times32=256$的物理语言序列;扩散解码器以首帧为干净条件、以物理语言为条件,用flow-matching损失$\mathcal{L}_{\text{FM}}=\mathbb{E}\lVert v_\psi-(\epsilon-x_0)\rVert^2$重建,配合纯噪声预热与时空课程($1\to2\to4$秒、$256\times448\to512\times896$)。(3) 训练Reasoner:冻结Tokenizer离线编码得目标序列,初始化自Qwen3-VL-4B并扩展词表,以首帧+VLM高层动作描述为输入,用自回归交叉熵$\mathcal{L}_{\text{VLM}}=-\sum_j\log p_\theta(z_j|I_0,c,z_{<j})$训练,分预训练(500万)与运动SFT(100万)两阶段。(4) 推理:首帧+意图经Reasoner出物理语言序列,再由冻结解码器渲染成视频;判别则比较两段视频的物理语言似然。
技术新颖性
新颖性体现在多处工程与建模决策的协同。首先是 transition-level Q-Former 的“局部时间归纳偏置”:相比把整段视频压成全局表示,显式建模相邻状态对既降低每次压缩复杂度又保留时序顺序,消融显示去掉它 PSNR 从 28.9 降到 28.2。其次是“外观/动力学解耦”机制:首帧承载静态外观、扩散先验补细节、离散瓶颈只学转移,使同一物理语言可换不同首帧复用(迁移实验 Fig.5 验证),并让 UMAP 投影自然形成按运动模式组织的流形(Fig.6)。第三是纯噪声预热,阻止解码器依赖预训练去噪先验而忽略物理语言条件,去掉它 PSNR 降到 27.9。第四是用 VLM 做 Reasoner 而非从头训练,复用大规模图文知识;同时设计“只描述发起动作、不剧透细节”的标注 prompt(Table 14),避免文本条件泄露结果。整体上把生成式视频分词器、VLM 自回归推理、扩散渲染三者统一在物理语言这一接口下,是体系级的创新。
实验结果
PhiZero在三大生成与三大理解基准全面领先。生成侧:Physics-IQ Verified(Table 1)IQ-Score 41.2居首,超Cosmos3-Super(39.5)、Grok-Video(34.8)、Wan2.2-14B(32.2),S-IoU 58.2、ST-IoU 36.8最高;PhyGround(Table 2)Physics 3.01、Overall 2.97双第一,超Veo3.1(2.93)与Wan2.2-14B(2.95);WorldModelBench(Table 3)Total 8.19、Physics Adherence 4.88双第一。理解侧:IntPhys2(Table 4)Overall 56.34超Gemini-2.5 Flash(55.63)、GPT-4o(53.75);LikePhys(Table 5)平均错误率41.7最低,刚性体29.14尤为突出;YoCausal(Table 6)聚合排名2.0最优、CCI 6.20最高。重建侧(Table 7),仅256个离散token取得PSNR 28.9、SSIM 0.903,远胜VideoFlexTok(k=64, 576 token, 26.5),而Wan2.2 VAE需44800连续token。消融(Table 8/9)证明扩散解码器、transition Q-Former、纯噪声预热、仿真数据、两阶段训练缺一不可;纯prompt增强的Wan2.2-5B仅26.6,远低于完整41.2,说明自然语言推理不足以替代物理语言。Fig.4显示PhiZero能补出基线缺失的碰撞位移、重力形变、连锁反应与动态阴影。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Physics-IQ Verified 物理结果保真度 | IQ-Score ↑ | 41.2 | Cosmos3-Super 39.5 / Wan2.2-14B 32.2 | 相对最强对手 Cosmos3-Super +1.7,且 S-IoU/ST-IoU 同时居首 |
| PhyGround 物理定律遵循 | Physics Score ↑ / Overall ↑ | 3.01 / 2.97 | Veo3.1 2.85 / 2.93 | Physics Score +0.16,Overall +0.04,双项第一 |
| WorldModelBench 通用世界建模 | Total ↑ | 8.19 | Runway 8.08 / Wan2.2-5B 7.98 | Physics Adherence 4.88 与 Common Sense 1.71 均最高 |
| IntPhys2 直觉物理理解 | Overall ↑ | 56.34 | Gemini-2.5 Flash 55.63 / GPT-4o 53.75 | +0.71,Medium 子集 60.50 提升最明显 |
| LikePhys 物理合理性判别 | Avg. Error ↓ | 41.7 | CogVideoX1.5-5B 43.8 / Wan2.1-14B 43.8 | 刚性体错误率 29.14 最低,整体 -2.1 |
| YoCausal 真实因果理解 | Agg. Rank ↓ | 2.0 | Wan2.1-14B / Wan2.2-14B 3.5 | CCI 6.20 最高,聚合排名最优 |
| Tokenizer 视频重建 | Tokens / PSNR ↑ | 256 / 28.9 | VideoFlexTok k=64:576 / 26.5 | 用更少 token 取得更高保真(SSIM 0.903) |
局限与改进
作者在附录 E 坦承三点局限。其一,物理语言目前是对状态转移的经验性表示,而非符号化的物理定律,离散符号尚未直接锚定到可解释的物理变量或形式化定律,因此缺乏可解释性与可干预性。其二,由于主要从观测视频学习,覆盖范围受限于“视觉可观测”的内容,触觉交互、微观粒子动力学等难以从视觉获取的转移较难建模(如 LikePhys 中流体类错误率仍高达 53.15)。其三,受数据和算力所限,当前模型规模和训练语料相对物理世界的多样性仍偏小。我个人额外观察到:理解类任务采用“似然比较”协议,依赖物理语言似然作为代理指标,可能对长序列累积误差敏感;生成仍限定在固定 4 秒片段,长时段一致性需滑窗拼接,误差易累积;部分理解指标虽居首但绝对优势不大(如 IntPhys2 Hard 仅 52.38),说明“物理直觉”远未饱和。
独立分析的弱点
弱点一:物理语言可解释性不足。当前离散符号是数据驱动的,难以对应到速度、力、接触等物理量。改进方向:引入物理变量对齐(如与光流、深度、接触图做对比学习)或可微分物理约束,让符号部分锚定到可解释量。弱点二:视觉可观测性限制导致流体、柔性体、触觉类误差偏高(LikePhys 流体 53.15)。改进方向:引入多模态感知(触觉、力觉)或仿真器生成的稠密物理监督补足不可观测量。弱点三:固定 4 秒片段 + 滑窗拼接,长时段一致性差、误差累积。改进方向:层级化或循环式物理语言预测,显式建模场景状态演化。弱点四:Reasoner 依赖 VLM 生成的高层动作文本,文本歧义可能误导推理(如 YoCausal 用相同文本配正反视频)。改进方向:直接以数值化轨迹/动作作为条件(论文在驾驶/机器人中已部分这么做),减少文本中介。弱点五:评测多用代理指标(似然)或 VLM 评判,可能与人类物理直觉存在偏差,建议引入更多真值物理实验对照。
未来方向
作者提出的方向包括:一是把物理语言作为显式中间表示,提升 VLM 的时空理解能力并为具身策略提供更有效的规划;二是利用其跨外观/跨本体可迁移性,把大规模人类视频中的状态转移迁移到机器人本体,缓解真实机器人交互数据稀缺;三是突破固定时长片段,用层级化或循环预测实现长时段、时序一致的世界建模;四是用更强骨干、更多算力和更大多样化语料继续扩展。基于成果我认为还可延伸:将物理语言与可微分物理引擎/神经辐射场结合做可干预的因果推理;把物理语言作为奖励信号或世界模型用于强化学习与模型预测控制;探索物理语言的多本体统一(人、人形机器人、灵巧手共享一套转移符号),以及向触觉、声学等非视觉模态扩展,真正逼近“通用物理世界语言”。
复现评估
复现难度较高但路径相对清晰。有利因素:骨干为开源的 Wan2.2-5B(扩散解码器)与 Qwen3-VL-4B(Reasoner);FSQ 配置(级别 $(8,5,5,5,5,5)$、词表 25K)、Q-Former(32 query)、训练课程($1/2/4$ 秒、$256\times448\to512\times896$)、学习率($2\times10^{-5}$)、损失权重(entropy 0.005、REPA 0.1)、LoRA rank 32 等关键超参均给出,数据来源(OpenVid-1M、Kinetics-710、SSV2、nuScenes、AGI-Bot RealRobot、LIBERO)多公开,标注 prompt(Table 14)已披露。不利因素:约 5 万小时自有数据未开源;各阶段均用 128 张 A100、训练步数达数十万,算力门槛高;VLM 判定的过滤阈值不全;理解评测依赖各基准官方评测器。综合:架构可复现,但完整复现顶级指标需大量算力与数据工程,社区更可能基于小规模子集验证思路。
论文图表
对比人类智能(从视觉经验抽象出规律并用自然语言推理)与 PhiZero(从野外视频学得物理语言、在物理语言中推理),并展示物理逼真视频生成、动作条件下的驾驶/机器人世界模型、以及向 G1 人形机器人和 Sharpa 灵巧手的零样本动作迁移等下游应用。
一张图讲清'为什么学物理语言'以及'它能干什么',是理解全文动机与贡献的最佳入口。
把源视频状态转移编码成物理语言,再用编辑过的、外观不同的首帧解码同一序列,迁移视频在物体/背景大改下仍保留倒水、黏性铺展、液体流动等演化模式。
证明物理语言实现了外观与动力学的解耦,是迁移/零样本应用的理论基础。
把转移特征聚合成片段级表示,PCA 降到 20 维再用 UMAP 投到 3D。自动驾驶中静止片段成独立簇、不同转向沿连续流形分布;机器人操作中四种夹爪转移模式形成紧凑可分簇。
证明离散符号确实编码了有意义的运动语义而非随机编码,支撑'语言'这一命名。
包含逼真通用生成(海浪拍岩、倒咖啡、热油溅落、铁罐爆炸)、轨迹条件驾驶、动作条件机器人操作、以及序列控制下的交互式滚动。
展示物理语言作为统一接口的多任务应用潜力,呼应 broader applications 一节。