Apple-π:评测视频模型基于物理定律的物理智能基准 Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
首个将视频物理推理锚定到物理定律并分阶段诊断的基准
前置知识
世界模型(World Model)
世界模型指能够内部化物理世界规律、从而预测或模拟现实演化的系统。在大规模视频上训练的视频生成模型被认为可能通过隐式吸收几何、运动、因果性等规律,逐渐涌现出对物理世界的内部掌握,从而成为世界模拟器。核心争议在于:模型究竟是真正理解了支配性的物理定律,还是仅仅在重播视觉上的表面规律。
本文正是要检验视频模型是否真的是基于物理定律的世界模型,理解这个概念才能把握论文要回答的核心问题。
思维链与视频思维链(Chain-of-Frames)
思维链(Chain-of-Thought)从纯文本推理,扩展到带图像的思维(thinking with image),再发展到带视频的思维(thinking with video)。其中 chain-of-frames 把逐帧视频生成类比为逐步文本推理,即模型通过一帧一帧地生成视频来外显其推理过程。Apple-π 借此让模型的物理思维变成可见、可审计的帧级推理轨迹。
这是 Apple-π 评估范式的基石:通过 chain-of-frames 提示让模型把物理推理过程以视频形式可视化,才能逐阶段审计它在哪里出错。
统一理解-生成模型(Unified Understanding-Generation Model)
统一模型同时具备视觉理解(如看图回答、OCR、分割)和视觉生成(如根据指令画图/生成视频)两类能力,相比纯视频生成模型显式耦合了理解与生成。本文将其作为架构对照组,用以探究显式的理解模块是否能提升基于物理定律的物理智能。
论文的关键结论之一是统一模型(如 GPT Image 2、Nano Banana 2)显著优于纯视频模型,理解这一架构差异是解读实验结果的前提。
基于定律的物理推理(Law-Grounded Physical Intelligence)
区别于亚里士多德式对自然现象的直觉描述,牛顿式科学推理强调:先感知物理量,再抽象出支配定律,最后用定律推导未来动力学。本文把这一轨迹变成可评测协议,要求模型能读出物理量、识别支配定律(如自由落体 $h=\tfrac12gt^2$、动量守恒、牛顿第一定律 $\sum\vec F=0$),并生成与定律一致的动态。
这是论文标题与立意的核心:评估的不是看起来是否合理,而是模型是否通过忠实的、基于定律的推理过程得到结果。
MLLM 裁判与物理客观指标(MLLM Judge & Physics-Law Metric)
MLLM 裁判指用多模态大模型(本文用 Gemini 3 Flash)配以赛道相关的评分细则(rubric),对内容的正确性、格式合规性等主观维度打分;而物理客观指标则是把模型输出与物理推导的真值做对照,如分割 IoU、像素级保真度、时空掩码重叠和三维速度误差。两者结合构成混合评估套件。
理解评估方式才能读懂主结果表中的分数含义,以及为什么能把模型失败定位到具体的推理阶段。
研究动机
现有物理智能基准存在一个根本缺陷:它们只评估模型输出了什么,从不验证模型是如何得到该输出的。如表 1 所示,理解类基准(PhysBench、QuantiPhy、PhyX)主要做多领域 QA,而生成类基准(VideoPhy-2、PhyWorldBench、WorldModelBench、PhyGenBench 等)要么通过人类评分、要么用像素级指标来衡量物理合理性。这些方法都无法区分模型是真用了物理定律,还是只产出了看起来对的结果。当模型成功时,无法判断它是否真正调用了物理定律;当它失败时,也无法判断是读错了场景、误判了定律,还是在推导环节出错。更关键的是,没有任何一个基准同时做到 Law-Grounded、Multi-Stage、Chain-of-Frames 和客观物理度量四项,无法回答最重要的问题:视频模型能否像牛顿那样基于定律推理物理世界。
本文的目标是本文的目标是构建首个将评估显式锚定到物理定律的视频模型基准 Apple-π,把牛顿式科学推理(感知→公式化→推导)转化为一个可审计的视频生成协议。具体而言,作者希望提供三样东西:一是覆盖经典力学 10 个任务的 Orchard 数据集;二是基于感知、公式化、推导三阶段并细分为五个子轨的基准协议,让模型逐阶段展示其物理思维;三是混合 MLLM 主观打分与物理定律客观度量的评估套件,从而不仅能判断模型是否失败,还能诊断它在哪里失败。最终目标是量化当前视频模型距离可靠的基于定律的世界模拟器还有多远。
与已有工作不同的是,本文的独特切入角度在于把焦点从 what(模型输出了什么)转向 how(模型怎么推理)。与所有此前基准不同,Apple-π 把物理推理过程外化为可见的帧级推理轨迹:通过 chain-of-frames 提示让模型逐帧生成视频,作为其可视化的思考链,从而可被逐阶段审计。同时,它用 infographic 式标注首帧来绑定每个物理量与其视觉指代物,刻意剥离了指代消解负担,使评估聚焦于基于定律的运动推理本身。这种法律锚定、阶段分解、混合主客观评估三者结合的设计,是现有任何基准都没有做到的(见表 1 中 Apple-π 是唯一四项全勾的方法)。
核心方法
Apple-π 的整体思路是:先用定律优先的方式构建可控、可分析的视频数据集 Orchard,再用牛顿式科学推理的三阶段框架设计评测协议,最后用混合评估套件定位失败位置。Orchard 包含 400 个视频,来自仿真(243 例,NVIDIA Isaac Sim 生成)、自录真实视频(121 例)和互联网视频(36 例)三个互补来源,覆盖 10 个经典力学任务,并按单定律/多定律两级分类。协议将每个案例沿感知、公式化、推导三个阶段评测,前两者各分文本/图形两个子轨,共 5 个子轨。所有子轨共享输入格式(标注首帧 + chain-of-frames 提示)和输出格式(生成视频作为推理轨迹),并统一在 [0,1] 区间打分。
核心创新是把牛顿式科学推理的三阶段——感知物理量、公式化支配定律、推导定律一致的动力学——显式映射成可审计的视频生成任务。每个子轨都有明确的输入和期望输出:感知-文本要求复现标注数值(类似 OCR),感知-图形要求定位物体(类似实例分割),公式化-文本要求在四选一中选出支配定律,公式化-图形要求预测目标时刻 $t^*$ 的状态,推导要求生成整段与定律一致的运动轨迹。这与已有方法的本质区别在于:它不是评估输出看起来是否物理合理,而是把推理链拆解开来逐阶段检验,使模型的物理思维过程首次变得可观测、可定位。
方法步骤详情
方法分三个耦合组件。第一步构建 Orchard:按三大单定律支柱组织——万有引力(自由落体 $h=\tfrac12gt^2$、抛体 $\vec r(t)=\vec r_0+\vec v_0t+\tfrac12\vec gt^2$、斜面 $a=g\sin\theta$、重力圆周 $mg=mv^2/r$)、动量守恒(完全弹性 $e=1$、完全非弹性 $e=0$、非弹性 $0<e<1$ 碰撞)、牛顿第一定律(静止、匀速直线 $\sum\vec F=0$),外加多定律复合分支;物体统一为球、立方体、圆柱、圆锥四种基本几何体以控制混淆变量。第二步执行评测协议:给模型一张 infographic 标注首帧和 chain-of-frames 提示,分别在 5 个子轨上生成视频或最终帧答案(含淡出到白底或保留原场景两种形式)。第三步评估:MLLM 裁判用赛道相关 rubric 主观打分,并在可匹配真值时计算分割 IoU、像素保真度、时空掩码重叠、三维速度误差等物理客观度量,每个子轨分数按组分加权平均。每模型测试 400 案例×5 子轨×3 次 rollout=6000 个响应。
技术新颖性
技术新颖性体现在四点结合。其一,定律锚定:每个案例围绕显式的经典力学定律和物理指定条件组织,而非含混的真实现象,使失败可归因。其二,阶段分解:把推理链拆成感知-公式化-推导五子轨,首次实现逐阶段诊断,能区分读错场景、误判定律还是推导出错。其三,chain-of-frames 评估范式:把视频生成当作可见的推理轨迹来审计,而非只看最终输出的合理性。其四,混合评估:MLLM 主观评分负责内容/格式等视觉质量,物理客观度量负责定律一致性,互补覆盖所有子轨。表 1 证实这是首个同时满足 Law-Grounded、Multi-Stage、Chain-of-Frames、客观物理度量四项的基准,填补了现有工作的关键空白。
实验结果
作者在 11 个模型上评测,结果见表 2。最关键的发现是:当前视频模型远未成为可靠的基于定律的世界模拟器,最好的视频模型 Seedance 2.0 平均仅 0.473,而 Wan2.2 为 0.267、HunyuanVideo-1.5 仅 0.177、Veo 3.1 为 0.313、VBVR-Wan2.2 为 0.373。相比之下,统一模型显著更强:GPT Image 2 达 0.704、Nano Banana 2 达 0.699,在感知和公式化轨道尤其领先。第二,存在清晰的推理漏斗:从感知→公式化→推导难度递增,例如 Seedance 2.0 在感知-文本为 0.597、公式化-文本 0.478、推导仅 0.315,说明早期成功并不能保证后续正确。第三,多定律(Multi)普遍难于单定律支柱,反映模型难以在定律切换时传递物理状态;第四,存在持续的 Sim-to-Real 差距,真实案例得分普遍低于仿真案例(如 Seedance 2.0 仿真 0.487 vs 真实 0.459)。统一模型即便更强,在推导上也只约 0.40,表明定律一致的时序动态仍是核心瓶颈。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Apple-π 整体平均(11 模型,400×5×3=6000 响应/模型) | 平均分 [0,1] | 最强视频模型 Seedance 2.0=0.473;最强统一模型 GPT Image 2=0.704、Nano Banana 2=0.699 | Wan2.2=0.267、HunyuanVideo-1.5=0.177、Veo 3.1=0.313、BAGEL=0.218、OmniGen2=0.214 | 统一模型较纯视频模型提升明显(如 GPT Image 2 较 Seedance 2.0 高 +0.231),显示显式理解对基于定律的物理智能有重要作用 |
| 阶段级诊断(感知/公式化/推导) | 各子轨分 [0,1] | Seedance 2.0:P-T=0.597、P-G=0.490、F-T=0.478、F-G=0.485、Ded.=0.315 | Nano Banana 2:P-T=0.934、P-G=0.667、F-T=0.841、F-G=0.650、Ded.=0.405 | 揭示推理漏斗——推导是所有模型的最大瓶颈,即便最强统一模型推导也仅约 0.40 |
| 支柱级与来源级泛化(单/多定律、仿真/真实) | 支柱分与来源分 [0,1] | Seedance 2.0:Multi=0.495(低于单定律 Grav.=0.450、N1=0.510);Sim.=0.487、Real=0.459 | Wan2.2:Multi=0.344、Sim.=0.310、Real=0.224 | 量化了多定律状态传递困难和 Sim-to-Real 差距两个关键局限 |
局限与改进
作者承认的局限主要有:一是范畴限于经典力学 10 个任务,未覆盖电磁、热力学、流体等更广物理领域,结论能否外推到更复杂物理尚不确定。二是评估对 MLLM 裁判(Gemini 3 Flash)有依赖,主观打分的 rubric 和权重设计可能引入偏差,且对格式合规性的敏感可能导致部分失败其实是指令遵循问题而非物理推理问题。三是客观物理度量只在能匹配真值的子轨上适用,对于缺乏清晰物体区域或轨迹的输出难以评估。从独立观察看,数据集规模(400 例)相对较小,且多定律样本(9 例单定律 vs 1 类多律)比例失衡,可能限制统计稳健性;infographic 标注首帧与真实世界条件存在差距,模型在真实无标注场景的表现未被直接测试。
独立分析的弱点
独立分析有三点弱点。第一,定律覆盖窄:仅经典力学难以支撑关于视频模型整体物理智能的强结论,改进方向是扩展到电磁学、流体、热力学等多领域,并纳入软体/可形变物体的非刚性物理。第二,评估对 MLLM 裁判和格式协议高度敏感:定性失败分析(图 5)显示部分失败源于 OCR、分割、渲染、指令遵循而非物理推理,这会污染物理智能的度量;改进方向是进一步剥离接口能力,或对格式失败做条件化分析。第三,多定律样本太少(仅一类多律复合),难以充分检验跨定律状态传递;改进方向是大幅扩充多律组合的种类与数量。此外,统一模型在推导子轨用关键帧替代完整视频,与视频模型完整序列评测不完全公平,可比性可进一步规范化。
未来方向
作者明确指出的方向包括:未来视频世界模型不仅需要更强的时序生成,还需要显式的物理理解模块、更丰富的物理推理数据以及面向推理的后训练。基于成果可延伸的方向有:一是把定律锚定的阶段分解协议推广到更多物理领域与更长时程、更复杂的多体交互;二是研究如何把 chain-of-frames 推理轨迹用于训练而非仅评测,例如用失败定位信号构造针对性监督数据;三是探索显式物理引擎或符号推理与神经视频生成的混合架构,以弥合推导瓶颈和 Sim-to-Real 差距;四是开发不依赖 MLLM 裁判的端到端物理一致性度量,提升评估的可复现性与客观性。
复现评估
复现评估总体良好但存在门槛。数据层面,Orchard 的仿真部分用 NVIDIA Isaac Sim 生成,具备精确物理参数和像素级轨迹,利于客观度量复现;自录与互联网视频的具体采集协议和标注尚未明确公开程度。方法层面,提示模板(chain-of-frames)、infographic 标注首帧设计、五个子轨的输入输出规范和评估 rubric 在附录中有详细说明,协议本身可复现。算力层面,每模型需评测 6000 个响应,且统一模型的推导子轨需在多个评估时刻生成关键帧,对推理和评测算力要求较高。MLLM 裁判依赖 Gemini 3 Flash,属闭源商业 API,主观打分的完全可复现性受限。论文未明确说明 Orchard 数据集与评测代码是否开源,这是复现的关键不确定因素。
论文图表
全景图展示 Apple-π 的核心立意:对比亚里士多德式直觉描述(生成看起来对的苹果落地视频)与牛顿式定律推理(用 $g=9.8\,m/s^2$ 和 $v=gt$ 推导运动)。右侧给出三大组件:Orchard 数据集(400 视频、10 个经典力学任务)、基准协议(感知 P-T/P-G、公式化 F-T/F-G、推导 Ded.)、以及结合 MLLM 主观与物理客观度量的评估套件。
这张图一次性讲清了论文的动机(直觉 vs 定律)、三大组件和评测目标,是理解全文的导览图。
图示典型失败案例:模型能保留标注文字(OCR ✓)和跟踪物体(分割 ✓),但误绑了初始速度箭头的方向,导致公式化-图形的目标状态和推导的轨迹都演化错误(✗)。揭示了一种关键失败模式——复制标注不等于理解物理变量。
这张图定性揭示了模型看起来对但物理含义错误的失败模式,呼应了论文核心关切并指向 limitations。