PAWBench:概率对齐世界建模评测基准 PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。
前置知识
世界模型(World Model)
接收当前观测与动作、预测环境未来如何演化的生成式模型,源自模型强化学习(Dyna、World Models、Dreamer 一脉),用于在内部'想象'动作后果以支持规划与决策。视频生成模型因为能按条件渲染连贯的未来画面,正被越来越多地视为视觉世界模型的候选载体。
本文的全部论证建立在'视频生成器应被当作世界模型'这一前提之上,并进一步追问它作为世界模型是否合格。不理解世界模型的定义与用途,就无法理解'概率对齐'为何是对它的更高要求。
概率对齐(Probabilistic Alignment)
同一初始观测 $x$ 与动作 $a$ 下,随机物理过程可有多条合法未来轨迹。模型诱导轨迹分布 $P_M(\tau\mid x,a)$,经结果映射 $g(\tau)\in Y$ 得到结果分布 $p_M(y\mid x,a)$。支撑对齐只要求 $\mathrm{supp}\,p_M = Y$(合法结果都可能出现),概率质量对齐更强,要求 $p_M(\cdot\mid x,a)=q$(比例也正确)。
这是论文提出的核心判据与标题来源;PAWBench 的两条赛道(Calibration 与 Coverage)分别检验这两个层面,全文所有实验都围绕'模型离这一判据有多远'展开。
全变差距离(Total Variation Distance, TVD)
衡量两个离散分布差异的常用度量:$\mathrm{TVD}(p,q)=\frac{1}{2}\sum_{y\in Y}|p(y)-q(y)|$,取值 0 表示完全一致。例如模型输出 70/30 而参考为 50/50 时 TVD 为 0.2。需要注意:即便从真分布中有限抽样,经验分布的 TVD 也不是零。
PAW-Calibration 的核心指标(论文报告 $100\times\mathrm{TVD}$,越低越好),主表和'差距不是采样误差'的蒙特卡洛论证都靠它;不懂 TVD 就读不懂 Table 1。
扩散模型的初始噪声采样
视频扩散模型从高斯噪声 $\epsilon\sim\mathcal N(0,I)$ 出发逐步去噪生成视频,初始噪声是输出多样性的重要来源。独立抽 50 个种子容易反复命中同一模式;Couple to Control(C2C)用中心化构造 $\tilde\epsilon_{g,i}=\epsilon_{g,i}-\frac{1}{m}\sum_j\epsilon_{g,j}$,使组内两两协方差为 $-I/(m-1)$,同时每个样本的边缘分布仍是标准高斯。
第 5.2 节的噪声干预完全建立在这个机制上;只有理解'边缘不变、联合改变',才能明白 C2C 为什么只是拓宽有限预算内的探索,而不能改变模型本身学到的分布。
LoRA 低秩适配微调
冻结预训练权重,只训练低秩增量 $\Delta W=BA$(秩 $r\ll d$),以极小的显存与数据代价改变模型行为。本文用它训练五个版本:训练集中左倒/右倒铅笔视频比例分别为 0/100、20/80、50/50、80/20、100/0,其余训练条件完全相同,以检验训练分布能否重塑生成结果的概率。
第 5.3 节'更新模型参数'的干预全部经由 LoRA 实施;其设置(Wan2.2 I2V-A14B、秩 32、$832\times480\times49$ 帧、学习率 $10^{-4}$)也是全文最容易复现的部分。
研究动机
视频生成模型(Veo、Kling、Seedance、Wan 等)在画质、指令遵循与时序连贯性上快速进步,正被宣传为'世界模型'。但现有评测——VBench、VideoPhy、T2VPhysBench 等——都把每条生成视频当作孤立样本,评的是视觉质量、时序一致性、文本对齐或单条视频的物理合理性。这留下一个致命盲区:真实物理过程本质上是随机的,同一初始观测与动作(如'把硬币弹一次')可以有多个合法结果(正面/反面各 50%)。一条视频看起来完全合理,并不能说明模型是否复现了结果的分布——模型可能把几乎全部概率质量坍缩到少数几种结果上(硬币十次九次正面),或者把比例分错。单样本评测对这类失败完全失明,而这恰恰是交互与规划最在乎的:智能体决策依赖的是各种后果'是否可能'以及'各占多少概率',而不只是其中一条看起来合理的未来。
本文的目标是论文的目标分三层。第一,把'概率对齐'形式化为世界模型的分布级判据:在固定初始观测 $x$ 与动作 $a$ 下,模型诱导的结果分布既要有正确的支撑(合法结果都可能出现),又要有正确的概率质量(各结果比例正确)。第二,构建 PAWBench——50 个场景、8 个物理机制组、两条赛道(PAW-Calibration 检验概率质量对齐、PAW-Coverage 检验有效支撑覆盖),配合 PAWEval 协议把重复 rollout 转换成可打分的经验结果分布——用它评估 11 个现役视频生成系统,量化回答'我们离概率对齐的世界建模还有多远'。第三,从语言提示、初始噪声采样、模型参数训练这三个层面做干预实验,判断这一差距究竟是推理时可以弥补的探索问题,还是模型学到的预测分布本身的缺陷。
与已有工作不同的是,独特的切入角度是把评测单元从'一条视频'换成'同一条件下重复采样的经验分布'。为了让重复 rollout 的统计有意义,场景设计有三条硬约束:随机性必须来自可见的物理机制(而非提示歧义或隐藏初条件)、动作提示只允许单次原子干预、终端结果必须是有限且视觉可区分的集合。PAW-Calibration 只保留参考分布可由扇区比例、组合计数或物理对称性解析推导的场景;PAW-Coverage 则收录结果可枚举但概率无法可靠指定的复杂交互(保龄球、翻瓶子、触碰猫)。与最接近的 CaliBench(9 个已知分布场景)相比,PAWBench 规模翻倍以上并显式区分两个对齐 regime,还额外加入因果/非因果配对干预(铅笔倾斜改变物理转移 vs Galton 板无关文字不变转移)以及语言、噪声、训练三层探针,把'测出差距'推进到'定位差距来源'。
核心方法
直觉是:让模型把同一道概率题做 50 遍,再看答题的频率分布对不对,而不是只看某一次答得像不像。技术路线分四步。其一,每个场景固定一张源图(初始观测 $x$)与一条动作提示(动作 $a$),并预先定死有限结果集 $Y$;PAW-Calibration 场景另有参考分布 $q$。其二,模型在完全相同的输入下生成 $K=50$ 条独立 rollout。其三,PAWEval 用 Gemini 3.5 Flash 按冻结的结果 rubric 把每条视频映射为某个 $y\in Y$ 或读出失败 $\perp$;每个场景至多 30 条失败(即至少 20 条可读、在模式内)才算通过门控,否则只计入 Scene Pass Rate(SPR)。其四,聚合可读结果得到条件经验分布 $\hat p_{M,\mathrm{readout}}(y)=\frac{1}{n_{\mathrm{readout}}}\sum_{i=1}^{K}\mathbb 1[y_i=y]$;Calibration 报告 $100\times\frac12\sum_y|\hat p(y)-q(y)|$,Coverage 报告 $|\{y:\hat p(y)>0\}|/|Y|\times100\%$。两条赛道的分数分开报告、不合并排名。
核心创新是把'分布对齐'拆成两个互补且不可互相替代的层面:概率质量对齐(结果出现频率对不对)与有效支撑覆盖(合法结果是否都出现)。一个模型可以多样但不校准(什么都出但比例错),也可以校准但缺结果——单样本评测无法区分这两种失败,PAWBench 用两条赛道把它们分开测量,并拒绝合并成单一分数。第二个关键设计是统计卫生:源图与提示完全固定,使 rollout 间的差异只反映模型诱导的分布;读出失败 $\perp$ 被排除在条件分布之外、只体现在 SPR 上,避免把'生成不出可读视频'与'概率分错'混为一谈。第三个亮点是因果/非因果配对干预:一个概率对齐的世界模型应当只在物理转移改变时才改变其预测分布。用铅笔倾斜(因果,参考分布随之改变)与 Galton 板无关文字(非因果,参考分布不变)这类对照,可以直接检验模型分布究竟在跟踪物理机制,还是被表面对照牵着走。
方法步骤详情
第一步,场景构建:围绕 8 个机制组(投掷/旋转/路由/抽取 + 碰撞/稳定性/智能体交互/材料转变)人工构建并审核 50 个场景;源图由图像模型生成候选后人工筛选,动作提示限定为单次原子干预,参考分布只在能由解析或对称性独立辩护时保留,全部元素在任何模型评测之前定稿。第二步,重复生成:11 个视频模型在每个场景的相同输入下采 $K=50$ 条视频。第三步,结果读出:PAWEval 以冻结 rubric 输出终端标签或 $\perp$,另跑辅助可信度审计(动作执行/物体连续性/物理过程),后者只作诊断、不改分数。第四步,聚合打分:条件分数只对过门控场景计算,按机制组与赛道分别平均。第五步,稳健性核验:把预算从 $K=1$ 扫到 $100$;为每个模型构造'从参考分布抽样、保留相同过审场景与可读样本数'的匹配蒙特卡洛零假设(5 万次重复);再对 1500 条视频、每条 7 人标注,对比 PAWEval 与人类判断。第六步,三层干预:五个 VLM 在不生成视频的情况下重复采样未来;GPT-5.5 逐条预测结果并改写提示(PE),或人工按参考分布分配目标写入提示(Oracle PE);C2C 耦合噪声($G=10$ 组、每组 $m=5$、共 50 条);以及五个训练比例(0/100 至 100/0)的 rank-32 LoRA 适配 Wan2.2 后重新评测。
技术新颖性
技术新颖性主要在评测协议与实验设计,而非新模型架构。与 VBench、VideoPhy、T2VPhysBench 等单样本物理评测相比,本质区别是评测对象从'视频个体'变成'条件结果分布',指标从似真性变成 TVD 与支撑覆盖率。与 CaliBench 相比:规模从 9 个场景扩到 50 个;显式区分'参考分布可得'与'只知支撑'两个 regime;把读出失败与条件分布解耦、用 SPR 单独刻画可靠性;并且首次把分布级评测与因果状态控制、VLM 语言先验、噪声耦合采样、训练分布干预连成一条完整的归因链——不但测出'模型的分布错了',还回答了'错在预测、错在生成、还是错在探索'。TVD、覆盖率与 SPR 三指标并报、拒绝单一排行榜的做法,也修正了基准评测中常见的'一维分数定高下'的倾向。
实验结果
主结果(Table 1)是:没有任何模型同时做到概率准、覆盖广、跨场景可靠。Cosmos 3 Super I2V 校准最好(平均 TVD 20.5)但只有 80% 的校准场景通过读出门控;LTX-2.3 覆盖最高(71.7%)但 SPR 仅 72%;Seedance 2 拿到 100% 校准 SPR、LingBot-Video-MoE 拿到 100% 覆盖 SPR,却都不是对应条件指标的第一名。校准与覆盖明确脱钩:覆盖广的模型不是概率准的模型。差距也不是评测协议的假象:把预算从 $K=1$ 增到 $100$,覆盖率上升而校准几乎不动;匹配蒙特卡洛显示 11 个模型观测 TVD 均值 31.2,而从参考分布抽样的零假设均值仅 8.33、99% 分位 9.22,5 万次重复中 0 次达到观测值($p=2.0\times10^{-5}$)。PAWEval 在 888 条可比视频上与人类精确一致 722 条(81.3%),高共识子集达 91.7%。因果干预下模型分布反应不足甚至方向错误,非因果文字却能明显牵动分布。三层干预各有收获但都不解决问题:五个 VLM 直接采样未来全部错配(最好的 GLM-5V Turbo TVD 也有 34.8);GPT-5.5 的 PE 提示让四个生成器校准全部变差、覆盖只有 2 个改善;Oracle PE 虽全面改善(MiniMax H3 TVD 24.2→10.8、Cosmos 覆盖 55.2%→87.3%),但生成器只兑现 37.6%–58.1% 的指定结果;C2C 耦合噪声让三个模型校准与覆盖同升(LTX-2.3 TVD 30.1→19.9),说明独立采样探索不足;LoRA 训练比例虽单调推移两个铅笔场景的左倒频率,但两个参考分布不同的场景同向移动,无一适配版同时满足直立 50/50 与左倾 100/0 两个参考。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| PAW-Calibration(概率质量对齐) | 条件 TVD ×100,越低越好 | Cosmos 3 Super I2V:20.5(全场最低) | 十一模型观测均值 31.2;有限采样零假设 99% 分位仅 9.22 | 比模型均值低约 34%,但仍是采样噪声上界的 2 倍以上,说明差距真实存在 |
| PAW-Coverage(有效支撑恢复) | 覆盖率 %,越高越好 | LTX-2.3:71.7%(但 SPR 仅 72.0%) | Wan2.2 63.4%(覆盖最高的全通过模型之一);多数模型 41.8–58.8% | 较次优 +8.3 个百分点,但以牺牲场景级可靠性为代价,不能简单读作更好 |
| PAWEval 结果读出 vs 人类判断 | 精确标签一致率 | 81.3%(888 条可比视频中 722 条一致) | 高共识(6–7 票)子集 91.7%,低共识(3–4 票)子集 58.7% | 一致率随人类共识强度单调上升,表明分歧集中在本身模糊的视频上 |
| Oracle PE(直接指定目标结果) | 校准 TVD ×100(↓)/ 覆盖率 %(↑) | MiniMax H3:TVD 24.2→10.8;Cosmos 3:覆盖 55.2%→87.3% | 各模型 Base(无提示干预)条件 | 四个生成器校准全部改善、覆盖全部上升,但目标达成率仅 37.6%–58.1% |
| C2C 负相关噪声耦合 | 校准 TVD ×100(↓)/ 覆盖率 %(↑) | LTX-2.3:TVD 30.1→19.9、覆盖 71.7%→74.8%;Wan2.2:覆盖 63.4%→69.2% | 相同 $K=50$ 预算下的独立 IID 噪声采样 | 三模型校准均值下降、覆盖均值上升,证明 IID 采样在有限预算内探索不足 |
| LoRA 训练分布干预 | 直立/左倾铅笔场景 TVD ×100(参考:50/50 与 100/0) | 训练 20% 左倒:直立 TVD 50.0→17.6;训练 80–100%:左倾 TVD→0.0 | 未适配 Base:直立 17.3、左倾 41.3 | 无任何模型同时满足两个参考;两场景随训练比例同向移动,只有粗粒度全局控制 |
局限与改进
作者承认三点:评测只看终端结果,牺牲了轨迹级动力学与中间物理过程;估计基于有限 rollout($K=50$ 并非收敛点);场景是受控、视觉可解析的单步短事件,未触及长时程、交互式与具身环境。我补充几点:第一,参考分布依赖理想化假设(硬币均匀、转盘扇区精确),而生成的源图本身可能带有视觉偏差,模型的'错'有可能部分是基准的'错';第二,裁判是单一商业模型 Gemini 3.5 Flash,而它同时也是 VLM 采样实验的被测对象,存在循环性风险,81.3% 的一致率也只覆盖 1500 条中的 888 条可比子集;第三,门控带来类似存活者偏差的问题——SPR 低的模型(如 LTX-2.3 校准 SPR 仅 24%)的条件分数是在更易通过的子集上计算的,跨模型比较必须连同 SPR 一起读,Table 1 因此拒绝单一排名;第四,因果/非因果配对只有 8 对,'欠反应因果、过反应非因果'的结论缺乏效应量与显著性检验;第五,干预实验覆盖的模型很少(PE 4 个、C2C 3 个、LoRA 仅 Wan2.2),外推到全部模型需谨慎;第六,把连续物理结果离散成有限标签,可能低估模型在连续维度上的校准差异。
独立分析的弱点
第一,终端结果抽象过粗:到达同一终态的两条轨迹被视为等价,速度、动量、接触力等中间动力学完全不入分,而'过程正确'恰是世界模型最重要的性质——可引入能量/动量一致性或轨迹级分布距离作为第二层评分。第二,评测成本高:11 模型 × 50 场景 × 50 rollout 约 2.75 万条视频,扩模型或扩场景成本线性增长——需要序贯估计、早停或重要性采样式的高效估计器(作者也承认这点)。第三,单一商业 VLM 裁判存在偏见与循环风险——可用多裁判集成加人类仲裁子集,并公开裁判一致性的分层报告。第四,配对干预样本太少(8 对),统计功效不足——应扩充配对数量并报告效应量与置信区间。第五,LoRA 实验只动了全局混合比,无法区分'学到场景条件分布'与'学到全局方向先验'——可改用状态依赖的训练分布(不同初始倾角配不同比例)来直接测试条件化学习是否可能。第六,参考分布的解析推导建立在生成式源图之上,可能不成立——应对源图做经验频率校验(例如真实地大量投掷图中物体统计频率),把基准自身的不确定性从模型分数中扣除。
未来方向
作者提出的方向:把概率对齐从终端标签扩展到更丰富的状态轨迹;研究更高效可靠的 rollout 估计器;把基准扩展到交互式与具身环境;发展显式学习校准分布的训练目标。基于本文成果还可以延伸:一是'分布匹配微调'——把 PAWBench 的参考分布当作训练信号,直接惩罚经验结果分布与 $q$ 之间的 TVD,把概率对齐变成可优化目标;二是把 C2C 式耦合采样嵌入规划管线,用有限 rollout 预算更均匀地探索后果空间,再交给策略网络做风险感知决策;三是探究扩散噪声空间中是否存在可解释的'结果选择'变量,使一次前向过程即可控制落点分布,而非靠重复采样;四是检验偏好对齐(RLHF/美学奖励)是否系统性地压平了生成分布——本文 LoRA 实验已经证明训练频率会写入模型,这为'模式坍缩源于数据与偏好优化'提供了可检验的假说;五是把评测推广到部分可观测场景与动作本身引入随机性的设定,并研究视频世界模型在机器人策略评估中所需的校准保证。
复现评估
复现难度中高。有利的一面是方法描述异常详尽:场景 taxonomy(Table 6)、读出与门控规则、指标聚合公式、蒙特卡洛协议、C2C 构造公式、LoRA 全部超参(Wan2.2 I2V-A14B、秩 32、$832\times480\times49$ 帧、学习率 $10^{-4}$、每专家 2000 步、200 条源视频扩成 5×2000 的数据集)都写在正文与附录中;C2C 基于公开方法(Jia et al., 2026);项目页 pawbench.github.io 已存在。不利的一面:正文未承诺开源场景数据与评测代码;判分依赖闭源 Gemini 3.5 Flash、提示工程依赖 GPT-5.5、被测的 11 个视频模型多为闭源 API 且版本会随时间漂移;人类研究通过 Rapidata 众包 1500 条视频 × 7 次判断,有真实费用;主评测加干预实验的总生成量数万条视频,API 成本可观。最可复现的是 LoRA 干预(开源基座 + 完整超参)与 C2C 耦合构造;最不可复现的是闭源商业模型的逐版本分数。独立团队建议先在开源模型(Wan2.2/2.7、LTX、Cosmos 开放版)子集上复现主结论。
论文图表
对比示意:同一初始观测与动作下,模型的一条 rollout 可以物理上完全合理;但重复 rollout 可能暴露概率未对齐的世界——结果集中在狭窄子集,而非匹配合法的随机支撑。右图为理想的对齐情形:覆盖全部合法结果且比例正确。
一图点题:单条视频合理 ≠ 分布正确,这是整篇论文要攻击的评测盲区,也是 PAWBench 立项的动机。
八个模型在各机制组上的审计构成:物理过程错误占比最大,动作执行与物体连续性错误在各组也相当可观。
揭示许多'可读结果'是以不物理的方式达成的——单看结果分数会高估模型能力,是理解局限性的重要证据。