HarnessEval-W:用智能体流水线评测视觉世界 HarnessEval-W: Agentifying the Evaluation of Visual Worlds
分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致
前置知识
交互式世界模型
一类以历史观察和用户动作为条件预测未来观察的生成模型,把视频生成放进闭环交互里:玩家按下按键或发出指令后,模型生成相应演化的下一帧画面。本文用公式把它的能力分解为三要素:从隐状态渲染观察 $S(o_i|s_i)$、在动作下更新状态 $T(s_i|s_{i-1},a_{i-1})$、随时间维持状态序列一致。
本文评测的对象就是这类模型,三大评测轴(观察质量、转移正确性、世界持续性)正是从这个形式化分解导出的,不懂这个框架就无法理解八项评测设定的来历。
评测 Harness(脚手架)
源自 LLM 评测生态的概念:harness 不只是代码包装器,而是为完全智能体化的流水线提供健壮支撑的框架,把复杂的人类工作流(证据收集、工具使用、推理验证)形式化、可执行化。评测从『固定打分函数』变成『可编排的推理过程』。
这是本文的核心隐喻和标题来源:作者主张人类评视频也是一种工作流,因此也可以被 harness 化,整篇论文都是这个思想在世界模型上的落地。
VLM-as-Judge(模型评测器)
用视觉语言模型代替人类给生成内容打分:把视频帧和评分标准喂给 VLM,让它输出分数或判断。优点是能理解语义、无需人工标注;缺点是存在系统性偏见、对提示敏感、平局率高(给两个差不多好的视频打相同分)。
HarnessEval-W 的所有子代理底层都是同一个 VLM 后端(GPT-5.5),论文与 WBench 对照实验展示的正是『单次整体 VLM 打分』与『分解为多个子代理判断』之间的巨大差距。
Bradley–Terry 模型
一种从成对比较数据中估计每个对象『强度』的统计模型:假设对象 $i$ 胜过 $j$ 的概率为 $\sigma(s_i - s_j)$,把大量 A/B 两两选择聚合成每个对象一个连续强度分数,常用于 LLM 竞技场式的人类偏好评估。
论文用它把 5000 次人类 A/B 判断聚合成模型强度排序,作为检验 HarnessEval-W 分数与人类偏好对齐程度(Spearman 相关)的金标准。
光流与相机位姿估计
光流(如 RAFT)估计相邻帧之间每个像素的运动场,可定量检测物体是否真的在动、运动幅度多大;相机位姿估计(如 MegaSAM)从视频中恢复相机每帧的 6-DoF 位姿轨迹,可与指令轨迹对比验证视角变化是否准确执行。
这些是子代理的『诊断工具』:HarnessEval-W 的关键设计就是让子代理调用这类专用工具获取客观证据,而不是只靠 VLM 肉眼判断,这是评测可信度的基础。
扩散 Transformer 与自回归视频生成
DiT 是当前视频生成的主流架构(如 Wan、HunyuanVideo、Seedance),通过去噪扩散过程生成视频;自回归(AR)变体则逐块滚动生成,支持长时程交互式 rollout。交互式世界模型通常在 DiT 上做动作条件化微调或流式蒸馏。
被评测的 18 个模型横跨 Prompt-I2V、相机位姿、原生动作三种接口,理解这些接口与架构差异才能读懂排行榜分组和微调实验中『能力再分布』现象的含义。
研究动机
评测世界模型(尤其是生成视频里的物理因果、几何一致性与观察真实性)至今仍是一个脆弱的实践。现有基准把指标当成固定的打分函数暴力计算:VBench、EvalCrafter 对整段视频套用统一的固定维度,WorldScore、WorldMark 等用固定的问答式探针,报告的分数既无法解释也无法验证——当一个模型在某案例上得了低分,没有人能回答『低在哪里、为什么低』。而人类评价一段生成视频时,会自然而然地定位目标物体、跨时间追踪物体永存性、验证因果与几何约束,这种能力从未被现有基准成功自动化。更麻烦的是,世界模型评测高度依赖上下文:每个测试用例都是一个独特的小世界,物理动作、时间结构、可观察状态各不相同,任何固定 rubric 要么问了与该案例无关的问题,要么漏掉案例特有的关键上下文。
本文的目标是本文的目标是把 LLM 生态中的评测 harness 范式引入世界模型基准:不再套用固定 rubric,而是让评测器像人类专家一样工作——理解每个评测案例的上下文,把评测问题分解为可测量的子问题,为每个子问题派出配备定制上下文与诊断工具的专门子代理,最后由父代理验证证据并汇总裁决。评测产出不再是一个孤立的标量,而是一棵透明的证据树,完整记录测了什么、哪个工具提供了视觉接地、以及支持最终分数的完整逻辑链。作者用 330 个评测案例对 18 个代表性世界模型(涵盖通用视频生成器与交互式世界模拟器)进行系统评测,验证其判断与人类偏好高度对齐,并开源整套流水线作为随世界模型进化而生长的『活基准』。
与已有工作不同的是,独特切入在于把『评测』本身视为一种可以形式化、可以装上 harness 的人类工作流。与已有工作的本质区别有三点:其一,VBench 等工作把评测知识硬编码成固定维度与固定提示,HarnessEval-W 把评测知识外化为可扩展的技能库,每个技能声明自己的适用条件、所需证据、打分与聚合方式,案例先路由到合法适用的技能,不适用的测量被明确排除在评分之外而非给出默认分;其二,技能路由只依赖案例上下文与评测意图、与被评模型无关,同一案例对所有模型走完全相同的评测路线,保证公平可比;其三,作者强调评测的『能动性在于控制评测轨迹』——评测器自己决定检查什么、调用哪些工具、如何验证证据,这与仅把判分换成一次 VLM 问答的 model-based judge 有本质不同,也超越了此前停留在提示条件化图像/视频生成评测的自适应方法。
核心方法
直觉上,HarnessEval-W 模仿人类专家评视频的过程:先读懂动作指令想让世界发生什么变化,再到生成结果中搜集时空证据(定位目标、检查转变是否真的发生、追踪无关物体是否被动过),必要时调用工具做定量测量(光流、相机位姿、帧插值),最后核对证据、给出裁决。技术路线上是一个分层智能体流水线:顶层规划器解读案例信息(初始图像、动作提示、评测设定),从技能库中选择适用技能并为每个激活与跳过的技能记录有据可查的理由;每个高级技能进一步分解为一组可测子问题,交给平行的子代理各自检查并返回离散分数与诊断信息;父代理把子代理输出组织成结构化证据树,验证后聚合成最终分数与各维度得分。整个过程可以递归展开(子代理可以再派出自己的调查),最终产出可回溯到具体失败原因的证据树,例如『no-extra-event 得 0 分,因为 rollout 中出现了指令之外的人为干预去抓方块』。
核心创新是把世界模型能力形式化为可分解的三要素,并为每一要素设计对应的智能体评测技能。作者把给定历史观察 $\{o_i\}_{i=-T}^{0}$ 与动作 $\{a_i\}_{i=0}^{t-1}$ 的未来观察分布按隐状态 $\{s_i\}$ 分解:$$P(o_1,\dots,o_t \mid o_{-T},\dots,o_0; a_{0},\dots,a_{t-1}) \propto P(s_0 \mid o_{-T},\dots,o_0)\prod_{i=1}^{t} S(o_i \mid s_i)\, T(s_i \mid s_{i-1}, a_{i-1})$$ 其中 $S$ 是从状态渲染观察的似然,$T$ 是动作条件下的状态转移。该分解导出三大评测轴、八项设定:Observation Quality(渲染质量 Obs-R、物理观察 Obs-P)、Transition Correctness(探索式 Trans-E、意图式 Trans-I、物理式 Trans-P)、World Persistence(抗漂移 Pers-D、回访一致性 Pers-R、屏外演化 Pers-O)。与固定函数的本质区别:技能是声明适用性与验证规则的智能体单元;证据缺失时标记『不可用』并重归一化剩余权重,把『无法判断』与『做得差』区分开,不把测量缺口误记为模型失败。
方法步骤详情
构建与执行两条线。数据构建:先从六轴场景分类学(环境、前景、中景、密度、外观、视角)采样世界,并按场景可供性分配六个探针族之一;图像生成器把元数据转成提示生成初始观察;图像接地的规划器在可见世界中落实具体动作(文本指令、相机轨迹、控制序列),禁止引入图中不存在的实体;案例验证器审计『图像-动作』对(目标可见、动作可行、结果特定、证据充分),不合格即重采样,最终得到 330 个案例。评测执行:harness 解读案例后从技能库路由技能并记录跳过理由;每个技能把问题拆成子问题交给子代理,如 Intentional Change Verifier 产出 8 个五档判断 $Q^{IC}_1,\dots,Q^{IC}_8$,按 $IC = Q^{IC}_1\,Q^{IC}_8\,(0.30E_{chg}+0.25Q^{IC}_5+0.20Q^{IC}_4+0.25P_{int})$ 门控聚合,$E_{chg}=0.40Q^{IC}_2+0.60Q^{IC}_3$;Render Quality Inspector 计算 $RQ=\frac{1}{4}(AQ+IQ+HP+FL)$。所有子代理共享同一 VLM 后端、温度与帧采样配置,模型总分按 330 个案例平均。
技术新颖性
技术新颖性体现在三个层面。第一,评测知识『技能化』:与 MUSIQ、VLMEvalKit 等固定工具链不同,每个技能是封装了适用条件、证据需求、打分规则与聚合公式的智能体单元,可独立扩展——新增技能不需要改框架,为『活基准』奠定结构基础。第二,层级化证据树:不同于一次 VLM 打出的整体分,分数能精确回溯到失败的子问题(例如目标可见性 1.0 但 no-extra-event 0.0,说明模型执行了动作却引入了额外事件),使评测可审计、能直接指导模型改进。第三,评测协议本身的鲁棒性设计:同一案例固定路由、五档离散打分($\{0, 0.25, 0.5, 0.75, 1\}$)、加权线性聚合与乘法门控(judgeable、target visibility 作为门控因子)。附录还给出全部技能公式,例如漂移分析 $Drift = 0.35C + 0.20T + 0.15R + 0.15W + 0.15S$ 综合语义漂移、趋势、保留率、最差质量与稳定性,回访一致性用 NCC、直方图相关性、Canny 边缘 IoU 与 CLIP 余弦相似度构成帧对相似度。
实验结果
其一,Seedance 2.0 以 Overall 75.5 居首,Wan 2.7(75.0)、Kling 3.0(74.4)、MiniMax H3(74.3)随后,前四名全是文本驱动的通用视频生成器,归因于大规模文本条件训练的语义接地能力;但各有所长:Wan 2.7 在 Trans-I(83.6)与 Trans-P(71.1)双料第一,Seedance 的 Pers-D 最高(79.8),HY-WorldPlay 的 Pers-R 最高(81.9),SANA-WM 的 Pers-O 最高(72.3)。其二,人类对齐(5000 次 A/B 判断、9 个模型、Bradley–Terry 聚合)达 Spearman $\rho=0.93$(Intentional)、$\rho=0.87$(Physical);与 WBench 同后端对照,Physical 准确率 31.9%→71.7%、平局率 52.2%→1.8%,Intentional 60.2%→77.8%、平局率 36.1%→11.1%,Brier 分数均更低;三次重复运行相关性稳定在 0.928–0.964,包络仅 0.33 个 BT 单位,为 WBench(1.61)的 1/4.9。其三,微调导致能力再分布:Wan 2.2 微调成 DreamX-World 后 Trans-I −11.9、Trans-P −7.2,但 Trans-E +4.8、Pers-R +7.8;HunyuanVideo 1.5 微调成 HY-WorldPlay 后 Trans-I 暴跌 24.2,Pers-R 却涨 8.4。其四,Trans-I 与 Trans-P 强耦合($r=0.98$),Trans-E 与二者几乎无关($r=-0.15/-0.18$),说明指令语义接地与探索式续写是相互独立的能力。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Intentional Transition 人类偏好对齐(成对准确率) | Pairwise Accuracy(与人类 A/B 选择一致的比例) | 77.8% | WBench Event Edit 协议 60.2% | +17.6 个百分点(同 GPT-5.5 后端、同数据) |
| Physical Transition 人类偏好对齐(成对准确率) | Pairwise Accuracy | 71.7% | WBench Causal Fidelity 协议 31.9% | +39.8 个百分点;平局率从 52.2% 降至 1.8% |
| 模型排名与人类排序的一致性 | Spearman ρ / Kendall τ(对 Bradley–Terry 人类强度) | Intentional: ρ=0.93 (τ=0.82);Physical: ρ=0.87 (τ=0.74) | 无(首次建立世界模型评测的人类参照序) | 基于 5000 次人类 A/B 判断、9 个模型 |
| 评测器重复稳定性(温度 0 跑 3 次) | 三次拟合包络宽度(Bradley–Terry 单位) | 0.33(相关性 0.928–0.964) | WBench 1.61(相关性仅 0.646–0.780,斜率 11.2→21.0) | 包络窄 4.9 倍 |
| 18 个世界模型综合排名 | Overall(330 案例平均,1–100 归一化) | 榜首 Seedance 2.0 = 75.5 | 第 18 名 InSpatio-World = 61.4;开源最佳 Cosmos3-Super 71.9 | 文本驱动视频生成器整体领先交互式世界模型约 6–14 分 |
局限与改进
作者承认的局限:物理定律验证引擎基于光流与运动轨迹,假设相机相对静止、背景静态、运动适中且主体纹理明显,因此只能作为辅助验证;被评模型暴露不同条件接口(文本、6-DoF 相机轨迹、原生键鼠控制),适配器虽只改动作表示不改语义,跨接口比较仍可能引入系统性偏差。我自己的观察:其一,所有子代理共用同一 VLM 后端,评测器自身的偏见会沿层级传播且难以察觉;其二,论文未报告单案例评测成本,每案例多技能乘多子代理的 VLM 调用量远高于固定指标,大规模跑排行榜代价可观;其三,330 个案例对 18 个模型做精细排名时统计功效有限,1 分左右的 Overall 差异未必显著;其四,子代理输出是 0/0.25/0.5/0.75/1 的五档离散值,粒度较粗,且聚合权重(如 0.40/0.60)为人工设定,缺乏灵敏度分析;其五,案例由文生图模型合成初始化,可能存在分布偏移,未必覆盖真实交互的长尾场景。
独立分析的弱点
独立分析四点弱点。第一,单裁判后端依赖:整棵证据树由同一 VLM 生成,若该模型对某类内容(如液体流动、镜面反射、密集文字)有系统性错觉,所有技能会同时出错且结构上难以暴露,改进方向是多裁判后端集成、分歧检测与交叉验证。第二,成本与延迟:一次评测涉及路由、8 个并行子代理、父代理验证与聚合,比 VBench 类固定指标贵一到两个数量级,可引入级联策略——先用廉价确定性指标(光流、CLIP 相似度)粗筛,仅对临界案例启用完整证据树推理。第三,接口换算的公平性风险:把同一动作语义翻译成文本指令、相机轨迹或键鼠序列,翻译质量本身会影响模型表现,论文未量化适配器引入的噪声,可为每种接口增加翻译一致性校验。第四,评测与被评模型潜在同源:若干被评模型(Wan 系、HY-WorldPlay 等)与裁判 VLM 的训练数据可能高度重叠,存在『同生态模型互评』的隐性偏差,应做裁判-模型去相关分析或在论文中披露重叠情况。
未来方向
作者在第六节规划了三个方向:一是评测的测试时扩展(test-time scaling)——与 LLM 推理同理,更多算力可以换取更细的技能分解、更深的子代理搜索、多步与重复证据验证,让评测器始终与被测模型同等强大;二是扩展技能库——每个技能编码『什么证据能定案、用哪个工具接地』的人类评测知识,随世界模型场景复杂化持续增长,避免为每个新基准重造 rubric;三是递归自改进的智能体基准——当路由发现没有技能能合法回答某案例时,这个失败本身就是对评测器能力的测量,通过外部技能扩展或自驱动探索习得缺失能力并写回技能库,形成永不过时的自进化评测循环。基于本文成果还可延伸:把证据树蒸馏成奖励模型用于世界模型的 RL 训练,让可解释的评测信号直接反哺生成模型;建立跨裁判、跨版本的元评测协议,持续监控评测器自身的漂移;以及将技能库迁移到具身智能的闭环策略评估中。
复现评估
复现条件较好。代码在 GitHub(mirros-lab/harnesseval-w)完全开源,配套项目页与博客;330 个案例与技能库作为『活基准』发布并接受社区贡献。评测本身不需要训练算力,但有两类外部依赖:一是 18 个被评模型中 8 个为闭源 API(Seedance 2.0、Wan 2.7、Kling 3.0、Grok Imagine 1.5、FLUX 3 等),复现完整排行榜需要持续支付 API 费用;二是裁判后端为 GPT-5.5,全程多子代理调用,单次评测成本显著高于固定指标基准。开源模型(MiniMax H3 33B、Cosmos3-Super 64B、HunyuanVideo 1.5 8B 等,参数量 1.3B–64B)需要足够的 GPU 推理资源。技能公式在附录 C 全部给出,包括帧采样率(2/8/10 FPS)、归一化与退化处理细节,工程上可以忠实复现。总体难度中高:管线开源大幅降低工程门槛,主要成本在 API 调用与人类对齐实验(5000 次 A/B 判断)的复现上。
论文图表
开篇总览图:同一『机器人右爪把木勺举到玻璃碗上方』案例下三个模型的生成结果对比。模型 A 额外引入了一只抓手和一把勺子,被子代理以『意图外事件』判低分;模型 B 双爪都握住了勺子,违反了『左爪保持低位』的指令;模型 C 准确执行指令、无额外事件,三个模型的最终分为 0.582 / 0.750 / 0.913,且每个分数都能回溯到失败的具体子问题。
一图看懂本文核心卖点:分数不是黑箱数字,而是『为什么低分』的推理链(reasoning trace),这是与传统基准最直观的区别。
八项评测指标在 18 个模型上的两两 Pearson 相关矩阵。关键读数:Trans-I 与 Trans-P 强耦合(r=0.98),均与 Trans-E 几乎无关(r=-0.15、-0.18);Obs-R 与 Obs-P 不相关(r=-0.04);Obs-P 与 Pers-R 高度相关(r=0.83)。
揭示八项指标测的是不同能力、没有冗余,同时暗示『执行指令的语义接地』与『探索式续写』是两种独立能力,对设计训练方案有直接指导意义。