← 返回 2026-08-14

PlayWorld:用智能体玩家在长时程目标下评测视频世界模型 PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao 📅 2026-08-13 👍 44 2026-08-19 18:30
VLM-as-Judge 世界模型 基准评测 多模态智能体 视频生成 长时程交互

用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型

前置知识

视频世界模型 (Video World Model)

以当前观测帧和用户动作为条件、自回归地逐块生成未来视觉状态的生成模型。与一次性文生视频不同,它持续响应 W/A/S/D、镜头转向等控制信号,让用户在一个可交互的开放世界中自由探索,代表系统包括 Genie 3、HappyOyster、LingBot-World、Matrix-Game 等。

本文的全部评测对象就是这类模型。理解“动作→下一帧观测”的闭环生成方式,才能理解为什么评测必须在线交互,而不能像普通视频基准那样一次性生成再打分。

动作粒度差异 (Action Granularity)

不同世界模型对同一控制输入的响应幅度不同。例如同样三个转向指令,模型 A 能完成 360° 整圈回转,模型 B 只转了半圈;同样一个前进指令,不同模型移动的距离可能相差数倍。

这是现有固定轨迹评测不公平的根源,也是本文引入智能体玩家在线调整动作的直接动因。论文用“绕 Marina Bay Sands 转 360° 后地标能否重现”这一例子具体说明了问题。

出视野状态演化 (Out-of-sight Evolution)

评测目标离开视野再重新出现后,其身份是否保持、状态是否在不可见期间继续合理演化。例如一个人在画面外继续削苹果,转回镜头时果皮应当变长;一幅进行中的画作应该在遮挡期间新增内容。

这是 PlayWorld 四个评测维度之一。实验发现它是当前所有世界模型的最大短板(5 分制下全部低于 2 分),是理解论文核心结论的关键概念。

VLM-as-Judge 与 VQA 细则评分

用大型多模态模型(如 Gemini 3.1 Pro)代替人工,对生成视频回答若干 Yes/No 问题并加权汇总成分数。本文额外加了“维度专属验证门”:先判断轨迹是否有效(未通过直接记最低分 1 分),再按 $R_d = \frac{\sum_{j \in A_d} w_j a_j}{\sum_{j \in A_d} w_j}$ 加权、用 $S_d = 1 + 4R_d$ 映射到 1-5 分制。

PlayWorld 的全部主结果都来自这套 VQA rubric verifier。理解验证门机制和加权公式,才能正确解读论文表格中分数的含义与边界。

相机位姿估计与可控性指标

用 VGGT 等模型从均匀采样帧估计相机位姿,与动作序列(含智能体在线调整)定义的目标轨迹对比,计算平移误差与平均测地旋转误差,低于阈值(平移误差 < 0.3、旋转误差 < 45°)即判为通过。

论文用它度量动作可控性(Translation/Rotation Pass Rate),并据此发现“可控性好不等于世界模拟能力强”这一重要观察,是区分两类指标的必备背景。

研究动机

视频世界模型在近两年爆发式增长,Genie 3、HappyOyster、LingBot-World、HY-World2、Matrix-Game-3.0 等系统都能生成可交互的长序列视频,但如何公平比较它们仍是悬而未决的问题。现有基准(WorldScore、WorldMark、WBench、MemoBench 等)普遍采用预先定义好的固定动作轨迹:脚本下发一串固定的 W/A/S/D 和镜头指令,再检查生成结果是否达标。问题在于各模型的动作粒度差异巨大——论文举例说,为验证几何一致性,评测者想让相机原地转 360° 回到 Marina Bay Sands 的初始视角,同样三条转向指令在模型 A 上能完成整圈、地标离开又重新进入视野,在模型 B 上却只转了半圈、地标再没回来,这样算出的几何一致性分数根本不可比。更复杂的动作模式(如保持视线方向不变、绕雕塑公转一周)所需的动作时长和停止时机因模型而异,固定轨迹无法可靠完成。此外,Genie 3、HappyOyster 这类闭源系统只有网页界面,此前只能靠人工逐条交互评测,费时费力且容易引入主观偏差。

本文的目标是本文要把“人类玩家如何评测世界模型”这一真实过程自动化。现实中用户不是逐条核对固定轨迹,而是带着一个长时程目标去交互:比如“原地转 360° 看环境是否保持一致”“走进水里看是否产生逼真的涟漪和水深变化”。PlayWorld 的目标是建立一套自动化闭环评测协议:用一个多模态智能体(Agent Player)扮演人类玩家,给定长时程目标和一条人标的基本动作序列作为共享参考,智能体在每一步观察生成帧与历史动作,动态决定 Keep(保持)、Stop(提前结束动作)、Extend(延长动作)、Correct(修正或跳过下一步)或 End(目标已达成、结束评测),从而在动作粒度各异的模型上达成同一评测意图,实现公平的跨模型比较;同时在几何一致性、交互保真度、出视野演化、洞见演化四个核心维度上给出可复现的自动评分,并配套视频质量与动作可控性等基础能力指标。

与已有工作不同的是,本文的独特切入是“以目标为中心的闭环评测”这一范式转换。此前所有世界模型基准都在“输入什么动作序列”上做文章:WorldScore/WorldMark 用预定义相机轨迹,WBench/WorldRoamBench 引入预定义多轮导航模式,MemoBench/STEVO-Bench 用固定时刻表测试记忆与出视野演化,但它们都无法根据生成观测在线调整——一旦模型响应幅度不同,评测状态就不可比。PlayWorld 的关键洞察是:评测意图(objective)应当跨模型恒定,而实现意图的动作序列应当因模型而异。它保留一条人标基本动作序列作为共享先验(解决纯在线规划的延迟高、跨模型轨迹发散问题),又允许智能体在 40 步交互预算内做五种在线决策(实测只修改约 12%-15% 的动作),既保证可比性又保证公平性。消融实验证明该 Preset+Agent 策略在人类偏好上大幅超过纯预设(39.6%→65.6%)和纯智能体(29.2%→65.6%)两种极端方案。

核心方法

直觉上,PlayWorld 就是一个“机器人玩家”:它像真人一样坐在 Genie 3 或 HappyOyster 的网页界面(或本地推理管线)前,拿到一张初始场景图和一个目标(如“绕雕像公转一周且视线方向不变”),然后不断按键、看画面、判断目标是否达成,最后把整段交互录屏交给一个自动阅卷官(VQA rubric verifier)按细则打分。技术路线分三部分:(1) Agent Player——一个可替换的多模态大模型(论文最终选用 Claude Haiku 4.5)加执行接口,负责在线决策;(2) Agent 接口——把抽象的 W/A/S/D、↑/↓/←/→、WAIT 指令翻译成各模型的原生控制格式,网页模型用浏览器自动化派发按键并抓帧,本地模型用分块生成适配器;(3) 评测协议——171 个人工标注场景,每个场景含初始世界、场景化目标和基本动作序列,rollout 约 10-60 秒、最多 40 步交互预算;生成视频由 Gemini 3.1 Pro 按 1-5 分制在四个维度打分,另配七项视频质量指标和两项可控性通过率合成基础能力分。

核心创新是把评测单元从“动作序列”换成“长时程目标 + 共享参考序列”,与已有方法的本质区别有三点。第一,闭环自适应:现有基准都是开环的(下发固定指令、不管画面长什么样),PlayWorld 的智能体每一步都观察生成帧并做出 Keep/Stop/Extend/Correct/End 五种决策之一,使动作粒度不同的模型都能到达可比的评测状态——Table 1 中它是唯一在 Closed-Loop Adaptation 上打 ✓ 的基准。第二,人机混合控制(Preset + Agent):完全预设(Preset Only)会过冲或欠冲,完全在线(Agent Only)则决策延迟高、跨模型轨迹发散(Table 4 显示其人类偏好仅 24.4%-29.2%),而以人标序列为参考、只做约 12%-15% 定向修改的混合策略在轨迹分和人类偏好上都是最优。第三,带验证门的细则打分:先做维度专属验证(几何/出视野用 Trajectory Validity,交互用 Subject and Reachability),不通过直接记 1 分,避免 MemoBench 指出的“指令跟随失败污染记忆评测”问题。

方法步骤详情

第一步构建基准:从 Pexels 与 Google Images 收集候选图片(涵盖自然、城市、奇幻场景,主体含人、动物、车辆等六类),标注者筛选图片并选定第一/第三人称视角,Gemini 3.1 Pro 生成环境描述、人工校对;随后写下长时程目标、可视觉验证的完成条件和基本动作序列(单条到五条组合、50+ 动作模式),并按维度构建样本专属 VQA 细则,共 820+ 问题(身份与外观 317、物理与动力学 236、时间演化 203、空间与轨迹 72)。第二步闭环交互:每个案例把相同的初始帧、目标和基本动作序列发给九个模型;接口执行当前动作、抓取生成帧返回智能体;智能体综合生成帧、剩余序列、动作历史与目标,输出 Keep/Stop/Extend/Correct/End 决策,循环至 End 或 40 步预算耗尽,产出 10-60 秒 rollout。第三步验证门:Gemini 先判轨迹有效性(几何/出视野)或主体可达性(交互),失败则该维度记 1 分。第四步细则打分:视频组织成两条 contact-sheet 流(主流 10 FPS、384×216、25 帧 5×5 网格;细节流 0.5 FPS、800×450、2×2 网格),Gemini 对每个适用问题返回 $a_j \in \{0,1\}$ 及证据,权重为普通问题 1、定义性问题 2、N/A 为 0,维度分 $S_d = 1 + 4R_d$,Overall 为四维无权平均。第五步基础能力:七项视频质量指标加两项可控性通过率(VGGT 估位姿,平移误差 < 0.3、旋转误差 < 45° 算通过),九项指标平均排名转为百分比形式的 Basic Ability Score。

技术新颖性

技术新颖性体现在评测范式而非模型本身。其一,首次把“长时程目标 + 智能体在线执行”引入世界模型基准(对照 Table 1:此前六个基准全部没有闭环适应,仅 WorldMark 部分支持长时程回访),类似从“固定考卷”进化到“面试官根据考生回答追问”。其二,工程上打通了闭源网页模型的自动化评测——通过浏览器自动化完成登录、派发控制、抓帧和全程记录(Figure 7),使 Genie 3 和 HappyOyster 这类无法本地部署的系统能与开源模型在完全相同的协议下比较。其三,验证门 + 加权细则的打分设计兼顾鲁棒性与可解释性:维度分可分解到具体问题,附录 B 报告两次独立打分的平均方差仅 0.0112,说明单次打分已足够稳定。其四,作者把“轨迹控制通过率”(Table 3)与“世界模拟能力”(Table 2)分离报告,揭示了 SANA-WM 这类“跑得到但演不好”的模型,这一区分在此前混用两者的基准中是被掩盖的。Table 5 的消融还表明框架对底层多模态模型不敏感——Claude Haiku/Sonnet/Gemini 3.1 Pro 的轨迹分差异很小,Agent Player 可随更强模型的出现随时升级。

PlayWorld evaluates world models from the perspective of a human player. We define long-horizon objectives such as "turning around 360 degrees" or "walking into the water", and use an Agent Player to interact with the world models. We then evaluate them from multiple perspectives, including geometry consistency, interaction fidelity, and persistent state evolution.
Figure 1: PlayWorld evaluates world models from the perspective of a human player. We define long-horizon objectives such as "turning around 360 degrees" or "walking into the water", and use an Agent Player to interact with the world models. We then evaluate them from multiple perspectives, including geometry consistency, interaction fidelity, and persistent state evolution.
Benchmark construction pipeline of PlayWorld. Starting from diverse initial worlds, annotators define long-horizon objectives based on scenario-specific attributes, write basic action sequences, and construct sample-specific VQA rubrics.
Figure 2: Benchmark construction pipeline of PlayWorld. Starting from diverse initial worlds, annotators define long-horizon objectives based on scenario-specific attributes, write basic action sequences, and construct sample-specific VQA rubrics.
Composition of PlayWorld. The benchmark comprises over 170 human-annotated cases across diverse scenario categories.
Figure 3: Composition of PlayWorld. The benchmark comprises over 170 human-annotated cases across diverse scenario categories.
Representative cases in PlayWorld. Each case combines an initial world, a scene-grounded long-horizon objective, and a sample-specific VQA rubric.
Figure 4: Representative cases in PlayWorld. Each case combines an initial world, a scene-grounded long-horizon objective, and a sample-specific VQA rubric.
Agent interface execution on a web-based world model.
Figure 7: Agent interface execution on a web-based world model.

实验结果

论文系统评测了九个代表性模型:闭源的 Genie 3、HappyOyster,开源的 LingBot-World、LingBot-World2、HY-World2、SANA-WM、Hunyuan-GameCraft、HY-WorldPlay、Matrix-Game-3.0。Table 2 的 rubric 总分(1-5 制)显示 Genie 3 以 2.12 居首(几何 2.74、交互 2.40、洞见 1.51、出视野 1.81),HappyOyster 1.92 第二;开源阵营中 LingBot-World2 凭 1.95 的洞见演化得分以 1.82 领先;Matrix-Game-3.0 垫底(1.14,出视野与洞见均为 1.00)。最重要的发现是持续状态演化是所有模型的最大瓶颈:九个模型的洞见演化得分全部落在 1.00-1.95、出视野演化全部低于 2 分,静观 60 秒时会出现动作重复、主体消失、火箭不升空等失败(Figure 5),说明模型擅长保持可见结构与即时响应,却无法维持跨时间、跨遮挡的语义状态演化。第二,长时程回访暴露全局空间不一致:绕泰姬陵 360° 后模型会在不同视点重新“生成”多个不一致的地标副本,单帧看似合理但整段违反空间唯一性,反映模型依赖局部外观连续性而非持久的全局 3D 表征。第三,Table 3 显示“可控性好不等于能力强”:SANA-WM 轨迹验证总通过率 80.4%(高于 HappyOyster 的 79.6%)但 rubric 总分仅 1.48;Hunyuan-GameCraft 几何维度通过率仅 25.0%、HY-WorldPlay 仅 14.6%。第四,Table 6 中 HappyOyster 以 76.4% 的 Basic Ability Score 领先(Genie 3 为 72.2%),但 Hunyuan-GameCraft 平移通过率 89.6% 全场最高而旋转仅 29.4%,说明视频质量高、控制通过也不等于能完成长时程目标。第五,人类验证证实指标可信:600 次两两判断中 95.8% 达多数一致、Fleiss' κ=0.434,VQA 分数与人类偏好的 Spearman 相关 Overall 达 ρ=0.933、几何一致性 ρ=0.983(均 p<0.05)。

Comparison of world-model evaluation benchmarks. We compare input formats, closed-loop adaptation, long-horizon revisitation, evaluated capabilities, and rollout duration.
Table 1: Comparison of world-model evaluation benchmarks. We compare input formats, closed-loop adaptation, long-horizon revisitation, evaluated capabilities, and rollout duration.
Rubric-based VQA evaluation across four dimensions on the PlayWorld benchmark. Scores range from 1 to 5 (↑: higher is better). Overall is the unweighted mean across the four evaluation dimensions.
Table 2: Rubric-based VQA evaluation across four dimensions on the PlayWorld benchmark. Scores range from 1 to 5 (↑: higher is better). Overall is the unweighted mean across the four evaluation dimensions.
Trajectory-validation pass rates on the PlayWorld benchmark. The insight evolution dimension uses stationary observation and therefore does not require trajectory validation.
Table 3: Trajectory-validation pass rates on the PlayWorld benchmark. The insight evolution dimension uses stationary observation and therefore does not require trajectory validation.
Comparison of trajectory control strategies. Preset Only executes the basic action sequence without online adaptation. Agent Only selects all actions online from generated observations and executed-action history. Preset + Agent adapts action execution online using the basic action sequence as a reference.
Table 4: Comparison of trajectory control strategies. Preset Only executes the basic action sequence without online adaptation. Agent Only selects all actions online from generated observations and executed-action history. Preset + Agent adapts action execution online using the basic action sequence as a reference.
Comparison of agent models. We conduct the comparison on Genie 3, with Preset + Agent control strategy. We recommend Claude Haiku as the agent model.
Table 5: Comparison of agent models. We conduct the comparison on Genie 3, with Preset + Agent control strategy. We recommend Claude Haiku as the agent model.
Basic ability of video world models on the PlayWorld benchmark. Video Quality includes Aesthetic Quality, Imaging Quality, Motion Smoothness, Temporal Flickering, Temporal Consistency, Depth Stability, and Subject Consistency. Action Controllability includes Translation Pass Rate and Rotation Pass Rate.
Table 6: Basic ability of video world models on the PlayWorld benchmark. Video Quality includes Aesthetic Quality, Imaging Quality, Motion Smoothness, Temporal Flickering, Temporal Consistency, Depth Stability, and Subject Consistency. Action Controllability includes Translation Pass Rate and Rotation Pass Rate.
Inter-rater agreement in the human-alignment study. All results are computed from the same 120 pairwise items and 600 judgments used in Fig. 6.
Table 7: Inter-rater agreement in the human-alignment study. All results are computed from the same 120 pairwise items and 600 judgments used in Fig. 6.
Representative failures across four evaluation dimensions. Current video world models can follow camera or action controls, but still struggle to simulate coherent and realistic world dynamics.
Figure 5: Representative failures across four evaluation dimensions. Current video world models can follow camera or action controls, but still struggle to simulate coherent and realistic world dynamics.
Alignment between human preferences and VQA metrics.
Figure 6: Alignment between human preferences and VQA metrics.
查看结构化数据
任务指标本文基线提升
长时程目标评测总分(四维平均) Rubric Overall(1-5 分制) Genie 3 最高 2.12 最弱的 Matrix-Game-3.0 仅 1.14 极差 0.98 分;且所有模型距满分 5 分仍然遥远,说明任务远未解决
几何一致性 Rubric 得分(1-5) Genie 3:2.74 HY-WorldPlay:1.12 最优与最差相差 1.62 分,闭源领先明显
交互保真度 Rubric 得分(1-5) Genie 3:2.40 Matrix-Game-3.0:1.25 差距 1.15 分;所有模型在进水等复杂交互上仍难产生合理物理反馈
出视野演化 Rubric 得分(1-5) Genie 3:1.81 HY-World2:1.09 差距 0.72 分,且九个模型全部低于 2 分
洞见演化(60 秒静止观察) Rubric 得分(1-5) LingBot-World2:1.95 Matrix-Game-3.0 / HY-WorldPlay 等:1.00-1.01 极差约 0.95 分;全部模型低于 2 分,是全基准最大短板
轨迹验证通过率(几何/交互/出视野平均) 验证通过率 Genie 3:87.1% HY-WorldPlay:41.6% 差距 45.5 个百分点;SANA-WM 通过率 80.4% 但 rubric 总分仅 1.48,证明控制与能力脱节
动作可控性 平移/旋转通过率 Hunyuan-GameCraft 平移 89.6%(最高) 其自身旋转通过率仅 29.4%;Matrix-Game-3.0 旋转 27.7% 通过控制阈值也不保证达成目标状态,说明自动指标只能测基础能力
控制策略消融(Genie 3 / HappyOyster 各 25 例) 人类偏好 + 轨迹分 Preset+Agent:65.6% / 67.4%,轨迹分 1.08 / 1.12 Preset Only:39.6% / 40.8%;Agent Only:29.2% / 24.4% 人类偏好领先纯预设约 26 个百分点、领先纯智能体约 36 个百分点
自动指标与人类偏好一致性 Spearman ρ(9 模型排名) Overall ρ=0.933,几何一致性 ρ=0.983 出视野 0.812、洞见 0.745 为较低维度 所有维度 ρ≥0.745 且统计显著(p<0.05),验证 VQA 评分有效

局限与改进

作者承认的局限:(1) VQA 评分依赖 Gemini 3.1 Pro,两次独立打分方差虽仅 0.0112,但作者自认这并非评分不确定性的精确估计,推荐多次打分取平均;(2) 洞见演化采用静止观察、不适用轨迹验证门,四维协议不完全对称;(3) 模型适配问题——HY-World2 对初始图像有全局建模要求,不满足的案例被跳出其分数聚合,Hunyuan-GameCraft 每个生成块要求非空动作输入,导致长时间 WAIT 的洞见演化案例无法按预期协议评测,即跨模型比较并非在完全相同的案例集合上进行;(4) 人类研究 Fleiss' κ 仅 0.434,交互保真维度低至 0.323、全票一致率仅 16.7%,主观判断噪声不小。我自己的观察:(1) 评测链路强依赖两个商业黑箱模型(Claude Haiku 当玩家、Gemini 当阅卷官),评分标准难以完全审计,也有“用大厂自有模型给竞品打分”的中立性争议;(2) 40 步预算、10-60 秒 rollout 对真正的“长时程”(分钟级以上)仍偏短;(3) 智能体的 Stop/Correct 决策可能系统性地把轨迹“救”向成功,反而掩盖模型在固定指令下的失败模式;(4) 820+ 个 rubric 问题由单一 VLM 回答,缺乏问题措辞敏感性的消融。

独立分析的弱点

独立分析几个弱点。第一,裁判模型依赖与潜在偏见:玩家是 Claude Haiku 4.5、阅卷官是 Gemini 3.1 Pro,两个商业模型的版本升级都可能破坏基准分数的纵向可比性;rubric 问题由 Gemini 辅助生成再人工校对,质量上限受制于 VLM 的视觉理解能力(判断“涟漪是否逼真”“水深是否变化”这类细粒度物理线索恰是 VLM 弱项),改进方向是引入光流、深度一致性等客观物理信号作补充。第二,评分区分度不足:1-5 分制下多数模型挤在 1-2 分区间(洞见演化仅 1.00-1.95),尾部模型难以区分,可细化为连续量表或按子能力分解。第三,覆盖面有限:171 个案例中机器人主体仅 3 个、交互保真案例最少(30 个),缺少多智能体与密集遮挡场景;动作空间只有 W/A/S/D + 视角键 + WAIT,不支持鼠标点击、抓取等连续控制。第四,网页模型评测完全依赖浏览器自动化,登录、排队、页面改版都可能造成数据缺失,HY-World2 跳过案例说明样本不平衡已实际发生,可推动厂商提供标准化评测 API。第五,低分归因缺失:论文未做控制变量实验(如改变离开视野时长、遮挡间隔),无法区分出视野/洞见演化低分源于记忆容量不足、状态编码缺陷还是采样随机性,限制了发现对训练的指导价值。

未来方向

作者明确提出的方向包括:随着更强的多模态模型出现随时升级 Agent Player(Table 5 已证明框架对底层模型不敏感);在预算允许时对 VQA 打分做多次独立平均以降低 verifier 方差。基于本文成果可自然延伸的方向:(1) 把“持续状态演化是最大瓶颈”这一发现转化为训练信号——例如用出视野重访一致性作为世界模型后训练(RLHF/DPO)的奖励,或设计强制状态保持的外显记忆架构;(2) 扩展到分钟级、小时级的超长时程评测,检验全局 3D 表征的持久性与世界拓扑一致性(泰姬陵多副本问题);(3) 引入多智能体场景(多人对话、交通流)和与物理模拟器状态对齐的评测;(4) 评测即训练:用 PlayWorld 的 rubric 构建自动反馈闭环,直接优化世界模型;(5) 反事实评测——同一初始世界下系统性扰动动作序列,量化模型对动作-结果因果关系的敏感度;(6) 支持连续控制空间(鼠标、手柄摇杆)和音频等多模态观测的评测维度。

复现评估

论文声明代码和数据已在项目页公开(https://kxding.github.io/project/PlayWorld/),含 171 个人工标注案例和 820+ 个 VQA 问题,评测协议描述完整(prompt 结构、两条 contact-sheet 流参数、验证门逻辑、加权公式俱全),材料齐全度在基准论文中属较高水平。算力门槛不高但有两块硬依赖:其一,五个网页模型(Genie 3、HappyOyster、LingBot-World、LingBot-World2、HY-World2)需要相应服务账号与访问权限,浏览器自动化依赖网页版式稳定,是最大复现风险;四个本地模型(SANA-WM、Hunyuan-GameCraft、HY-WorldPlay、Matrix-Game-3.0)需要能跑视频扩散/自回归模型的 GPU(单卡 A100/H100 级别即可逐个运行)。其二,评分链路依赖 Gemini 3.1 Pro API(1400+ 条视频、每条数十个问题的调用量)和 Claude Haiku 4.5 API(每案例最多 40 步决策调用),有持续 API 成本。难度评估:只复现“评分”部分(Table 2/3/6),拿到已发布的 rollout 视频即较容易;完整复现“采集”部分(重跑九个模型)则受制于网页模型访问与版本漂移,难度中等偏高。论文给出的两遍打分方差(0.0112)和人类一致性数据(κ=0.434)也为复现者提供了现成校验标尺。