PlayWorld:用智能体玩家在长时程目标下评测视频世界模型 PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型
前置知识
视频世界模型 (Video World Model)
以当前观测帧和用户动作为条件、自回归地逐块生成未来视觉状态的生成模型。与一次性文生视频不同,它持续响应 W/A/S/D、镜头转向等控制信号,让用户在一个可交互的开放世界中自由探索,代表系统包括 Genie 3、HappyOyster、LingBot-World、Matrix-Game 等。
本文的全部评测对象就是这类模型。理解“动作→下一帧观测”的闭环生成方式,才能理解为什么评测必须在线交互,而不能像普通视频基准那样一次性生成再打分。
动作粒度差异 (Action Granularity)
不同世界模型对同一控制输入的响应幅度不同。例如同样三个转向指令,模型 A 能完成 360° 整圈回转,模型 B 只转了半圈;同样一个前进指令,不同模型移动的距离可能相差数倍。
这是现有固定轨迹评测不公平的根源,也是本文引入智能体玩家在线调整动作的直接动因。论文用“绕 Marina Bay Sands 转 360° 后地标能否重现”这一例子具体说明了问题。
出视野状态演化 (Out-of-sight Evolution)
评测目标离开视野再重新出现后,其身份是否保持、状态是否在不可见期间继续合理演化。例如一个人在画面外继续削苹果,转回镜头时果皮应当变长;一幅进行中的画作应该在遮挡期间新增内容。
这是 PlayWorld 四个评测维度之一。实验发现它是当前所有世界模型的最大短板(5 分制下全部低于 2 分),是理解论文核心结论的关键概念。
VLM-as-Judge 与 VQA 细则评分
用大型多模态模型(如 Gemini 3.1 Pro)代替人工,对生成视频回答若干 Yes/No 问题并加权汇总成分数。本文额外加了“维度专属验证门”:先判断轨迹是否有效(未通过直接记最低分 1 分),再按 $R_d = \frac{\sum_{j \in A_d} w_j a_j}{\sum_{j \in A_d} w_j}$ 加权、用 $S_d = 1 + 4R_d$ 映射到 1-5 分制。
PlayWorld 的全部主结果都来自这套 VQA rubric verifier。理解验证门机制和加权公式,才能正确解读论文表格中分数的含义与边界。
相机位姿估计与可控性指标
用 VGGT 等模型从均匀采样帧估计相机位姿,与动作序列(含智能体在线调整)定义的目标轨迹对比,计算平移误差与平均测地旋转误差,低于阈值(平移误差 < 0.3、旋转误差 < 45°)即判为通过。
论文用它度量动作可控性(Translation/Rotation Pass Rate),并据此发现“可控性好不等于世界模拟能力强”这一重要观察,是区分两类指标的必备背景。
研究动机
视频世界模型在近两年爆发式增长,Genie 3、HappyOyster、LingBot-World、HY-World2、Matrix-Game-3.0 等系统都能生成可交互的长序列视频,但如何公平比较它们仍是悬而未决的问题。现有基准(WorldScore、WorldMark、WBench、MemoBench 等)普遍采用预先定义好的固定动作轨迹:脚本下发一串固定的 W/A/S/D 和镜头指令,再检查生成结果是否达标。问题在于各模型的动作粒度差异巨大——论文举例说,为验证几何一致性,评测者想让相机原地转 360° 回到 Marina Bay Sands 的初始视角,同样三条转向指令在模型 A 上能完成整圈、地标离开又重新进入视野,在模型 B 上却只转了半圈、地标再没回来,这样算出的几何一致性分数根本不可比。更复杂的动作模式(如保持视线方向不变、绕雕塑公转一周)所需的动作时长和停止时机因模型而异,固定轨迹无法可靠完成。此外,Genie 3、HappyOyster 这类闭源系统只有网页界面,此前只能靠人工逐条交互评测,费时费力且容易引入主观偏差。
本文的目标是本文要把“人类玩家如何评测世界模型”这一真实过程自动化。现实中用户不是逐条核对固定轨迹,而是带着一个长时程目标去交互:比如“原地转 360° 看环境是否保持一致”“走进水里看是否产生逼真的涟漪和水深变化”。PlayWorld 的目标是建立一套自动化闭环评测协议:用一个多模态智能体(Agent Player)扮演人类玩家,给定长时程目标和一条人标的基本动作序列作为共享参考,智能体在每一步观察生成帧与历史动作,动态决定 Keep(保持)、Stop(提前结束动作)、Extend(延长动作)、Correct(修正或跳过下一步)或 End(目标已达成、结束评测),从而在动作粒度各异的模型上达成同一评测意图,实现公平的跨模型比较;同时在几何一致性、交互保真度、出视野演化、洞见演化四个核心维度上给出可复现的自动评分,并配套视频质量与动作可控性等基础能力指标。
与已有工作不同的是,本文的独特切入是“以目标为中心的闭环评测”这一范式转换。此前所有世界模型基准都在“输入什么动作序列”上做文章:WorldScore/WorldMark 用预定义相机轨迹,WBench/WorldRoamBench 引入预定义多轮导航模式,MemoBench/STEVO-Bench 用固定时刻表测试记忆与出视野演化,但它们都无法根据生成观测在线调整——一旦模型响应幅度不同,评测状态就不可比。PlayWorld 的关键洞察是:评测意图(objective)应当跨模型恒定,而实现意图的动作序列应当因模型而异。它保留一条人标基本动作序列作为共享先验(解决纯在线规划的延迟高、跨模型轨迹发散问题),又允许智能体在 40 步交互预算内做五种在线决策(实测只修改约 12%-15% 的动作),既保证可比性又保证公平性。消融实验证明该 Preset+Agent 策略在人类偏好上大幅超过纯预设(39.6%→65.6%)和纯智能体(29.2%→65.6%)两种极端方案。
核心方法
直觉上,PlayWorld 就是一个“机器人玩家”:它像真人一样坐在 Genie 3 或 HappyOyster 的网页界面(或本地推理管线)前,拿到一张初始场景图和一个目标(如“绕雕像公转一周且视线方向不变”),然后不断按键、看画面、判断目标是否达成,最后把整段交互录屏交给一个自动阅卷官(VQA rubric verifier)按细则打分。技术路线分三部分:(1) Agent Player——一个可替换的多模态大模型(论文最终选用 Claude Haiku 4.5)加执行接口,负责在线决策;(2) Agent 接口——把抽象的 W/A/S/D、↑/↓/←/→、WAIT 指令翻译成各模型的原生控制格式,网页模型用浏览器自动化派发按键并抓帧,本地模型用分块生成适配器;(3) 评测协议——171 个人工标注场景,每个场景含初始世界、场景化目标和基本动作序列,rollout 约 10-60 秒、最多 40 步交互预算;生成视频由 Gemini 3.1 Pro 按 1-5 分制在四个维度打分,另配七项视频质量指标和两项可控性通过率合成基础能力分。
核心创新是把评测单元从“动作序列”换成“长时程目标 + 共享参考序列”,与已有方法的本质区别有三点。第一,闭环自适应:现有基准都是开环的(下发固定指令、不管画面长什么样),PlayWorld 的智能体每一步都观察生成帧并做出 Keep/Stop/Extend/Correct/End 五种决策之一,使动作粒度不同的模型都能到达可比的评测状态——Table 1 中它是唯一在 Closed-Loop Adaptation 上打 ✓ 的基准。第二,人机混合控制(Preset + Agent):完全预设(Preset Only)会过冲或欠冲,完全在线(Agent Only)则决策延迟高、跨模型轨迹发散(Table 4 显示其人类偏好仅 24.4%-29.2%),而以人标序列为参考、只做约 12%-15% 定向修改的混合策略在轨迹分和人类偏好上都是最优。第三,带验证门的细则打分:先做维度专属验证(几何/出视野用 Trajectory Validity,交互用 Subject and Reachability),不通过直接记 1 分,避免 MemoBench 指出的“指令跟随失败污染记忆评测”问题。
方法步骤详情
第一步构建基准:从 Pexels 与 Google Images 收集候选图片(涵盖自然、城市、奇幻场景,主体含人、动物、车辆等六类),标注者筛选图片并选定第一/第三人称视角,Gemini 3.1 Pro 生成环境描述、人工校对;随后写下长时程目标、可视觉验证的完成条件和基本动作序列(单条到五条组合、50+ 动作模式),并按维度构建样本专属 VQA 细则,共 820+ 问题(身份与外观 317、物理与动力学 236、时间演化 203、空间与轨迹 72)。第二步闭环交互:每个案例把相同的初始帧、目标和基本动作序列发给九个模型;接口执行当前动作、抓取生成帧返回智能体;智能体综合生成帧、剩余序列、动作历史与目标,输出 Keep/Stop/Extend/Correct/End 决策,循环至 End 或 40 步预算耗尽,产出 10-60 秒 rollout。第三步验证门:Gemini 先判轨迹有效性(几何/出视野)或主体可达性(交互),失败则该维度记 1 分。第四步细则打分:视频组织成两条 contact-sheet 流(主流 10 FPS、384×216、25 帧 5×5 网格;细节流 0.5 FPS、800×450、2×2 网格),Gemini 对每个适用问题返回 $a_j \in \{0,1\}$ 及证据,权重为普通问题 1、定义性问题 2、N/A 为 0,维度分 $S_d = 1 + 4R_d$,Overall 为四维无权平均。第五步基础能力:七项视频质量指标加两项可控性通过率(VGGT 估位姿,平移误差 < 0.3、旋转误差 < 45° 算通过),九项指标平均排名转为百分比形式的 Basic Ability Score。
技术新颖性
技术新颖性体现在评测范式而非模型本身。其一,首次把“长时程目标 + 智能体在线执行”引入世界模型基准(对照 Table 1:此前六个基准全部没有闭环适应,仅 WorldMark 部分支持长时程回访),类似从“固定考卷”进化到“面试官根据考生回答追问”。其二,工程上打通了闭源网页模型的自动化评测——通过浏览器自动化完成登录、派发控制、抓帧和全程记录(Figure 7),使 Genie 3 和 HappyOyster 这类无法本地部署的系统能与开源模型在完全相同的协议下比较。其三,验证门 + 加权细则的打分设计兼顾鲁棒性与可解释性:维度分可分解到具体问题,附录 B 报告两次独立打分的平均方差仅 0.0112,说明单次打分已足够稳定。其四,作者把“轨迹控制通过率”(Table 3)与“世界模拟能力”(Table 2)分离报告,揭示了 SANA-WM 这类“跑得到但演不好”的模型,这一区分在此前混用两者的基准中是被掩盖的。Table 5 的消融还表明框架对底层多模态模型不敏感——Claude Haiku/Sonnet/Gemini 3.1 Pro 的轨迹分差异很小,Agent Player 可随更强模型的出现随时升级。
实验结果
论文系统评测了九个代表性模型:闭源的 Genie 3、HappyOyster,开源的 LingBot-World、LingBot-World2、HY-World2、SANA-WM、Hunyuan-GameCraft、HY-WorldPlay、Matrix-Game-3.0。Table 2 的 rubric 总分(1-5 制)显示 Genie 3 以 2.12 居首(几何 2.74、交互 2.40、洞见 1.51、出视野 1.81),HappyOyster 1.92 第二;开源阵营中 LingBot-World2 凭 1.95 的洞见演化得分以 1.82 领先;Matrix-Game-3.0 垫底(1.14,出视野与洞见均为 1.00)。最重要的发现是持续状态演化是所有模型的最大瓶颈:九个模型的洞见演化得分全部落在 1.00-1.95、出视野演化全部低于 2 分,静观 60 秒时会出现动作重复、主体消失、火箭不升空等失败(Figure 5),说明模型擅长保持可见结构与即时响应,却无法维持跨时间、跨遮挡的语义状态演化。第二,长时程回访暴露全局空间不一致:绕泰姬陵 360° 后模型会在不同视点重新“生成”多个不一致的地标副本,单帧看似合理但整段违反空间唯一性,反映模型依赖局部外观连续性而非持久的全局 3D 表征。第三,Table 3 显示“可控性好不等于能力强”:SANA-WM 轨迹验证总通过率 80.4%(高于 HappyOyster 的 79.6%)但 rubric 总分仅 1.48;Hunyuan-GameCraft 几何维度通过率仅 25.0%、HY-WorldPlay 仅 14.6%。第四,Table 6 中 HappyOyster 以 76.4% 的 Basic Ability Score 领先(Genie 3 为 72.2%),但 Hunyuan-GameCraft 平移通过率 89.6% 全场最高而旋转仅 29.4%,说明视频质量高、控制通过也不等于能完成长时程目标。第五,人类验证证实指标可信:600 次两两判断中 95.8% 达多数一致、Fleiss' κ=0.434,VQA 分数与人类偏好的 Spearman 相关 Overall 达 ρ=0.933、几何一致性 ρ=0.983(均 p<0.05)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长时程目标评测总分(四维平均) | Rubric Overall(1-5 分制) | Genie 3 最高 2.12 | 最弱的 Matrix-Game-3.0 仅 1.14 | 极差 0.98 分;且所有模型距满分 5 分仍然遥远,说明任务远未解决 |
| 几何一致性 | Rubric 得分(1-5) | Genie 3:2.74 | HY-WorldPlay:1.12 | 最优与最差相差 1.62 分,闭源领先明显 |
| 交互保真度 | Rubric 得分(1-5) | Genie 3:2.40 | Matrix-Game-3.0:1.25 | 差距 1.15 分;所有模型在进水等复杂交互上仍难产生合理物理反馈 |
| 出视野演化 | Rubric 得分(1-5) | Genie 3:1.81 | HY-World2:1.09 | 差距 0.72 分,且九个模型全部低于 2 分 |
| 洞见演化(60 秒静止观察) | Rubric 得分(1-5) | LingBot-World2:1.95 | Matrix-Game-3.0 / HY-WorldPlay 等:1.00-1.01 | 极差约 0.95 分;全部模型低于 2 分,是全基准最大短板 |
| 轨迹验证通过率(几何/交互/出视野平均) | 验证通过率 | Genie 3:87.1% | HY-WorldPlay:41.6% | 差距 45.5 个百分点;SANA-WM 通过率 80.4% 但 rubric 总分仅 1.48,证明控制与能力脱节 |
| 动作可控性 | 平移/旋转通过率 | Hunyuan-GameCraft 平移 89.6%(最高) | 其自身旋转通过率仅 29.4%;Matrix-Game-3.0 旋转 27.7% | 通过控制阈值也不保证达成目标状态,说明自动指标只能测基础能力 |
| 控制策略消融(Genie 3 / HappyOyster 各 25 例) | 人类偏好 + 轨迹分 | Preset+Agent:65.6% / 67.4%,轨迹分 1.08 / 1.12 | Preset Only:39.6% / 40.8%;Agent Only:29.2% / 24.4% | 人类偏好领先纯预设约 26 个百分点、领先纯智能体约 36 个百分点 |
| 自动指标与人类偏好一致性 | Spearman ρ(9 模型排名) | Overall ρ=0.933,几何一致性 ρ=0.983 | 出视野 0.812、洞见 0.745 为较低维度 | 所有维度 ρ≥0.745 且统计显著(p<0.05),验证 VQA 评分有效 |
局限与改进
作者承认的局限:(1) VQA 评分依赖 Gemini 3.1 Pro,两次独立打分方差虽仅 0.0112,但作者自认这并非评分不确定性的精确估计,推荐多次打分取平均;(2) 洞见演化采用静止观察、不适用轨迹验证门,四维协议不完全对称;(3) 模型适配问题——HY-World2 对初始图像有全局建模要求,不满足的案例被跳出其分数聚合,Hunyuan-GameCraft 每个生成块要求非空动作输入,导致长时间 WAIT 的洞见演化案例无法按预期协议评测,即跨模型比较并非在完全相同的案例集合上进行;(4) 人类研究 Fleiss' κ 仅 0.434,交互保真维度低至 0.323、全票一致率仅 16.7%,主观判断噪声不小。我自己的观察:(1) 评测链路强依赖两个商业黑箱模型(Claude Haiku 当玩家、Gemini 当阅卷官),评分标准难以完全审计,也有“用大厂自有模型给竞品打分”的中立性争议;(2) 40 步预算、10-60 秒 rollout 对真正的“长时程”(分钟级以上)仍偏短;(3) 智能体的 Stop/Correct 决策可能系统性地把轨迹“救”向成功,反而掩盖模型在固定指令下的失败模式;(4) 820+ 个 rubric 问题由单一 VLM 回答,缺乏问题措辞敏感性的消融。
独立分析的弱点
独立分析几个弱点。第一,裁判模型依赖与潜在偏见:玩家是 Claude Haiku 4.5、阅卷官是 Gemini 3.1 Pro,两个商业模型的版本升级都可能破坏基准分数的纵向可比性;rubric 问题由 Gemini 辅助生成再人工校对,质量上限受制于 VLM 的视觉理解能力(判断“涟漪是否逼真”“水深是否变化”这类细粒度物理线索恰是 VLM 弱项),改进方向是引入光流、深度一致性等客观物理信号作补充。第二,评分区分度不足:1-5 分制下多数模型挤在 1-2 分区间(洞见演化仅 1.00-1.95),尾部模型难以区分,可细化为连续量表或按子能力分解。第三,覆盖面有限:171 个案例中机器人主体仅 3 个、交互保真案例最少(30 个),缺少多智能体与密集遮挡场景;动作空间只有 W/A/S/D + 视角键 + WAIT,不支持鼠标点击、抓取等连续控制。第四,网页模型评测完全依赖浏览器自动化,登录、排队、页面改版都可能造成数据缺失,HY-World2 跳过案例说明样本不平衡已实际发生,可推动厂商提供标准化评测 API。第五,低分归因缺失:论文未做控制变量实验(如改变离开视野时长、遮挡间隔),无法区分出视野/洞见演化低分源于记忆容量不足、状态编码缺陷还是采样随机性,限制了发现对训练的指导价值。
未来方向
作者明确提出的方向包括:随着更强的多模态模型出现随时升级 Agent Player(Table 5 已证明框架对底层模型不敏感);在预算允许时对 VQA 打分做多次独立平均以降低 verifier 方差。基于本文成果可自然延伸的方向:(1) 把“持续状态演化是最大瓶颈”这一发现转化为训练信号——例如用出视野重访一致性作为世界模型后训练(RLHF/DPO)的奖励,或设计强制状态保持的外显记忆架构;(2) 扩展到分钟级、小时级的超长时程评测,检验全局 3D 表征的持久性与世界拓扑一致性(泰姬陵多副本问题);(3) 引入多智能体场景(多人对话、交通流)和与物理模拟器状态对齐的评测;(4) 评测即训练:用 PlayWorld 的 rubric 构建自动反馈闭环,直接优化世界模型;(5) 反事实评测——同一初始世界下系统性扰动动作序列,量化模型对动作-结果因果关系的敏感度;(6) 支持连续控制空间(鼠标、手柄摇杆)和音频等多模态观测的评测维度。
复现评估
论文声明代码和数据已在项目页公开(https://kxding.github.io/project/PlayWorld/),含 171 个人工标注案例和 820+ 个 VQA 问题,评测协议描述完整(prompt 结构、两条 contact-sheet 流参数、验证门逻辑、加权公式俱全),材料齐全度在基准论文中属较高水平。算力门槛不高但有两块硬依赖:其一,五个网页模型(Genie 3、HappyOyster、LingBot-World、LingBot-World2、HY-World2)需要相应服务账号与访问权限,浏览器自动化依赖网页版式稳定,是最大复现风险;四个本地模型(SANA-WM、Hunyuan-GameCraft、HY-WorldPlay、Matrix-Game-3.0)需要能跑视频扩散/自回归模型的 GPU(单卡 A100/H100 级别即可逐个运行)。其二,评分链路依赖 Gemini 3.1 Pro API(1400+ 条视频、每条数十个问题的调用量)和 Claude Haiku 4.5 API(每案例最多 40 步决策调用),有持续 API 成本。难度评估:只复现“评分”部分(Table 2/3/6),拿到已发布的 rollout 视频即较容易;完整复现“采集”部分(重跑九个模型)则受制于网页模型访问与版本漂移,难度中等偏高。论文给出的两遍打分方差(0.0112)和人类一致性数据(κ=0.434)也为复现者提供了现成校验标尺。
论文图表