H2R-Bench:世界模型中人至机器人操作视频生成的评测基准 H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models
首个系统评估视频世界模型能否把人类第一人称演示跨具身转写为机器人操作视频的基准
前置知识
视频世界模型(Video World Model)
指以大规模视频生成模型(多为扩散 Transformer,如 Sora、Wan、Seedance)为基础、能按时间演化预测环境未来视觉状态的模型。世界模型视角认为生成视频不只是“好看”,而是对物体动力学、状态转移与交互后果的隐式模拟。机器人领域希望用它低成本合成训练数据:给定初始状态或演示,让模型“想象”出机器人执行任务的未来画面。
本文评测的对象正是这类模型,检验它们能否把人类演示转写为以机器人为中心的操作视频,从而把海量人类视频变成机器人训练资源。
自我中心视频与 EgoDex
自我中心(egocentric)视频指头戴相机从第一人称视角记录的手部操作画面,天然包含任务目标、物体可供性、手-物接触与物理状态变化。EgoDex 是一个大规模自我中心灵巧操作数据集,本文从中抽取测试集片段作为人类演示源。
H2R-Bench 全部 120 条源案例都来自 EgoDex 测试集,理解源数据的形态(5 秒片段、手部操作、可见状态变化)是理解基准构造方式的前提。
跨具身迁移(Cross-Embodiment Transfer)
指同一任务技能在不同机器人本体(如二指平行夹爪与五指灵巧手)之间的转换。人手与机器人末端执行器在形态、自由度和抓取方式上差异巨大,因此迁移不是简单的画面替换,而要在保持任务目标、动作事件与功能接触等价的前提下,适配新本体的运动与接触策略。
本文的核心问题就是视频生成模型能否完成“人→指定机器人本体”的视觉级迁移,并首次给出了可操作的判定维度与硬失败规则。
MLLM 评委与 0-4 量规(Rubric)
用多模态大模型代替人类给生成视频打分:向评委提供均匀采样的视频帧和评分细则,评委返回结构化 JSON,含逐项 0-4 分、证据帧索引与理由;多个评委独立打分后取平均以降低单模型偏差。本文使用 Gemini 3.5 Flash、Qwen3.7-Plus、GPT-5.4 三个评委,温度设为 0。
H2R-Bench 的 M1-M4 四个迁移指标全部由 MLLM 评委按统一量规自动评分,论文还系统验证了这套自动评分与 3 名人类评分者的一致性,是理解其指标可信度的关键。
视频质量自动指标(MUSIQ / CLIP 美学 / AMT-S)
一类无需人工参照的任务无关质量度量:MUSIQ 评估逐帧成像质量;LAION 线性预测器基于归一化 CLIP ViT-L/14 特征估计美学;时间稳定性用相邻帧差异衡量;AMT-S 用中间帧插值重建误差衡量运动平滑度。四者裁剪到 [0,1] 后平均即本文的 M5 视频质量分。
论文用 M5 与迁移得分对照,证明“画面好”与“迁移正确”几乎不相关(Spearman ρ=0.14),这是全文最有冲击力的结论之一,也解释了为什么需要新基准。
研究动机
机器人学习需要大规模、覆盖多任务、多物体、多环境的操作演示,但采集机器人演示极其昂贵:需要专用硬件、遥操作接口、标定好的相机、安全约束和反复的物理执行。相反,自我中心人类操作视频资源丰富,天然记录了物体可供性、手-物接触、操作意图与物理状态变化,但人手与机器人末端执行器差异巨大,直接跨本体使用困难。视频世界模型的出现提供了新路径——从人类观察合成以机器人为中心的操作视频,作为目标机器人执行的中间表示;然而这些模型的跨具身迁移能力此前几乎未被系统评估:现有视频生成基准(如 VBench)只测视觉保真、时间连贯与文本对齐,新近的机器人导向基准(WorldModelBench、RBench、RoboWM-Bench、RoboTrustBench)大多以文本、初始图像或机器人视角场景为条件,评估画面合理性、物理常识或动作完整性,无法诊断“人→机器人”特有的失败,例如没有把人换成机器人、人仍是主要操作者、接触区域或操作模式与源演示不符、末端执行器形态错误等。
本文的目标是本文要建立一个系统化的诊断框架,回答:给定一段自我中心人类演示视频和目标机器人本体(平行夹爪或灵巧手),当前视频生成模型能否生成既忠实保留源演示的任务目标、动作事件、功能接触与物体响应,又以指定机器人本体正确执行的生成视频?具体目标包括四点:其一,构造源锚定、结构化标注的迁移案例集(120 源 × 2 本体 = 240 案例);其二,设计把“迁移正确性”与“画面质量”分离的评估协议,含五个维度与加权总分 H2RCore;其三,用统一的原生接口协议评测 11 个主流视频生成模型并给出能力画像;其四,用 3 名人类评分者对 660 个视频的独立打分验证自动指标的可信度,并给出失败模式诊断。
与已有工作不同的是,本文的独特切入是“相对源演示(source-relative)”的评估设定:源人类视频被当作“发生了什么”的证据而非风格参考,生成视频必须保留该特定演示的任务目标和功能交互,同时把执行者替换为指定本体;评估明确不要求位姿或轨迹模仿——夹爪和灵巧手可以用不同策略完成任务,只要兼容目标形态和源任务。另一处刻意设计是主实验不提供目标机器人参考图,只用文本指定本体,这检验的是模型对具身指令的真实理解而非参考图匹配能力。与现有基准相比(见原文 Table 1),VBench 不支持图生视频与机器人评估,WorldModelBench 部分支持,H2R-Bench 是唯一同时覆盖图生视频、机器人视频评估与人到机器人迁移、且全部覆盖目标/动作/接触/具身四个维度的基准;其加权设计把接触与具身各占 0.30(合计 60%),显式惩罚“人还在操作”或“用错末端执行器”这类硬失败。
核心方法
直觉上,评价一段“人→机器人”生成视频好不好,不能只问画面是否逼真,而要对照源演示逐项核查四件事:任务最终状态是否达成(M1)、所需动作事件是否发生(M2)、机器人是否建立了功能等价的接触(M3)、执行者是否是指定机器人本体(M4);画面质量(M5)单独计算、不参与迁移判定。技术路线上,基准从 EgoDex 测试集筛选 120 条 5 秒自我中心片段,按“决定任务成功的物理状态变化”分为 6 个操作族(每族 20 条),每条片段配对 2 个目标本体(平行夹爪、灵巧手)得到 240 个案例;用 Qwen3.7-Plus 从视频自动生成结构化标注(任务族、加权目标谓词、动作事件、功能接触区域与模式、预期物体响应、具身策略),全部经人工对照源视频核验。生成阶段每个模型使用其最强的公开源条件接口(视频或有序帧),评估时统一均匀采样 25 帧,M1-M4 由三个 MLLM 评委按 0-4 量规独立打分,最终聚合为 $\mathrm{H2RCore} = 100\,(0.15\,S_{\text{goal}} + 0.15\,S_{\text{action}} + 0.30\,S_{\text{contact}} + 0.30\,S_{\text{emb}} + 0.10\,S_{\text{video}})$。
核心创新有三点。其一,source-relative 评估设定:以具体的人类演示为锚点,要求生成视频保留该演示的加权目标谓词集合 $G_c$、必需事件集合 $E_c$、功能接触与物体响应,而非生成“看起来合理”的泛化机器人视频;M3 还设置 source-grounding 硬失败门——若生成视频替换了源场景或任务实体则直接记 0 分,防止“在别的场景里做出泛化接触”被误计为迁移成功。其二,把功能接触迁移与具身正确性各赋 0.30 权重(合计 60%),显式编码“有效迁移 = 功能上有支撑的交互 + 正确的机器人形态”这一领域判断,使视频质量(仅 0.10)无法弥补具身失败——这直接暴露了 Veo 3.1、HunyuanVideo 这类“画面精美但没换本体”模型的短板。其三,原生接口协议:每个模型用其最强的公开条件接口(Seedance 2.0、Wan2.7、Kling-V3 接收完整源视频,其余接收有序源帧),提示词只描述任务与本体、不含评估权重或证据帧索引,评估时所有模型使用相同的 25 帧证据预算,既保证公平又贴近真实使用方式。
方法步骤详情
第一步,源筛选与分层:从 EgoDex 测试集选取实体可见、状态变化明确、交互证据充分的 5 秒自我中心片段,按物理状态变化分为 F1 刚体重排、F2 机构操作、F3 插入装配、F4 可变形物体配置、F5 散装材料转移、F6 表面/材料变化六族,每族 20 条,共 120 条。第二步,结构化标注:Qwen3.7-Plus 观看源视频与 32 帧均匀采样帧(含首末帧),输出固定 JSON schema 的标注(初始/最终状态、实体、事件、接触证据),并为每个目标本体补充功能接触区域、操作模式、预期物体响应与双手角色;每条标注人工核验并带有效性判定。第三步,生成:案例形式化为 $x_i = (V_i^{h}, e_i, p_i)$,其中 $V_i^{h}$ 是人类源视频、$e_i$ 是目标本体、$p_i$ 是生成提示;模型输出 $V_i^{m} = G_m(Z_i^{m}, p_i)$,$Z_i^{m}$ 是其接口支持的源输入(完整视频或尽量保留时间端点的帧子集),输出保持原生分辨率与帧率。第四步,五维评分:M1 对 25 帧生成序列的末态按加权谓词打分;$S^{\text{action}}$ 对必需事件加权平均;M3 用 25 源帧加接触规范对照 25 生成帧,评接触区域迁移、接触建立、操作模式、时序上受支撑的物体响应、具身兼容策略五个维度(不适用的维度跳过);M4 评机器人在场(0.20)、人类手消失(0.20)、本体类别(0.20)、末端执行器正确(0.25)、时间结构一致(0.15),无人形或人为主操作的硬失败记 0;M5 由 MUSIQ 成像、LAION 美学、相邻帧稳定性与 AMT-S 平滑度四项平均,与任务标注无关。第五步,聚合:三评委分数归一化平均→视频级→数据集级→按上式加权得 H2RCore。
技术新颖性
与现有工作的本质区别:(1) 与 VBench、EvalCrafter 等通用视频基准不同,保真对象从文本提示换成了一段具体源演示,评估问题从“画面是否逼真”变为“证据是否被正确搬运”;文中 Table 1 显示只有 H2R-Bench 在 I2V、机器人视频评估、H2R 迁移三列全部打勾且八个维度全覆盖。(2) 与 WorldModelBench、RBench、RoboWM-Bench、RoboTrustBench 等机器人导向基准不同,那些工作或以文本/初始图像为条件、或面向机器人视角场景,H2R-Bench 首次把“人演示→指定本体执行”作为一等评估对象,并能区分目标、动作、接触、具身四类失败。(3) 与 Mitty、H2R-Grounder、Human2Robot 等生成或迁移方法本身不同,本文不提出新模型,而是提供可复用的度量协议:结构化源标注只用于评分不暴露给生成器、评委输出结构化 JSON 且验证证据帧、场景替换设为硬失败、并用人类评分(场景内 Spearman $\rho=0.883$、聚合 Pearson $r=0.930$)校验自动协议。(4) 权重敏感性分析表明,在等权、高画质权、仅迁移权三种替代方案下与默认排序的 Kendall 相关为 0.927-1.000,排序稳健,这种统计交代在基准论文中少见。
实验结果
发现一:视频条件模型垄断前三。Seedance 2.0 居首(夹爪 77.3 / 灵巧手 84.6),Wan2.7 次之(76.5/83.1),Kling-V3 第三(74.5/81.7);领先者的分离主要来自接触迁移与具身正确性,而非目标或动作分。发现二:画质与迁移严重脱钩。Veo 3.1 的夹爪 M1 达 0.725、灵巧手 M2 达 0.816,但 M4 仅 0.100/0.227;HunyuanVideo 1.5-I2V 的 M5 全场最高(0.806/0.808)而 contact≈0.185、embodiment≈0;所有模型 M5 挤在 0.73-0.81,H2RCore 却横跨 30.0-84.6,两者秩相关仅 $\rho=0.14$。发现三:目标本体影响不对称——灵巧手平均比夹爪高 3.3 分(9/11 模型更高),contact +0.055(11/11 模型为正)、embodiment +0.047;三个视频条件模型提升最大(Seedance +7.3、Wan2.7 +6.6、Kling-V3 +7.2),原因是灵巧手与人手形态更接近,替换执行者时更易保住接触;但 Grok Imagine 与 Mitty-EPIC 反而更低。发现四:机器人参考图并非普适良方:Wan2.7 夹爪受益巨大(76.5→83.1,contact 0.766→0.871、embodiment 0.772→0.875),灵巧手仅 +1.1;Kling-V3 反跌(夹爪 −13.5、灵巧手 −8.3),Seedance 亦跌(−8.8/−4.4),而 M5 在所有设定下几乎不变。发现五:稀疏帧证据不足:Seedance 从完整视频换成 9 张均匀帧(24 源消融),H2RCore 暴跌 27.6(夹爪)/41.4(灵巧手),M3 从 0.709 跌至 0.284、M4 从 0.598 跌至 0.104,生成常直接复现人类操作而非替换为本体。发现六:人类一致性验证了自动化评分:3 名评分者对 660 个视频打分,与 MLLM 的场景内 Spearman $\rho=0.883$,迁移子分 Pearson $r=0.930$(逐指标 r:M1 0.791、M2 0.818、M3 0.880、M4 0.877)。发现七:任务族差异明显,可变形物体(F4)是所有模型最强的族,说明难度主要由“是否需要精确定位的接触与部分隐藏的状态转移”决定,而非可见形变本身;定性案例(同一舀冰入杯演示)显示 HunyuanVideo 常保留人类为主动操作者、Veo 3.1 用错末端执行器,而 Seedance 保持可见的机器人-勺子接触并完成转移——证明只看最终状态不足以判定迁移成功。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 人→机器人迁移综合排名(灵巧手目标) | H2RCore (0-100) | Seedance 2.0 = 84.6(全场第一;Goal 0.744 / Action 0.832 / Contact 0.855 / Embodiment 0.911 / Quality 0.799) | 第二名 Wan2.7 = 83.1,第三名 Kling-V3 = 81.7;最低 HunyuanVideo 1.5-I2V = 30.7 | 较第二名 +1.5(95% CI [+0.92, +2.16]),较最弱 +53.9 |
| 人→机器人迁移综合排名(平行夹爪目标) | H2RCore (0-100) | Seedance 2.0 = 77.3(第一;Embodiment 0.768) | Wan2.7 = 76.5,Kling-V3 = 74.5;最低 HunyuanVideo 1.5-I2V = 30.0 | +0.79(95% CI [+0.08, +1.48],按源任务配对分层 bootstrap),与第二名差距接近统计噪声边缘 |
| 通用画质能否预测迁移能力(22 个模型-本体对) | Spearman ρ(VBench 式视频质量 vs H2RCore) | ρ = 0.14(几乎无秩关联) | 视频质量分数范围仅 0.73-0.81,而 H2RCore 范围 30.0-84.6 | 证明通用画质指标无法替代迁移诊断,M5 最高与 H2RCore 垫底可同时发生 |
| 完整视频条件 vs 9 帧稀疏证据(Seedance 2.0,24 源消融) | H2RCore (0-100) | 视频条件:70.9(夹爪)/ 85.1(灵巧手) | 9 张均匀帧条件:43.4(夹爪)/ 43.7(灵巧手);夹爪 M3 0.709→0.284,M4 0.598→0.104 | 视频证据带来 +27.6 / +41.4 分,而画质变化小于 0.02 |
| 自动评分协议 vs 人类评分(660 个生成视频) | Pearson r(迁移子分)与场景内 Spearman ρ | r = 0.930,场景内 ρ = 0.883;逐指标 r:M1 0.791、M2 0.818、M3 0.880、M4 0.877 | 评委两两之间 M4 一致性最高(0.874-0.892),M1-M2 约 0.58-0.70 | 证明 MLLM 多评委协议基本保留人类模型偏好,可作为可扩展的自动评估器 |
| 目标本体效应(同一 120 源,11 模型平均) | ΔH2RCore(灵巧手 − 平行夹爪) | +3.3 分,9/11 模型灵巧手更高;视频条件三模型 +6.6 至 +7.3 | 目标(M1 +0.002)、动作(M2 +0.008)、画质(M5 +0.004)几乎不变 | 增量全部来自 Contact +0.055(11/11)与 Embodiment +0.047(8/11),支持“形态相近利于迁移”假说 |
| 目标机器人参考图消融(三个视频条件模型) | H2RCore (0-100) | Wan2.7 夹爪 76.5→83.1(+6.6,Contact 0.766→0.871) | Kling-V3 夹爪 74.5→61.0(−13.5)、灵巧手 81.7→73.4(−8.3);Seedance 77.3→68.5(−8.8) | 参考图效果因模型而异,主要改变本体与交互依从而非画质(M5 变化仅百分之几) |
局限与改进
作者承认的局限(附录 D):基准评估的是可见迁移证据,不代表物理可执行性或下游策略性能;120 条 EgoDex 源与 2 个目标本体只覆盖操作场景变化的一部分;片段仅约 5 秒,未涉及长时演示;原生接口协议把“模型能力”与“源条件接口差异”混在一起(视频条件 vs 帧条件模型不完全可比);MLLM 评委在遮挡、细微接触或严重生成伪影下仍可能误判,尽管有多评委聚合与人工验证。我的补充观察:(1) 标注由 Qwen3.7-Plus 生成后人工核验,但仍以 MLLM 为初稿作者,系统性偏见可能残留,且 Qwen3.7-Plus 同时担任评委,存在自我偏好风险;(2) 人类验证只有 3 名评分者,660 视频虽多但每人负担重,未报告评分者内部一致性检验;(3) H2RCore 权重(0.15/0.15/0.30/0.30/0.10)是先验设计,敏感性分析只证明排序稳健,不证明权重最优;(4) 主实验只用文本指定本体,与许多真实可控编辑工作流(提供参考图)不同,可能系统性低估某些模型;(5) Seedance 与 Wan2.7 夹爪差距的 95% CI 下界仅 +0.08,第一名归属并不牢固;(6) 基准未闭环到策略学习增益——生成视频再好也只是“看起来对”,能否真正替代机器人演示训练出可用策略仍是开放问题。
独立分析的弱点
独立分析的弱点:(1) 评估闭环完全依赖 MLLM:M1-M4 由三个 MLLM 打分,而标注初稿也出自 Qwen3.7-Plus,一旦 MLLM 在接触区域判定、遮挡推理上有系统性盲区,误差会同时进入“标准答案”与“评分”两端且难以暴露——改进方向是引入分割/关键点级几何校验(如手-物接触热图、光流一致性)作为客观仲裁。(2) 规模偏小:每族仅 20 源、共 240 案例,第一名与第二名夹爪差 0.79 分的 CI 下界只有 +0.08,接近噪声;应扩至数千源并强制报告显著性。(3) 单一源数据集:EgoDex 以桌面/家庭场景为主,缺少厨房、工业、户外等域外验证,结论对分布偏移的稳健性未知。(4) 5 秒短片段回避了长时程一致性、多阶段任务规划与目标持久性等世界模型真正困难的问题。(5) 原生接口协议务实但混淆变量:前三名可能部分归功于视频接口而非模型本体;论文只对 Seedance 做了 9 图消融,未做同一模型“视频 vs 帧”的全矩阵对照,无法分离接口效应。(6) M4 硬失败规则(无机器人或人为主操作记 0)可能过粗,无法区分“机器人几乎全程在场”与“最后一帧才出现机器人”,而这两者对下游数据可用性差别巨大。(7) 未闭环到可执行性:84.6 分的生成视频也可能物理不可行,建议增加可达性/接触物理校验或小规模真机实验佐证,否则“把人类视频变成机器人训练资源”的最终承诺仍停留在视觉层面。
未来方向
作者提出的方向(附录 D):更长的演示需要高效时空建模;用密集视觉定位处理歧义任务实体;几何感知的新视角合成提供互补视觉证据;细粒度 3D 重建支持物体几何诊断。基于本文成果可自然延伸:(1) 从“评视频”到“用视频”:把 H2RCore 分数与下游 VLA/策略训练增益关联,验证“高迁移分 → 更好策略”的假设,形成生成-评测-训练闭环;(2) 真机执行回路:对高分生成视频做可执行性过滤与轨迹重定向,测量真实成功率,补齐“看得对 ≠ 做得到”的缺口;(3) 扩展本体空间:人形机器人、移动操作臂、软体夹爪等多目标条件,研究对未见本体的零样本泛化;(4) 长时程与多阶段任务:10-60 秒、含失误与恢复的演示,考察世界模型的因果一致性与纠错能力;(5) 训练侧干预:以 H2RCore 或其分量为奖励信号对视频生成模型做迁移微调(reward-guided fine-tuning),检验基准能否真正指导模型改进;(6) 多模态标注升级:加入深度、分割、接触力估计等密集标注,降低对 MLLM 评委的依赖并支持几何级诊断;(7) 跨域源数据:引入 EPIC-KITCHENS、Ego4D 等野外自我中心视频,考察分布偏移下的迁移稳健性。
复现评估
复现评估总体友好。数据:源片段来自公开的 EgoDex 测试集;240 个案例的结构化标注、生成提示模板、评委 prompt 与 JSON schema 宣称包含在基准发布中(项目页 rongdingyi.github.io/H2R-Bench),附录还给出完整公式 (S1)-(S12);但标注依赖人工逐条核验,复现者若从零重建需可观的标注人力。模型:5 个闭源模型(Seedance 2.0 经火山引擎 Ark、Wan2.7、Kling-V3、Veo 3.1、Grok Imagine)需付费 API,闭源接口的版本漂移与限流是主要复现威胁;6 个开源模型(Wan2.2-TI2V-5B、HunyuanVideo 1.5-I2V、LTX-2.3、SkyReels-V3-R2V、LongCat、Mitty-EPIC14B)可本地部署,论文完整披露软硬件环境(2×Xeon Gold 6144、251 GiB 内存、4×RTX 4090 24GB,CUDA 13.0、PyTorch 2.11、Diffusers 0.36)及每个模型的输入接口与输出配置(Table S8/S9,帧数/帧率/分辨率)。评分:三个 MLLM 评委(Gemini 3.5 Flash、Qwen3.7-Plus、GPT-5.4)经 API 以温度 0 调用,聚合公式全部给出。主要成本是 240 案例 × 11 模型的生成 API 费用与 660 视频的人工验证。综合难度评级为中低:协议文档充分、公式明确、开源部分门槛不高,但复现者需固定闭源 API 与 MLLM 评委版本并报告方差,否则数字会随时间漂移。
论文图表
给定同一段人类插销演示与目标本体指令,两个模型 A/B 生成的机器人视频在现有基准(整体合理性 Plausibility、物理性 Physics、平滑度 Smoothness)下都得到高分打勾;而 H2R-Bench 从目标(Goal)、动作(Action)、接触(Contact)、具身(Embodiment)四个迁移维度诊断,揭示模型 B 实际未完成迁移(胜率 0.1 vs 我们方法的 0.9)。
这是全文的问题陈述图:一张图说明现有评测会把“画面好看但没换本体”的视频评为高分,而 H2R-Bench 的四维诊断能识破这种假成功,直接论证了新基准的必要性。