← 返回 2026-07-30

HumanCLAW:让冻结视觉语言模型通过身体行动的评测框架 HumanCLAW: Can Vision-Language Models Act Through a Body?

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo 📅 2026-07-29 👍 76 2026-08-04 18:30
人形动作生成 具身智能 具身评测基准 动作决策 半物理仿真 视觉语言模型

冻结 VLM 通过原子技能控制人形身体,瓶颈不在感知而在具身自意识。

前置知识

视觉语言模型 VLM

在大规模图文对上训练的多模态基础模型,能同时理解图像与文本并完成视觉问答、grounding、空间推理等任务,如 GPT-5.5、Gemini-3.1、Claude-4.8、Gemma-4 等。本文把它作为冻结的「决策者」,不训练其权重,仅通过 prompt 注入任务与技能接口。

本文核心问题就是「现成的 VLM 能不能像玩第一人称游戏一样驱动一具人形身体」,理解 VLM 的能力边界是读懂全文动机的前提。

动作智能 Action Intelligence

作者定义的新概念:空间智能的操作层组件——在执行闭环里,每一刻决定身体下一步该做什么(selecting、parameterizing、sequencing actions),且每个决策都被执行、其物理后果反馈到下一步决策。它比开环的 spatial QA 或 generic planner 更窄但更精确。

整篇论文的评测目标就是动作智能,所有指标、failure 归因都围绕它展开;不掌握这个概念就无法理解 benchmark 设计意图。

半物理仿真 Half-Physics Simulation

世界遵循刚体物理(碰撞、摩擦、重力、铰接物体、可移动物体),但人形身体不被模拟的关节力矩驱动,而是用从生成动作序列派生的等价运动学速度驱动。本文基于 AI Habitat + Bullet 引擎,120Hz 运行,被动关节刚度 $\lambda=1.0$。

这是「决策与执行解耦但身体仍自由行动」的关键技术,正是它让每次失败都能归因到决策层而非平衡控制失败。

流匹配与扩散变换器 Flow Matching + DiT

DiT(Diffusion Transformer)是把 Transformer 用于扩散/流匹配去噪的架构;流匹配通过学习速度场 $v^\star$ 沿 ODE 从噪声采样到数据。本文用一个 38M 参数、10 层、8-head 的 DiT 作为运动先验,从 5 帧历史预测 15 帧 0.5s 未来。

Motion Base DiT 是技能接口的实现基础,读懂公式 $\tilde{x}(\tau)=(1-(1-\sigma_{min})\tau)\epsilon+\tau x_{fut}$ 与 $\|\hat{v}_\theta-v^\star\|_2^2$ 才能理解 zero-shot 可靠的 motion chunk 是怎么来的。

ControlNet Adapter

ControlNet 风格的适配器:复制 base 模型 block 为可训练控制分支,通过零初始化的残差投影 $W_\ell$ 注入,保持 base 冻结。本文为每个原子技能训练一个 adapter,组合公式为 $z^{\ell+1}=B_\ell(z^\ell,\tau)+W_\ell C_\ell(z^\ell+e_s(c_t),\tau)$。

plug-and-play 的设计让新增技能只需训一个新 adapter、不动其他部分,是「atomic skill 接口」可扩展性的来源。

原子技能与 CLAW 代理 Atomic Skills / CLAW Agents

CLAW(Command-Language-Action-Workflow)类代理通过符号接口把语言目标变成可执行动作。原子技能是 minimal、unambiguous 的身体动作单元(如按给定步幅走、按角度转、按高度坐),区别于「坐到沙发上」这种把 finding/approaching/orienting/committing 捆绑的复合指令。本文定义了 8 种原子技能:walk、side_step、step_back、turn_in_place、climb_upstairs、walk_downstairs、sit_in_place、stop。

原子技能是连接 VLM 文本输出与连续全身运动的桥梁,理解它才能看懂为什么作者要把 composition 推给 VLM 的 step-by-step reasoning。

研究动机

评估一个 VLM 能否通过物理身体行动,目前落在两个极端之间,存在系统性盲区。一端是 agent benchmark(如 VirtualHome、ALFRED、Habitat 2.0、BEHAVIOR-1K):为让评估可行,命令通过 simulator-defined 的动作抽象、脚本或预定义 avatar 动画执行,模型从不需要实现「具有物理后果的全身行为」——结果代码代理走起来像 ghost,能穿墙、能贴着脚本爬楼梯。另一端是端到端 VLA(如 RT-2、π0、GR00T 类):它们学到生成可执行运动,但拟合 embodiment-specific 轨迹,把决策与学到的控制策略纠缠在一起,难以分离 generalist 的推理本身能外推到物理动作多远。对 humanoid 尤其棘手:motor execution 还会混淆评估——身体可能在爬楼梯时失去平衡跌倒,产生与动作决策无关的失败。当任务失败时,研究者根本分不清是 VLM 做了糟糕决策,还是 motor controller 执行失败。现有工作都不提供「决策与执行解耦、但身体仍在物理世界中自由行动」的设置。

本文的目标是构建一个让冻结的、现成的 VLM 能在物理世界中自由行动的受控评测框架 HumanCLAW。具体目标包括:(1) 决策与 motor execution 解耦——每步 VLM 只输出一个带参数的原子技能命令,由 motion generator 转成 sub-second 的连续全身运动 chunk;(2) 在保留真实物理后果(重力、碰撞、接触、物体位移)的半物理 simulator 中执行,但把平衡丢失与 motor tracking 失败排除掉,使每次失败都归因到决策层;(3) 全程不训练 decision maker,完全依赖 internet-learned reasoning 的泛化。在此基础上构建 HumanCLAW-Bench:1,218 个 egocentric find-navigate-interact episode,横跨 41 个室内房屋,从 find→navigate→interact 三阶段渐进式度量九个前沿 VLM 的长 horizon 动作智能。

与已有工作不同的是,本文的独特切入既不是「无身体的动作」(code agent 抽象掉运动,模型像 ghost 走脚本),也不是「身体与平衡不可分」(VLA 把决策与控制纠缠)。HumanCLAW 选了中间地带:把 decision maker 完全冻结,依赖推理泛化;把运动生成建模为 frozen motion prior + plug-and-play 的 per-skill ControlNet adapter,从而获得 zero-shot 可靠的语义接口;同时用 half-physics 保留物理交互但排除平衡失败。该框架第一次把「VLM 能否 act through a body」这一动作智能问题(即空间智能的操作层组件)放到了物理 grounded、closed-loop、sub-second、且 body-state 是问题一部分的设置下进行测量,弥补了开环 spatial QA 与 generic planner 评测的盲区。

核心方法

整体思路先有直觉:让 VLM 像玩第一人称游戏一样,但通过更丰富的「参数化全身技能」接口而非按键,且 outcome 由物理交互而非 script 决定。技术路线是一个 closed loop:每个 sub-second 时间步,VLM 接收 egocentric RGB observation $o_t$、紧凑的文本 history $h_t$ 与高层 instruction $p$,输出一个原子技能命令 $\langle s_t,c_t\rangle=H(p,o_t,h_t)$,其中 $s_t$ 来自固定技能集,$c_t$ 是连续参数。一个解耦的 motion generator $G$ 把命令转成 zero-shot 可靠的 0.5s 运动块 $\hat{x}^{fut}_t=G(x_t,s_t,c_t)$,条件于当前 body state $x_t$。最后,locomotion-decoupled 物理 simulator $W$ 执行该 chunk 更新物理世界并返回下一帧观测 $o_{t+1}=W(x_t,\hat{x}^{fut}_t)$。Observe-think-act 形成完整闭环:agent 不提交固定 plan,而是动态决定下一步并不断根据自己动作重塑的身体—场景空间关系做出调整。

核心创新在于同时用「原子技能」和「半物理仿真」两处 decoupling,让每次失败归因清晰。原子技能是 minimal、unambiguous 的身体动作单元——按给定步幅走、按角度转、按高度坐——绝不像「坐到沙发上」那样把 finding、approaching、orienting、committing 捆绑进一个 fuzzy 命令;作者刻意把这种 composition 推给 VLM 自己的 step-by-step reasoning,对 decision maker 不做任何任务级训练。八种原子技能:$\text{walk}(x,z,\psi)$、$\text{side\_step}(x)$、$\text{step\_back}(z)$、$\text{turn\_in\_place}(\theta)$、$\text{climb\_upstairs}(h,d)$、$\text{walk\_downstairs}(h,d)$、$\text{sit\_in\_place}(h)$、$\text{stop}$。半物理则让世界遵循刚体物理(碰撞、摩擦、重力、铰接与可移动物体),但人形 body 不被模拟关节力矩驱动,而是被从生成运动派生的等价运动学速度驱动 $\dot{q}_t=(q_{t+1}-q_t)/\Delta t$,simulator 在 120Hz 运行,被动关节刚度 $\lambda=1.0$。这样身体不会因平衡丢失失败,但仍与场景物理交互:墙能挡、接触能推可移动物、未支撑的垂直运动受重力约束。这与已有方法本质不同——code agent 抽象 motion 像 ghost,VLA entangle 决策与控制,game-play VLM 按键 outcome 由脚本决定。

方法步骤详情

完整步骤如下。(1) Contextual Prompting:每步 VLM 接收 system prompt(控制蓝色人形机器人、egocentric 相机)、高层 instruction(如「找沙发坐下」)、可用 motion skill 列表与每个 skill 的使用规则、以及 recent steps 的文本 history(之前的 visual state、reasoning、selected action),history 是动作连贯性的关键 cue。(2) Ego-Perception and Spatial Understanding:VLM 输出格式化的 visual state,从左到右描述可见物体、近似距离、target 是否可见、immediate surrounding 是否有 obstacle 或 affordance(stairs、open space、sitting surface),把空间解释外化。(3) High-to-Mid-to-Low Reasoning:先 interpret 长 horizon instruction 在当前 visual state 下应 search/approach/align/interact;再 derive mid-level objective(如 move toward visible object、entering open area、aligning with stairs、turn before sit)——每步显式决定 inherit 还是 revise 前一步 mid-level 目标;最后 convert 为 low-level skill。(4) Low-Level Motion Skill Choice:从 skill pool 选 skill category(turn/sit 等)+ 连续参数,以结构化 JSON 输出。(5) Skill-Specific Spatial Response Verifier:motion generation 前应用 short-context verifier,检查 spatially unsafe 或 premature proposal——走时会撞障碍?stop 前已到 target?climb 无可见 stair?sit 从无效 pose?失败则用同 action pool 的 corrected skill 替换;这是为对抗 VLM 随 rollout context 变长 spatial reasoning 退化、planner hallucinate progress(声称到达却仍远)。(6) Skill-Conditioned Motion Generation:Motion Base DiT(38M 参数、10 层、8-head self-attention、30fps)输入 5 帧 clean history + 15 帧 noisy future 作为 motion token $u^\tau=[x_{t-4:t},\tilde{x}_{t+1:t+15}(\tau)]\in\mathbb{R}^{20\times d}$,$d=219$;flow time $\tau$ 由 sinusoidal MLP 经 adaLN-Zero 注入;预测速度场 $\hat{v}_\theta=G_\theta([x_{t-4:t},\tilde{x}_{t+1:t+15}(\tau)],\tau)_{t+1:t+15}$,仅保留 future token 输出。AMASS 上以 20-frame chunk 训练,先 calibrate 到 chunk-local frame 去除全局平移与 yaw。Flow matching 构造 $\tilde{x}(\tau)=(1-(1-\sigma_{min})\tau)\epsilon+\tau x_{fut}$、$v^\star=x_{fut}-(1-\sigma_{min})\epsilon$,最小化 $\|\hat{v}_\theta-v^\star\|_2^2$,推理用 30-step midpoint solver。(7) Plug-and-Play Skills as ControlNet:每个原子技能对应一个 ControlNet-style adapter,base DiT 冻结,$z^{\ell+1}=B_\ell(z^\ell,\tau)+W_\ell C_\ell(z^\ell+e_s(c_t),\tau)$,$W_\ell$ 零初始化;scalar 条件用 MLP,spatial 条件用 Fourier features 再投影;每个 adapter 独立训练(AdamW lr $3\times 10^{-4}$、batch 2048、5×10⁵ 到 1.5×10⁶ step),新增 skill 不需改其他 skill。(8) Half-physics Simulation:基于 AI Habitat + Bullet,把 0.5s pose 序列转成等价 root/joint velocities 作为人形唯一驱动信号。

技术新颖性

技术新颖性集中在五点。第一,把「动作智能」精确定义为空间智能的 operational component——closed-loop、physical-grounded、且 body-state 是问题的一部分——比开环 spatial QA 或 generic planner 更窄但更准,使评测能定位 failure 在哪一层。第二,用 skill-conditioned motion generator + frozen VLM 实现「决策—执行解耦但 body 自由行动」,且新增 skill 只需训练新 ControlNet adapter,不动 base、VLM、sim 或其他 skill——可扩展性强。第三,high-to-mid-to-low reasoning harness + skill-specific verifier 这一 scaffold,把长 horizon composition 留给 VLM 推理而非 fuzzy command,verifier 用 compact 技能特定 prompt 反制 long-context 退化。第四,half-physics 把 balance 排除但保留 contact/collision/gravity/object dynamics,使 collision、推物、被墙挡等失败可归因到 action-level 决策。第五,不训练 decision maker——所有 composition 在 reasoning 里 zero-shot 发生,这背后是「generalizable action intelligence 源于推理而非拟合动作数据」的哲学承诺。

HumanCLAW closed-loop framework
Figure 2: HumanCLAW closed-loop framework
HumanCLAW harness: contextual high-to-mid-to-low reasoning scaffold + skill-specific verifier
Figure 3: HumanCLAW harness: contextual high-to-mid-to-low reasoning scaffold + skill-specific verifier
Skill-conditioned motion generator: Motion Base DiT + per-skill ControlNet
Figure 4: Skill-conditioned motion generator: Motion Base DiT + per-skill ControlNet
Skill controllability
Figure 5: Skill controllability
Half-physics versus pure kinematics
Figure 6: Half-physics versus pure kinematics
Difficulty distributions over the 1,218 benchmark episodes
Figure 7: Difficulty distributions over the 1,218 benchmark episodes

实验结果

Table 1 验证技能保真:原子技能 zero-shot 可靠。achieved/commanded 比率近 1 且方差小——walk 0.966±0.022、turn 0.994±0.038、side_step 1.002±0.123、step_back 0.986±0.056、sit 0.977±0.078,stair 0.738-0.794 为稳定可 calibrate 的 gain;对比 MoMask 即便把数字写进 prompt 也只 render generic motion,比率偏离 1 且方差大 1-2 个数量级(std 0.3-1.3 vs 0.02-0.12),证明 motor 层足够可靠、benchmark 主要隔离高层推理。Table 2 主表 9 个 SOTA VLM:最强 Gemini-3.1 仅 FindSR 64.9% / NavSR 42.4% / InteractSR 16.8%;四个模型 InteractSR ≤0.2%。stage-by-stage drop 明显——FindSR 32.6-64.9%、NavSR 0.8-42.4%、InteractSR 0-16.8%。「landing rate」(NavSR/FindSR)显示识别 target 普遍可行,但把识别转成停在 target 旁的身体才是分水岭:Gemini-3.1 仅 0.65、Gemma-4-31B 0.49、InternVL3.5-38B 0.02。Body awareness 与 cost 同读:Qwen3.5-27B disturbance 最低(#Dtb 0.93)且步数最少(37.6)但 InteractSR 0%,是「不动」而非控制;InternVL3.5-38B 与 Claude-4.8 collision 最高(51.2%/44.2%)配 NavSR 崩溃,是失控乱动;Claude-4.8 token 最多(in 7047/out 625 per step)却全指标落后。Motion Jerk 度 choreography coherence:GPT-5.5 最 coherent 4.2、Gemma-4-31B 4.8,且与 success 解耦——Gemini-2.5 success 有竞争力但 Jerk 最差 8.7(约 5 步 1 次 turn-reversal)。Gemma-4-31B(58.1/28.7/11.1)除 Gemini-3.1 外打平或超过所有 proprietary 模型,progress 对社区开放。Finding 3:perception 非瓶颈——GeoFindSR vs FindSR 仅差 5-10pts(Gemini-3.1 69.9 vs 64.9),target 真正进 ego view 几乎总被识别;Find 失败主要 upstream:38% ineffective exploration、10% approach-without-turning、3% midpoint give-up、23% perception lapse、12% ineffective action、9% jammed、6% too far。Finding 4:egocentric self-localization 是 nav 瓶颈——5,473 个主动 find 成功 episode 中 3,706(68%)仍 nav 失败,2/3 是 ego-spatial self-awareness 错误:body awareness 34%(20% 已到 0.2m 但不 signal arrival 继续 nav、14% jammed 仍发 forward cmd)、ego-spatial distance hallucination 30%(停且声明到达却仍 >0.2m 远)。Finding 5:reaching 不是 interacting——726 个 nav 成功 episode 中 513(71%)sit 失败,81% 是 body awareness 错误:58% sit on air(pelvis 无 mesh contact,原地降 body 没 seat)、14% sit wrong(落不同 object/floor/wall)、9% stand-after-sit(短暂 mesh contact 但继续 acting 转回 off seat);19% 是 decision failure(reach+stop 站立但从不 sit)。Finding 6:没 VLM 感知自身 body——collision 集中在它不看的部位:leg/foot 28-45% 步、arm/hand 20-35%、head <7%。Figure 9 两例:arm 撞倒 plainly in view 的 chair 未 register;leg 持续撞 visible obstacle 仍 forward walk——scene 被 see 但 body 不被 see,VLM 纯 VQA 训练像 ghost,无 pixel 是自身 limb 的 instinctive model。

Skill functional fidelity: achievement ratio = achieved / commanded (mean±std)
Table 1: Skill functional fidelity: achievement ratio = achieved / commanded (mean±std)
Full validation results on HumanClawBench
Table 2: Full validation results on HumanClawBench
Ablation on HumanClawBench mini-val 100 episodes
Table 3: Ablation on HumanClawBench mini-val 100 episodes
Find / Nav / Interact success-rate variants separating objective vs model-acknowledged success
Table 4: Find / Nav / Interact success-rate variants separating objective vs model-acknowledged success
Per-body-group collision breakdown on HumanClawBench
Table 5: Per-body-group collision breakdown on HumanClawBench
Where episodes fail across the nine VLMs: capability funnel + per-stage root-cause breakdowns
Figure 8: Where episodes fail across the nine VLMs: capability funnel + per-stage root-cause breakdowns
查看结构化数据
任务指标本文基线提升
Find(目标进入 ego 视野并被模型承认) FindSR ↑ Gemini-3.1 64.9%(最强) InternVL3.5-38B 46.8% / Claude-4.8 32.6%(最弱) 最强模型比最弱高约 32 个百分点;目标一旦渲染几乎总能被识别,瓶颈在 upstream exploration
Navigate(主动 stop 且 pelvis—target AABB 距离 ≤20cm) NavSR ↑ Gemini-3.1 42.4% GPT-5.5 13.9% / Claude-4.8 8.6% / InternVL3.5-38B 0.8% Gemini-3.1 是次强 Gemma-4-31B(28.7%)的 1.5 倍;68% 已 find 仍 nav 失败,2/3 是 ego-spatial 自定位错误
Interact(sit 后 pelvis 与 target 网格接触并停住) InteractSR ↑ Gemini-3.1 16.8% Gemma-4-31B 11.1% / GPT-5.5 3.4% / 四个模型 ≤0.2% 即使最强模型也只解决 16.8%;726 个 nav 成功 episode 中 71% 仍 sit 失败
技能执行保真(achieved/commanded 比率) Skill Achievement Ratio ≈1 Ours walk 0.966±0.022、turn 0.994±0.038、sit 0.977±0.078(std ≤0.12) MoMask walk 1.921±1.031、sit 1.817±1.279(std 0.3-1.3) 本文 motor 层方差比 MoMask 小 1-2 个数量级,证明 benchmark 主要测高层推理而非 motor
Harness 消融——verifier 作用 NavSR / InteractSR baseline NavSR 27.0% / InteractSR 18.9% w/o verifier NavSR 2.0% / InteractSR 0.0% verifier 是把 skill 流转成「到达并 commit」闭环的决定性组件,去掉 NavSR 暴跌 25 个百分点
Harness 消融——mid-level objective 作用 InteractSR baseline 18.9% w/o mid-level 0.0% mid-level reasoning 把「走—转—对齐—坐」几秒级序列绑定,去掉 InteractSR 直接归零

局限与改进

作者明确承认的限制:(1) interaction vocabulary 小,目前只 instantiate 为 sit,richer manipulation 能拓宽 interact stage 并 stress 更精细的 body placement;(2) decision-level attribution 相对于 skill vocabulary——更细或更粗的词汇会画出不同 boundary;(3) half-physics 故意抽象掉 balance 与 motor tracking,所以 HumanCLAW 度量的是 action decision 而非 low-level control,把 competent decision maker 迁到 physical humanoid 是 future work;(4) 接口无 tactile channel——collision displace world 但从未被 feel,agent 只能从 egocentric view 实现 proprioception,body-state 或 contact signal 可能是 missing input 而非 missing faculty;(5) 只评 frozen off-the-shelf VLM,是否 targeted training for body awareness 能提升 ceiling 是 open question。我额外观察到的限制:(6) 未与 fitted action policy 对比,作者自己承认「reasoning vs data」的 bet 仍是 working hypothesis;(7) 场景仅 41 个 indoor HSSD house、6 个 target category,outdoor、manipulation、真实扫描场景的泛化未验证;(8) 只 sit 这一种 interaction,未覆盖抓取、开门、整理等典型 manipulation;(9) simulator-only,无 sim-to-real 验证。

独立分析的弱点

独立分析的弱点及改进方向:(1) Interaction 多样性不足——只 sit。改进:加 reach/grasp/open/push/drop 等 manipulation skill,每个新 ControlNet adapter 即可 plug-and-play,能 stress finer body placement,也会暴露 sit 之外的 body-awareness 缺陷。(2) 无 proprioceptive/tactile feedback 是 architectural limitation——body awareness 占 34% nav 失败和 81% interact 失败,可能核心是 missing input 而非 missing faculty。改进:把 contact sensor、joint position、IMU 注入 prompt 或作为额外 modality,做对照实验验证「输入缺失」vs「能力缺失」。(3) 未对比 fitted VLA。改进:在同一 bench 上跑 RT-2/π0/GR00T 类 VLA,直接验证「reasoning vs data」的哲学承诺,目前结论是「failures 在 decision 层」但缺少对照组。(4) simulation-only,无 sim-to-real。改进:把 decision maker 接到真实 humanoid 或 teleoperation rig,验证 half-physics 抽象是否过度乐观。(5) atomic skill vocabulary 固定为 8 种、参数语义预设。改进:让 VLM 自己 propose new skill parameterization(learn-to-call tools),或引入连续参数学习。(6) 评测仅单一 scene distribution(41 HSSD indoor house)。改进:跨 dataset(HM3D、MP3D、真实扫描)验证 generalization,并加 dynamic scene。(7) 长 context 退化仅靠 verifier patch。改进:persistent spatial memory 模块、calibrated termination head、internal body-state model从架构上根治。(8) failure attribution 是规则驱动,可能误分。改进:引入人工标注的样本验证规则准确率。

未来方向

作者明确提出的方向:(1) richer interaction vocabulary 拓宽 interact stage;(2) 把 competent decision maker 迁到 physical humanoid(half-physics→full physics);(3) targeted training for body awareness(作者认为是「tractable」open question);(4) 加入 body-state/contact signal 作为输入,验证是否 missing input。基于成果可延伸的方向:(a) 把 HumanCLAW 框架扩到 manipulation(抓取/开门/整理),利用 plug-and-play adapter 的可扩展性;(b) 加入 persistent spatial memory、calibrated termination head、internal body model 来 close embodied self-awareness gap;(c) 在同一 bench 上跑 fitted VLA 对比 frozen reasoner,直接验证「reasoning vs data」bet;(d) multi-agent 协作(多人形共同任务);(e) outdoor 与 dynamic scene、真实扫描场景的泛化;(f) 用 verifier 反例做 RL fine-tuning signal 训练 body awareness;(g) 把 action intelligence 定义推广到 7-DoF 机械臂之外更复杂 embodiment;(h) 把决策与 motor 控制的 boundary 设计成可调参数,研究不同 granularity 下归因变化。

复现评估

Project page: https://human-claw.github.io。Motion generator 基于公开 AMASS/BABEL 数据,DiT 仅 38M 参数、训练细节明确(flow matching、30-step midpoint solver、AdamW lr $3\times 10^{-4}$、batch 2048、5×10⁵ 到 1.5×10⁶ step),中等规模 GPU 即可复现。Benchmark 基于公开 HSSD 41 validation house + AI Habitat + Bullet,1,218 episode 的配置明确(distance ≤3.5/≤8m、choice ≤2/≤5、obstacle ≤2.5/≤5 阈值;6 个 target category;sit 597 / nav 621 子集划分),难度分层规则透明。VLM 部分混合 proprietary API(GPT-5.5、Gemini-3.1、Claude-4.8)与 open weight(Gemma-4-31B、Qwen3.x、InternVL3.5-38B)——open 模型可复现,proprietary 版本结果可能随 API 更新漂移。Root-cause attribution 用 deterministic 规则(Table 7:navmesh geodesic distance、pelvis-object mesh contact、per-step egocentric render、action stream、model visible state),完全可从 log 复现且无人工标注,可复现性高。算力需求:motion generator 训练 batch 2048 需中等 GPU;inference 每 episode 约 78 步、每步一次 VLM API call,主要成本在 API token(Gemini-3.1 in 5890/out 311 per step)。整体难度中等偏上,主要卡点在 Habitat+Bullet 集成、AMASS 数据处理与 half-physics 的速度转换实现。