MPIE-Bench:面向解剖可信的多人交互编辑的基准与评测协议 MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
用冻结3D人体网格重建量化多人交互编辑的解剖与接触几何,揭示VLM裁判的饱和盲区
前置知识
多参考上下文编辑(Multi-reference in-context editing)
这是当前个性化图像编辑的主流接口:模型在一次前向中同时接收若干参考人物图像和一段编辑指令,把指定的命名人物放进新场景并执行动作。与之相对的是早期单身份适配器或空间条件绑定。本文评测的10个编辑器(GPT-Image-2、Gemini-3-Pro-Image、Seedream-5-Pro、FLUX.1-Kontext、DreamO、OmniGen2、UNO、ACE++、BAGEL、FireRed-Image-Edit)都共享这个多参考+指令的接口。
理解这一接口是读懂评测任务设定的前提:所有编辑器输入相同(参考图+冻结指令+开放seed 0、每样本1次生成),差异完全落在编辑器对接触几何的处理能力上。
人体网格重建(Human Mesh Recovery, HMR / Multi-HMR)
HMR从单张RGB图像恢复3D人体网格(通常基于SMPL参数化模型)。Multi-HMR是Baradel等2024年提出的公开多人HMR前端,能在一张图里同时重建多个人体网格并给出检测分数、3D关节、所有权等字段。本文冻结 checkpoint multiHMR_896_L,对每张生成图保留得分最高的前 $k=n_{exp}$ 个检测(不做人脸身份匹配),重建失败或返回0个网格时Anatomy/Interaction记0分。
Mesh Anatomy/Interaction两条新评分轴全部建立在冻结的Multi-HMR输出之上,前端、带宽、权重都在打分前固定以保证排行榜可复现。
VLM-as-a-judge(视觉语言模型裁判)与饱和现象
用大型视觉语言模型充当裁判,按检查清单逐项判断生成图是否符合要求(人数、动作、接触点、穿透等),返回二元/序数标签。本文发现这种裁判在接触轴上严重饱和:对GPT-Image-2/Gemini/Seedream三类闭源编辑器,V-Interaction给出0.98–0.99的接近满分,而同一批图肉眼可见地存在肢体融合、穿插,mesh Interaction仅0.45–0.72。这就是本文要绕开的评测盲区。
理解VLM裁判的饱和现象,才能明白为什么必须用3D网格几何而非语言模型判断来打分,也才能理解Table 5中V-Anat/V-Inter与M-Anat/M-Inter的巨大落差。
接触密度曲线与C0–C3分级
对每个交互视频,作者计算一条接触密度曲线 $\phi(t)$,由人体框IoU、姿态邻近度、光流、遮挡线索加权得到,精炼权重为 $(w_{IoU}, w_{Prox}, w_{Flow}, w_{Occ})=(0.35,0.30,0.20,0.15)$,再做视频内百分位归一化。密度局部极大值(高度$\geq P60$、间隔$\geq 2$秒)作为密集接触的目标帧,分离度高的一帧作为身份参考帧。最终将样本按接触强度划分为C0(无接触)/C1(手部)/C2(躯干或点线)/C3(高接触)四级,约61%样本落在C2–C3。
C0–C3是评测的核心难度分层,论文大量结论(如密度压力、Anat在C2→C3软化、Inter在C3的真实差距)都建立在这个分级之上。
凸包穿透代理与表面距离
Interaction轴不计算昂贵的SDF穿透体积,而用代理量:穿透量 $V_p = r_{in}\cdot\min(Vol_{hull}(A), Vol_{hull}(B))$,其中 $r_{in}$ 是对称化的「体内顶点比例」(一个网格顶点落入对方凸包的比例),$Vol_{hull}$ 是凸包体积,凸包因子用以消除绝对网格单位;表面距离 $d_s = \min_{u\in A,v\in B}\|u-v\|_2$ 是两网格最近点对的欧氏距离。这些量经软坡函数 $s(x;a,b)=\mathrm{clip}((b-x)/(b-a),0,1)$ 映射成分数。
这是Interaction轴的核心数学定义,软带阈值($V_p$在0.05/0.15、$r_{in}$在0.20/0.50、$d_s$在0.05/0.40)是在CHI3D相关GT上标定的,理解这些才能读懂Section 4.4和Table 9。
研究动机
当前文本到图像与个性化编辑模型已经能轻松合成高保真单主体图像,但要把多个命名人物放进共享接触动作(如拥抱、背负、缠斗)时仍会暴露严重失败:肢体融合(两人接触处limbs fuse)、凭空生成的多余手足(invented extremities)、身体互相穿插(interpenetrating bodies)。然而现有评测几乎看不见这些解剖与几何问题——多人生成基准只问「出现几个人」「身份是否匹配」「动作是否在」「画面是否好看」,一张身体根本不可能成立的图竟能同时满足这四项。更糟的是,把交互判断委托给视觉语言模型的基准,在实验中对最强闭源模型在交互质量上打出0.98–0.99的近乎满分,而这些图肉眼可见地存在融合肢体。换言之,「编辑请求是否发生」和「身体是否扛过了这次编辑」是两个不同的问题,而前者正在被唯一地回答,后者长期缺席。
本文的目标是本文的目标有两块。一是构造一个聚焦接触丰富场景的多人交互编辑基准MPIE-Bench:2500个视频挖掘的编辑三元组,横跨405个场景、14个交互类别、4个接触密度级(C0–C3),其中约61%落在密集接触的两档,399个样本(16%)期望出现3人及以上、最多9人;参考图与目标帧来自同一段真实交互叙事,使编辑器无法直接拷贝像素。二是提出评测协议MPIE-Eval,在保留Count/Identity/Instruction/Quality四条传统任务轴的同时,新增Anatomy与Interaction两条轴:它们从冻结的公开多人网格重建模型(Multi-HMR)上读出接触时刻的身体几何,Anatomy看「每个人形块是否都被完整身体集合解释」,Interaction看「身体间的穿透与表面距离是否与指令要求的接触相符」,从而把语言模型的主观判断换成可复现的几何量。
与已有工作不同的是,本文的独特切入角度是:用冻结的3D人体网格重建而非语言模型的「意见」来衡量接触时刻的身体相干性。这与以往所有基准有本质区别——既有的多人/解剖评测要么只用语义或关系层面问交互(从不问实现该关系的身体是否解剖可能),要么把单人体解剖缺陷诊断局限在孤立的一个人上(见Table 1的覆盖表,MPIE-Bench是唯一在Count/ID/Instr/Anat/Inter五轴全打勾的)。数据层面,作者从视频里挖掘,因为接触密集的人物图像在个性化语料里稀缺;用valley→peak构造(稀疏帧取干净参考、密集帧取交互目标),并以跨视频>跨镜头>跨相机>同镜头的优先级抑制copy-paste泄露。协议层面,前端、所有阈值、带宽、权重在打分前全部冻结(Table 2),任何排名都能从释放的Multi-HMR dump重算,把评测从「偏好」变成「排名可观测量」。
核心方法
整体思路是「先把数据做对,再把分数做成几何」。直觉上:既然VLM裁判对接触几何饱和,那就用一个对几何敏感但与编辑器无关的冻结前端去重建生成图里的人体,再读出两条轴。技术路线分两段。第一段数据构造MPIE-Bench:从Pexels免版税素材、Harmony4D(MIT)和学术授权的CHI3D三类来源采集多人交互视频,过滤分辨率与多人存在性后按交互类型分类;对每段视频算接触密度曲线定位峰谷,峰做交互目标、谷做身份参考;VLM从「参考+目标」反向写出命名角色、共享动作、接触意图的编辑指令;人工审核后冻结2500个目标、405个场景、参考人脸嵌入。第二段评测MPIE-Eval:用10个编辑器在相同参考+冻结指令下每样本生成1张图,先用冻结Multi-HMR重建人体,再分别打6条轴——Anatomy从前景掩膜与网格栅格的错配出发判4类失败,Interaction从凸包穿透代理与表面距离出发按指令接触意图加权,Count/ID/Instruction/Quality各走独立管线,6轴永不混成一个标量。
核心创新点是「接触时刻的身体相干性应当由3D网格几何而非语言模型判断」。这与已有方法的本质区别有三。其一,Anatomy问的是「每个人形块是否被完整身体集合解释」——这正是融合肢体或凭空肢体所违反的,通过经典前景掩膜 $M_{fg}$ 与保留网格栅格 $M_{ex}$ 在人体ROI $R$ 内的错配(leftover $\ell=|M_{fg}\cap R\setminus M_{ex}|/|M_{fg}\cap R|$)来度量。其二,Interaction问的是「重建出的接触几何是否与指令的接触意图相符」——不是泛泛判动作在不在,而是把穿透量 $V_p$、体内比 $r_{in}$、表面距离 $d_s$ 按指令映射的required/forbidden/unspecified分别加权。其三,整个前端与全部阈值在打分前冻结,把分数变成可在释放dump上重算的排名可观测量,而不是又一个偏好头。
方法步骤详情
数据挖掘:(1)对每段视频先粗算 $\phi_{coarse}=0.7 IoU_{pair}+0.3 E_{mot}$,再精炼 $\phi=(0.35,0.30,0.20,0.15)$ 加权的IoU/邻近/光流/遮挡并做视频内百分位归一;(2)用3帧框平滑后取高度$\geq P60$、间隔$\geq2$秒的峰作目标,另设与峰不相交的高分离池取参考;(3)VLM反向写指令并冻结 $n_{exp}$、C0–C3;(4)人工审核去重、每场景封顶,冻结2500目标与参考嵌入。生成:10个编辑器(3闭源GPT-Image-2/Gemini-3-Pro-Image/Seedream-5-Pro + 7开源)在相同refs+指令、open seed 0、每样本1图上推理。Mesh重建:冻结Multi-HMR multiHMR_896_L,按检测分保留前 $k=n_{exp}$ 个,失败或0网格则Anat/Inter=0,$0<n_{det}<n_{exp}$ 时Inter减半。Anatomy:算leftover $\ell$、blob数 $n_b$、in-hull enclosure、over-detect、Multi-HMR scale/ownership/part项,经软坡映射成 $s_{attach}/s_{orphan}/s_{struct}/s_{resid}$,按 $S_{anat}=0.40 s_{attach}+0.20 s_{orphan}+0.25 s_{struct}+0.15 s_{resid}$ 混合;仅在附加签名($\ell\geq0.62,n_b=0$)时leftover/fuse原值进入min,否则惩罚缩0.15倍。Interaction:每对网格算 $V_p,d_s$,得 $s_{pen}=\min(s(V_p;0.05,0.15), s(r_{in};0.20,0.50))$、$s_{prox}=s(d_s;0.05,0.40)$、$s_{clear}=1-\max(s_{prox},1-s_{pen},1-s_{qual})$,按意图 $S_{inter}^{req}=0.45 s_{pen}+0.35 s_{prox}+0.20 s_{qual}$、$S_{inter}^{forb}=0.55 s_{pen}+0.45 s_{clear}$、$S_{inter}^{unspec}=0.85 s_{pen}+0.15 s_{qual}$,多对按最坏对聚合。任务轴:Count来自共享vlm_judge清单,ID用带yaw门ArcFace遮挡感知人脸匹配,Instruction用冻结TIFA式问答库,Quality用HPSv2审美分。
技术新颖性
技术新颖性体现在五处。第一,首次提出基于冻结多人网格重建的接触时刻解剖/交互评分轴Anatomy与Interaction,把以往依赖VLM或语义探针的接触评测(Table 1/Table 19)替换为可审计几何量,并设计hull归一化穿透代理 $V_p=r_{in}\cdot\min(Vol_{hull}(A),Vol_{hull}(B))$ 替代昂贵脆弱的SDF体积。第二,valley→peak视频挖掘与同场景参考/目标构造,使接触稀疏帧天然给出干净身份参考、密集帧给出交互目标,并以跨视频>跨镜头>跨相机>同镜头优先级抑制copy-paste泄露。第三,协议打分前冻结:前端、软带、权重、附加签名门、ROI pad(0.22 max(H,W)、地板24px)、Track A/B分辨率轨道全部公开锁定,任何排名可从释放dump重算。第四,设计VLM饱和诊断,并明确区分两条不相交VLM路径(共享检查清单vlm_judge vs 每样本冻结指令问答库)。第五,提供完整5人一致性研究,用Steiger显著性检验、Krippendorff α、场景聚类bootstrap量化不确定性,把新轴与人类金标准、zero-shot VLM裁判做正面对比。
实验结果
核心发现如下。其一,mesh轴暴露VLM看不见的差距:跨10编辑器,mesh Anatomy最高仅0.65(Gemini)、mesh Interaction最高0.72(Seedream),而checklist VLM对同批图给V-Anat 0.95–0.96、V-Inter 0.98–0.99(Table 5)。其二,无编辑器两轴都强:Gemini Anat第一(0.65)但Inter仅0.68,Seedream Inter第一(0.72)但Anat 0.62。其三,闭/开源最大差距在Identity($S_{id}$约0.49–0.58 vs 0.02–0.21, Table 3)。其四,密度压力(Figure 4, n=513/449/942/596):Gemini/Seedream/FireRed的Anatomy从C2→C3软化,DreamO等开源几乎平坦(0.54→0.56),高接触C3下Inter约0.51–0.69。其五,Track B(letterbox→$1024^2$)绝对分全面上升(Anat +0.06–0.14),开源Anat相对Track A rank Spearman仍0.89、top-3不变。其六,人类一致性(N=170, 5人α=0.53):mesh映射M在10项里9项超zero-shot VLM(Table 8),I3(0.43 vs 0.09)与Ir(0.46 vs 0.17)上Steiger显著M>V。其七,协议稳定:Anat权重/签名/ℓ离线重组下10模型rank Spearman≥0.98(Table 12)。其八,受控损坏(Table 7, n=200):force penetration −0.15、drop person −0.35等均使Inter单调下降。其九,种子噪声O($10^{-2}$)远小于闭/开源与密度差距;意图解析145/170(85.3%)匹配人类,替换后Inter变化<$10^{-3}$。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Mesh Interaction(Track A, 全集N=2500) | S_inter(越高越好, 0–1) | Seedream-5-Pro 0.72(列最优) | ACE++ 0.45(列最差) | 闭源最优相对开源最差 +0.27;而checklist V-Inter对同图饱和在0.88–0.99 |
| Mesh Anatomy(Track A, 全集N=2500) | S_anat(越高越好, 0–1) | Gemini-3-Pro-Image 0.65(列最优) | ACE++ 0.54(列最差) | 列内差距0.11;V-Anat同图0.56–0.96 |
| Identity身份保持 | S_id(越高越好) | GPT-Image-2 0.58 / Gemini 0.50 / Seedream 0.49 | UNO 0.05 / ACE++ 0.02 | 闭源约+0.30–0.56,是最大的闭/开源差距轴 |
| 人类一致性(per-item Spearman ρ vs 5人金标准, N=170) | ρ(H,M) mesh映射 vs ρ(H,V) zero-shot VLM | M在10项中9项超V;I3 ρ(H,M)=0.43 vs ρ(H,V)=0.09(Steiger p<0.05) | zero-shot VLM裁判 | 在硬接触项上几何映射比zero-shot VLM更贴近人类判断 |
| 受控网格损坏方向检验(n=200 GT) | ΔInter方向 | force penetration −0.15、drop person −0.35、duplicate person −0.14、separate-far −0.15 | 未损坏baseline | Inter在所有损坏下单调下降,通过6/6方向检查 |
局限与改进
作者承认若干局限。其一,Interaction仍用整身体邻近度 $s_{prox}$,不强制接触发生部位:handshake/hand-hold/high-five/arm-around这4类locus-critical提示(覆盖491/2500≈19.6%)虽池化Inter≈0.59略高于其余≈0.56,但固定N=150子集上把手部3D距离替换全身距离,Inter整体仅降0.005–0.011、手部分支ID降0.02–0.04,说明全身邻近比部位专用距离宽松,部位条件化留作未来。其二,约1.3% required-ok单元出现「高穿透/高邻近但VLM接触点=no」的gaming代理,闭源约0.5%、个别开源2–2.5%,去掉不改Inter top-2。其三,完整GT包公开打分尚在释出,GT仅作定性上锚。其四,Multi-HMR检测分非校准不确定性,低det分箱(Anat/Inter≈0.55/0.46)与高det分箱(≈0.65/0.76)差异仅作诊断。我自己的观察:单一前端冻结虽保证可复现,但Table 15显示换HMR2前端后10模型rank Spearman仅Anat 0.10/Inter 0.25,排名高度依赖前端,双前端均值(表16, Anat ρ=0.92/Inter 0.68)才稳定,结论稳健性相当程度上靠多前端共识支撑;且5人α均值仅0.53,人类金标准本身只是中等可靠排名信号。
独立分析的弱点
独立看存在若干弱点。第一,部位条件化缺失:whole-body $s_{prox}$ 对handshake/high-five等部位专用接触过宽松(手-手替换仅使Inter降0.02–0.04),改进方向是在Interaction加part-conditioned locus项,对locus-critical提示用腕/手3D最近距离替代全身距离。第二,前端单一性:冻结Multi-HMR使排名可复现,但HMR2前端下10模型Spearman仅0.10/0.25(Table 15),改进方向是把双前端或多前端均值(表16 Anat ρ=0.92)作主榜,并引入接触感知更强的重建器作为可替换track。第三,人脸可见度主导ID差距:闭源FVR达0.88–0.91而开源UNO仅0.15、ACE++ 0.05,在FVR=1子集重算ID只升约0.05–0.06(表18),改进方向是把ID评测与可见度解耦或条件化报告。第四,每样本单次生成:N=150、3种子验证种子级均值std为O($10^{-2}$)但逐图噪声大,改进方向是对关键差距(Seedream−Gemini Inter Δ=+0.042, CI[0.019,0.064])做更大规模多种子重测。第五,leftover前景掩膜用经典luma/saturation无学习分割器,复杂背景或宽松衣物可能误判,可引入轻量学习型人体分割稳定 $\ell$。第六,软带阈值在CHI3D GT上标定但GT像素受学术许可不公开,只释出recipe,第三方复算标定仍受制约。
未来方向
作者明确的未来方向分三块。一是anatomy-aware训练(Appendix B):用rank-512 LoRA而非全参数微调FLUX.1 Kontext(窄任务约$10^4$规模数据下全参数微调大DiT易灾难遗忘,且Kontext是guidance-distilled,全更新会扰动蒸馏结构);加一条轻量辅助LoRA+投影头在训练时预测2D多人骨架可视化(推理时丢弃),迫使共享骨干在遮挡下保持「每人一套完整骨架」;按C0–C3做接触密度课程(C0–C1→C2→C3),先稳住身体完整性再上深度互遮挡;损坏正负对预留给Diffusion-DPO/Flow-GRPO等偏好优化。二是评测侧:part-conditioned locus项(手-手距离)、region-condition惩罚项、多前端共识榜。三是把更强contact-aware重建器作可替换leaderboard track。基于成果可延伸的方向还包括:把valley→peak挖掘与接触密度曲线迁移到视频编辑与多人生成(非编辑)任务、用mesh Anatomy信号做在线RL奖励、把冻结指令问答库(TIFA式)推广为统一编辑指令遵循基准。我额外建议把Anatomy的leftover/blob诊断作为可微监督信号回传扩散主干,并把「每人一套完整骨架」约束与contact-field表示结合以同时优化Anat与Inter。
复现评估
复现性整体良好。作者承诺释出(i)可再分发子集与场景级split;(ii)冻结参考人脸嵌入;(iii)6轴评测脚本含3D mesh Anatomy/Interaction;(iv)人类检查清单模板与一致性脚本;(v)GT百分位阈值标定recipe。冻结常数公开:Multi-HMR后端固定multiHMR_896_L,mining与Anat/Inter全部软带、权重、附加签名门、ROI pad(0.22 max(H,W)、地板24px)在Table 9与Section G列明。可审计性:每样本Multi-HMR JSON含kept detection scores、pen_volume_m3、pen_inside_ratio、min_surf_dist、leftover fractions、contact intent,可在释放dump上离线重组而不重跑重建器,权重/门/ℓ变体下rank Spearman≥0.98。数据许可:Harmony4D像素MIT、Pexels按其License只释出ID/URL/时间戳/脚本/派生裁剪、CHI3D学术授权只释出ID/时间戳/框/脚本,受限层级不进公开suite,标定用CHI3D交互资源(Fieraru 2025)只调阈值不释出像素。算力上评测侧开销可控(单前端推理+几何计算),但10编辑器(尤其3闭源API)生成成本与vendor默认随2026-07变化,第三方完全复现vendor-native Track A受API版本与计费制约,这是主要复现瓶颈。难度中等——协议公开冻结,主要门槛在获取学术授权数据与闭源API稳定调用。
论文图表
定性失败示例:列依次为参考、GT、各编辑器输出;红标提示词中的接触线索,框出肢体融合、缺失部件、接触错误等典型failure。直观展示了「动作在、身份在,但身体不可能成立」的失败模式。
这是全文问题的视觉化证据,回答了「为什么需要Anatomy/Interaction」——肉眼可见的几何错误恰恰是VLM裁判打高分的图。