面向多参考条件音视频生成的综合评测基准 MultiRef-Compass MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
首个面向多参考条件音视频生成的综合评测基准,含 350 个样本、四大维度十四项子指标
前置知识
多参考到音视频生成 (MR2AV)
Multi-Reference-to-Audio-Video 生成是指模型同时条件化于多个参考素材(人物多视图、物体、场景、视频片段、音频片段)和文本指令,输出一段同步的音视频内容。它不同于传统 I2V(单图驱动)和 T2AV(纯文本驱动)任务:模型必须先判断多张参考图究竟是同一主体的不同视角,还是属于不同实体,再把它们绑定到指令指定的角色、动作、互动关系上,并合成自然融合的画面与匹配的声音。这是一个 reference-conditioned 生成任务而非编辑任务,参考视频/音频只提供身份、外观、音色等线索而非待编辑的源内容。
本文定义并针对 MR2AV 这一新设定构建基准。如果不理解 MR2AV 与单参考 R2AV、纯文本 T2AV 的差异,就无法理解现有基准为何不够用,也无法理解本文四个评测维度(特别是 Reference Consistency 与 Binding Correctness)的设计动机。
MLLM-as-a-Judge(多模态大模型作为评判器)
MLLM-as-a-Judge 是指用一个多模态大语言模型(本文使用 Gemini 3.1 Pro)来代替人工,对生成结果进行打分。常见做法有 checklist 式(先由 LLM 把指令拆解成若干原子问题,再让 Judge 逐条核查)和 rubric 式(直接给出评分量表)。本文采用 1–5 的 MOS 量表,并辅以 rejudging(重判)阶段:对所有模型在同一问题上的初判分数与理由并排比对,纠正过严或过松的不一致判定。它的优势是可扩展、可审计,但会继承 Judge 模型自身的偏好。
本文 14 项子指标中大部分(AQ、BC、DP、ESM、SC、VT、AT、SCA、TO 等)都依赖 MLLM-as-a-Judge,并专门设计了 rejudging 与稳定性分析(相对标准差 <1%)。理解这个范式才能理解评测结果的可信度与潜在偏差。
组合绑定与身份分裂 (Compositional Binding & Identity Splitting)
组合绑定指把参考实体正确地关联到指令中指定的角色、动作、互动关系上——谁穿哪件衣服、谁拿哪个道具、A 把东西递给 B 等。常见失败包括身份混淆(identity swap)、属性泄漏(attribute leakage,比如 A 的衣服跑到 B 身上)、声源错配。身份分裂(identity splitting)是一种典型失败:模型把同一主体的多个视角参考图误判为多个不同身份,从而在视频中生成出多个长相不同的人物。本文专门设计了 Binding Correctness (BC) 指标和 Board 1(同一主体多视图)来诊断这两类失败。
这是 MR2AV 区别于单参考任务的核心难点,也是本文最关键的诊断维度之一。理解它才能看懂 SkyReels-V3 的失败案例以及 Ppaste 系数为何要惩罚 copy-and-paste 式生成。
参考相似度嵌入工具(SigLIP / YOLO-World / ECAPA-TDNN / LatentSync)
本文的自动指标依赖一组外部模型:SigLIP 用对比学习训练的视觉-语言嵌入,用来度量生成帧与参考图之间的整体外观相似度;YOLO-World 是开放词表的目标检测器,用来在帧中定位人物/物体区域以便做局部裁剪比较;ECAPA-TDNN(SpeechBrain)是说话人验证模型,用来度量生成语音与参考音色的相似度;LatentSync 是基于 SyncNet 的唇音同步工具,给出 LSE-C(置信度)和 LSE-D(距离)。DOVER++ 与 Audiobox 则分别评估视频和音频的技术质量。
Entity Fidelity (EF)、Timbre Similarity (TS)、Speech-Lip Sync (SLS) 等核心自动指标都建立在这些工具之上。看懂论文里 $EF_{\text{base}}$、$VSLS_{1\text{-}5} = 1 + 4 \times (0.60 \cdot C_{\text{norm}} + 0.40 \cdot D_{\text{norm}})$ 等公式,需要先理解它们背后用的嵌入模型。
粘贴自然度系数 Ppaste 与重判 (Rejudging)
粘贴自然度系数 $P_{\text{paste}}(r) \in [0,1]$ 是本文针对自动参考相似度指标的关键修正:当模型把参考图直接贴进视频(出现 sticker-like、mask 边缘、滑动而非自然移动等 copy-and-paste 痕迹)时,嵌入相似度会虚高,因此用 $EF_{\text{final}} = EF_{\text{base}} \times P_{\text{paste}}(r)$ 来打折。Rejudging 是对 MLLM 初判的事后校准:把同一 checklist 问题下所有模型的分数与理由并排比较,发现并纠正语义标准不一致的判定(例如把『adjust the position』狭义理解为精细手势的过严判定)。两者结合让评测既不奖励作弊式生成,也不受 Judge 随机性影响。
这两项是本文相对现有基准(如 OpenS2V-Nexus、T2AV-Compass)最显著的方法学创新。看懂它们才能理解为什么 SkyReels-V3 在 Ppaste 修正后排名从 5 跌到 8,而 Vidu Q3-Mix 反而从 6 升到 5。
研究动机
现有的视频/音视频生成基准几乎都不适用于多参考条件场景。如表 1 所示,T2AV-Compass(500 样本)、AVGen-Bench(235)、AVBench(470)只测文本驱动的指令遵循与音画对齐,完全不要求输出锚定在参考素材上;UniVBench(200)和 OpenS2V-Nexus(180)虽然测参考一致性与主体保持,但基本是为单参考设计,且很少区分『同一主体的多视角』和『不同实体的组合』这两种本质不同的参考结构。结果是:当用户在真实创作流里给出多张图(同一人物的不同视角、要互动的多个角色、要出现的物体和场景)时,现有协议无法回答模型能不能正确解读参考间的关系、把它们绑定到正确的实体和事件上、并合成出自然的音画内容。模型常见的失败模式——把同一主体的多视角生成成多个不同身份(identity splitting)、属性互相串台(attribute leakage)、把参考图直接贴进画面(copy-and-paste)——在现有榜单上根本看不出问题。
本文的目标是本文的目标是为多参考到音视频生成(MR2AV)构建一个可控、可复现、可诊断的综合基准。具体而言:(1)系统覆盖三类参考结构——同一主体多视角保持(B1)、异构参考组合(B2,人物-物体-场景)、多实体绑定(B3),并扩展到视频+音色参考的挑战设定(B4);(2)定义一套可解释的评测协议,把模型能力拆解为四个正交维度——基础质量(Basic Quality)、参考一致性(Reference Consistency)、音画一致性(Audio-Visual Consistency)、指令遵循(Instruction Following),共 14 项子指标;(3)提供既能扩展又能审计的混合评测框架(自动工具 + rejudging 增强的 MLLM-as-a-Judge),并验证其与人类偏好的相关性;(4)在 8 个代表性系统上实测,揭示当前模型在多个维度上的真实短板。
与已有工作不同的是,本文的独特切入角度是把过去两条互不相交的评测线索合并:参考到视频(R2V)这条线测主体一致性但通常只覆盖单参考且不区分多视角 vs 多实体;音视频对齐这条线(T2AV)测指令遵循但几乎不锚定参考。MultiRef-Compass 同时要求多模态参考(图像/视频/音频)、多视角保持、多实体绑定与多模态参考一致性(见表 1 最后一行)。技术上,它通过『omni-reference 模式 + 规则路由』让框架可扩展到任意参考模态;通过粘贴自然度系数 $P_{\text{paste}}$ 直接攻击『嵌入相似度虚高』这一已知作弊式失败模式;通过 rejudging 阶段在不改动评测协议的前提下提升条目级一致性。这些都是现有基准没有显式处理的。
核心方法
整体思路是『先建可控数据,再做可诊断评测』。数据侧采用资产包复用策略:从 Pexels、Freesound 等版权宽松来源整理可复用的主体包、物体包、场景包、视频包、音色包(主体包有两条线——从视频中抽多视角身份,或用 Nano Banana 从单张主图生成 3–6 张不同视角/表情/姿态的辅助参考),再按 Board 规则重组出 350 个样本(B1 同主体多视角、B2 异构组合、B3 多实体绑定、B4 视频+音色扩展)。Prompt 不是自由文本而是结构化模式:GPT-5.5 先生成视频/音频/语音三模态字段再融合成统一指令,人工复核锚定与合理性。评测侧采用混合 Judge 架构:规则路由器按 prompt 元数据只激活适用指标(如唇音同步仅对对话/独白样本启用),自动工具(DOVER++、Audiobox、SigLIP+YOLO-World、ECAPA-TDNN、LatentSync)提供客观证据,MLLM(Gemini 3.1 Pro)在 1–5 MOS 上做 checklist/rubric 打分,最后用轻量 rejudging 阶段横向校准。
核心创新有三点,且彼此互补。第一是 omni-reference 模式 + 度量路由:每条参考可以用多张图表示,并可附带可选的视频/音频参考,规则路由器只激活适用指标,使同一框架可同时服务图像/视频/音频参考,而无需为每种组合另写评测。第二是粘贴自然度系数 $P_{\text{paste}}(r) \in [0,1]$,最终实体保真度按 $EF_{\text{final}} = EF_{\text{base}} \times P_{\text{paste}}(r)$ 折算——直接戳穿『把参考图贴进视频拿到虚高嵌入相似度』的作弊式生成,这是与 OpenS2V-Nexus 等只看相似度的基准的本质区别。第三是 rejudging 阶段:对同一 checklist 项,把所有模型的初判分数与理由并排比对,只纠正明显的语义不一致(既纠正过严也纠正过松),不引入新维度、不改指标定义、不独立重打分,从而保留原协议的可比性同时提升条目级一致性与可审计性。
方法步骤详情
完整流程分三大步。步骤一——资产包整理:从 Pexels/Freesound 收集物体与场景;主体包用两条管线(真实人物多视角抽帧,或用 Nano Banana 从单图合成 3–6 张辅助参考),并要求背景多样以防模型把背景当身份捷径;音色包覆盖青年/老年男女与高低音卡通声;视频包保留原始片段作为动态参考;每个包附带 JSON 元数据避免不兼容组合。步骤二——Board 重组:B1 从同一主体包抽多视角;B2 把主体/物体/场景按主体-物体-场景、多视角+场景、多主体共享场景等灵活方式组合;B3 从不同包抽多个实体并指派不同角色;B4 在 B2/B3 基础上叠加视频+音色参考;每个样本固定 3 个参考输入槽(部分主体把多视角拼成一张图),底层原子视觉输入为 3–7 个。步骤三——结构化 prompt 生成与评测:GPT-5.5 按 board 与难度生成视频/音频/语音三字段并融合,人工复核后产出样本级元数据驱动度量路由;评测时对每个生成视频按 4 维 14 子指标评估,自动工具给客观证据、MLLM 在 1–5 MOS 上打分、rejudging 横向校准,最后聚合出模型级分数与四维能力雷达图。
技术新颖性
技术新颖性体现在四方面。在任务定义上,首次明确把 MR2AV 与单参考 R2AV、纯文本 T2AV 区分开,并显式建模『同一主体多视角 vs 不同实体组合』这一关键区分(Board 1 vs Board 3),现有基准均未做到(见表 1)。在数据构造上,资产包复用 + Board 重组使难度来源可解释、样本可复现,区别于每条样本独立标注的传统做法;同时通过元数据驱动的度量路由实现『按需激活指标』。在评测方法学上,$P_{\text{paste}}$ 系数是首个针对参考相似度虚高的显式修正项;rejudging 是首个在 MLLM-as-a-Judge 上做横向一致性校准的轻量机制,且作者用 5 次重复实验验证相对标准差 <1%、条目级 MAE 普遍在 0.05–0.13,证明它不是噪声。在评测广度上,omni-reference 模式让框架原生支持图像、视频、音频三类参考(B4 已实测音色相似度 TS),是面向未来 omni-reference 音视频系统的可扩展底座。
实验结果
核心结论是『没有任何系统在四个维度上同时强势』,且难度随参考组合复杂度上升而快速下降。基础质量上,Gemini-Omni VTQ 最高(0.2373)、HappyHouse 1.1 ATQ 最高(7.7729)、Seedance 2.0 因结构真实感拿到最高 AQ(3.9452)。参考一致性上,Kling 3.0 自动 EF 最高(0.6160),但 Seedance 2.0 在 MLLM 维度 BC(4.6360)与 DP(4.8500)上最强,说明嵌入相似度与细粒度保持是互补信息。Board 难度效应显著:EF 从 B1 的 0.6930 降到 B2 的 0.5893、再降到 B3 的 0.5748,主要由 Human 分支驱动(0.6930→0.5522→0.5409),Object/Background 一直稳定在 0.65–0.68,说明多实体交互主要压垮人物身份与面部/身体一致性。音画一致性上,Gemini-Omni SLS 最高(4.5333),但部分因它生成稳定正面脸(保留 84 个有效样本,Kling/Seedance 仅 47)。指令遵循上,Seedance 视觉任务最强(VT 4.7054),Kling 音频与语音领先(AT 4.7101、SCA 4.8630),Wan 2.7 时序最强(TO 4.7611),模型呈现明显专长化。SCA 聚合中英几乎持平(87.8% vs 88.0%),但 Kling 中文 97.6%、HappyHouse 中文 100%,而 Gemini-Omni 英文 98.1% 中文仅 76.7%。最戏剧性的是 SkyReels-V3 直接贴参考图并 identity splitting,自动 $EF_{\text{base}}$ 0.6460,$P_{\text{paste}}$ 仅 0.80 折到 $EF_{\text{final}}$ 0.5168,使其排名从第 5 跌到第 8,Vidu Q3-Mix 因融合自然从第 6 升到第 5。整体 Seedance 第一、Gemini-Omni 第二;闭源雷达明显外扩,开源被压向内环。人类偏好对齐极好:BQ/RC/AVC/IF 的 Pearson 分别为 0.8979/0.9380/0.9217/0.9644。rejudging 稳定性:5 次重复运行所有指标相对标准差均 <1%,条目级 MAE 在 0.056–0.137。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 参考一致性(自动 Entity Fidelity) | EFbase(SigLIP 相似度,越高越好) | Kling 3.0 = 0.6160(最佳) | Wan2.1-VACE = 0.5204(最差) | 闭源最佳 vs 开源最差差距 0.0956 |
| 粘贴修正后参考一致性 | EFfinal = EFbase × Ppaste | SkyReels-V3 从 0.6460 折到 0.5168 | Vidu Q3-Mix 从 0.6432 折到 0.5789(Ppaste=0.90) | SkyReels-V3 排名 5→8,Vidu Q3-Mix 6→5 |
| Board 难度对 EF 的影响 | EFbase(自动) | B1=0.6930, B2=0.5893, B3=0.5748 | Human 分支:0.6930→0.5522→0.5409 | 多实体场景使人物 EF 下降约 22% |
| 音画一致性(Speech-Lip Sync) | SLS(1–5 MOS) | Gemini-Omni = 4.5333(最佳) | Wan 2.7 = 2.7732 | 差距 1.76 MOS,但受面部稳定性偏好影响 |
| 语音内容准确率(中英文) | 严格准确率(%) | HappyHouse 中文 100%、Gemini-Omni 英文 98.1% | Vidu Q3-Mix 英文 74.1% / 中文 75.0% | 模型呈现强语言偏好,Gemini 中英差距 21.4 个百分点 |
| 人类偏好对齐 | Pearson 相关(越高越好) | IF=0.9644, RC=0.9380, AVC=0.9217, BQ=0.8979 | — | 四个维度均 >0.89,验证协议有效性 |
| B4 音色相似度(扩展板) | TS(1–5,ECAPA-TDNN 余弦) | Seedance 2.0 = 2.690 | Kling 3.0 = 1.724 | Seedance 明显更强,但两者都未可靠保持音色 |
局限与改进
作者承认的局限包括:(1)作为可控诊断基准,350 个样本无法覆盖所有创意领域、文化风格或参考模态;(2)为兼容不同模型输入接口,主评测把每个样本标准化为 3 张参考图,更大参考集不在当前范围;(3)自动证据工具对卡通主体、以及经历大幅姿态/表情变化的人脸仍有局限;(4)SLS 指标对面部稳定性敏感——生成稳定正面脸的 Gemini-Omni 可能因此受益(附录 D.2 显示它保留 84 个有效样本,Kling/Seedance 仅 47 个),故 SLS 应与 board 类型和保留样本数联合解读;(5)MLLM 评测带来额外成本并可能继承模型特定偏见;(6)闭源系统及 API 会随时间变化。我自己补充的观察:内容安全过滤使 Seedance 2.0 与 Gemini-Omni 实际只评了 282 与 245 个样本(非全 350),跨模型比较时引入了样本集不对齐的隐性偏差;B4 只评了 Seedance 与 Kling 两个模型,TS 这类扩展指标统计说服力较弱。
独立分析的弱点
第一个弱点是样本规模偏小且覆盖不均:350 个样本远小于 OpenS2V-Nexus 等百万级数据集,B4 仅 50 样本且只有 2 个模型参与;安全过滤进一步让 Seedance/Gemini 有效样本降到 282/245,跨模型比较存在隐性样本不对齐。改进方向:扩大到数千样本并分层抽样,对被过滤样本单独建 safety-disabled 子集。第二个弱点是 SLS 与若干自动指标对生成结果本身有偏好:SLS 偏好稳定正面脸、SigLIP 相似度偏好静态贴图,使动态但自然的生成被系统性低估。改进方向:引入运动鲁棒的唇音同步模型,并把 $P_{\text{paste}}$ 思路推广到 SLS(动态自然度系数)。第三个弱点是 MLLM Judge(Gemini 3.1 Pro)单点依赖,会继承该模型的视觉/语言偏见(如对亚洲人脸判别差异、对中文判分倾向)。改进方向:多 Judge 集成并对分歧做显式标注。第四个弱点是 rejudging 只纠正明显不一致,无法处理系统性语义偏差(如对『adjust』的统一狭义理解)。改进方向:升级为基于参考判例的少样本校准或引入人类 seed 标注。第五个弱点是四个维度彼此正交的假设过强——EF 高未必自然、BC 准未必保真——目前缺乏跨维度失败模式聚类分析。
未来方向
作者明确提出的未来方向:扩展到更丰富的 omni-reference 设定(B4 已报告视频+音色参考结果)、开发对动态人脸和复杂多说话人场景更鲁棒的同步指标。基于本文成果可延伸的方向包括:(1)把基准从 3 张参考图扩展到 5–10 张甚至无上限,测真正复杂的多角色叙事;(2)扩展到长视频(分钟级)与多镜头结构评测(LongAV-Compass 已开头但未做多参考);(3)把 MLLM-as-a-Judge 升级为多 Judge 集成 + 人类锚点校准以降低单点偏见;(4)将 $P_{\text{paste}}$ 与 rejudging 思想迁移到其他多模态生成评测(音乐生成、3D 生成);(5)基于本基准的失败模式分类(identity splitting、attribute leakage、copy-and-paste、声源错配)反向指导 MR2AV 模型训练目标设计,例如加入显式的参考-实体绑定对比损失;(6)把基准做成在线 leaderboard 并周期性更新被评测模型版本,缓解 API 漂移。
复现评估
复现性总体良好但有缺口。论文顶部声明了 Code 与 Dataset 两个链接,数据构造流程(资产包来源 Pexels/Freesound + AIGC 合成 + 人工复核)描述详细,Board 重组规则、Prompt 模式(表 5)和全部 14 个指标的判定 prompt(附录 E)都完整给出,评测用 Gemini 3.1 Pro 作为 Judge 并报告模型版本与访问日期。算力使用 8 张 NVIDIA A800,闭源模型走官方 API/平台生成 10 秒 1080p 视频,开源模型按官方推荐推理配置;每个样本统一给 3 个参考视角,对只接受单图输入的模型把多视角拼成 stitched 图。稳定性用 60 样本子集做 5 次重复,相对标准差 <1%。主要复现障碍:(1)闭源模型 API 随时间变化,作者承认不可控;(2)内容安全过滤使 Seedance 2.0、Gemini-Omni 实际评测样本数不同(282/245),复现时难以精确对齐;(3)资产包虽来自版权宽松来源,但具体主体身份的选取与 AIGC 合成种子未完全公开;(4)rejudging 的触发阈值与人工抽检比例未给出精确数值。整体上中等规模团队(数张 A800 + API 预算)可复现核心结果,完全复制需相当的工程与标注成本。
论文图表