← 返回 2026-08-06

AVE-Compass:面向音视频编辑能力的全面评测基准 AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu 📅 2026-07-17 👍 16 2026-08-11 18:30
MLLM评判 多模态大模型 智能体 自动化评测 视频编辑 评测基准 跨模态对齐 音视频编辑

提出音视频协同编辑评测基准AVE-Compass,并配套规划式智能体AVE-Agent。

前置知识

音视频协同编辑 (Audio-Visually Coupled Editing)

指一类需要同时修改视频画面与音频轨、或要求两者保持因果/时序一致的自然语言编辑指令。典型例子:把『多云的天空改成暴雨』时画面要变雨景,背景音要同步换成雨声、雷声;删除一个可视对象时对应的音轨也要消除。它的难点在于编辑一个模态往往隐含对另一模态的修改要求,且不能破坏未编辑的内容。

整篇论文的 benchmark 与 agent 都围绕『跨模态因果依赖』设计,不理解这一点就看不懂为什么 IF/FP 要分模态评估、为什么 EI 要定义为 $\text{IF}\times\text{FP}$。

MLLM-as-Judge(多模态大模型作评判)

用多模态大模型(如 Gemini)代替人类或专用评分模型,对生成结果做语义层面的打分。本文做法是把每条指令拆成原子化的 Yes/No 检查清单(checklist),让 MLLM 逐条判断『编辑是否执行』『非目标内容是否保留』,再用单独的 rubric 评估真实感。论文报告人类-LLM 一致率约 90%。

IF、FP、REAL 三个主观维度全部基于此机制,理解 checklist 生成与评判流程才能看懂 Table 2 的四个维度分数是怎么来的,以及为什么需要 Table 5 做人类一致性验证。

Editing Intent (EI) = IF × FP

作者定义的复合指标,把『指令遵循 IF』与『保真度 FP』相乘。动机是:只看 IF 会被『彻底重新生成整段视频』的模型骗到(如 LTX2 的 IF 高但 FP 很低);只看 FP 会被『原样返回不动』的模型骗到(如 Gemini-Omni、Seedance 偏向不改音频)。EI 只在『既按要求改了、又保住了该保的』时才给高分。

Table 2 以 EI Overall 作为主排序指标,是理解模型排名与论文核心结论(『现有模型离可靠编辑还很远』)的钥匙。

子任务 DAG 与反思式智能体 (Subtask DAG & Self-Reflection Agent)

AVE-Agent 把自由指令分解成带依赖边的有向无环图(DAG),每个子任务配评估准则;执行器按 video/audio/speech 分支调用工具(SAM 分离、MMAudio 生成、TTS、唇音同步等),每步用『评估-改进-重试』的反思循环保留最高分候选;混合评估器在全局组装后再做一次跨步一致性检查,按最小代价原则选择『通过/重混/重生成/重新规划』。

这是论文方法部分的核心,理解 planner-executor-evaluator 三智能体协作与 minimal-action 策略才能看懂 Figure 3 和消融实验 Figure 6。

跨模态时序对齐指标 (Lip Sync / AV Sync)

Lip Sync 用 SyncNet 置信度衡量编辑后语音是否与可见嘴部动作同步;AV Sync (AVS) 用 Synchformer 估计音频与视频事件的时间偏移,在固定容差窗内归一化为 $[0,1]$ 分数。两者都属于自动化可复现指标,归一后越大越好。

Table 3 的 Cross-Modal 组正是论文强调『音频侧同步是最大短板』的关键证据,AVE-Agent 在这两项上分别提升 +0.091、+0.073。

研究动机

近年指令式视频编辑发展很快,但真实视频并非无声的画面序列——其语义由画面动态、前景声音、背景环境声、语音内容共同构成。现实编辑请求常常要求音频与画面同步修改:改变一个可见动作要同步改对应音效,删除一个可视对象要消除其声学痕迹,编辑语音内容时还要保持口型与背景声。然而现有评测严重不足:视频编辑 benchmark(VEBench、IVEBench、FiVE、UniVBench、CoVEBench)几乎都只评估无声片段的视觉变换;音频评测(AVI-Edit 等)只看孤立音频生成或单点同步。更关键的是现有指标过粗——全局相似度/质量分(如 Xu 2021、Elizalde 2023)无法回答『动作改了之后对应声音变了吗?删除对象后背景声保住了吗?编辑语音时场景一致性维持了吗?』这类隐式跨模态问题。Table 1 进一步显示现有音视频 benchmark(SAVEBench、AVED-Bench、AVI-Edit)只覆盖 object-level 对应、不支持多镜头、不支持语音编辑、不做难度分层。

本文的目标是作者有两个目标:(1) 构建一个能诊断真实音视频编辑能力的全面 benchmark——既要测编辑是否完成(IF),也要测未编辑内容是否保住(FP),还要测生成片段是否真实(REAL),并用三者复合的 Editing Intent 度量完整编辑执行;(2) 针对评测暴露的『现有模型缺一个显式的跨模态规划与同步机制』这一缺陷,提出一个基于规划的智能体 AVE-Agent,通过任务拓扑分解和自反思来提升复杂联合编辑的质量。benchmark 还要覆盖多镜头源视频、语音相关编辑、以及目标定位难度/音源复杂度/跨模态联动三个维度的难度分层,使结果可做诊断性分析。

与已有工作不同的是,本文的独特切入角度有三:第一,把评测从『单模态或 object-level 对应』升级到『全局场景级的跨模态因果依赖诊断』——196 条指令明确要求音频与视觉耦合(如改动作必带改音),并用 2688 个细粒度 checklist 把『隐式跨模态要求』拆成可逐条核验的原子问题。第二,提出 Editing Intent $=\text{IF}\times\text{FP}$ 这一复合指标,以及 response-gated(响应门控)分析,专门区分『真正编辑了且保住了』与『干脆没改/全部重生成』这两种欺骗性高分,论文据此揭示 Gemini-Omni 音频响应率仅 22.0%、Seedance 视频响应率仅 69.1%。第三,benchmark 与方法并举——既给出诊断工具,又用同一诊断信号驱动 AVE-Agent 的规划-执行-评估闭环,把『评测发现的失败模式』直接转化为『agent 要修的子目标』。

核心方法

方法整体包含两部分:AVE-Compass benchmark 与 AVE-Agent 智能体。直觉上,作者认为可靠的音视频编辑必须同时满足『按要求改了』和『没动不该动的』,于是把评估解耦成 IF/FP/REAL/EI 四个维度,并用细粒度 checklist 让 MLLM 做语义级判定,配合自动化跨模态/视频/音频指标提供可复现的底层质量信号。技术路线上,benchmark 先人工筛 145 个源视频,再用『LLM 生成候选指令 → 批判模型过滤 → 人工终审』得到 196 条耦合指令,每条指令再生成可核验 Yes/No 检查项共 2688 个;评估时把 MLLM-as-Judge(主观语义)与 7 个自动化指标(可复现底层)分开报告,避免混淆。agent 部分则采用 planner-executor-evaluator 三智能体:规划器把自由指令分解成带依赖的子任务 DAG 并给出每步评估准则,执行器在 video/audio/speech 三分支内调用 SAM、MMAudio、TTS 等工具并做反思重试,混合评估器在全局组装后再按最小代价策略决定通过/重混/重生成/重新规划。

核心创新是把评测与方法的共同焦点对准『跨模态因果依赖 + 最小代价的闭环修正』。与已有 benchmark 的本质区别在于:SAVEBench/AVED-Bench/AVI-Edit 都只测 object-level 对应(比如某发声物体在不在),无法测全局场景级的隐式耦合;AVE-Compass 用耦合指令强制模型推断并执行跨模态后果(如改动作必改音)。与已有编辑方法的本质区别在于:传统方法要么单模态(视觉编辑把音频当后处理,音频编辑无视画面),要么只覆盖特定对象/音效;AVE-Agent 通过显式 DAG 编码跨模态依赖边,并用『评估-改进-重试』反思循环 + 全局最高分保留规则来纠错,从而把『编辑执行』『保真』『同步』三者在同一闭环里权衡。另一个关键设计是 minimal-action policy:能重混就不重生成、能重生成就不重新规划,避免不必要的全量重算。

方法步骤详情

Benchmark 构建:(1) 源视频收集——从 OmniVideoBench、UltraVideo 及 AIGC 生成视频中筛候选,剔除无效音轨/音画错位/对象或声源模糊的样本,标注视觉内容、镜头结构、主体信息、风格、音源,最终保留 145 个源视频;(2) 指令生成——按 joint audio-visual / speech / video-only / audio-only 四分支 28 种操作类型,由模态专属 LLM 生成器基于结构化描述提候选指令,批判模型过滤不自然/不可行/不接地的,人工终审后保留 196 条;(3) checklist 生成——基于源描述+编辑指令生成评估『编辑执行』与『非目标内容保留』的原子 Yes/No 题,人工逐条复核冗余/弱接地/歧义,最终 2688 条;(4) 难度标注——按目标定位难度、音源复杂度、跨模态联动度三轴打标。评估:(1) MLLM-as-Judge 报告 EI/IF/FP/REAL 各分 Overall/Video/Audio 0–100;(2) 自动化指标分 Cross-Modal(Lip Sync、AVS)、Video(V-AES、SC、MSM)、Audio(A-AES、SF),全部归一化到越大越好。AVE-Agent 运行:规划器先做结构化画像(场景/主体/动作/音频上下文),用 Gemini 规划器推断显式与隐式跨模态后果,分解成模态专属子任务并用依赖边连成 DAG,再由 plan validator 校验完整性/可执行性/跨模态一致性,冲突则重新规划;执行器按子任务类型路由到 video/audio/speech 分支,把高层意图编译成工具专属输入(视觉编辑提示、SAM 分离目标、带自动负约束的 MMAudio 请求、语音编辑指令),每次调用后用规划器准则做子任务评估,失败则由 improver 改写提示重试,全程保留最高分候选;混合评估器对组装后的完整片段评估 IF/FP/质量,按最小代价原则选最终动作,全局最高分规则防止回归。

技术新颖性

技术新颖性体现在四个层面:(1) 评测维度的解耦——首次把 Editing Intent 定义为 $\text{EIF}=\text{EIF}$ 形式的 IF×FP 复合,使『完整编辑执行』有了可量化主指标;并设计 response-gated 分析,仅在目标模态确有响应时重算 FP/REAL,从而揭露非响应型高分假象(如 Gemini 音频响应仅 22.0%)。(2) 数据构建的耦合性——196 条指令全部是 audio-visually coupled,跨越 joint/speech/video-only/audio-only 四分支 28 类型,并用三轴难度分层支持诊断分析,这是 Table 1 中唯一同时满足『全局场景跨模态 + 多镜头 + 语音编辑 + 难度分析』的 benchmark。(3) 评测协议的双重保险——把 MLLM-as-Judge(语义正确性)与自动化指标(底层质量)分开报告,并用图 5 左侧 Spearman 相关证明两组近似正交、互补,避免单一聚合分掩盖问题;表 5 进一步用 ~90% 人类一致率验证可靠性。(4) Agent 的闭环最小代价——三智能体 + DAG + 反思重试 + 全局最高分保留 + minimal-action 重规划策略,让 agent 在 Table 2/3 的 IF、音频侧 IF、跨模态同步上全面领先。

Dataset statistics of the AVE-Compass benchmark
Figure 2: Dataset statistics of the AVE-Compass benchmark
Overview of AVE-Agent
Figure 3: Overview of AVE-Agent
Ablation of planner-side prompt enhancement and evaluator-driven retry refinement
Figure 6: Ablation of planner-side prompt enhancement and evaluator-driven retry refinement

实验结果

论文在 AVE-Compass 上评估了 6 个系统(Wan2.7、HappyHorse、Gemini-Omni、Seedance、LTX2 以及本文 AVE-Agent(Wan)),得到三大结论。(1) AVE-Agent 是最强编辑执行者:Table 2 中 EI Overall 59.8(+17.4)、Video 66.7(+6.6)、Audio 50.2(+25.4),IF Overall 77.3(+8.0)、FP Overall 77.6(+13.4),尤其音频侧 IF 与音画同步提升最大;Table 3 自动化指标 Lip Sync 0.622(+0.091)、AVS 0.766(+0.073),其余多数指标也领先。(2) 现有模型难以同时兼顾 IF 与 FP:LTX2 的 IF Overall 70.1 偏高但 FP 仅 30.6(基本是重生成整段),Gemini-Omni/Seedance 反过来 FP 高(84.9/81.7)却常原样返回导致 IF 仅 44.9/37.4;这正验证了用 EI=IF×FP 作为主指标的必要性。(3) 音视频真实感仍有限:尽管部分模型 V-AES/A-AES 较高,但 REAL 普遍低于自动化质量分,说明模型对物理世界的理解仍弱。补充分析上,Table 4 的 response-gated 显示 Gemini 音频响应率仅 22.0%(最低)、Seedance 视频响应率 69.1%,而 AVE-Agent 门控前后下降最小(视频 80.1→77.9、音频 74.8→70.9),说明其高分不是靠不作为;图 4 显示随源视频时长增加基线 EI 普遍下滑而 AVE-Agent 较稳;图 5 中部显示单模态编辑上 AVE-Agent 在 audio-only 综合最优;图 5 右侧错误统计中 AVE-Agent 总错误数最少且无明显偏科。消融图 6 显示去掉 prompt 增强 EI 掉 7.76、IF 掉 6.91,去掉 retry EI 掉 8.75、IF 掉 8.51,验证两个组件互补。Table 5 报告 EI/IF/FP/REAL 的人类-LLM 一致率约 88.8%–91.3%,自动化指标五次重复波动 <0.01、MLLM 波动 <1%。

Comparison of AVE-Compass with existing editing benchmarks
Table 1: Comparison of AVE-Compass with existing editing benchmarks
MLLM-as-Judge results on AVE-Compass
Table 2: MLLM-as-Judge results on AVE-Compass
Automated metric results on AVE-Compass
Table 3: Automated metric results on AVE-Compass
Response-gated Fidelity Preserving and Realism by modality
Table 4: Response-gated Fidelity Preserving and Realism by modality
Human-LLM agreement of MLLM-as-Judge metrics
Table 5: Human-LLM agreement of MLLM-as-Judge metrics
Robustness under difficulty
Figure 4: Robustness under difficulty
Metric orthogonality, single-modality editing, and error analysis
Figure 5: Metric orthogonality, single-modality editing, and error analysis
查看结构化数据
任务指标本文基线提升
音视频编辑(MLLM-as-Judge,主指标 Editing Intent Overall) EI Overall (0–100) AVE-Agent(Wan): 59.8 Wan2.7: 42.4;HappyHorse: 41.3;Gemini-Omni: 38.0;Seedance: 26.6;LTX2: 15.2 相对次优 Wan2.7 提升 +17.4(约 +41%),音频侧 EI 从 Wan2.7 的 24.8 跃升至 50.2(+25.4)
指令遵循(音频侧 IF) IF Audio (0–100) AVE-Agent(Wan): 69.4 Wan2.7: 60.3;HappyHorse: 54.5;Gemini-Omni: 10.8;Seedance: 24.4 相对次优 Wan2.7 提升 +9.1(约 +15%),印证『音频侧是最大短板且 agent 改善最显著』
跨模态时序对齐(自动化) Lip Sync / AV Sync AVE-Agent(Wan): 0.622 / 0.766 Wan2.7: 0.531 / 0.693;HappyHorse: 0.620 / 0.695 Lip Sync +0.091(相对 Wan2.7 约 +17%)、AVS +0.073(约 +11%)
音视频编辑 benchmark 横向覆盖(Table 1) 支持能力项数 AVE-Compass: 全局场景跨模态 + 多镜头 + 语音编辑 + 难度分析 + 19 指标 + 28 任务类型 SAVEBench/AVED-Bench/AVI-Edit: 仅 object-level 对应,无多镜头/语音/难度分析 唯一同时满足四项关键能力的 benchmark,指标与任务类型数量也最多
评测可靠性(人类一致率,Table 5) Human-LLM Agreement (%) EI 89.9 / IF 91.3 / FP 88.8 / REAL 91.0 —(无直接基线,作为可靠性证据) 四个维度均接近 90%,自动化指标五次重复波动<0.01、MLLM 波动<1%

局限与改进

作者承认的局限:benchmark 规模相对精简(196 条指令),虽覆盖全部操作类别与难度但作者指出做大规模评测对日常使用成本很高(见附录 E),意味着统计置信度受样本量约束;AVE-Agent 建立在 Wan2.7 之上,提升部分依赖底层编辑模型本身的能力,未必能等价迁移到其他骨干;REAL 分数普遍低于自动化质量分,说明现有模型(含 agent)在物理真实性上仍有明显差距。我自己的观察:(1) Gemini-Omni 因内容审核漏掉 16 条语音编辑(Table 2/3 带 *),使某些对比不完全公平;(2) response-gated 仍依赖『响应』判定的准确性,若该判定本身有偏,门控结论也会被影响;(3) AVE-Agent 在 Speech Quality(SF) 上反而比 Wan2.7 低 0.060(Table 3),说明反思重试未必在所有维度都正向,语音质量是潜在短板;(4) 评测高度依赖 MLLM-as-Judge,虽有人类一致率背书但仍是代理指标,复杂场景下判分稳定性需更多验证。

独立分析的弱点

第一,benchmark 规模与多样性偏小:145 视频、196 指令虽精心设计,但对长尾编辑类型(如罕见音效、专业影视剪辑手法)覆盖不足,统计区间会偏宽。改进方向是引入主动学习式扩充,针对模型失败案例定向补数据。第二,AVE-Agent 的工具栈绑定具体模型(SAM、MMAudio、TTS、特定视频编辑模型),工具更替会牵动整个流水线,可移植性受限;改进方向是把工具抽象成统一接口(输入规范 + 输出规范 + 可评估准则),实现即插即用。第三,混合评估器采用最小代价策略虽省算力,但当跨步冲突需要重规划时延迟会显著上升,且全局最高分规则可能在多目标权衡下并非最优;改进方向是引入学习式调度(用强化学习选重试动作)。第四,Speech Quality(SF) 出现 -0.060 回退,提示语音分支的反思循环可能损害自然度;改进方向是给语音分支单独的保真约束或 MOS 感知重试准则。第五,MLLM-as-Judge 强依赖单一评判模型,存在系统性偏差风险;改进方向是多评判模型集成 + 分歧案例人工复核。

未来方向

作者隐含的方向:把 benchmark 扩展到更长视频、更多语言/文化的语音编辑、以及实时交互式编辑场景;让 AVE-Agent 的规划器与评估器更强地利用跨模态因果推理(如显式建模『动作-音效』映射)。基于本成果可延伸的方向:(1) 把 response-gated 与 EI 复合指标推广到其他生成任务(如图文一致性、3D 编辑)作为防欺骗评估范式;(2) 将 planner 的子任务 DAG 与强化学习结合,让 agent 在线学习最优工具调用序列与重试预算;(3) 探索真实感 REAL 与底层自动化质量分之间的鸿沟,构建专门的物理合理性数据集与可微指标;(4) 把 benchmark 升级为持续学习基准,定期纳入新发布的编辑模型做动态排行榜;(5) 研究多评判模型一致性偏低案例,反推哪些编辑能力是当前 MLLM 也判断不准的盲区。

复现评估

复现性整体较好:作者在论文首页即给出 GitHub 仓库(https://github.com/NJU-LINK/AVE-Compass)和 HuggingFace 数据集(https://huggingface.co/datasets/NJU-LINK/AVE-Compass),承诺公开 145 源视频、196 指令与 2688 checklist;生成器提示词、难度定义、checklist 生成与评判协议均放在附录(A.1/A.2/F.2),评估指标公式与每类激活表也有详述。难度主要在三处:(1) AVE-Agent 的完整工具链涉及多个外部模型(SAM、MMAudio、TTS、视频编辑骨干)与较大算力,端到端复现门槛高;(2) MLLM-as-Judge 依赖闭源 Gemini,评判结果随模型版本可能漂移,需要锁版本或提供可替代开源评判方案;(3) 部分被评系统(Gemini-Omni、Seedance、HappyHorse)为闭源商业系统,第三方难以完全复现其输出,benchmark 的模型对比可复现性受限于这些系统的可用性。自动化指标则相对友好,因所用 SyncNet、Synchformer、DINOv2、 aesthetic predictor 均有公开实现。