LongAV-Compass:面向 T2AV、I2AV 和 V2AV 的分钟级音视频生成统一评测基准 LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
首个统一评测分钟级音视频生成的跨模态基准,覆盖文本/图像/视频三种条件输入。
前置知识
扩散模型 (Diffusion Model)
通过迭代去噪过程从噪声中生成数据的生成模型,主流视频生成系统(如 Seedance、Kling、Veo)几乎全部基于扩散架构。在长视频生成中,模型需要在时间维度上保持去噪过程的稳定性,否则会产生跨事件的视觉漂移。
本文评测的 11 个模型都属于扩散或多阶段扩散架构,理解其原理有助于把握基准设计——尤其是为什么 minute 级生成本质上受到时间去噪稳定性的制约。
多模态大语言模型 (MLLM) 评判
使用 Gemini 3.1 Pro 等大语言模型作为自动评判员,给视频生成结果打分。本文采用 1–5 MOS 量表,从事件完成度、视觉质量、长程一致性等多个维度对每个 event 进行 LLM 评分,并通过 pairwise 排序与人类判断做相关性验证。
LongAV-Compass 的核心评估方法就是以 MLLM 为中心,再辅以 DINO-v2、ArcFace、CLIP、ImageBind 等可计算指标。任何想修改或复现该基准的读者都需要熟悉 MLLM-as-Judge 的工作方式及其已知局限性(幻觉、版本漂移)。
事件级脚本 (Event-level Script)
将一段分钟级视频按时间轴分解为有序的 event 序列,每个 event 包含时间范围、动作描述、完成条件、视觉元素、音频预期等结构化字段。这比单条 prompt 更适合评估长视频的叙事推进与跨事件一致性。
本文 284 个测试用例的标注核心就是 event 级脚本——这是与 VBench、EvalCrafter 等短片评测的根本区别。理解 event 结构有助于把握为什么 VQA、Trans. 等指标需要按 event 而不是按固定时长切窗计算。
研究动机
当前主流音视频生成评测(如 VBench、EvalCrafter、VABench、T2AV-Compass)几乎全部聚焦于 5–10 秒的短视频剪辑,覆盖的输入模态也严重碎片化——MSVBench 只看 T2V、AVGen-Bench 与 T2AV-Compass 只做 T2AV、VABench 兼顾 T2AV 和 I2AV、VinTAGe-Bench 只做 V2A、PhyAVBench 兼顾多个任务但仍偏短片。Table 1 的对比清晰表明此前没有任何基准同时支持 T2AV/I2AV/V2AV 三种输入模态并且要求平均时长超过 1 分钟。然而工业界(Seedance 2.0、Kling 3.0、Veo 3.1)和开源社区(LTX 2.3、Wan2.2 等)已经在快速支持 60–120 秒甚至更长的输出,驱动场景已经扩展到 vlog、教程、产品演示、品牌广告与剧情短片。评测能力的滞后直接造成三个具体的失明区:第一,无法判断模型在分钟级时间跨度上是否仍能保持主体身份、事件连续与音画对齐;第二,无法在统一协议下横向比较不同输入模态的系统;第三,无法诊断跨事件身份漂移、跨片段过渡抖动、音画同步衰减等长程退化的具体表现。
本文的目标是本文的具体目标是构建一个名为 LongAV-Compass 的统一基准,覆盖分钟级(60–120 秒)音视频生成的全部三种主流条件输入模态(T2AV、I2AV、V2AV),并提供一套支持长程诊断的分层评测框架,使研究者既能横向排名,也能诊断失败模式。数据集规模目标为 284 个精选测试用例(T2AV 128、I2AV 115、V2AV 41),并通过 scenario×complexity 的二维分类法保证覆盖 Vlog、Content-Creator、Performance Ads、Brand Ads 四类应用场景与 L1–L4 四个难度等级。最终目标不仅是给出 leaderboard,而是将评测转化为对长程一致性、事件连续、跨模态对齐的系统性诊断工具。
与已有工作不同的是,本文的独特切入角度是把"时长"和"条件模态"两个长期被分开的评测维度合并进同一个 schema,并通过 taxonomy-guided 构建 + event-level 标注 + 多粒度诊断三层设计,把它从短片 leaderboard 升级为长程诊断平台。具体而言,作者用 Gemini 3.1 Pro 作为统一标注与统一评判的核心,把人类 1–5 MOS 评分、CLIP 文本-视频相似度、DINO-v2 与 ArcFace 身份保持、ImageBind 跨模态相似度整合成 20+ 个细粒度维度;并在 human-alignment 阶段将系统输出两两比较,得到 content fidelity、visual quality、long-video stability 三个维度的 Pearson 相关性分别为 0.917、0.935、0.867,以验证自动分数与人类偏好的一致性。
核心方法
LongAV-Compass 的方法论可以一句话概括:以分钟级事件脚本为评测单元,以 MLLM 为评判核心,以可计算感知指标为补充,提供一个跨 T2AV/I2AV/V2AV 的统一诊断框架。技术上它由两条相互耦合的设计组成——(1) 数据构造:用 Gemini 3.1 Pro 结合 scenario 与 complexity 模板生成原创脚本,并搭配来自 YouTube/FineVideo/Pexels/Pixabay 的 Creative Commons 视频做真实转写,覆盖 L1–L4 难度、4 类场景、双语语料;(2) 评估框架:在 event-aligned 切片上跑 MLLM 评判与 6 个共享视频指标(VQA、VQ、Cont.、Trans.、Hol.、TVAlign),再用 3 个音频指标(AVS、AudQ、AudL)和 2 个任务专属指标(I2AV 的 IV1+ImgAlign、V2AV 的 continuation 评估)做补充。所有切片都按 event 边界对齐,而非按固定时间窗口,从而能精确捕捉跨片段的退化。
本文最核心的创新点是把"评测粒度"从"短视频整体打分"提升到"event 对齐的多维度诊断"。已有基准绝大多数依赖固定时长窗口或单条 prompt 的整体相似度,而 LongAV-Compass 引入 event-level 脚本——每个 case 同时有 global description 和 event sequence,每个 event 包含时间范围、动作、完成条件、关键视觉元素、音频预期、shot 级别的视觉描述、可验证的 QA checklist。这一粒度直接支撑三类与已有方法有本质区别的新指标:(1) VQA 按 event 累加 subject/action/scene/check 三类问答,能诊断模型是否真正执行了脚本;(2) Trans. 专门对相邻 event 的边界剪辑(事件前后 2 秒)检查黑帧、闪烁、冻结与 LLM 评分;(3) Cont. 把整条视频抽成低帧率预览图后与全局描述+event 序列一同交给 MLLM 评估,度量跨事件的叙事推进与主体一致性。配合 DINO-v2、ArcFace、CLIP、ImageBind 等可计算指标,就把"长程一致性"从一个口号变成了 20+ 个可量化、可定位的维度。
方法步骤详情
完整的评测管线分四步。第一步是数据构造:T2AV 用 60% 真实视频转写(YouTube/FineVideo/Pexels/Pixabay 的 CC 视频,先用 Gemini 3.1 Pro 看视频生成 JSON 脚本,包含事件时间范围、动作、QA、视觉描述、音频预期、shot 描述、身份追踪、物理约束)+ 40% scenario×complexity 模板生成(人类设计师先定场景/复杂度/语言,LLM 再产出对齐的脚本),通过 MLLM 复审+人工双重质量控制;I2AV 用 Pixabay/Burst/StockSnap/Pexels 收集图像,先用 Gemini 提取结构化 image prior(主体、关键物体、环境、构图、光照、运动潜力、一致性约束),再由 LLM 生成与图像锚定的完整事件脚本;V2AV 从真实视频里抽 10–15 秒参考片段+给出 45–50 秒续写脚本,包含独立 video prompt、audio prompt、speech prompt。第二步是统一标注:每个 case 同时产 global description 和 event sequence,event 内含 temporal span、action summary、completion criterion、key visual、expected audio,并叠加 identity constraints、physical constraints、narrative dependencies。第三步是推理与切片:本地模型在 H200 GPU 上跑,商用模型走官方 API;输出保存为 full video.mp4,再按 canonical events.json 在每个 event 边界前后 2 秒抽出 transition-boundary clips,并把每个 event 切出 event-level clip 用于分段评分;音频评测则在 audio-bearing event clips 上重抽以确保音频连续。第四步是评分:视频侧 6 维度(VQA/VQ/Cont./Trans./Hol./TVAlign)+ 音频侧 3 维度(AVS/AudQ/AudL)+ I2AV 加 IV1/ImgAlign(用 CLIP image-image 余弦相似度)+ V2AV 加参考一致性;所有 MLLM 评分都记录模型版本与 API snapshot 时间,原始 JSON 输出与得分文件全部公开以便复现审计。
技术新颖性
技术新颖性主要体现在三个层面。第一,schema 层面——首次用"global description + event sequence + task-aware fields"的统一标注同时承载 T2AV/I2AV/V2AV,使得模态差异可以被控制变量化地对比,而传统做法需要为每个模态单独设计基准。第二,评测粒度层面——event 对齐切片+边界切片+低帧率全局预览的多粒度评估单元,比固定时长窗口更适合捕捉跨边界退化,配合 DINO-v2/ArcFace/CLIP/ImageBind 让"长程一致性"变成一组可计算诊断。第三,验证层面——human-alignment 不止汇报一个相关系数,而是把人类判断和 benchmark 判断都转换为 pairwise win rate,再算 Pearson,分别在 content fidelity (0.917)、visual quality (0.935)、long-video stability (0.867) 三个维度上做了独立验证,比单一总分验证更具诊断价值。
实验结果
在 T2AV(Table 3)上,Kling 3.0 以 VQA=0.9274 与 Cont.=4.4139 拿下事件完成度与长程一致性双第一,Seedance 2.0 拿下 VQ=3.7116、Hol.=4.1128 与全部三项音频指标(AVS=3.6038、AudQ=3.7875、AudL=4.1845)的最高分;Veo 3.1 的 VQA=0.7784 略低但仍稳定领先大多数开源模型。开源模型里 LTX 2.3 取得 TVAlign=0.6205(全场最高)、Longcat 与 HunyuanVideo 1.5-I2V 在 Trans. 上接近 3.89,但它们的 VQA 仅 0.50–0.59 区间,说明局部过渡和语义对齐并不能补偿事件执行失败——典型的"代理指标强 ≠ 长视频生成强"案例。V2AV 上 Seedance 2.0 实现全面压制,VQA=0.8753、Cont.=4.7636、Hol.=4.1705、TVAlign=0.9727、AudQ=4.4357、AudL=4.3129;Veo 3.1 的 VQA=0.8055 仍可观但 Cont. 仅 1.8425、Trans. 仅 2.2815,说明它即使产出语义合理的续写,也会在参考边界附近断崖式漂移。难度分析(Table 6)显示,组合 T2AV+I2AV 时 proprietary 模型 L1–L4 复合分稳定在 70.6–75.2 区间,open-source 从 L1=57.9 掉到 L4=51.4,agent-based 从 47.3 跌到 41.2,提示结构复杂度主要暴露的是模型家族的"长程可控性差距"。Event-count(Figure 9)进一步验证:事件链从 ≤4 增长到 >4 时,proprietary 仅 76.0→74.4、open-source 从 59.4→52.0、agent-based 从 46.2→44.6。场景层面(Figure 4、5)Performance Ads 是判别力最强的场景——变分最大且大多数模型在此场景跌至其最低总分,根因不是 prompt 不被理解,而是产品演示、因果推进、多卖点递送在分钟时长下都难以可靠执行。视频-only 模型(Wan2.2-I2V-A14B、HunyuanVideo 1.5-I2V、Helios、Open-Sora、VideoDirectorGPT)在音频三栏统一记 N/A;而 Helios 在 ImgAlign=0.9202、Open-Sora 在 ImgAlign=0.9184 时都仅拿到 VQA<0.50,反向证明 reference-image preservation 在 I2AV 上是必要而非充分条件。Human-alignment(Figure 10)三个维度 Pearson 都在 0.867 以上,最高的 visual quality 达到 0.935,验证了框架的可信度。Input-format sensitivity(Table 7)还揭示了一个反直觉结论:拥有最丰富参考的 V2AV 并不总能产出最佳长视频——Helios 在 V2AV 上表现最好,Veo 3.1 则在 I2AV 上更稳,说明最佳条件格式是模型相关的,没有跨模型通用的最优模态。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| T2AV text fidelity (event fulfillment) | VQA (0–1) | Kling 3.0 = 0.9274, Seedance 2.0 = 0.9023, Veo 3.1 = 0.7784 | Open-source best LTX 2.3 = 0.7321;agent-based VideoDirectorGPT = 0.5205 | Kling 3.0 相对最强开源基线提升约 +0.20(+27%),相对 agent 基线提升 +0.41(+78%) |
| T2AV long-form continuity | Cont. (1–5 MOS) | Kling 3.0 = 4.4139, Seedance 2.0 = 4.2649 | Open-source best LTX 2.3 = 3.2888;agent-based VideoDirectorGPT = 1.8172 | Kling 3.0 相对 LTX 2.3 提升 +1.13(+34%),相对 agent 基线提升 +2.60(+143%) |
| T2AV audio quality | AudQ (1–5 MOS) | Seedance 2.0 = 3.7875 | Kling 3.0 = 3.6049;Veo 3.1 = 3.2387;LTX 2.3 = 2.5017 | Seedance 比 Kling 提升 +0.18(约 +5%),比 LTX 2.3 提升 +1.29(约 +51%) |
| I2AV image anchoring | IV1 + ImgAlign | Kling 3.0 IV1=0.9960;Seedance 2.0 ImgAlign=0.9027;Veo 3.1 ImgAlign=0.9051 | VideoDirectorGPT ImgAlign=0.9640(最高)但其 VQA 仅 0.1976 | Kling 3.0 IV1 比 HunyuanVideo 1.5-I2V (0.9351) 高 +0.06,但 ImgAlign 反而略低(约 0.02),说明 first-frame anchoring 与 long-horizon alignment 是解耦能力 |
| V2AV text-video alignment | TVAlign (0–1) | Seedance 2.0 = 0.9727 | Veo 3.1 = 0.7100;Helios = 0.5191;LongCat = 0.3706 | Seedance 比 Veo 高 +0.26(+37%),比 LongCat 高 +0.60(+163%) |
| Human alignment | Pearson correlation | Content fidelity 0.917;Visual quality 0.935;Long-video stability 0.867 | 无对照;强相关 >0.85 通常视为 MLLM-as-Judge 可用 | 三个维度均超过 0.85 强相关阈值,最弱维度 0.867 也显著高于随机 |
局限与改进
作者明确指出的局限包括:(1) 评测对 MLLM 高度依赖——所有 MOS 评分都基于 Gemini 3.1 Pro,其版本与 API snapshot 时间会直接影响结果,因此作者记录了版本信息并公开原始 JSON,但仍无法完全消除模型漂移风险;(2) V2AV 样本量偏小(仅 41 条)且无 L1 样本(因续写本身结构复杂),导致 V2AV 上的细分诊断统计效力较弱;(3) Performance Ads 等场景下人类对齐验证只有 40 条 pilot,相关性结论尚待大规模 human study 二次确认;(4) prompt adaptation 是手工对齐各模型的 native interface,端到端模型、pipeline 模型、agent-based 模型三者接受的输入形态迥异,如何确保"同样的 event 顺序、相同的条件语义、相同的音频预期"被忠实保留存在主观判断空间。我的观察补充:(a) 用 CLIP image-image cosine 作为 ImgAlign 会把"图像色调相似但语义已漂移"误判为对齐,可能高估参考保持能力;(b) Trans. 的算法指标(黑帧、闪烁、重复、冻结)只覆盖 pixel-level 异常,对 diffusion 系列常见的"风格漂移但无明显黑帧"现象仍欠灵敏;(c) 评测限制在 60–120 秒,对真正"章节级"(5 分钟以上)的长视频生成仍未触达。
独立分析的弱点
独立观察到的弱点集中在四类场景。一是 High Event Count——18 个 event 的长脚本(Case 1,performance ad 美甲演示)下,所有模型在 event 6–7 之后都出现主体外观漂移、色卡与产品颜色反转,原因可能是 diffusion 模型的时间 attention 距离受限;改进方向是引入 explicit long-range memory bank 或 cross-event identity anchor tokens。二是 Multi-Actor Drama——13 个 event 的多角色情感戏(Case 2),模型普遍把情绪坍缩成中性默认表情,根本原因是训练语料中带强情绪演化的多角色长视频稀缺,改进方向是合成或采集高情感密度的多角色剧本以及在标注中显式编码 emotion arc。三是大场景 Aerial Cinematography(Case 3,drone+持续运动+地面切换),几何一致性在长连续镜头上保持率很低,改进方向是引入 3D-aware 的场景表征(如 NeRF-style prior)或分离 camera trajectory 与 scene content 的可控生成。四是 Brand Ad 的产品一致性——同一产品在不同 shot 里瓶身形状、字体、颜色发生改变,应通过显式 reference-image injection(IP-Adapter 风格)并在 product class token 上做 hard constraint 来缓解。整体看,LongAV-Compass 目前"对齐类指标饱和但事件执行不可靠"的剪刀差需要新一代评测把对齐类指标的作用权重大幅下调、事件执行与因果推进的作用权重大幅上调。
未来方向
作者在结论部分暗示的方向包括:(1) 把 LongAV-Compass 扩展到真正章节级(>5 分钟)的视频与播客级音频评测;(2) 把 Performance Ads 与多角色 Drama 这两类暴露最多失败模式的场景做成更细的子基准;(3) 跟踪模型版本演化以提供 leaderboard 的 longitudinal view;(4) 探索更多 condition modality(音频条件、深度条件、姿态条件)以扩展 X→AV 矩阵。基于成果我可以延伸的方向有:(a) 在评测侧加入基于 LLM 的因果链验证(causal chain QA),专门检测 L4 因果推进;(b) 引入 ensemble 评判——多个 MLLM 投票(Gemini + GPT + Claude)减少单一模型的版本漂移;(c) 用 DINO-v2 + ArcFace 联合约束做"subject identity embedding 的 trajectory 偏差",把身份漂移量化;(d) 增加对抗性测试用例(故意包含模糊、矛盾或冲突的 event 描述)来探测模型的鲁棒性边界。
复现评估
作者对可复现性做了较系统的设计:所有模型推理(本地模型)跑在 NVIDIA H200 上,商用模型走官方 API;评测脚本、prompt 模板、生成 prompt、模型特定适配、输出后处理、rubric 全部在 Appendix A–D 中公开;MLLM 评判记录了 Gemini 3.1 Pro 的版本号与 API snapshot 时间;作者承诺开源数据的同时,还会公开"raw MLLM JSON 输出、评估脚本与聚合分数文件",以便未来工作无需重跑全管线即可审计 judgment 与重计算分数。代码与基准托管在 https://github.com/pkucs-Ltf/LongAV-Compass2026。复现难度评估:数据标注所需的 Gemini 3.1 Pro 调用有中等成本;本地模型推理需要 H200 量级 GPU(约 80GB 显存)才能跑齐 11 个模型中的开源部分;商用模型则需要 Seedance 2.0/Kling 3.0/Veo 3.1 的官方 API 配额;总体看对中小实验室门槛偏高,但对工业研究团队与一线高校基本可行。建议读者按"先跑开源模型(Longcat、LTX 2.3)熟悉流程→ 再扩展到商用 API"的路径进入。
论文图表
用堆叠柱状图显示 284 个测试用例在 4 个应用场景(Vlog、Content-Creator、Performance Ads、Brand Ads)和 4 个复杂度等级(L1–L4)上的二维分布,可以看出 L2–L3 是分布主体、V2AV 缺少 L1、四个场景被均衡覆盖。
它把 motivation 中声明的二维 taxonomy 落到具体数字上,是判断"覆盖是否均衡、是否存在偏科"的关键证据。