CLIP-CC-Bench: 用集成嵌入评测视频语言模型段落级视频描述能力的基准 CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
5个嵌入裁判+Borda投票,评测17个视频语言模型对90秒电影片段的段落级描述
前置知识
视频语言模型(VLM)
接收视频输入并生成文本的多模态大模型。典型做法是对视频均匀采样若干帧,用视觉编码器提取特征,经对齐模块送入大语言模型后自回归生成描述。不同模型支持的最大帧数差异巨大(本文评测的模型从8帧到600帧不等),帧数越多对时间动态的捕捉越细。代表模型有VideoLLaMA3、InternVL、mPLUG-Owl3、Qwen2.5-VL等。
本文的全部实验对象就是17个此类模型,理解它们的架构差异(Transformer系/高效系/时间定位专精系)是读懂排名结论的前提。
n-gram重叠指标(BLEU/ROUGE/METEOR/CIDEr)
传统文本生成评测指标,通过统计生成文本与参考文本之间的词序列(n-gram)重合度打分。BLEU看精确率、ROUGE看召回率、METEOR加入词干与同义词匹配、CIDEr用TF-IDF加权。它们的共同弱点是只看表层词汇,无法识别语义等价的改写。
本文动机部分系统论证了这些指标为何不适合段落级描述(漏掉语义改写、语篇结构),新指标正是为取代它们而设计。
语义嵌入与余弦相似度
把句子或段落编码为稠密向量,用夹角余弦 $\cos(u,v)=\frac{u\cdot v}{\|u\|\|v\|}$ 度量语义相似度。BERTScore/Sentence-BERT是早期代表,但上下文窗口通常只有512个token,处理不了几百词的段落。新一代基于LLM的嵌入模型(如NV-Embed-v2、Qwen3-Embedding)支持长上下文且语义理解更深。
本文评测协议的原子操作就是嵌入+余弦相似度,粗粒度(整段)和细粒度(逐句)匹配都建立在其上。
精确率/召回率/F1
信息检索基本指标:精确率衡量预测中有多少是对的,召回率衡量参考中有多少被覆盖,F1是二者的调和平均 $F1=\frac{2\cdot Pr\cdot Rc}{Pr+Rc}$,调和平均会被短板拖低,防止只优化单一维度。
细粒度匹配用逐句最优配对计算P/R/F1,且最终HM-CF指标也是粗细两个分数的调和平均——理解调和平均的惩罚性质是理解指标设计的关键。
MTEB嵌入排行榜
Massive Text Embedding Benchmark,对嵌入模型在聚类、语义文本相似度、分类、检索等任务上的大规模排名。榜单前列包括NV-Embed-v2、KaLM-Embedding-Gemma3-12B、Llama-Embed-Nemotron-8B、Qwen3-Embedding-8B、GTE-Qwen2-7B等基于LLM训练的长上下文嵌入模型。
本文的5个'裁判'全部取自MTEB榜单头部,理解这些模型来自不同训练配方(有助于集成去偏)能解释为什么它们绝对分数差异大但排序一致。
LLM-as-judge
用GPT-4等大模型按评分准则(rubric)加思维链直接给生成文本打分,G-Eval和视频版G-VEval是代表。优点是灵活且与人类判断相关性较好,缺点是黑盒、评分依据不透明、同一输入多次运行方差大,长文本上更不稳定。
这是本文明确要避开的替代路线,理解其'不可复现、方差高'的缺陷才能明白为什么要选嵌入集成这种确定性方案。
Borda计数与Bootstrap重采样
Borda计数是一种排序投票聚合:每个评委按自己的排名给候选打分(第1名得16分、第17名得0分),总分决定最终名次,只使用序数信息因此对各家分数尺度不敏感。Bootstrap则对数据集做有放回重采样(本文$B=1000$次),重跑整个流程以估计排名的统计稳定性。
Borda是把5个裁判合并成排行榜的机制,Bootstrap是论文证明'排名不是数据集大小造成的假象'的关键证据。
研究动机
视频语言模型(VLM)发展迅猛,但我们其实不知道它们能否写出准确的长篇段落级视频描述。现有评测体系存在四类具体缺陷:(1)单句描述数据集如MSVD、MSR-VTT、VATEX只评孤立短片段,不需要多事件综合理解;(2)密集描述基准如ActivityNet Captions、YouCook2虽然有多句参考,但各时间段独立打分,且依赖BLEU/ROUGE/METEOR/CIDEr这类n-gram指标——对段落长度文本会系统性地漏掉语义等价的改写,捕捉不到语篇结构和叙事覆盖度,而改进的SODA又依赖带时间边界的事件表示和IoU计算,在多个动作挤在同一时间窗的真实长视频中难以应用,其内部仍用METEOR打分;(3)视频QA基准如TVQA、NExT-QA、Video-MME只测离散选择题推理,不测生成完整描述的能力,且很多数据集含专有名词和文化梗,模型可以靠记忆化关联刷分而非真懂画面;(4)新兴的LLM-as-judge(如G-Eval/G-VEval)是黑盒,重复运行方差大、与人类判断相关性不稳定,尤其在长描述上不可靠。同时BERTScore等嵌入方法512 token的上下文窗口根本装不下段落级文本。综上,没有任何现有基准能对分钟级视频的段落级描述做整体性评估。
本文的目标是本文要构建CLIP-CC-Bench——一个专门评测长篇段落级视频描述的评测套件,并配套一套透明、可复现、经过统计可靠性验证的评分协议。具体目标包括:数据层面,从电影中精选200个90秒片段(共5小时),每段配专家撰写的段落参考描述,并系统性剔除专有名词与文化指涉,迫使模型展现真正的视觉理解而非记忆检索;方法层面,用5个MTEB头部嵌入模型组成裁判团,结合粗粒度(段落级)与细粒度(句子级)双路语义匹配,再以Borda计数聚合出对17个SOTA VLM的最终排名;可靠性层面,用裁判间一致性和Bootstrap重采样直接量化协议的内部稳定性;工程层面,开源全部评测脚本、模型输出和聚合工具,填补短片段与纯QA基准留下的空白。
与已有工作不同的是,本文的独特切入角度有三点。第一,把'专有名词消除'作为一等公民的设计原则:标注指南明确禁止人物名、地名、品牌、文化历史专有名词和虚构宇宙术语,标注者必须写'一个穿黑夹克的男人'而不是角色名,这在段落级描述基准中是首创,直接把'视觉理解'与'世界知识检索'解耦。第二,用嵌入模型集成+Borda计数替代单一指标或LLM裁判:不同嵌入模型有截然不同的绝对分数尺度(KaLM慷慨、NV-Embed保守)但序数判断高度一致,Borda只取排名恰好消掉尺度偏差、保留序数共识,这借用了集成学习去偏的思想,是其他评测协议没有的。第三,把协议自身的可靠性作为可量化贡献:系统级裁判间Spearman $\rho$、实例级Pearson相关、1000次Bootstrap下的排名区间,这些内部效度证据在基准论文中极少被系统报告。粗细双粒度分解还额外暴露了'叙事对齐'与'细节覆盖'之间的系统性差距,本身就是一个可测量的诊断维度。
核心方法
直觉上,这个评测就像请五位口味不同的专家同时给两篇文章的'中心思想贴合度'和'细节覆盖度'分别打分,再把五人的名次投票合成一个总排名。技术路线分两段。数据构建段:按内容标准(多角色互动、丰富视觉元素、自洽剧情、约90秒、统一技术质量)从140多部电影/剧集(1959-2024年,中位数2009年)中精选200个片段;4名受过专有名词禁用训练的研究生标注员边看边实时口述描述,经自动语音识别转写、人工校对后,再用一个只改语法、不动内容、不引入专有名词的GPT-4o提示词清理,最终得到平均402.2词(标准差208.5,范围99-1011词)、平均21.9句的段落参考。评测段:17个VLM在统一提示词(详述事件、动作、镜头运动、外观,禁止识别或命名人物)、$temperature=0$、贪心解码、各自最大帧数下生成候选段落;5个嵌入裁判对每对(参考$G$,候选$P$)分别计算整段级余弦相似度与逐句最优匹配的P/R/F1,取调和平均得HM-CF,每个裁判据此给17个VLM排名,最后按Borda公式聚合。整个流程确定性、可复现,代码与输出全部开源。
核心创新是把'多裁判集成+序数聚合+双粒度分解'组合成一个结构化测量协议,与已有方法的本质区别在于三点。其一,与EMScore对比:EMScore虽也做粗细两路嵌入匹配,但它是跨模态(拿视频当参考)且面向短caption,本文是纯文本段落对段落,参考即专家长文,更适合分钟级内容。其二,与LLM-as-judge对比:G-Eval/G-VEval靠GPT-4o思维链打分,黑盒且跑两次分数可能不同;本文的嵌入余弦是完全确定性的函数,任何人重跑得到一模一样的数字,可复现性有本质差异。其三,Borda聚合不是简单的分数平均:五个裁判的绝对分数不可比(NV-Embed-v2给VideoLLaMA3的HM-CF只有0.55,KaLM给同一模型0.79),直接平均会被尺度污染,而Borda只用排名,数学上自动消掉单调尺度偏差;论文用裁判间系统级$\rho=0.96-0.99$的一致性证明了'分数有偏、排序无偏'这一关键前提成立。此外,粗细双粒度用调和平均$HM\text{-}CF_j$绑定,使模型无法靠泛泛而谈刷粗粒度分、也无法靠罗列细节刷细粒度分。
方法步骤详情
流程五步。第一步,数据构建:按~90秒时长、多角色互动等视觉复杂度、剧情自洽、技术质量四条标准,从140多部电影/剧集(1959-2024年)精选200个片段;4名受训标注员实时口述并执行专有名词禁令,经ASR转写、人工校对、GPT-4o语法清理(只修语法不动内容),每片段约45分钟、共150小时,得平均402.2词的段落参考。第二步,候选生成:17个VLM(2B-72B、最大帧数8-600)在统一提示词(描述事件动作与外观、禁止命名人物)、temperature=0、贪心解码下生成段落;片段#126所有模型均无输出,指标在199个片段上严格配对。第三步,粗粒度:$\text{Coarse}_j=\cos(f_j(G),f_j(P))$,整段各编码为一个向量。第四步,细粒度:候选$n$句对参考$m$句建余弦矩阵,精确率$\text{Pr}_j=\frac{1}{n}\sum_i\max_k\cos(f_j(p_i),f_j(g_k))$,召回率对称定义,合成$\text{Fine}_j$。第五步,聚合:每裁判取粗细两分的调和平均$HM\text{-}CF_j$,按数据集平均分给17个VLM排名,Borda得分$\sum_j(V-\text{rank}_j(v))$,满分80,平分以五裁判均值决胜。
技术新颖性
技术新颖性体现在四个层面。第一,'消除专有名词'从数据清洗技巧升格为基准设计原则:现有视频基准普遍含专名,模型靠人脸识别+世界知识就能蒙混过关,本文通过标注规范从源头切断这条捷径,使分数纯粹反映视觉时序理解——这一设计在段落级视频描述评测中没有先例。第二,嵌入裁判集成是借自机器学习集成的跨领域移植:MTEB头部的五个模型来自不同机构、不同底座(Gemma3、Llama、Qwen2/Qwen3)和不同训练配方,它们对同一描述的敏感性差异被显式利用(NV-Embed对长度失配敏感、KaLM宽松),Borda非参数聚合保证最终排名对任一裁判的个性偏好鲁棒,论文还用Bootstrap验证了排名稳定性,这在基准论文的方法学上是少见的自我审计。第三,粗细粒度分解虽借用了EMScore的概念框架,但本文将其用于文本级长参考,并把'粗-细差距'本身作为发现报告(所有模型粗分恒高于细分),把评测指标变成了诊断工具。第四,与需要时间边界标注的SODA和黑盒的G-Eval不同,本协议只需要文本对文本,部署成本接近于零且完全确定,工程可复现性本身就是贡献。
实验结果
排名(表4):VideoLLaMA3满分Borda 80/80登顶(平均HM-CF 0.67),五裁判一致第一;mPLUG-Owl3第二(75分,0.66);LLaVA-OneVision与ViLAMP同67分,以均分0.640对0.638决胜;LongVA垫底(0分,0.48)。裁判特性(表3):KaLM最慷慨(VideoLLaMA3得0.79),NV-Embed-v2最保守(0.55)且方差最大;但裁判间系统级Spearman $\rho=0.96-0.99$、实例级Pearson均值0.90,分数有偏而序数共识极强。可靠性(表7):1000次Bootstrap下排名$\tau=0.98$,第一名保留率100%,排名区间±1位。核心发现:粗细差距普遍,VideoLLaMA3在KaLM上粗0.82对细0.76、在NV-Embed-v2上0.68对0.47,说明VLM懂大概、丢细节;Transformer系霸榜,专精时间建模的TimeChat/TS-LLaVA/Video-XL落在10-15名;性能分层清晰(顶层>0.63、中层0.58-0.62、底层<0.58)。定性(表8/9):clip 112由LLaVA-OneVision以84分居首,clip 053由VideoLLaMA3以83分居首;LongVA生成10837字符重复幻觉被罚至0.294,InternVL2拒答仅5分。榜首绝对分仅0.67,改进空间巨大。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 90秒段落级视频描述(CLIP-CC-Bench总榜) | Borda分数(满分80) / 平均HM-CF | VideoLLaMA3:80/80,平均0.67 | 第二名mPLUG-Owl3:75分,平均0.66 | Borda高出5分,且是17个模型中唯一满分(五裁判全体第一名) |
| 长视频描述(榜首与榜尾差距) | 平均HM-CF(5裁判) | VideoLLaMA3:0.67 | LongVA:0.48(第17名) | +0.19,同时榜首绝对值仅0.67,揭示巨大的改进空间 |
| 细粒度细节匹配(最严格裁判NV-Embed-v2) | Fine F1 | VideoLLaMA3:0.47 | 同模型同裁判的Coarse:0.68 | 暴露0.21的粗细粒度差距,诊断出细节生成是全行业短板 |
| 评测协议内部一致性 | 裁判间Spearman ρ(系统级) | 0.96–0.99(均值0.98) | 无外部基线(协议自证) | 实例级Pearson亦达0.85–0.94(均值0.90),支持集成去偏设计 |
| 排名统计稳定性 | Bootstrap Kendall τ (B=1000) | 0.98(95% CI 0.96–1.00) | 原始全量排名 | 第一名保留率100%,各模型排名区间±1位(InternVL2 ±2) |
局限与改进
作者承认的局限:数据规模有限——200个片段约5小时,聚焦叙事电影,未覆盖教学视频、监控视频和用户生成内容;仅限英语;每个片段只有单一参考描述,无法穷尽描述复杂场景的所有合理方式;指标强调语义内容,不显式建模事件的时间/因果顺序;由于对段落级描述做全量人工评分不现实,缺少基于抽样的人类元评测来确认自动分数的外部效度。我自己的观察补充:第一,单参考+余弦匹配可能惩罚合法的视角差异——同一片段侧重前景动作或侧重视觉氛围都是好描述,但只有与参考覆盖面重合的部分得分;第二,细粒度贪心一对一匹配对重复生成不够敏感,LongVA在clip 053用重复幻觉刷出10837字符,KaLM仍给0.600,说明需要显式的重复/覆盖惩罚;第三,裁判本身有未校正的偏置(如NV-Embed对长度失配的惩罚),论文只是用集成稀释而非建模消除;第四,Borda丢弃分数幅度信息,第一名领先多少完全不可见,需配合均分解读;第五,90秒片段对现代长上下文VLM(如600帧的ViLAMP)并不算真正'长',结论对真正分钟级以上视频的外推需谨慎。
独立分析的弱点
弱点一:单参考描述的覆盖偏差。参考由单标注员一次口述完成,个人视角决定了哪些细节入参考,生成的多视角好描述被系统性低估。改进方向:每片段3-5条独立参考,取对候选的最大分(best-of-K)或平均分,成本可控(每条45分钟)。弱点二:裁判长度与风格偏置未建模。附录B.2显示NV-Embed对候选-参考长度失配显著惩罚(mplug的656字符简短描述在KaLM得0.762,NV仅0.460),系统性地偏爱短输出。改进方向:按长度分桶做分数归一化,或在协议中加入长度比作为显式协变量报告。弱点三:对重复性幻觉的惩罚不足。LongVA数百行重复句式在KaLM/GTE上仍有0.600/0.526,因为泛化句子的嵌入恰好与参考泛化句相似。改进方向:引入生成端的n-gram重复率惩罚,或对参考句设置最低命中率下限(每句参考至少被某个候选句以阈值$\theta$匹配,否则封顶扣分)。弱点四:无时序建模。事件顺序被打乱但集合语义不变时分数几乎不变,而时序恰是视频理解核心。改进方向:把贪心最优匹配换成单调对齐(如DTW或保序匹配),时序错位即降分——作者在局限部分也提到这是自然延伸。弱点五:规模与域窄。200片段、52%对话/剧情类,动作与程序性场景合计不足三成,对机器人、自动驾驶等下游需要的密集感知描述代表性不足。改进方向:按叙事类型配额扩充至千级片段,加入教学/监控/UGC域与多语言参考。
未来方向
作者明确提出的方向:(1)扩展协议以奖励正确的事件排序,例如引入时序对齐项;(2)做小规模抽样的人类元评测,验证自动分数与人类判断的外部效度;(3)扩充数据集规模与领域覆盖;(4)每片段增加多条参考描述;(5)支持跨语言评测。基于本文成果可自然延伸的研究:其一,把粗细差距作为训练信号——既然所有VLM细粒度得分(如NV-Embed下0.47)远低于粗粒度,可用细粒度匹配分数作为RLHF/GRPO的奖励函数针对性训练细节生成;其二,开发免参考变体,直接把视频帧嵌入与描述句子嵌入做跨模态对齐,摆脱对人工参考的依赖,使评测可扩展到任意视频;其三,研究裁判集成的加权方案,例如按与人类判断的相关性自适应加权,或引入针对长度/重复的对抗性裁判;其四,将该协议用于数据集诊断——量化主流训练集(如ShareGPT4Video式数据)的描述粒度分布,解释为何细节能力普遍薄弱;其五,与幻觉专项评测结合,用对象存在性验证器检查生成描述中的实体是否真实出现在视频中,弥补嵌入相似度对'编得像'不敏感的问题。
复现评估
复现友好度很高。开源情况:代码、标准化评测脚本、17个VLM的全部模型输出、聚合工具均在GitHub(Multimodal-Intelligence-Lab/CLIP-CC-Bench)公开,另有项目页与在线排行榜;GPT-4o清理提示词在附录E完整给出,标注指南亦写入正文,数据构造全程可审计。数据:参考描述文本可直接获取,但200个片段源自受版权保护的电影,复现者需自行按来源获取视频或等待官方的分发方式(论文未说明片段文件的版权授权方案,这是最可能卡住复现的环节)。算力:候选生成需要跑17个2B-72B的VLM各199个片段,max_tokens=5000,单张A100级别GPU即可在数天内完成主要7-8B模型;评分侧只需5个7-12B嵌入模型做前向编码,开销可忽略。难度评估:低——推理用temperature=0贪心解码保证确定性,嵌入余弦本身是确定函数,任何人重跑得到逐位一致的结果;协议无需训练、无需时间标注、无需LLM裁判API调用,边际成本极低。主要工作量在于重建17个VLM的推理环境和获取片源;若只复用官方发布的模型输出,则重算排行榜只需几分钟。
论文图表