SemComp-Bench:视频生成中语义任务完成的基准测试 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
提出以结果为导向的视频生成新任务,用VLM评判结果达成与语义接地双重指标。
前置知识
I2V / T2V(图生视频与文生视频)
文生视频(T2V)仅以文本提示为条件生成视频;图生视频(I2V)额外接受一张参考图像作为首帧或外观条件,使生成内容与给定图像在主体身份、外观和场景上保持一致。主流模型如 Wan2.2、CogVideoX、HunyuanVideo 通常同时提供这两种模式的对应版本。
本文评测的核心问题正是:模型能否在参考图像约束下完成指令指向的任务结果,因此必须理解 I2V 与 T2V 条件输入的差异才能读懂模态对比实验(Table 3)。
VLM-as-a-Judge(视觉语言模型评审)
用视觉语言模型代替人工评判生成内容质量的方法。评审 VLM 接收参考图、指令和生成视频的采样帧序列,对预定义问题给出结构化回答(如二值判断),并用视觉证据支持其判断。相比人工评测成本极低,且可对每条细粒度标准单独打分。
SemComp-Bench 的整个评估协议都建立在 VLM 判官之上——OA Score 与 GR Score 均由 VLM 回答结构化二值问题得到,理解该机制才能明白分数的可信度边界。
语义接地
指生成结果与参考图像之间在任务相关的高层语义上的对应关系:结果必须真正源自参考中的实体,而非换成无关的替代物。接地允许与任务无关的属性(背景、光照、朝向等)自由变化,但要求任务相关实体、材质、颜色等保持一致。
这是本文任务定义的核心概念:论文要求生成视频不仅『达成结果』,还要『结果接地于参考图』,二者的联合达成才是语义任务完成,单独理解任一半都会误解评测目标。
Koala-36M 数据集
一个大规模的真实世界视频数据集,包含带标题的完整长视频,主题覆盖广泛。其特点是视频为完整上下文(full-context)的真实视频,而非人工拼接或合成片段,适合从中挖掘真实的『初始状态→完成状态』任务实例。
SemComp-Data 完全从 Koala-36M 中筛选构建(从约 2 万条视频中产出 1,273 条实例),参考帧与结果视频取自同一条原始视频,这保证了任务的可实现性——读懂数据来源才能理解基准的可靠性论证。
研究动机
当前视频生成模型(如 Sora、Veo、Kling、Wan2.2、HunyuanVideo 等)在视觉保真度与时序一致性上已相当出色,但一个根本性问题被长期忽视:给定一张参考图和一条任务指令(例如『把这张钞票折成乌龟』),模型能否真的把参考中的钞票变成乌龟形状的折纸?现有数据集与基准几乎都只评测视觉保真度、时序连贯性、主体一致性或提示词遵循度,从不联合考察『指令指向的结果是否达成』与『结果是否保持与参考图的任务相关语义对应』这两个维度。实际观察表明,模型往往要么生成一段与参考无关的过程演示,要么在开头复现参考帧后画面突然跳变到无关内容——即结果未达成或语义脱接地(作者在 Fig. 1 中用『折叠成乌龟却换成无关乌龟』的场景说明这一点),而这类失败在现有指标下可能完全不被发现。
本文的目标是本文的目标是形式化并系统评测『语义任务完成视频生成』(Semantic Task Completion Video Generation)这一以结果为导向的新任务。具体包括三件事:其一,给出严格的任务定义——成功要求结果达成(outcome achievement)与语义接地(semantic grounding)同时满足,且不要求展示中间步骤、不要求与参考图的常规外观一致;其二,构建 SemComp-Data 评测数据集,覆盖六大领域共 1,273 条结构化的『参考图—指令—结果视频』三元组,且每条实例配对简短与详细两种指令;其三,提出 SemComp-Bench 评测协议,用 VLM 回答结构化二值问题,输出 OA Score(结果达成)与 GR Score(生成可靠性)两个互补分数,并支持按标准的细粒度失败诊断。
与已有工作不同的是,本文的独特切入角度在于『以结果为中心』的评测视角转换。已有工作把视频生成看作过程合成问题,自然地用外观一致性、流畅度衡量好坏;本文则把生成视为任务求解问题——评价对象是最终达成的状态,而非变换过程本身。方法上,作者利用从 Koala-36M 挖掘的『同一条真实视频中的前后状态』来构造数据,天然保证任务可实现且视觉可验证,避开了人工设计任务或合成结果的成本与偏差。评估上,不同于 VLM 打连续分的常见做法,本文采用证据支撑的二值判断与合取式(conjunctive)OA 指标:样本只有在结果实现、语义接地、实体一致性、全局视觉连续性四条标准全部通过时才算成功,这种设计使 37.8% 的最高 OA Score 直观暴露了任务的真实难度,而连续分数可能会掩盖这种联合失败。
核心方法
论文的贡献由『一个任务定义 + 一个数据集 + 一个评测协议』组成。直觉上,作者想回答的问题是:视频模型是否像一个能看图办事的助手,把参考图里的东西按照指令变成目标状态?技术上分三步走。第一步构造数据:从 Koala-36M 出发,经四阶段流水线(候选筛选、状态挖掘、视频扩展、指令结构化)把约 2 万条原始视频转化为 1,273 条标准化三元组 $x_i = (r_i, I_i, o_i)$,其中 $r_i$ 是参考帧,$I_i = (i^{brief}_i, i^{detailed}_i)$ 是配对的双粒度指令,$o_i$ 是以结果为中心的视频片段。第二步设计评测:SemComp-Bench 用 VLM 对生成视频均匀采样的 27 帧序列回答结构化二值问题,维度上分为结果达成(OA,四条标准合取)与生成可靠性(GR,五条标准取均值),每条生成视频经 3 次独立 VLM 调用取算术平均以降低评审方差。第三步实验:在领域均衡的 SemComp-Core(60 条,每域 10 条)上评测 7 个代表性模型,并做模态(I2V vs T2V)与指令粒度(详细 vs 简短)的对照分析。评审 VLM 采用火山引擎 API 的 Doubao-Seed-1.8,作者称其在评估效率与成本间取得了较好的平衡。
核心创新有三点。第一是任务形式化本身:『语义任务完成』要求结果达成与语义接地同时成立,却显式豁免中间过程与外观一致性——这与所有现存的保真度/一致性基准形成本质区别,评价的对象从『视频看起来怎么样』变成『任务办成了没有』。第二是全上下文数据构造:参考帧与结果视频剪取自同一条真实视频(如钓鱼教程的起始帧与完成帧),而非独立采集或人工合成,从数据层面保证『该任务对该参考是可实现的』,且接地约束真实可验证;这是对以往人工 prompt 集合的根本改进。第三是双分数互补的评测设计:OA Score 是四条标准的合取通过率 $A_i = a^{or}_i a^{sg}_i a^{gec}_i a^{gvc}_i \in \{0,1\}$,OA Score $= \frac{1}{N}\sum_{i=1}^{N} A_i$,一个失败即全盘归零,专门度量任务完成;GR Score 则是五条可靠性标准的算术均值 $G_i = \frac{1}{5}(g^{pp}_i+g^{vc}_i+g^{afr}_i+g^{wsc}_i+g^{ti}_i)$,度量『视频本身拍得稳不稳』。实验证明二者排序不同(Seedance GR 第一但 OA 仅 20%),说明生成质量与任务能力是正交的能力维度。
方法步骤详情
数据构造流水线四阶段如下。阶段一(候选筛选):对 Koala-36M 视频先做标题关键词过滤,剔除脱口秀、访谈、新闻等依赖旁白的视频;对保留视频均匀采样帧拼成『视频摘要』马赛克图,用 VLM 将其归入六大领域(艺术与精密、美妆时尚、手工DIY、食品烹饪、园艺宠物、运动健身)及任务类别,无法可靠分类的标为 Uncertain 并丢弃;再为每个任务类别人工定义参考状态与结果状态。阶段二(状态挖掘):VLM 基于状态定义做帧级时间戳定位——先识别视频演示的任务与预期结果,再定位最匹配两个状态定义的参考/结果时间戳并抽帧;随后做 QA 式质量检查:把两张未标注帧与任务描述给 VLM,让其指出哪张是结果帧,预测与定位不一致则保守丢弃。阶段三(视频扩展):沿用 Panda-70M 的镜头切分与同景合并流程,以验证过的结果时间戳为锚点,选取包含结果帧的核心镜头并合并视觉一致的相邻镜头直至最短 3 秒,得到以结果为中心的片段(平均时长约 4.03 秒)。阶段四(指令结构化):先做归一化关系描述,按『动词+参考图主体+介词+结果状态』模板生成不超过 30 词的简短指令;再做属性选择,VLM 从对象元素、人物身份、对象外观、场景四种对齐类型中选定适用的,并决定保留/舍弃哪些参考属性;最后指令组合把简短指令扩展为包含接地约束与结果细粒度视觉特征(背景、光照、颜色、形状、组件细节)的详细指令。评测阶段:每条生成视频均匀采样 27 帧按时间排序,VLM 分三个独立调用打分,OA 四条标准与 GR 五条标准各设预定义二值问题,失败导向的问题(实体不一致、全局视觉不连续及五条 GR 标准)回答『否』记为 1(通过)。
技术新颖性
技术新颖性体现在四个层面。数据层面:以往基准要么用人工编写的 prompt 列表(如 VBench 类),要么依赖模型生成后再筛选,本文的四阶段流水线把『原始长视频→标准化三元组』的转化完全自动化且可扩展(约 2 万条视频产出 1,273 条实例),其中状态挖掘把『结果片段定位』重构为『帧级时间戳定位』,避免了对模糊片段边界的建模;QA 式交叉验证作为保守一致性筛网,用一次性 disagree 即丢弃换取标签精度。指令层面:同一实例配对 brief(≤30 词、模板约束、贴近真实用户习惯)与 detailed(含对齐约束与结果视觉细节)两种指令,使指令特异性的影响可以被受控地研究——Table 3 显示该设计直接揭示了 0.6% vs 4.4% 量级的巨大差异。评估层面:合取式 OA 是对『任务完成』的诚实度量,任何一条保护性标准(实体一致性、全局连续性)失败即归零,有效防住了『开头像参考、后面乱跳』的作弊式生成;证据支撑的二值判断要求 VLM 给出视觉依据,兼顾了可解释性。分析层面:OA 与 GR 双维度解耦设计首次实证了『生成可靠性≠任务能力』这一此前未被量化的结论。
实验结果
在 SemComp-Core(60 条、六域均衡、I2V+详细指令设定)上的核心结果如下。结果达成方面(Table 1):HunyuanVideo-1.5-720P-I2V 以 37.8% 的 OA Score 居首($A^{or}=0.878$, $A^{sg}=0.706$, $A^{gec}=0.583$, $A^{gvc}=0.794$),Wan2.2-I2V-A14B 以 28.3% 次之,两者胜在四条标准均衡而非单项突出;Seedance 2.0 虽在结果实现(0.839)与语义接地(0.744)上表现强劲,但实体一致性(0.444)与全局连续性(0.594)拖累其合得分至 20.0%;Wan2.2-TI2V-5B 恰好相反,连续性类标准最高(0.689/0.922)但任务维度弱(0.589/0.400);Phantom-1.3B 仅 3.9%。生成可靠性方面(Table 2):Seedance 2.0 的 GR Score 最高(91.8%),Wan2.2-I2V-A14B 以 89.0% 领先开源模型,而所有模型的共同瓶颈都是场景内时空一致性 $G^{wsc}$(0.328–0.739),说明模型能生成好看的静帧却难以维持稳定的视觉演化。GR 与 OA 排序明显错位:Seedance GR 第一但 OA 仅 20%,HunyuanVideo OA 第一但 GR 只有 79.1%,实证了两个维度的正交性。条件消融方面(Table 3):I2V 全面碾压同规模 T2V——Wan2.2-A14B 为 28.3% vs 4.4%,CogVideoX1.5-5B 为 14.4% vs 5.0%,HunyuanVideo 为 37.8% vs 4.4%,收益主要来自语义接地、实体一致性与全局连续性;T2V 内部详细指令显著优于简短指令(如 HY:4.4% vs 1.7%),但简短指令反而常获得更高的实体一致性与连续性通过率,揭示了指令特异性与生成难度之间的权衡。定性观察(Fig. 5):各模型倾向于复现参考图外观并演示过程,却常常无法达成目标结果,且伴随物理不合理变换与画面突变。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 语义任务完成—结果达成(I2V + 详细指令) | OA Score(四条标准合取通过率) | HunyuanVideo-1.5-720P-I2V 37.8%(最佳,为被评测对象之一) | 各对比模型:Wan2.2-I2V-A14B 28.3%、Wan2.2-TI2V-5B 23.3%、SkyReels-V2 22.8%、Seedance 2.0 20.0%、CogVideoX1.5-5B 14.4%、Phantom-1.3B 3.9% | 本文不提出新模型而是提出基准;基准揭示最强模型 OA 也不足 40%,量化了该任务的整体难度 |
| 语义任务完成—生成可靠性(I2V + 详细指令) | GR Score(五条可靠性标准均值) | Seedance 2.0 91.8%(被评测对象中最佳) | Wan2.2-I2V-A14B 89.0%、Wan2.2-TI2V-5B 85.4%、HY-1.5 79.1%、CogVideoX1.5-5B 78.8%、Phantom-1.3B 76.8%、SkyReels-V2 71.1% | GR 与 OA 排序错位(Seedance GR 第一但 OA 仅 20%),证明可靠性与任务能力正交 |
| 条件模态消融(同一模型 I2V vs T2V,详细指令) | OA Score | I2V 显著优于 T2V:HY-1.5 37.8% vs 4.4%;Wan2.2-A14B 28.3% vs 4.4%;CogVideoX1.5-5B 14.4% vs 5.0% | 各模型对应 T2V 版本 | 参考图条件带来最高约 33 个百分点的提升,主要增益在语义接地与实体/全局一致性 |
| 指令粒度消融(T2V,详细 vs 简短指令) | OA Score | 详细指令一致更优:HY-1.5 4.4% vs 1.7%;Wan2.2-A14B 4.4% vs 0.6%;CogVideoX1.5-5B 5.0% vs 0.6% | 同模型 T2V + 简短指令设定 | 详细指令通过提升结果实现与接地得分获胜,但简短指令下实体一致性/连续性反而更高,暴露特异性-难度权衡 |
局限与改进
作者承认的局限:其一,SemComp-Data 的 VLM 标注依赖单一评审模型(Doubao-Seed-1.8),其自身的幻觉或误判可能系统性传导进数据与评分,虽然三次独立调用取平均与 QA 交叉验证可部分缓解,但未报告与人工标注的一致性系数;其二,SemComp-Core 仅 60 条样本,每个领域 10 条,统计功效有限,单项通过率如 $A^{or}=0.839$ 与 $0.878$ 之间的差异未必显著;其三,结论『任务特定训练能否利用 SemComp-Data 提升性能』仅在结论中作为展望,未做实验验证。我自己的观察:第一,评审 VLM 与被评模型的能力边界问题——27 帧采样可能漏掉短暂的关键结果帧,导致 OA 被低估或误判;第二,六大领域偏生活化手工任务,缺少工程、科学仪器操作等高价值场景,外推性存疑;第三,合取式 OA 对失败原因不敏感(一次全局跳变与彻底未接地同罚),虽然标准级通过率可诊断,但样本级信息有所损失;第四,闭源模型(Seedance 2.0)使用其暴露的默认设置,与开源模型官方配置的可比性存在细微不对等。
独立分析的弱点
第一,评审单点依赖:整个流水线(分类、状态定位、质检、打分)都绑定在同一个 VLM 上,若该模型对某类任务(如精细手工)系统性偏弱,数据噪声与评分偏差会同向叠加。改进方向:引入多个异构 VLM 交叉标注并报告标注者间一致性,或对 SemComp-Core 做一次全面人工复核并公开差异率。第二,样本量与显著性缺失:60 条样本上 3.9 个百分点级别的差距(如 37.8% vs 28.3% 相差约 6 个样本)未给出置信区间或显著性检验,模型排名可能不稳定。改进方向:利用全部 1,273 条实例做完整评测并报告 bootstrap 置信区间,或将 SemComp-Core 扩容。第三,帧采样策略粗糙:固定均匀采 27 帧对 720p、时长不一的生成视频一视同仁,可能错过瞬时达成状态。改进方向:采用关键帧检索或由 VLM 自适应选择补充帧,评估采样密度对分数的敏感性。第四,任务域窄且无难度分层:全部实例来自手工/生活技能类视频,且未按任务复杂度(如步骤数、对象交互数)分层报告。改进方向:按状态变化复杂度标注难度等级,并在更多领域(工具使用、科学操作)扩展采集。第五,缺少过程维度:任务定义显式豁免中间过程,使基准无法衡量『过程是否合理』这一用户同样关心的属性。改进方向:增设可选的过程合理性加分项,与 OA/GR 并列报告。
未来方向
作者明确提出的方向:利用 SemComp-Data 的 1,273 条带配对双粒度指令与接地约束的三元组进行任务特定微调或强化学习,验证数据能否直接转化为模型能力提升;论文也暗示详细指令中的属性保留/舍弃标注天然适合构造奖励信号。基于本文成果可延伸的方向:其一,把 OA/GR 从离线评测搬到训练回路,用证据支撑的二值 VLM 判断作为 RLHF/RLVR 风格的奖励函数,直接优化『结果达成率』;其二,扩展到长时程多步任务,评测模型能否完成需要多阶段状态迁移的任务(当前基准只锚定单一结果状态);其三,将状态挖掘流水线迁移到第一人称视角视频(如 Ego4D),构造具身智能体的任务完成基准;其四,研究评审 VLM 与生成模型的共进化问题——当模型开始针对 Doubao-Seed-1.8 的判分习惯优化时,评测协议需要更强的对抗鲁棒性;其五,将语义接地约束与 3D/物理仿真结合,用可微物理引擎替代 VLM 判断物理合理性标准 $G^{pp}$,降低评审噪声。
复现评估
复现难度中等偏低,但有明确的卡点。有利条件:论文对流水线各阶段的输入输出、指令模板(动词+主体+介词+状态、≤30 词)、对齐类型定义、评测问题集都有详细描述,数据源 Koala-36M 公开可得,SemComp-Data 的 1,273 条实例若随项目页发布即可复用;评测只需 API 调用(Doubao-Seed-1.8 via 火山引擎)加采样脚本,无训练算力需求;7 个被评测模型中 5 个开源(Wan2.2、CogVideoX1.5、SkyReels-V2、HunyuanVideo-1.5、Phantom),官方默认推理配置即可复现 Table 1/2 的开源部分。卡点:其一,每条 720p 视频生成一次的成本不低(60 条 × 7 模型 × 3 次 VLM 调用之外还有推理成本),全量 1,273 条复现 Table 1 需要可观的 GPU 预算;其二,闭源模型(Seedance 2.0)需要相应 API 权限且其默认设置可能随版本漂移;其三,评审依赖的商业 VLM 若不可用或更新,分数不可直接对齐;其四,截至论文发布项目页仅给出主页地址,数据与代码的开源范围和许可证尚未确认,若四阶段流水线的提示词与状态定义表(位于补充材料)不全,从零重建会有偏差。建议复现路径:先在小规模自建子集上跑通评测脚本,再申请开源模型批量推理资源,最后对照论文数字校准。
论文图表
以『把钞票折成乌龟』为例对比四种情形:参考帧为一张钞票,指令要求折成乌龟。左上角展示语义未接地的失败(生成了与参考无关的乌龟),右侧展示理想情形(中间过程不要求呈现,但结果既达成任务又保持与参考钞票的语义接地),左下角为结果未达成的情形。图示强调评测只关心最终结果状态。
这是理解全文任务定义的钥匙:一眼看清『结果达成』『语义接地』『过程豁免』三个概念的边界,是向他人解释这篇论文时最该展示的一张图。
展示六个代表性实例:烟熏眼妆、鹿的万圣节妆容、组装完整耳机、心形线绳艺术、橡皮筋扭成手环、骷髅变真猩猩、蛋卷制作、瓜果奶酪串制作等。每个实例给出参考帧、结果为中心的视频片段和简短指令。
让读者直观感受评测数据的真实形态与多样性:任务覆盖美妆、手工、食品等领域,且结果与参考来自同一条真实视频,这对判断基准的合理性至关重要。