← 返回 2026-08-17

RA-Bench:面向真实危机事件场景的AI生成视频检测系统性评估基准 Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao 📅 2026-08-14 👍 277 2026-08-22 18:30
AI生成视频检测 危机事件 基准评测 多模态大模型 深度伪造防御 社交传播

以真实危机视频为锚构建RA-Bench,系统评测发现现有检测器与人眼在逼真AI视频面前双双失守

前置知识

I2V(图生视频)条件生成

I2V(Image-to-Video)指以一张静态图像作为条件、结合文本提示生成后续视频帧的生成范式。模型在扩散或自回归框架下把首帧当作初始状态,合成与该帧外观、构图、光照一致的新运动。RA-Bench 用每条真实危机视频的首帧作为所有生成器的统一条件,精确模拟"拿真实照片编造后续事件"的典型造谣流程,使真假视频共享同一场景语义。

理解 RA-Bench 的配对构造(真视频与伪视频共享首帧与 prompt),以及"条件保真度越高越难检测"这一核心结论,都必须先懂 I2V 的条件机制。

AUC 与 TPR@5%FPR

AUC 即 ROC 曲线下面积,衡量检测器对真伪视频连续打分的排序能力,0.5 等于随机。TPR@5%FPR(文中记作 T@5%)表示把对真视频的误报率压到 5% 时能召回多少假视频,是低误报约束下的召回指标,更贴近内容审核的真实需求——误删真实灾害视频代价很高。

传统检测器的多数核心结论(如 AUC 从公开参考的 67.6–98.6% 跌到 RA-Bench 上的 43.9–57.3%、T@5% 仅 2.8–7.5%)都以这两个指标呈现,不熟悉它们就读不懂 Table 2。

平衡准确率与假类召回(BAcc / FakeR)

BAcc 是两类召回率的算术平均,$\mathrm{BAcc}=\frac{1}{2}(\mathrm{RealR}+\mathrm{FakeR})$,其中 FakeR 是假视频被判为假的比例,RealR 是真视频被判为真的比例。只输出离散判决的 MLLM 检测器无法算 AUC,因此用 BAcc/FakeR/宏 F1 评估;BAcc 接近 50% 而 RealR 极高,说明模型在无差别地判"真"。

BusterX++ 强偏 Real 类(FakeR 仅 4.1–9.1%)、Skyra 依赖时间戳先验等关键发现,都是从 FakeR 与 BAcc 的组合模式中识别出来的。

零样本 MLLM 与三种提示协议

零样本多模态大模型指不经任务微调、仅靠提示词让 GPT/Gemini/Qwen 等模型判断视频真伪。本文比较三种输出协议:Binary 直接二选一判决;Diagnostic 要求按五个方面打分再给总体结论;Rating 要求输出 0–100 连续分并附明确判决。协议决定了输出是连续分(可算 AUC)还是离散判决(只能算 BAcc/FakeR)。

论文发现换 prompt 能让 Qwen3.5-0.8B 的 FakeR 从 19.7% 反转到 100%,提示协议敏感性是零样本检测的核心失效模式,是 4.1.2 节全部结论的前提。

VBench++ 质量维度与 Condition Fidelity

VBench++ 是常用的视频生成质量评测套件。本文用其 I2V 评估器给全部 16,056 个生成片段打分,并定义 Condition Fidelity 为视频-图像主体一致性与背景一致性两个归一化分数的均值,衡量生成视频对条件首帧的保真程度;另用 Dynamic Degree 区分动态/静态片段,避免低运动片段靠"几乎不动"骗取高时序一致性分。

4.2 节关于"质量越高越难检测、但不同检测器族敏感的维度不同"的分析完全建立在这些分数与其源内分层关联方法之上。

社交传播模拟(RA-Bench-LastMile)

视频到达观众前会经历平台转码(VP9→H.264)、空间降采样(0.5×)、降帧率(8 fps)、叠加新闻徽章等处理。RA-Bench-LastMile 把这些操作组合成 T1、T1+T2、T1+T3、T1+T4 与 Full 五档条件,对真伪配对视频施加完全相同的处理,检验检测器在"最后一公里"传播链路上的鲁棒性。

Full 条件下微调 MLLM 的平均 FakeR 从 46.0% 崩到 1.4%,是论文"传播使检测失效"结论的关键证据;不理解这些操作的物理含义就无法解读 Figure 11。

研究动机

视频生成模型已经能编造以假乱真的战争、灾难、公共卫生危机画面,这类内容一旦被当作真实新闻传播,可能直接引发公众恐慌与社会动荡。然而现有检测评测与这一风险场景严重脱节:GVF、GenVideo、GenVidBench、AIGVDBench 等基准主要从 OpenVid-1M 等通用语料构造真伪视频对,聚焦日常场景,既不要求生成内容锚定在可追溯的真实事件上,也缺少社会风险类别体系;Table 1 的对比显示,没有任何既有基准同时覆盖真实事件溯源、社会风险分类、真实事件条件化 I2V 生成、人类欺骗挑战集与社交传播模拟这五项能力。更麻烦的是,检测器在公开基准上的表现高度乐观——文中引用的公开参考 AUC 高达 67.6–98.6%——但这些分数能否迁移到危机事件场景、生成条件如何改变可检测性、能骗过人眼的视频是否也能骗过检测器、以及经过社交平台转码压缩后检测是否仍然可靠,此前都没有系统性证据,导致防御方对真实威胁缺乏清醒认知。

本文的目标是本文的目标是回答一个具体问题:面对以真实危机事件为素材的 AI 生成视频攻击,当前检测手段到底可不可靠?为此作者构建了 RA-Bench(Real videos as Anchors):收集 675 个公开危机与社会重大事件视频,经两轮人工审核后保留 1,830 个真实锚点,覆盖 10 个社会风险大类(天气与自然灾害、战争与武装冲突、政治与治理、公共安全、事故与基础设施故障、经济与社会恐慌、公共卫生、科技、太空探索、大型公共活动)和 44 个子类;再以每个锚点的首帧加共享 prompt 为条件,用 4 个开源(Wan2.2、Wan2.2-Lightning、LTX、OmniWeaving)与 5 个闭源(HappyHorse、Runway、Kling、Seedance2.0、Hailuo)生成器产出 16,056 个伪造片段,合计 17,886 个视频。在此基准上沿三条正交线索展开评测:检测器跨源泛化能力、生成属性(质量/条件/种子)与可检测性的关系、以及人类感知与社交传播下的检测可靠性,从而给防御方一份可复用的"体检报告"。

与已有工作不同的是,本文最独特的切入是 Real-as-Anchor 的配对设计:以往基准的假视频大多从通用语料的 prompt 分布中采样,与真视频没有一一对应关系;RA-Bench 则让每个伪造视频与它的真实锚点共享同一首帧(I2V 条件)、同一 caption 生成的 prompt 和同一种 H.264 编码,精确复刻"拿一张真实灾难照片续写一段假视频"的真实谣言生产方式,同时把语义内容、时长和编解码格式这些混淆变量控制住。第二个独特之处是把"人"和"传播"纳入评测闭环:通过 20 名评审的源不可知盲测筛出 633 个被全部 5 名评审判为真实的生成视频构成 RA-Bench-HumanProof,专门检验"人类觉得真"的样本对检测器是否同样致命;再设计 RA-Bench-LastMile 传播模拟,量化转码、降采样、降帧、新闻徽章四类操作对检测能力的侵蚀。这使得论文的结论从"检测器分数低"升级为"检测器恰好在人类最容易被骗、内容传播最真实的链路上失效",直接对应真实世界的防御需求。

核心方法

直觉上,要公平考核检测器,需要一批"除了是假的之外其他都一样"的假视频,RA-Bench 的五阶段流水线正是为此搭建。第一步源数据收集:从政府机构、开放版权库(如 Wikimedia Commons)和公开视频平台收集 675 个真实事件视频,归入 10 个 L1 大类与 44 个 L2 子类,刻意不做类别配额以保持自然分布。第二步自动预处理:PySceneDetect 检测镜头切点、FFmpeg 切分出 5,774 个候选片段,并用 ResNet-18 做近重复预筛。第三步两轮人工审核:7 名志愿者按画质、语义契合、时长、重复、来源风险五项标准两两独立审核,分歧与不确定样本交由 4 名仲裁者终审,保留 2,426 个、拒绝 3,348 个。第四步后处理:时长约束到 3–15 秒、统一 H.264(CRF 17)重编码以消除编解码器线索、同质性修剪删去 595 个冗余片段、版权审查记录重分发权利,得到 338 个来源的 1,830 个锚点,共 18,448 秒(约 5.1 小时),平均 10.08 秒。第五步配对生成:用 Gemini-3.1-Pro-Preview 生成结构化 caption 并转成共享 prompt,以首帧为条件调用 9 个生成器,生成 2–8 秒片段,统一 H.264 重编码并去音频,产出 16,056 个伪造片段。

核心创新是"以真视频为锚"的受控配对生成加上"三维体检"评测框架。与 GVF、AIGVDBench 等从通用语料构造真伪集合的做法有本质区别:RA-Bench 的每个伪造视频都从一条可追溯的真实危机视频"长"出来——同一首帧(I2V 条件)、同一 prompt、同一种编码,唯一不同的是后续运动由生成器合成。这既提高了难度(生成视频保留真实场景的构图、光照与拍摄风格),又封死了"检测器靠编解码器或时长作弊"的漏洞,还精确对应社交媒体上最常见的滥用模式。在评测侧,论文拒绝给出单一总分,而是把问题拆成三条正交的分析轴:检测器跨源泛化、生成属性对可检测性的影响、人类感知与社交传播;并首创两个挑战集——HumanProof(633 个被 5 名评审全判"真"的生成视频)与 LastMile(转码、降采样、降帧、新闻徽章的组合传播模拟)——把评测从静态分类准确率推进到"全链路可靠性"。这套"受控配对 + 协议审计 + 人机对照"的方法论本身就是对检测评测范式的重要更新。

方法步骤详情

评测协议值得展开。传统检测器共 7 个:帧级的 CNNSpot、NPR、UnivFD、ForgeLens 输入 8 个均匀采样帧并平均每帧假概率;视频级的 DeCoF 取前 32 帧中的 8 帧,D3 用 3 秒 8fps 窗口 16 帧,ReStraV 取中心 2 秒 24 帧的 DINOv2 特征。零样本 MLLM 共 10 个(Qwen3.5 系列 0.8B 至 122B-A10B、Qwen3.7-Plus thinking、Gemini-3.1-Pro-Preview、GPT-5.5),输入 16 帧短边 256 序列,分别在 Binary/Diagnostic/Rating 三种提示下输出判决。微调 MLLM 包括 Skyra-SFT/Skyra-RL(官方时间戳或帧索引两种时间标签)与 BusterX++(released pipeline)。连续打分报配对 AUC 与 TPR@5%FPR,离散判决报 BAcc、宏 F1 与 FakeR。消融设计精细:Global–Local-8 对比 Uniform-8 检验固定 8 帧预算下的采样策略;Wan2.2 的 T2V/首帧 I2V/首尾帧 I2V 三设置在相同 1,830 条 prompt、种子 0 下生成,隔离真实图像条件量;种子 0/42/123 重复生成检验随机性;Wan2.2 fixed* 把时长固定在约 5.06 秒作对照——它使 Skyra 的 FakeR 从 33.8% 飙到 96.4%,牵出时间戳先验这一关键发现。

技术新颖性

技术新颖性体现在四点。其一,数据构造上首次把真实事件溯源作为硬约束(Table 1 中只有 RA-Bench 五项能力全覆盖),且每步筛选数量留痕可审计。其二,协议审计式评测:不只报分数,还主动设计干预实验定位失效机理——把 Skyra 输入中的绝对时间戳替换为帧索引后,"恰好在 5.00 秒结束的片段"与其他片段的 FakeR 差距从 48.6/43.4 点缩到 1.5/1.4 点,证明其表观性能相当程度来自训练数据 ViF 元数据中时间戳与标签的相关性而非视觉证据;这种"检测器到底在检测什么"的审计方法可迁移到其他检测器。其三,把 VBench++ 各质量维度与检测输出做源内分层、按 Dynamic Degree 分层的关联分析,发现不同检测器族依赖的质量维度不同(Gemini 最敏感于 Condition Fidelity 与时序一致性,传统检测器均值还强烈受 Imaging Quality 影响),否定了"单一质量分数决定检测难度"的直觉。其四,人类欺骗样本与传播模拟的引入,使基准第一次能回答"对人失效的样本是否也对机器失效"以及"内容在真实传播链路上还能被拦住吗"。

Overview of the five-stage RA-Bench construction pipeline.
Figure 2: Overview of the five-stage RA-Bench construction pipeline.
Overview of RA-Bench. (a) The L1 real-event taxonomy used to organize the 1,830 real-video clips into 10 broad social-risk domains. (b) The clip distribution across the L1 domains. (c) The image-to-video generation sources used to construct the generated-video set.
Figure 3: Overview of RA-Bench. (a) The L1 real-event taxonomy used to organize the 1,830 real-video clips into 10 broad social-risk domains. (b) The clip distribution across the L1 domains. (c) The image-to-video generation sources used to construct the generated-video set.
A real anchor and its generated counterpart for a representative RA-Bench crisis event.
Figure 4: A real anchor and its generated counterpart for a representative RA-Bench crisis event.

实验结果

第一,三大检测器族无一能稳定跨源泛化。7 个传统检测器公开参考 AUC 为 67.6–98.6%,在 RA-Bench 上源级均值跌至开源源的 50.9–57.3%、闭源源的 43.9–54.0%,63 个检测器-源组合中 26 个低于 50%;公开排名与 RA-Bench 排名的 Spearman 相关仅 0.26(UnivFD 第二→第六,NPR 第六→第三),各源最强检测器各异;5% 假阳性率下 7 检测器平均只召回 2.8–7.5% 假视频;8 帧均匀采样换全局-局部混合仅 +0.99 点 AUC(CI [0.69, 1.29])。第二,零样本 MLLM 对提示与来源双重敏感:最强 Gemini-3.1-Pro Binary 仅 63.4% BAcc 且按源波动 54.3–74.5%;换提示词可让 Qwen3.5-0.8B 的 FakeR 在 19.7%/97.8%/100.0% 间反转,Qwen3.5-4B 反向(85.2%→5.5%→21.9%);GPT-5.5 Rating 连续分 62.1 AUC 但判决宏 F1 仅 36.9(几乎全判真);Qwen3.5 扩到 122B-A10B 仅部分组合受益(LTX Rating AUC 51.0→65.8,Hailuo 仅 50.5→52.7)。第三,微调 MLLM 呈两类病灶:Skyra 依赖时间戳协议(帧索引替换后均值 BAcc 从 68.5/69.5% 跌到 54.4/54.9%),BusterX++ 强偏 Real 类(FakeR 4.1–9.1%)。第四,生成属性影响因检测器族而异:Condition Fidelity 每升一个四分位距,Gemini Diagnostic FakeR 降 14.4 点;动态内容使 Gemini 假类证据增 5.5–8.4 点却不影响传统检测器均值(+0.1,CI 含零);T2V→首帧 I2V→首尾帧 I2V 使微调 MLLM 平均 FakeR 从 70.5%→42.7%→28.3%,传统检测器均值 AUC 却非单调(33.4%→50.9%→44.6%,D3 −25.6 点、DeCoF +6.0 点);三个种子下源级结论几乎不变(AUC 极差 ≤1.05 点)。第五,人与机器失败高度重叠且传播雪上加霜:20 名评审对开源生成视频判假率 68.6%、闭源仅 52.9%(Seedance2.0 40.7%、Kling 45.1%),真视频也有 22.8% 判断被误判为生成;633 个"5 人全判真"样本构成的 HumanProof 上,Gemini Binary/Diagnostic 仅 54.7%/54.5% BAcc,传统检测器平均 47.5% AUC、4.4% T@5%;LastMile Full 条件把 5 个微调配置平均 FakeR 从 46.0% 压到 1.4%(BusterX++ 0.2%、RealR 100%),传统检测器 AUC 从 51.4% 降到 47.3% 且排名重排(Spearman 0.07)。

Comparison of benchmark designs for AI-generated video detection.
Table 1: Comparison of benchmark designs for AI-generated video detection.
Traditional detector performance across the nine RA-Bench generation sources.
Table 2: Traditional detector performance across the nine RA-Bench generation sources.
Source-specific zero-shot multimodal model results on the nine RA-Bench generation sources.
Table 3: Source-specific zero-shot multimodal model results on the nine RA-Bench generation sources.
Fine-tuned MLLMs across the nine RA-Bench generation sources.
Table 4: Fine-tuned MLLMs across the nine RA-Bench generation sources.
Detection under three Wan2.2 generation settings.
Table 5: Detection under three Wan2.2 generation settings.
Detection results remain stable across generation seeds.
Table 6: Detection results remain stable across generation seeds.
Human recognition varies sharply by generation source.
Table 7: Human recognition varies sharply by generation source.
Human-deceptive videos remain difficult for current detectors.
Table 8: Human-deceptive videos remain difficult for current detectors.
Source-specific AUC profiles for the seven traditional detectors.
Figure 5: Source-specific AUC profiles for the seven traditional detectors.
Effect of temporal allocation under a fixed eight-frame budget.
Figure 6: Effect of temporal allocation under a fixed eight-frame budget.
Qwen3.5 scaling across prompts and generation sources.
Figure 7: Qwen3.5 scaling across prompts and generation sources.
Skyra performance changes with temporal-tag representation.
Figure 8: Skyra performance changes with temporal-tag representation.
Generation quality and fake-side detectability on RA-Bench.
Figure 9: Generation quality and fake-side detectability on RA-Bench.
Changes in detectability across Wan2.2 generation settings.
Figure 10: Changes in detectability across Wan2.2 generation settings.
Detection under the RA-Bench-LastMile social dissemination simulation.
Figure 11: Detection under the RA-Bench-LastMile social dissemination simulation.
查看结构化数据
任务指标本文基线提升
传统检测器跨 9 个生成源泛化 配对 AUC(%) 源级均值 43.9–57.3,26/63 个检测器-源对低于 50 公开参考 AUC 67.6–98.6(AIGVDBench LTX-I2V / VidProM) 大幅下降约 10–50 个百分点,属于系统性负迁移
零样本 MLLM 视频鉴伪(最强配置) BAcc / macro-F1(%) Gemini-3.1-Pro Binary 63.4 / 62.9 随机水平 50;其他零星模型普遍 50–55 仅高约 13 点,且跨源波动 54.3–74.5,不稳定
人类欺骗子集 RA-Bench-HumanProof(633 视频) AUC / BAcc(%) 7 传统检测器均值 47.5 AUC;Gemini Binary 54.7 BAcc 随机 50;源匹配 RA-Bench 参考 49.5 AUC / 61.2 BAcc 接近或低于随机;Gemini 相对源匹配参考下降 6.5 点 BAcc
社交传播模拟 RA-Bench-LastMile(Full 条件) 微调 MLLM 平均 FakeR(%) 1.4(BusterX++ 0.2,RealR 100%) Original(标准化片段)46.0 下降 44.6 点:传播处理使假视频召回几乎归零(负向)
人类盲测识别生成视频 FakeR(判为生成的比例,%) 闭源平均 52.9(Seedance2.0 40.7,Kling 45.1) 开源生成器平均 68.6 闭源比开源低 15.7 点,最逼真的近半数骗过人类

局限与改进

作者承认三点局限:RA-Bench 只是快速演进领域的快照,仅覆盖 9 个 I2V 生成源和纯视觉检测,需版本化滚动更新;I2V 生成与社交传播被当作分离的受控阶段,未覆盖真实攻击者的多阶段伪造流水线(生成后再编辑、合成音频、加字幕、反复平台压缩);人类判断在受控界面收集,缺少线上社交情境的影响。我的补充观察:闭源 API 的内容安全过滤使各源配对规模不均(Seedance2.0 仅 1,524 条),可能引入选择偏差;caption 与 prompt 全由 Gemini-3.1-Pro-Preview 生成,而它同时是最强零样本检测器,存在提示分布与被测模型同源的循环性风险,且 prompt 风格单一;人类评审仅 20 人、每视频 3 次判断,未报告专业背景,代表性有限;4.2 节的质量-可检测性分析是相关性而非因果;LastMile 仅 150 个锚点、覆盖 41/44 子类,统计功效有限;所有检测器均以 released 权重直接推理,缺少"RA-Bench 同分布微调后的上限"参照,无法严格区分跨源失效是域偏移还是能力上限。

独立分析的弱点

独立来看,本文有几个值得警惕的弱点。第一,评测以"现成检测器直接推理"为主,两个微调 MLLM(Skyra、BusterX++)也是在其他数据(ViF 等)上训练,没有在 RA-Bench 内做留出微调,"跨源失效"的结论无法区分域偏移与能力上限,应在锚点级划分下补测微调上限,否则容易低估"数据覆盖不足"这一可修复因素。第二,攻击侧只覆盖 I2V 续写一种模式,没有文本到视频全合成、局部编辑/换脸、生成后混剪等攻击,也没有对抗性后处理(如专门洗掉伪影的净化模型),威胁模型不完整。第三,prompt 由单一模型批量生成,风格同质;口语化、情绪化、带新闻标题等不同提示风格下的检测难度可能显著不同。第四,HumanProof 依赖 5 名评审全判"真"的严格标准,阈值松紧会改变子集构成;且 633 条中 514 条来自闭源源,人类欺骗结论主要由闭源模型驱动,开源端仅 119 条。第五,LastMile 的新闻徽章只测一种台标样式与位置,无法证明"任何可信度标识都会让 MLLM 更倾向判真"的普适性。对应改进方向:加入域内微调基线、扩展多攻击模式与对抗净化、多模型多风格 prompt 采样并报告方差、评审一致性控制、徽章样式/位置的系统消融。

未来方向

作者提出五个方向:(1)设计利用时序一致性、光照变化、物体运动等多线索的鲁棒检测器,应对越来越逼真的生成视频;(2)建立检测器可解释性评测基准,验证 MLLM 给出的取证证据是否正确且忠实,并探索用 agent 与后训练把检测分解为结构化推理步骤;(3)主动水印与被动检测协同设计,在生成时嵌入可识别信号并评估其在传播后处理下的鲁棒性;(4)扩展到音视频联合检测,因为 Seedance2.0 等模型已能原生生成音画同步内容,纯视觉检测会留盲区;(5)反向利用基准:把检测分数当作生成真实性的度量,在视频生成模型后训练中充当奖励模型。Discussion 还建议用模块化或多智能体工作流融合多个检测器与取证工具的证据,而非依赖单一分类器。基于本文成果还可延伸:把 HumanProof 式人类盲测纳入生成模型训练目标(以"人类不可分辨"为正则);对 LastMile 各传播操作做可微建模,训练对传播链路不变的视频表征;构建版本化滚动基准,持续纳入新生成器与新检测器,绘制攻防差距的时间演化曲线;以及把协议审计方法(如时间戳干预)推广为检测器发布前的标准"捷径学习"测试。

复现评估

复现条件相当友好。数据与代码完全公开:论文首页给出 RA-Bench 网站、Hugging Face 数据集与 GitHub 代码三个入口,17,886 个视频随数据集发布,每个源视频都记录版权与重分发权利元数据。附录文档化程度很高:L2 类别定义与 675 源清单、PySceneDetect/FFmpeg 参数、审核标准与两轮流程、各生成器的执行字符串与推理设置(如 Wan2.2 用 UniPC 40 步、shift 5.0、guidance 3.5;LTX 30 步加蒸馏 LoRA)、检测器输入协议、三种零样本提示的完整模板、HumanProof 与 LastMile 的完整协议全部列出。算力方面:4 个开源生成器需本地 GPU 生成约 7,320 个片段(Wan2.2 A14B 级 40 步采样,需多卡),闭源 5 个走 API 有费用;传统检测器单机 GPU 可完成,MLLM 侧需对 9 源 × 数千片段调用 Gemini/GPT/Qwen API,费用是主要成本。人工成本集中在构建期(7 名审核者 + 4 名仲裁者 + 20 名人类评审),直接使用发布数据集可完全跳过。综合判断:用现成数据复现评测表格为中等难度(主要是 API 费用与推理时间),从零重建基准为高难度(需标注人力与生成算力),但协议细节足以支撑两者。