重新审视多模态自动事实核查的“无污染”动态评测 Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
实证揭示动态MAFC基准仍残留17-29%污染并扭曲评测,呼吁更严苛的去污染评估
前置知识
多模态自动事实核查 (MAFC)
MAFC 系统验证(check-worthy)声明的真伪,通常分两阶段:先从开放网络、新闻、社交平台等外部来源检索多模态证据 $E=\{e_1,\dots,e_k\}$(文本或图像/视频),再聚合证据推理出裁决标签(Supported / Refuted / Not Enough Evidence)。它强调“必须依赖外部证据”,而不是仅靠模型内部记忆。
理解 MAFC 才能理解为什么“污染”会成为评测失真的核心:污染让模型绕过外部证据检索这一关键步骤,直接用参数化知识答题,从而伪装出“会核查”的假象。
基准污染 (Benchmark Contamination)
指评测样本在 LLM 预训练阶段就被见过。在 MAFC 语境下,本文定义为:对于目标 LLM $m$,若其参数化知识能匹配人类事实核查员使用的 oracle 证据,则该 claim 视为被污染。结果是模型无需检索外部证据即可作答,夸大真实能力。
本文全部围绕污染的“程度—成因—影响—对策”展开,没有这个概念就无法理解 RQ1–RQ4 的论证链。
动态评测范式 (Dynamic Evaluation)
为对抗污染而生的范式:持续收集 LLM 知识截止日期之后发布的新鲜样本(按月/季度刷新),代表系统有 LiveBench、LiveCodeBench、VERITAS、XFACTA。其隐含假设是“发布时间在 cutoff 之后 ⇒ 模型没见过 ⇒ 无污染”。
本文正是要挑战这一隐含假设,证明即使 claim 发布在 cutoff 之后,仍可能因引用 cutoff 之前的旧事实或可由旧事实合成而被“回声式”污染(Déjà Vu)。
证据充分性评测管线 (Evidence Sufficiency Pipeline)
源自 AVeriTeC 的检测流程,三步:(1) 让目标 LLM 仅凭内部知识为 claim $c$ 生成一篇事实核查文章 $\tilde a$;(2) 用 GPT-4o-Mini 从人工 oracle 文章 $a$ 与 $\tilde a$ 中各抽取证据项集合 $E$ 与 $\tilde E$;(3) 用匈牙利算法做一对一匹配,按 $s(\tilde E,E)=\frac{1}{|E|}\max\sum f(\tilde e_i,e_j)X(\tilde e_i,e_j)$ 计算 claim 级污染分,超过阈值 $\tau$ 即判为潜在污染。
这是本文唯一使用的污染检测工具,是 RQ1–RQ4 全部数据的来源;理解它的输入输出才能判断结论的可信度与局限。
AVeriTeC / ClaimReview2025Q4 基准
AVeriTeC 是当前 SOTA 的静态 MAFC 基准,来自 50 家事实核查机构,作者取其 dev set 的 500 条去重后剩 491 条,最新样本为 2020-10-31。ClaimReview2025Q4 是本文自建动态基准,仿 VERITAS/ClaimReview2024+ 协议从 ClaimReview 项目抽取 2025 Q4 发布、英文、IFCN 签约机构核查的 claim,经 GPT-4o-Mini 过滤畸形样本后得 901 条。
这两条基准分别代表“静态-高污染风险”和“动态-理应无污染”两端,它们的对比正是本文核心论点的实验载体。
研究动机
现有 MAFC 评测存在两层问题。第一层是静态基准(如 AVeriTeC、MOCHEG、VERITE、AVerImaTeC)一直不更新,其 claim 最新只到 2020-10-31,而 GPT-5.2、Gemini-3.0-Pro 等 SOTA LLM 的知识截止普遍不早于 2023 年,模型在预训练时极可能已见过相关事件,能直接凭参数化知识作答,绕过“检索外部证据”这一 MAFC 核心挑战,从而夸大性能。第二层更隐蔽:业界寄希望于动态基准(VERITAS、XFACTA)通过持续收集 cutoff 后的新 claim 来消除污染,但这一假设从未被直接量化验证过——发布在 cutoff 之后并不意味着 claim 真的“新”,它可能引用 cutoff 之前的旧事实(如 1986 年的 EMTALA 法案),或能由多个旧事实合成。此外,文献中关于“cutoff 后性能是否下降”的证据互相矛盾:Rothermel 等报告下降,但 Quelle 与 Bovet 未观察到突变,Fontana 等只在 real claim 上发现下降,且性能变化也可能源于分布漂移或 claim 复杂度变化,而非污染本身。缺乏对污染的直接隔离与控制,使得现有基准分数可信度存疑。
本文的目标是本文要做四件事,对应四个研究问题。RQ1:直接量化现有静态(AVeriTeC)与动态(自建 ClaimReview2025Q4)MAFC 基准在六种 SOTA LLM 上的污染程度,回答“动态评测到底消除了多少污染”。RQ2:通过案例研究弄清为什么“cutoff 后发布”的 claim 仍会被污染,揭示污染的真实成因。RQ3:实测污染对 MAFC 性能评测的影响有多大,是否会造成性能膨胀和排名扭曲。RQ4:在严格去污染的统一集合上重新评估六个 SOTA LLM 的真实 MAFC 能力,给出可信的排行榜,并为未来基准构建提供实践指南。最终目标是推动 MAFC 评测从“按时间戳过滤”升级到“按 claim 新颖性控制”。
与已有工作不同的是,本文的独特切入点是“直接量化污染”而非“按时间戳间接推断”。以往判断污染靠“把 claim 按 LLM cutoff 日期分组看性能是否掉”,这种方法把污染、分布漂移、claim 复杂度变化混在一起,无法归因。本文改用 AVeriTeC 的证据充分性管线,让模型自己生成事实核查文章并与人工 oracle 比对,把污染“测出来”而非“推断出来”。其次,以往工作(如 Yoon et al.)只研究依赖人工指定工作流、且只测静态基准的 MAFC 系统;本文转向完全自主的智能体式系统(DEFAME),并同时分析新兴动态基准,前瞻性更强。再者,本文进一步用 trajectory 级查询重构分析(Specialization/Generalization/Exploration/Repetition)解释了污染为何能膨胀性能——它让模型更精确地命中证据而省去广泛探索,从机制层面给出了“污染—性能”的因果链条。
核心方法
整体思路是把“模型是否污染”转化为“模型内部知识生成的证据是否足以替代人类核查员使用的证据”。直觉上:若一个 claim 模型已经“知道答案”,那它仅凭参数化知识写出的事实核查文章,应能与人类核查员的文章高度相似;反之真正新颖的 claim,模型写不出像样的证据。技术路线因此分三步。第一步,对每条 claim $c$ 提示目标 LLM $m$ 生成一篇事实核查文章 $\tilde a$,诱发其内部知识。第二步,用 GPT-4o-Mini 分别从人工 oracle 文章 $a$(爬自核查机构源 URL)与 $\tilde a$ 中抽取证据项,得到 $E=\{e_1,\dots,e_n\}$ 与 $\tilde E=\{\tilde e_1,\dots,\tilde e_{n'}\}$;这一步统一抽取消除人类与 LLM 写作风格差异并去除 cookie、广告等噪声。第三步,用匈牙利算法做 $\tilde E$ 到 $E$ 的一对一匹配,计算 claim 级污染分 $s(\tilde E,E)=\frac{1}{|E|}\max_{X}\sum\sum f(\tilde e_i,e_j)X(\tilde e_i,e_j)$,其中 $X$ 是 0/1 指派矩阵,分母 $|E|$ 防止过度生成抬高分数并惩罚遗漏 oracle 证据。当 $s\ge\tau$ 即判为潜在污染。基准级分数 $S=\frac{1}{|C|}\sum_c s(\tilde E_c,E_c)$ 为所有 claim 的均值。
核心创新不在发明新管线,而在“重新定义 + 大规模实证 + 机制归因”三件套:(1) 把 MAFC 的污染严格定义为“参数化知识匹配人类 oracle 证据”,并把对象从静态扩展到动态基准与自主智能体;(2) 横跨六款 SOTA LLM、三种相似度(METEOR 严格词汇、Gemma-Emb-0.3B、Qwen3-Emb-0.6B 语义嵌入),首次给出动态基准仍残留 17.09%–29.30% 污染的量化证据,并基于 180 条人工标注(两名研究生独立标注一致率 97.8%)经 threshold-sweep 把语义阈值定为 $\tau=0.6$;(3) 进一步用 trajectory 查询重构统计揭示污染的“捷径效应”——污染 claim 的轨迹显著减少 Exploration 步数,证明污染是通过让检索更精准、跳过证据空间探索来膨胀分数,而非靠更强的推理。这套组合是已有工作(仅研究人工工作流 + 静态基准)所没有的。
方法步骤详情
完整流程可拆为五步。Step A 数据准备:静态侧取 AVeriTeC dev set 500 条去重得 491 条并爬取 oracle 文章;动态侧按 VERITAS/ClaimReview2024+ 协议从 ClaimReview 抽取 2025 Q4 的英文 claim,仅保留 IFCN 签约机构核查样本,去重后用 GPT-4o-Mini 过滤掉直接暴露裁决、不完整句子或含冗余元信息的畸形 claim,最终得 901 条 ClaimReview2025Q4。Step B 污染检测(输入 claim,输出污染分):对每条 claim 用温度 0.01 的目标 LLM 生成 $\tilde a$,再用 GPT-4o-Mini 从 $\tilde a$ 与 $a$ 抽证据得 $\tilde E$、$E$,按匈牙利匹配算 $s$,三种度量各自有阈值(METEOR $\tau=25\%$;语义 $\tau=0.6$)。Step C 子集划分:某模型的污染子集 = 三种度量都超阈值的 claim 交集,其余为未污染子集。Step D 性能评测:以 DEFAME(ReAct 式智能体,调用 Serper API 的 Google Web/Image Search,返回 top-3 网页含文图)为统一 MAFC 框架,每个目标 LLM 作 backbone,分别跑污染与未污染子集,比 Accuracy 与 Macro-F1。Step E 机制分析:用 GPT-5-Nano 把每条轨迹相邻查询对 $q_k\to q_{k+1}$ 标为 Specialization / Generalization / Exploration / Repetition,统计污染/未污染子集的平均次数。Step F 严格评估:取六款模型在三种度量下都未污染的 claim 交集,构成 154 条统一去污染集合,重新跑 DEFAME 得可信排行榜。
技术新颖性
技术新颖性体现在四点。其一,把污染检测首次系统应用于“动态 MAFC 基准 + 自主智能体”这一前沿组合,覆盖 GPT-5.2、Gemini-3.0-Pro、DeepSeek-V3.2、Qwen3.5-122B-A10B 等 2025/2026 新模型,是前瞻性而非回顾性研究。其二,构造 ClaimReview2025Q4(901 条 Q4-2025 英文 claim)作为可复现的“后 cutoff”分析载体,弥补 VERITAS 未开源、XFACTA 已停更(2025-08 后无更新)的空白。其三,提出污染成因二分法——“直接引用旧事实”(如 EMTALA 1986、Scarborough 2022 烟花、UK 75 岁 TV licence)与“合成多个旧事实”(如 Barron Trump 2028 参议院资格 = 出生年 2006 + 宪法 30 岁门槛),为未来去污染提供可操作的判据。其四,用 trajectory 查询重构统计把“污染为何膨胀性能”从相关性推进到机制解释(Exploration 步数显著减少),这是以往污染研究未触及的层级。
实验结果
本文共报告 16 项发现,可归纳为四组。RQ1(程度):动态基准确实能降污染但消不干净。Table 2 显示 ClaimReview2025Q4 在六款模型上的污染分全面低于 AVeriTeC:METEOR 降 2.92–4.95 个百分点,两个语义度量降 6.20–11.16 个百分点。但 Table 3 的交集统计显示,仍有 17.09%(GPT-5.2)至 29.30%(Qwen3.5-122B-A10B)的 claim 被三种度量同时判为污染(Finding 1.3)。语义度量识别的污染子集显著大于词汇度量,说明污染多表现为语义改写而非逐字复用(Finding 1.4)。Qwen3.5-122B-A10B 在动态基准上污染最重(METEOR 35.18%、Gemma 55.94%、Qwen3 50.94%),可能因其 cutoff 未知、训练数据已含 Q4-2025 内容(Finding 1.5)。RQ2(成因):Table 4 的四个案例揭示两类来源——直接引用 cutoff 前的旧事实(Claim 1 EMTALA、Claim 2 Scarborough、Claim 3 TV licence),以及合成多个旧事实(Claim 4 Barron Trump 2028 参议院资格)。RQ3(影响):Table 5 显示从污染子集切到未污染子集,所有模型的 Accuracy/Macro-F1 都下降,Qwen3.5-122B-A10B(−10.88 Acc)、Gemini-3.0-Pro(−10.50)、Gemini-3.0-Flash(−11.34 Macro-F1,最大)、GPT-4o-Mini(−9.60/−9.59)显著下降($p<0.05$)。污染还扭曲排名:污染子集上 Gemini-3.0-Flash Macro-F1 最高(61.22%),未污染子集上 GPT-5.2 反超(52.81%)。Table 6 的 trajectory 分析显示污染轨迹 Exploration 步数显著更少(如 Qwen3.5 未污染 1.24 vs 污染 0.89),证实污染通过让检索更精准、跳过广泛探索来膨胀分数。RQ4(真实排名):在六模型三度量都未污染的 154 条交集上(Table 8),DeepSeek-V3.2 以 Macro-F1 55.93% 居首,GPT-4o-Mini 最低(39.14%),但所有模型 Macro-F1 都低于 56%,说明 MAFC 远未饱和。Table 7 还揭示去污染集合存在标签失衡(Refuted 占 68.18%),故主指标用 Macro-F1。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 动态基准污染程度(RQ1,三度量交集) | ClaimReview2025Q4 污染 claim 占比 | GPT-5.2 17.09% — Qwen3.5-122B-A10B 29.30% | 动态评测“假设 0% 污染” | 首次量化证明动态基准仍残留 17.09%–29.30% 污染,证伪“cutoff 后即无污染”假设 |
| 静态 vs 动态污染对比(Table 2) | 平均污染分(Gemini-3.0-Pro, Qwen3-Emb-0.6B) | AVeriTeC 65.78% → ClaimReview2025Q4 56.89% | AVeriTeC 静态基线 | 动态化使污染分降 8.89 个百分点(语义度量普遍降 6.20–11.16 pp) |
| 污染对 Macro-F1 的膨胀(Table 5) | Macro-F1 下降幅度(污染→未污染子集) | Gemini-3.0-Flash −11.34 pp(最大) | 污染子集 Macro-F1 61.22% | 证明污染可造成高达 11.34 pp 的性能虚高,且 $p<0.05$ 显著 |
| 排名扭曲(Table 5) | 未污染子集 Macro-F1 第一名 | GPT-5.2 52.81% | 污染子集第一名 Gemini-3.0-Flash 61.22% | 证明污染可改变模型排名,污染子集结论不可信 |
| 严格去污染评测(Table 8) | 统一去污染集合(154 条)Macro-F1 | DeepSeek-V3.2 55.93% 居首 | 六款 SOTA LLM | 给出可信 MAFC 排行;所有模型 <56% 揭示巨大改进空间 |
局限与改进
作者自承的局限主要有三。其一,相似度估计只能捕捉“可观察的证据重叠”,对更隐蔽的潜在污染(模型见过但未体现在生成证据里的知识)只能给出保守下界,结论“X% 污染”实际可能偏低。其二,语义阈值 $\tau=0.6$ 虽经 180 条人工标注调参,但人工一致率 97.8% 之后的阈值最高分类准确率也只有 75.6%(Gemma)/82.2%(Qwen3),意味着仍有约 1/5 到 1/4 的 claim 被误判,污染子集与未污染子集的边界并不锐利。其三,仅评测英文 claim,多语言、跨文化场景下的污染模式未涉及。我额外观察到几点:去污染交集只剩 154 条(相对 901 条原始 claim 仅约 17%),样本量偏小,Table 8 的 1–2 个百分点差距很可能不显著却仍被排成名次;DEFAME 作为单一 MAFC 框架,污染对“非智能体式”或“多智能体辩论式”(作者自己另有 Debating Truth 工作)系统的影响可能不同;GPT-4o-Mini 同时充当证据抽取器与被评模型之一,存在轻微的角色耦合;cutoff 未知的 DeepSeek-V3.2、Qwen3.5 在“cutoff 后”判定的有效性本身存疑。
独立分析的弱点
弱点一:污染检测管线对语义度量高度敏感,三种度量识别的子集差异很大(如 GPT-5.2 上 METEOR 仅 22.31%,Qwen3 却达 38.51%),单一度量易高估或低估。改进方向:引入证据级 entailment / NLI 模型做更细粒度的逻辑等价判定,而非仅靠嵌入余弦或 METEOR。弱点二:阈值靠 180 样本调参,泛化性弱,且与抽取器模型耦合。改进方向:用更大规模、跨主题的人工标注做校准,或改为无阈值的连续污染分报告。弱点三:去污染交集仅 154 条且 Refuted 占 68%,类别高度失衡,Macro-F1 的小差距易被噪声主导。改进方向:在去污染阶段同时做分层抽样平衡三类裁决,或扩大动态基准规模(如全年 ClaimReview)以保留更多样本。弱点四:仅测 DEFAME 一个 MAFC 框架,污染效应是否框架无关未知。改进方向:补测 RAGAR、HerO、Debating Truth 等不同范式系统。弱点五:对 cutoff 未知模型(DeepSeek、Qwen3.5)的“cutoff 后”判定效力存疑。改进方向:用模型自报 cutoff、训练数据卡或成员推断攻击交叉验证。弱点六:仅英文,跨语言污染(如中英翻译复用)未覆盖。改进方向:扩展多语言 ClaimReview 子集。
未来方向
作者明确提出的方向包括:超越基于时间戳的过滤、采用更鲁棒的 claim 新颖性控制(如复用 VERITAS 的 claim rectification 步骤平衡标签);检测“超越可观察证据重叠”的更隐蔽潜在污染;扩展到非英文以提升数字媒体素养。基于本文成果可延伸的方向:把污染检测管线包装成基准构建期的“去污染预处理工具”,在收录 claim 时即过滤;研究“合成型污染”的自动识别(本文只靠人工案例,Barron Trump 这类多事实合成污染尚未自动化判定);探索对抗性污染——攻击者可故意构造引用旧事实的 claim 来操纵排行榜(作者团队已有 Fact2Fiction 投毒攻击工作,可衔接);把 trajectory Exploration 步数作为“是否真在核查”的在线信号,对低 Exploration 轨迹降权;构建多语言、跨模态(视频、音频)的去污染基准。
复现评估
复现性整体较好。代码与附录已在 https://trustworthycomp.github.io/Rethink-MAFC-Eval/ 开源;ClaimReview2025Q4 的构建协议(仿 VERITAS/ClaimReview2024+,借 MisinfoMe、CimpleKG 代码)描述详细,含 GPT-4o-Mini 过滤畸形 claim 的具体规则;评测框架 DEFAME、检索 API(Serper)、温度 0.01、轨迹标注器(GPT-5-Nano 三次重复)均明确,关键结果都做了至少三次重复试验和 bootstrap 显著性检验。算力门槛中等:核心实验需要为 6 款模型 ×(491+901)claim 各生成一篇事实核查文章并抽取证据、做匈牙利匹配,再跑 DEFAME 智能体轨迹,API 费用与时间成本可观但可行。主要复现风险有三:六款 SOTA 模型多为闭源付费 API(GPT-5.2、Gemini-3.0-Pro/Flash),版本会随时间漂移,结果难以长期稳定;VERITAS 未开源,作者只能自建替代基准,第三方难以完全对齐;语义阈值 $\tau=0.6$ 依赖一次性 180 样本标注,复现者需自行重做标注才能校准。
论文图表
概览图把 MAFC 基准污染问题可视化:左侧预训练语料通过虚线箭头连到 LLM 内部知识,象征污染来源;中间把 claim 流分为 Contaminated (Déjà Vu) 与 Uncontaminated (Novel) 两类;右侧用 RQ1(程度)、RQ2(成因)、RQ3(影响)、RQ4(真实性能)四个研究问题串起全文逻辑链。
这张图是理解全文结构的地图,所有 RQ 与后续实验都对应到这里,读论文前必看。