面向可泛化深度伪造视频检测的多智能体取证推理框架 Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection
多智能体协作推理检测深伪视频,并构建10万级细粒度标注数据集
前置知识
多模态大语言模型 (MLLM)
MLLM 是同时处理图像/视频和文本的大语言模型,如 GPT-4o、Gemini、Qwen2.5-VL。它通过视觉编码器把图像帧编码为视觉 token,再与文本 token 一起输入语言模型,从而具备描述视频内容、指出可疑面部细节、判断真伪的能力。本文所有智能体均以 Qwen2.5-VL-7B 为底座。
读懂本文需理解 MLLM 如何把「看视频」变成「写报告」,以及为何单个 MLLM 容易被最显著的视觉线索带偏。
深度伪造视频 (Deepfake)
Deepfake 指用生成式 AI 合成或篡改人脸视频的技术,主要分三类:换脸(face swapping, FS)、表情迁移(face reenactment, FR)和整脸生成(entire-face synthesis, EFS,含文生视频 T2V / 图生视频 I2V / 文图生视频 TI2V / 视频生视频 V2V)。新一代生成器如 Seedance 2.0、Sora 2 能合成高保真、时序连贯的整脸视频,几乎不留旧的拼接边界等明显痕迹。
理解伪造类型分布是读懂本文数据集构成和 in-domain/OOD 评估协议的基础。
多智能体系统 (Multi-Agent System)
多智能体系统通过让多个专门智能体协作完成任务。本文采用层级式设计:4 个观察智能体分别从纹理、光照、运动、物理四个角度独立分析视频,各自输出文本观察报告而不给最终判断;1 个裁判智能体(judge agent)汇总这些报告并产出真伪判断和取证解释。
本文核心创新就是多智能体架构,理解「分工观察 + 集中裁决」的机制是把握全文的关键。
监督微调 (SFT)
SFT 指用带标签数据通过自回归语言建模微调模型。本文观察智能体在维度标签 $O^\star_d$ 上训练,最小化 $\mathcal{L}^{obs}_d(\theta_d) = -\frac{1}{N_d}\sum_{(v,O^\star_d)\in\mathcal{T}}\sum_{t=1}^{L_d}\log p_{\theta_d}(o^d_t \mid X(v), I_d, o^d_{<t})$;裁判智能体在拼接的观察报告和(可选)视频帧 $Q_c(v)=(R(v),V_c(v))$ 上训练。使用 LoRA + AdamW,1 个 epoch,SFT 学习率 $1\times10^{-4}$。
SFT 是让通用 MLLM 获得专门取证能力的第一阶段,理解它才能看懂两阶段训练管线。
群体相对策略优化 (GRPO)
GRPO 是一种强化学习算法:对同一输入采样 $G$ 个候选回答,用二值准确率奖励 $r_g\in\{0,1\}$(是否预测正确)计算组内相对优势 $A_g = (r_g - \bar{r})/(\sigma_r + \epsilon)$,再用 clip 截断目标更新策略并加 KL 散度惩罚防止偏离 SFT 策略。本文仅对裁判智能体做 GRPO(每提示采样 $G=8$,学习率 $5\times10^{-6}$),观察智能体冻结。
GRPO 是把 F1 从 50.49 进一步提升到 53.28 的关键第二阶段,理解它才能解释最终性能来源。
LoRA 低秩适配
LoRA 在冻结的预训练权重旁注入低秩矩阵 $W = W_0 + BA$($B,A$ 为小矩阵),只训练这部分参数,大幅降低显存和计算开销。本文所有智能体都用 LoRA 微调,使得在 7B 模型上训练 5 个智能体(4 观察 + 1 裁判)成为可能。
理解 LoRA 才能明白作者为何能在 10 万级视频数据集上完成多智能体训练。
研究动机
随着生成式 AI 快速发展,新一代视频生成器(Seedance 2.0、Sora 2、Kling、Wan 等)能合成高保真、时序连贯、身份稳定的整脸视频,几乎不留旧的拼接边界或低级生成痕迹。传统小视觉检测器(DFGaze、TFCU、Effort、TALL++ 等)主要从二值真伪标签学习判别特征,容易过拟合到特定数据集或生成器的「捷径特征」,遇到新的生成方法、身份、压缩条件或数据源时性能急剧下降。同时,现有基准覆盖的合成方法有限——Celeb-DF v2 仅 1 种方法、DF40 仅 23 种(止于 HeyGen 2024)、Celeb-DF++ 22 种(止于 FLOAT 2025)——而且普遍只提供二值标签,缺乏支撑判断的可视化证据注释。这种粗粒度监督既难让模型学到细微多样的未见伪造线索,也无法判断检测器是获得了可迁移的取证知识还是仅仅拟合了数据集偏差。更根本的是,把深度伪造检测当成单一整体判断,忽略了不同伪造痕迹(纹理过度平滑、光照不一致、运动不稳定、物理合理性违反)需要不同的取证知识和推理形式。
本文的目标是本文有两个核心目标。第一,构建一个大规模、覆盖最新生成方法、并提供细粒度文本监督的深度伪造视频基准 FaceVid-Forensics-100K:包含 100,000 段人脸视频,覆盖 33 种合成方法(含 2026 年的 Seedance 2.0),分为 21,075 段真实和 78,925 段伪造视频,涵盖换脸、表情迁移和整脸生成(T2V/I2V/TI2V/V2V)三大类。除二值标签外,每段视频还在纹理、光照、运动、物理四个维度提供细粒度观察标注以及与最终裁决一致的取证解释。第二,基于该基准提出一个可解释、可泛化的多智能体取证推理框架,通过四个专门的观察智能体独立从不同角度寻找伪造线索,再由裁判智能体综合多方证据做出真伪判断和解释,目标是即便完全由开源小模型组成,也能在跨生成器泛化上超越闭源 GPT/Gemini。
与已有工作不同的是,本文的独特切入角度在于把「单模型整体判断」重构为「多智能体分工观察 + 集中裁决」。与单 MLLM 容易被最显著的单一伪影带偏、且让看似合理的解释与最终裁决不一致不同,本文让每个智能体只负责一种特定取证维度(如纹理智能体专查皮肤细节与拼接边界、光照智能体专查光源方向与阴影),从而鼓励系统性搜索某一类痕迹;当某一类痕迹较弱或缺失时,最终判断仍可依靠多角度相互印证的证据,降低单一显著线索主导错误预测的风险。此外,作者用「多模型聚合 + 冲突解决」的流水线自动合成细粒度文本标注,绕开了昂贵的人工标注;并把数据集在生成器层面严格划分训练集与 OOD 测试集(20 个完全未见生成器专属 OOD),真正做到严格评估跨生成器泛化能力,而非仅在身份或样本层面划分。
核心方法
整体思路有两层。直觉上,深度伪造痕迹可分为四类独立来源——纹理过度平滑、光照不一致、运动不稳定、物理合理性违反——每一类需要不同的取证知识。与其让一个大模型一次性整体判断(容易过拟合到最显著的视觉线索),不如让四个「专科医生」各自从自己的角度独立问诊,再由「主治医师」汇总多方证据做出诊断。技术路线上,作者先构建 FaceVid-Forensics-100K 数据集:从现有基准和网络抓取约 110 万段含人脸视频,用 AltFreezing 检测器按难度筛选并对真实视频按 YouTube ID 去重,最终精选 10 万段;再用 5 个范式多样的 MLLM(GPT-4o、Gemini 3.5-Flash、Qwen2.5-VL、Skyra、VideoVeritas)独立生成四维度观察和初始判断,由 DeepSeek-V4 Pro 在真值标签引导下聚合冲突、合成与裁决一致的标签。推理时,对输入视频 $v$ 均匀采样帧序列 $X(v)$,四个观察智能体各自产出文本观察 $b\hat{O}_d$,拼接后连同可选的视频帧送入裁判智能体。
核心创新点是把深度伪造检测显式分解为「独立证据采集 + 显式证据调和」两阶段多智能体架构,这与单 MLLM 一次性整体判断、链式思维(CoT)单模型多步推理、以及多轮对话(同一智能体顺序分析)有本质区别。关键差异在于:其一,四个观察智能体是参数独立的,每个只针对一个维度专门训练,避免单一推理轨迹自我强化错误判断(论文 Figure 7 展示 CoT/多轮对话反复得出 Real 而本文 MAS 得出正确 Fake);其二,观察智能体只产出观察不产出判断,强制把「诊断」和「决策」解耦;其三,裁判智能体显式权衡相互支持或冲突的证据,最终判断依赖多方印证而非单一显著线索。Table 5 的消融证明该增益来自独立证据采集与调和机制,而非更长的提示或更多对话轮次——同一底座上 CoT 和三种 Multi-turn 变体 F1 都远低于本文方法。
方法步骤详情
完整流程分五步。步骤一(数据采集):从 AIGVDBench、GenVidBench(约 678 万)、ViF-Bench、FF++ 及网络抓取的 577 段 Seedance 2.0 等近期生成器视频汇合,逐帧人脸检测后得 1,158,585 段含人脸视频(30,240 真 + 1,128,345 假,436.56 小时)。步骤二(筛选去重):对四个主导生成模型用 AltFreezing 评分保留难样本,假视频从 1,122,159 降到 70,243;真实视频按 YouTube ID 去重从 30,240 降到 21,075;最终 10 万段。步骤三(标签合成):5 个 MLLM 独立生成四维度观察与初始答案-解释对,DeepSeek-V4 Pro 在真值标签引导下分维度合并(全错则反向推理),输出观察标签 $O^\star_d$ 与裁决一致解释 $Z^\star$。步骤四(SFT):观察智能体在 $O^\star_d$ 上独立训练(学习率 $1\times10^{-4}$,LoRA+AdamW,1 epoch),前向生成 $R(v)$,裁判智能体在 $(R(v),V_c(v))$ 上训练。步骤五(GRPO):冻结观察智能体,对裁判每输入采样 $G=8$ 个候选,用二值奖励 $r_g$ 算相对优势 $A_g=(r_g-\bar{r})/(\sigma_r+\epsilon)$,以 clip 目标加 KL 惩罚(学习率 $5\times10^{-6}$)更新裁判。
技术新颖性
技术新颖性四处。第一,数据集:FaceVid-Forensics-100K 首个同时覆盖 33 种合成方法(含 2026 年 Seedance 2.0)并提供四维度细粒度观察标注 + 裁决一致解释的 10 万级基准,远超 DF40(23 方法、止于 HeyGen 2024)和 Celeb-DF++(22 方法、止于 FLOAT 2025)的二值标签。第二,标注流水线:用「5 个范式多样 MLLM 独立标注 + DeepSeek-V4 Pro 真值引导聚合冲突」自动合成高质量文本监督,聚合器与标注器解耦避免继承归纳偏置,且聚合器选纯文本 LLM 因仅操作文本报告。第三,框架:首次把「分工观察 + 显式调和」多智能体范式引入深伪检测,严格对照 Single、CoT、三种 Multi-turn 帧供给变体,证明增益来自独立证据采集而非更长提示或更多轮次。第四,训练:用 GRPO 仅对裁判做策略优化,把 F1 从 SFT 的 50.49 推到 53.28,KL 散度分析显示带视频裁判更少偏离 SPT 初始化(峰值约 0.010 vs 0.015)。
实验结果
核心发现四点。其一,OOD 跨生成器泛化最优:完整系统在 7,636 段 OOD 视频(5,716 真 + 1,920 假,20 个未见生成器)上达 69.87% Acc、81.82% Recall、53.28% F1,超最强单模型基线 Gemini-2.5-Pro(F1 47.45%)5.83 个百分点,也超 GPT-5-mini(39.00%)、GPT-4o(37.55%)、最强小视觉 TFCU(45.20%)、最强取证 MLLM VideoVeritas(43.22%)和 Skyra(38.30%)。其二,裁判直接看视频有用:文本裁判 F1 从 51.01 升到 53.28。其三,消融验证每组件:四观察智能体全开 F1 最高(无视频 47.53 vs 单维度最高 45.13);联合 SFT 优于单训;GRPO 把带视频 F1 从 50.49 推到 53.28。其四,推理策略对照:在 Qwen2.5-VL-7B 和 InternVL3.5-8B 上本文都优于 Single、CoT、三种 Multi-turn 变体(基线 F1 仅 9.5–25.85)。逐生成器看,带视频 + GRPO 宏观平均 69.47%,比 TALL++ 高 5.25。需注意 OOD precision 偏低,in-domain 小视觉 TFCU(99.46% F1)仍强于本文(96.19%),优势在泛化。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| OOD 跨生成器深度伪造视频检测(准确率) | Accuracy | 69.87% | Gemini-2.5-Pro 63.78%(最强单模型基线) | +6.09 个百分点 |
| OOD 跨生成器深度伪造视频检测(F1) | F1 Score | 53.28% | Gemini-2.5-Pro 47.45%(最强单模型基线) | +5.83 个百分点 |
| OOD 跨生成器深度伪造视频检测(召回) | Recall | 81.82% | VideoVeritas 78.96%(最强取证 MLLM) | +2.86 个百分点 |
| OOD 逐生成器宏观平均准确率 | Macro-Avg Accuracy | 69.47%(带视频 + GRPO) | TALL++ 64.22%(最强小视觉模型平均) | +5.25 个百分点 |
| OOD 逐生成器宏观平均(vs 取证 MLLM) | Macro-Avg Accuracy | 69.47% | Skyra 65.23%(最强取证 MLLM 平均) | +4.24 个百分点 |
| In-domain 已知分布检测(F1,相对小视觉模型的差距) | F1 Score | 96.19%(w/ Video + GRPO) | TFCU 99.46%(最强小视觉模型) | -3.27 个百分点(本文在已知分布上不及专门小模型,属局限) |
| 推理延迟(RTX 5090,Qwen2.5-VL-7B) | Latency (s/video) | 6.128(w/ Video)/ 5.791(w/o Video) | Multi-turn 7.123 / 14.150(InternVL3.5-8B) | 比多轮对话快,且吞吐约为其 2 倍(172–182 vs 84–90 tokens/s) |
局限与改进
作者承认三处局限。第一,B.4 节指出「所有四种配置在 fake 上解释得分均高于 real」是 200 段采样子集特有,不应过度推广,暗示评估子集可能有采样偏差。第二,C.1 节坦承多智能体引入更多提示,单视频延迟 5.791–6.128 秒显著高于 Single(1.503)和 CoT(2.095),建议未来用 BEAVER 等提示压缩优化。第三,GRPO 主优化分类准确率而非解释质量——Table 9 中 GRPO 配置解释得分(overall 5.95/6.03)未优于 SFT(6.37/6.25),作者提示应把检测性能与解释评分结合解读。我另观察到:OOD recall 81.82% 但 F1 仅 53.28%,precision 偏低;in-domain 小视觉 TFCU 达 99.46% F1 而本文仅 96.19%,已知分布上未超专门小模型;主力底座仅 Qwen2.5-VL-7B,虽附录测了组合与规模,未在更强底座上验证上限。
独立分析的弱点
独立分析弱点及改进方向有四。弱点一:OOD precision 偏低。recall 81.82% 但 F1 仅 53.28%,大量真实视频被误判为假,在审核场景误伤合法内容。改进方向是引入显式假阳率约束(Focal 式或代价敏感奖励 shaping),或在 GRPO 中直接用 F1/precision 作奖励而非单纯二值 $r_g\in\{0,1\}$。弱点二:解释质量与准确率未协同优化。Table 9 显示 GRPO 配置解释得分未优于 SFT,奖励只关心对错。改进方向是设计多目标奖励(准确率 + 解释评分)或用 RLHF 把解释质量纳入优化。弱点三:推理成本偏高。每视频 5.8–6.1 秒,难支撑实时审核。改进方向是用 BEAVER 提示压缩、观察智能体并行 + 早期退出、或蒸馏为单一小模型。弱点四:底座偏小且单一。主力仅 Qwen2.5-VL-7B(32B 时 F1 也仅 50.81)。改进方向是用视频原生更强的更大底座做观察智能体,推高 OOD 上限。
未来方向
作者明确提出的未来方向:用 BEAVER 等训练-无关提示压缩技术降低多智能体的推理开销(见 C.1 节末尾)。基于本文成果可延伸的方向至少有六条。其一,把四维度观察智能体扩展为更多专科,例如音频-唇形同步智能体、生理信号智能体(检测脉搏/眨眼微运动/呼吸),进一步增强证据多样性。其二,把「多模型聚合标注」流水线泛化为持续学习框架,让数据集随新生成器出现自动增量更新标注,缓解 OOD 持续漂移问题。其三,探索观察智能体之间的辩论(debate)机制——当前是单向汇总到裁判,可加入第二轮交叉质询让智能体针对冲突证据相互质疑,提升难例判断。其四,把框架迁移到音频深度伪造、AI 生成图像、AI 生成文档等其他模态的检测,验证「分工观察 + 集中裁决」范式的通用性。其五,设计多目标 RL 同时优化准确率和解释质量,把 Table 9 的解释评分也纳入奖励信号。其六,结合主动学习,优先标注裁判智能体最不确定的样本以提升数据效率和标注预算利用率。
复现评估
复现评估总体较好。开源与文档:论文提供项目主页 https://xavierjiezou.github.io/ARGUS/ ,附录 F 给出完整提示模板(Listing 1–8)及每维度角色字段(Table 14)。数据集构成(Table 6 按源和方法列出训练 68,906 / in-domain 23,458 / OOD 7,636)清晰。训练细节齐全:所有智能体用 Qwen2.5-VL-7B + LoRA + AdamW,1 epoch,SFT 学习率 $1\times10^{-4}$,GRPO 学习率 $5\times10^{-6}$,每提示采样 8 个响应,ms-swift 实现,单卡 RTX 5090 可推理。算力中等偏上:7B+LoRA 训练友好,但完整标注流水线依赖 5 个 MLLM(含 GPT-4o、Gemini 3.5-Flash 闭源 API)+ DeepSeek-V4 Pro 聚合,复现完整标注需付费 API 预算。主要难点:生成器层面 OOD 划分依赖对生成器族属严格管理;GRPO 奖励仅二值准确率,随机种子影响数值。
论文图表
对比单 MLLM 与本文多智能体框架。单 MLLM 一次性看视频直接判断真假,常因忽视细微取证伪影而预测错误;本文框架用纹理、光照、运动、物理四个专门智能体分别从四个角度检查视频,再由裁判智能体汇总报告产出更可靠的解释和真假判断。
一图概括全文核心思想——把整体判断拆解为多角度分工观察 + 集中裁决,是理解后续所有内容的入口。
展示数据集三个切面。(a) 域分布:训练 68.9K、in-domain 23.5K、OOD 7.6K,训练与 in-domain 共享同族生成方法,OOD 仅含 EFS 且来自 20 个未见生成器与部分未见真实视频。(b) 评估协议:身份从训练身份 → 未见身份 → 未见身份,来源从已见池 → 同训练集 → 未见来源。(c) 伪造类型:FS 1,498、FR 998、EFS 76,429、真实 21,075,并列出涵盖的生成器(Runway、Sora、Kling、Seedance 2.0 等)。
理解 in-domain 与 OOD 的严格划分是看懂所有泛化实验的前提,这张图直观呈现了数据集规模、覆盖和评估协议。