DF26:真假难辨时代的AI视频检测基准 DF26: We Cannot Tell Fake From Real Anymore
DF26基准显示人类与最先进检测器识别AI生成视频的能力已接近随机
前置知识
深度伪造(Deepfake)与全场景生成
深度伪造指用深度生成模型合成或篡改的媒体内容。早期工作集中在换脸与面部重演,即把一张脸替换到目标视频上或驱动其面部动作,伪影只出现在面部区域;而 2025 年后的文生视频/图生视频模型(如 Veo 3.1、Wan 2.6、Kling 3.0)能直接生成整段无真实源的全合成场景视频,伪影遍布整帧与时间轴。检测器通常从纹理频率、压缩伪影、时序一致性等痕迹中区分真假。
本文基准的假视频全部是全场景生成而非面部局部篡改,理解这一威胁模型的转变才能明白为何旧检测器在 DF26 上集体失效。
AUROC 与 EER
AUROC(ROC 曲线下面积)衡量检测器在所有判别阈值下把假视频排在真视频之前的能力,取值 0.5 为随机、1.0 为完美;EER(等错误率)是误报率等于漏报率时的错误率,越低越好。本文采用视频级评分:帧检测器对 32 个均匀采样帧的分数取平均得到整段视频的分数,时序检测器直接输出视频分数。
论文所有对比都以 AUROC 为主指标、EER 为辅助指标,例如 DFD-FCG 在 CDFv3 上 AUROC 高达 94.3、在 DF26 上仅 48.2,这组数字是全文最核心的证据。
文生视频(T2V)与图生视频(I2V)
T2V 从纯文本 prompt 生成视频;I2V 以一张首帧图像为条件生成后续内容,外观与条件帧强耦合。同一模型往往两种模式都支持,但留下的生成痕迹不同:I2V 继承真实首帧的部分统计特性,T2V 则完全合成。DF26 对开源模型同时覆盖两种模式,对商业模型仅覆盖 T2V。
实验显示 I2V 对人和机器都更难:人类在 LTX 2.3 I2V 上准确率仅 25.2%,且 I2V 与 T2V 各自的最佳检测模型都不同。
跨生成器泛化协议
检测器通常在某一生成器或旧操纵数据集上训练,部署时面对未见过的生成器。跨生成器协议要求训练集与评测集的生成器不相交,衡量检测器学到的是通用合成痕迹还是特定生成器的指纹。DF26 主协议为 held-out 评测:不允许在任何 DF26 数据上训练或微调,跨子集评测不调超参数与阈值。
本文的核心结论——检测失败源于生成器迁移而非场景内容——正是通过按生成器分层的跨生成器评测得出的。
FF++ 与 CelebDF 等遗留基准
FaceForensics++(FF++,ICCV'19)、DFDC、CelebDF++(CDFv3)是深度伪造检测的标准旧基准,操纵类型以换脸和面部重演为主。几乎所有公开检测器都在 FF++ 上训练,因此它们在新基准上的表现直接反映分布外泛化能力,旧基准分数也常被用来宣传检测器性能。
DF26 的检测器全部沿用 FF++ 训练的公开权重,旧基准上的高分与 DF26 上的崩塌形成了论文最关键的对照。
研究动机
现有检测体系建立在过时的威胁模型上。主流基准 FaceForensics++(ICCV'19)、DFDC、CelebDF++(CDFv3)的伪造类型集中在换脸、面部重演和面部属性篡改,而 2025–2026 年的文生视频/图生视频模型(Veo 3.1、Kling 3.0、Wan 2.6、Grok Imagine 1.0 等)已能直接生成整段无真实源的全合成场景视频,两者留下的伪影分布截然不同。后果十分严重:在 CDFv3 上时序检测器 DFD-FCG 与 PwTF-DVD 的 AUROC 高达 94.3 和 92.3,但这种高分无法预示它们在新型生成视频上的表现。Deepfake-Eval-2024 也发现学术基准已不再代表社交媒体上实际流传的野外伪造内容。更糟的是,一项覆盖 56 项研究的元分析显示人类识别 AI 生成视频的准确率本就接近随机,而单人公开演讲恰恰是虚假信息最高风险的场景——伪造名人声明或官方讲话的危害远大于普通视频。现有基准中没有能同时满足全场景生成、单人公开演讲、生成器元数据齐全、支持跨生成器协议这四个条件的评测集。
本文的目标是本文要构建一个专门评测现代全合成公开演讲视频检测的受控基准 DF26,并系统量化人类与当前最优检测器在该基准上的真实水平。具体目标有四:(1) 数据规模与结构:2691 段视频,含 271 段真实与 2420 段合成视频,覆盖三类高风险公开演讲场景——镜头直述/日常、官方声明、演播室访谈;(2) 生成器覆盖:3 个开源模型(Wan 2.2 A14B、HunyuanVideo 1.5、LTX 2.3)支持 T2V+I2V 双模态,4 个商业系统(Kling 3.0、Veo 3.1、Wan 2.6、Grok Imagine 1.0)仅 T2V,合成视频共 2420 段;(3) 可复现元数据:每个样本携带来源标识、场景标签、生成器标签、生成模态、生成 prompt 及预处理信息;(4) 评测协议:主协议为 held-out 评测,检测器不得在 DF26 上训练或微调,并以 232 次人类标注实验对比 DF26 与 CDFv3、DeepSpeak v2 的感知难度。
与已有工作不同的是,已有工作各覆盖威胁空间一角,但没有一个隔离了公开演讲与全场景生成的组合。换脸系基准(FF++、DFDC、CDFv2/v3)操纵局限于面部;Deepfake-Eval-2024 收集野外数据但缺乏生成器元数据与可复现协议,无法归因检测失败究竟来自生成器迁移、压缩还是场景错配;DeepSpeak 与 TalkingHeadBench 聚焦说话人头、唇同步与语音驱动动画,属于局部或视听合成;ViF-Bench 覆盖开放域 AI 视频但场景分布太散,无法隔离虚假信息最相关的公开演讲设定。DF26 的独特切入是控制变量式的真假配对:每段真实视频经 Gemini 2.5 VLM 从均匀采样的四帧提取一个语义 prompt,所有生成器用同一 prompt 生成配对假片;I2V 模式更直接用真实视频首帧做条件,使真假样本在场景、人物、构图上对齐,生成器成为唯一自变量,检测器差异因此可被明确归因于生成器迁移。
核心方法
DF26 的构建遵循先严格过滤、再语义分类、后人工策展的多阶段流水线。核心直觉:要测生成器迁移,必须冻结内容变量——用同一段真实视频派生的 prompt 让 7 个生成器生成平行世界的假视频,真假内容对齐后差异只剩生成痕迹。真实视频从三个来源池筛选:OpenVid-1M 贡献 197 段(CC-BY-4.0,主要供给镜头直述与演播室访谈)、TalkingCelebs 贡献 62 段(政客与公众人物,用于官方声明场景)、MAVOS-DD 贡献 12 段(CC BY-NC-SA 4.0)。流水线分五阶段:A 过滤与归一化、B Gemini 2.5 VLM 语义分类、C 人工策展、D prompt 生成、E 批量生成与质量控制,所有视频统一为 5 秒、1280×720、H.264。开源模型在 3× NVIDIA H200(141GB 显存)集群上生成 1626 段视频,约 440 GPU 小时,单段耗时 Wan 2.2 约 33 分钟、HunyuanVideo 1.5 约 12 分钟、蒸馏 LTX 2.3 约 3 分钟;商业模型经 Higgsfield 平台付费生成,因平台条款仅覆盖镜头直述与演播室访谈两场景。
核心创新是真假配对加生成器为唯一变量的受控实验设计,与以往基准有本质区别。第一,伪造类型全场景化:不做换脸或面部编辑,整段视频由 T2V/I2V 完全合成。第二,prompt 锚定:每段真实视频从均匀采样的四帧用 Gemini 2.5 生成一个只描述可观察外观(人物、背景、光照、构图、镜头风格、说话语境)的 prompt,不含任何数据集标识,所有生成器共享同一 prompt,使生成器差异成为评测的目标变量。第三,I2V 条件锚定:开源模型额外用真实视频首帧做图生视频,让假片继承真实首帧的统计特性,构造出仅后段漂移的更难样本。第四,评测优先协议:主基准分数必须在 held-out 设置下获得,禁止在 DF26 上训练;在 DF26 子集上的重训练只能作为诊断性消融单独报告,防止在测试集上训练造成的虚高。第五,商业快照:闭源系统作为固定基准快照纳入,其子集按 Higgsfield 条款禁止用于训练或蒸馏商业模型。
方法步骤详情
Stage A 过滤与归一化:元数据过滤(分辨率限 1280×720 或 1920×1080、时长不小于 5.0 秒);内容检查——对 10 个均匀采样帧跑 OCR,任一帧含文字即拒绝(防台标字幕捷径),人脸检测要求无任何帧超过 1 张脸、且至少 80% 采样帧恰好 1 张脸;归一化为 5 秒、1280×720 的 H.264。Stage B 语义分类:Gemini 2.5 VLM 将候选标注为 Official Statement、Studio Interview、Direct-to-Camera/Casual 或 Other,作为人工策展的候选标签。Stage C 人工策展:核查六项标准——单人可见且在说话、符合三场景之一、无大面积文字水印、时长分辨率达标、画质充足、无严重遮挡损坏——并在场景内保证来源、外貌、背景、构图、光照的多样性;官方声明类因合格候选稀缺仅保留 71 段。Stage D prompt 生成:从四帧生成语义 prompt 并随元数据发布。Stage E 生成与 QC:开源模型用官方 checkpoint 生成 1626 段(T2V+I2V),商业模型经 Higgsfield 生成(6 次请求被拒),确保无水印与平台标识。评测时帧检测器对 32 个均匀采样帧取平均为视频分数,AUROC 为主指标、EER 为辅,跨子集不调超参与阈值。
技术新颖性
技术新颖性体现在四个层面。协议层面:首次把跨生成器协议与全场景公开演讲生成结合,以 held-out 评测为主协议、训练实验降级为诊断消融,并用 1000 次自举重采样给出 95% 置信区间——如 PwTF-DVD 在 Wan 2.2 T2V 为 92.9 [90.5, 94.9],与 HunyuanVideo 1.5 的区间不重叠,证明逐生成器差异超出抽样噪声。数据层面:真假配对与 I2V 首帧锚定把内容混杂因素最小化,这是 ViF-Bench、DeepSpeak 等基准不具备的。覆盖层面:同时纳入 4 个商业闭源系统(经统一平台 Higgsfield,Elo 从 1016 到 1221)与 3 个开源生成器,横跨 T2V/I2V,为闭源更难检测提供系统证据:DFD-FCG 在开源子集 AUROC 57.4、闭源仅 34.5($-22.9$)。分析层面:把人类实验与机器评测放在同一 5 秒裁剪协议下,首次量化人机可检测性错位——LTX 2.3 I2V 人类准确率仅 25.2%,却是机器较易检的生成器之一(PwTF-DVD 79.5、DFD-HR 83.8),说明机器利用的痕迹并非人眼可见。
实验结果
四组核心实验。其一,检测器整体崩塌:9 个 FF++ 训练的 SOTA 检测器中,DFD-FCG 从 CDFv3 的 94.3 AUROC 跌至 DF26 的 48.2($\Delta$AUROC $=-46.1$,EER 12.3→51.9),PwTF-DVD 从 92.3 跌至 61.6($-30.7$),最好的 GenD-PE 仅 69.7,Effort 低至 44.0。其二,逐生成器差异悬殊:PwTF-DVD 在 Wan 2.2 T2V 达 92.9、LTX 2.3 I2V 达 79.5,但在 HunyuanVideo 1.5 两种模式仅 41.9/56.7;GenD-PE 在 LTX 2.3 T2V 仅 43.5;I2V 最佳是时序模型 PwTF-DVD,T2V 最佳是帧模型 GenD-PE。其三,人类研究:232 次标注会话(每次 30 段、15 段假),DF26 假视频准确率仅 52.6%,远低于 CDFv3 的 74.5% 与 DSv2 的 69.8%;真视频三集相近(76.0/75.5/72.8%),说明难点在找不到合成证据而非把真当假;LTX 2.3 I2V 仅 25.2%,触及与真实不可区分的下界(真被误判为假的比率 24.0%)。其四,重训练诊断:在官方声明 I2V 子集(HunyuanVideo 1.5)重训 GenD-PE 后,对未见商业生成器 Grok/Veo 3.1/Wan 2.6 的 AUROC 达 96.8/95.6/93.1(原版 66.5/76.6/88.3);DFD-FCG 三场景均近 50(50.5–51.7),失败由生成器迁移而非场景类型驱动。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨生成器 AI 视频检测(FF++ 训练的检测器零迁移评测) | 视频级 AUROC (%) | DF26 上最佳检测器 GenD-PE 为 69.7(宏平均最高 72.7) | 同一批检测器在 CelebDF++ 上最高 94.3(DFD-FCG);DFD-FCG 在 DF26 仅 48.2 | DF26 使现有检测器相对 CDFv3 普遍下降 18.1–46.1 AUROC、EER 恶化 13.7–39.6,暴露遗留基准的虚高 |
| 人类识别 AI 生成视频 | 假视频准确率 (%),232 次标注会话 | DF26 上 52.6%(1685 段假视频) | CDFv3 上 74.5%(5240 段)、DeepSpeak v2 上 69.8%(1416 段) | DF26 假样本难度大幅提升,接近随机;LTX 2.3 I2V 仅 25.2%,触及把真判假基线 24.0% 对应的不可区分下界 |
| 重训练 GenD-PE 后的跨生成器泛化(Official Statement I2V 子集训练) | 未见生成器视频级 AUROC (%) | HV 1.5 I2V 训练:Grok 1.0 96.8、Veo 3.1 95.6、Wan 2.6 93.1,宏平均 82.3 | FF++ 训练的原版 GenD-PE:66.5、76.6、88.3,宏平均 76.0 | 对闭源生成器绝对提升 6.5–30.3 个点,证明必须用现代生成器数据更新检测器 |
局限与改进
作者承认两点局限:一是数据规模小,2691 段视频相对大型基准偏少,真实视频仅 271 段且官方声明类因合格候选不足只有 71 段,虽然 1000 次自举重采样显示置信区间足够窄,逐格点的统计功效仍有限;二是只覆盖视觉模态,不评测音频真实感、语音质量、唇同步与音画一致性,而 Veo 3.1 等新一代模型已能生成同步音频,威胁面正在扩大。我补充几点观察:商业模型只能经 Higgsfield 黑盒调用,生成配置(采样步数、分辨率档位、随机种子)不可控也未披露,闭源更难的结论可能与模型家族、后处理、压缩等混杂因素纠缠,作者自己也强调源类型分析是诊断性而非因果性的;闭源子集只覆盖两个场景,官方声明类商业样本完全缺失,场景维度结论不完整;OCR 严格拒绝任何含文字帧虽防住了捷径,也使基准无法研究带台标字幕的野外真实部署形态;人工策展的画质与多样性判断含主观成分,论文未报告策展者间一致性。
独立分析的弱点
第一个弱点是真实视频池的规模与多样性:271 段真实视频、说话人身份近乎唯一,难以支撑按人群、口音、光照条件的细分子集分析,也限制了检测器偏见研究;改进方向是像 DSv2 那样雇付费演员录制受控素材并按人口学维度分层扩池。第二个弱点是音频缺失:现代商用系统默认输出同步语音,纯视觉检测器在真实攻击面前会被听起来完美的视频绕过,应增加音画联合检测轨道并构造音画不一致的对抗子集。第三个弱点是黑盒商业生成:推理配置不可固定导致闭源结果的复现性与归因都打折扣,建议与厂商合作发布受控 API 快照或至少记录响应元数据。第四个弱点是检测器集合虽达 9 个但全部为视觉单模态、多数以 CLIP/DINO 类图像骨干预训练,缺少视频基础模型零样本检测的对照,无法回答更强预训练是否天然更鲁棒。第五,5 秒固定时长控制了证据量,却排除了长视频时序伪影积累的场景,长片检测值得单独评测。第六,闭源生成仅限 2026 年 3 月的模型快照,而视频模型迭代极快,基准内容会随时间贬值。
未来方向
作者提出的方向包括:通过付费演员扩充数据规模(类比 DSv2 的做法);把基准扩展到多模态,覆盖音频真实感、唇同步与音画同步检测。基于本文成果还可延伸:其一,建立活体基准机制,每半年滚动纳入新发布生成器——表格显示各模型 Elo 从 HunyuanVideo 1.5 的 1016 到 Grok Imagine 1.0 的 1221,模型迭代极快,静态基准会迅速过期;其二,生成器指纹学习,表 6 中逐生成器 AUROC 跨度从 13.6(Effort 在 Grok 1.0 上)到 92.9,说明各模型伪影可分,可研究多生成器混合训练加指纹聚类做生成溯源;其三,把表 8 的重训练发现产品化为持续微调流水线,用少量新生成器样本即可恢复对商业模型的泛化(HV I2V 重训后对三个闭源生成器不低于 93.1);其四,结合可解释性定位人类与机器判断依据的差异——人不可检的 LTX I2V 恰是机器较易检的生成器(79.5–83.8),这一错位是设计人机协同审核流程的切入点;其五,在真实平台噪声(转码、缩放、水印叠加)下做鲁棒性压力测试。
复现评估
复现难度中等偏上但诚意充足。数据集走受控访问:需通过申请表提交所属机构、研究目的与用途承诺方可获取;默认用途为 held-out 评测,开源子集允许训练与微调,闭源子集按 Higgsfield 条款禁止用于训练商业模型。处理管道代码公开,prompt 与全套元数据(来源、场景、生成器、模态、预处理)随数据发布,补充材料表 S2–S4 还给出关键指标的 95% 自举置信区间,便于统计校验。算力方面,开源生成部分需要 H200(141GB)级显卡,内部用 3 卡集群、约 440 GPU 小时生成 1626 段视频;论文给出的单段耗时(Wan 2.2 约 33 分钟、HunyuanVideo 1.5 约 12 分钟、蒸馏 LTX 2.3 约 3 分钟)对预算估算很有用,一般实验室可用单卡以更长时间复现子集。主要不可复现环节是商业生成:依赖 2026 年 3 月的 Higgsfield 付费平台与当时模型版本,属不可重放的快照;VLM 分类与 prompt 生成绑定 Gemini 2.5,换模型会引入差异。检测器侧全部使用公开 checkpoint 与官方预处理,评测无需训练,这部分极易复现。
论文图表
按生成器细分的区间数据:PwTF-DVD 在 Wan 2.2 T2V 为 92.9 [90.5, 94.9],与 HunyuanVideo 1.5 I2V 的 41.9 [37.1, 46.6] 区间不重叠;Veo 3.1 上 PwTF-DVD 仅 26.7 [22.2, 31.0],显著低于随机。
证明逐生成器的巨大性能差异不是小样本噪声,而是生成器伪影可检测性的真实差异,这是第 6.2 节结论的统计基础。
按三个语义场景细分:DFD-FCG 在镜头直述/官方声明/演播室的 AUROC 分别为 50.6 [44.8, 56.6]、51.7 [44.6, 59.3]、50.5 [44.9, 56.3],三个区间高度重叠;PwTF-DVD 为 60.1、72.3、66.1。
从统计上确认检测失败与公开演讲场景类型无关,区间重叠支持'生成器迁移而非场景内容驱动失败'的归因。
展示人类实验开始前的知情同意书与指导语截图:参与者只被告知将观看无声短视频并给出真实整体印象(AI 生成/AI 篡改/真实三选一),不告知类别先验与数据集数量。
人类实验方法透明度的关键材料:说明实验设计刻意避免先验信息引导,使 52.6% 的结果可与 CDFv3、DSv2 公平比较。
标注界面截图:每段视频最多回放 10 次并显示剩余回放次数,记录选择与从首次播放到选择的响应时间;三个数据集的界面完全一致,片段随机排序。
说明人类评测协议的统一性(同一界面、同一 5 秒裁剪、同一回放预算),保证跨数据集难度对比的公平性。