MMMMM:面向多语言多模态虚假信息机制研究的统一分类体系 MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation
统一多模态虚假信息分类体系并用VLM自动标注2.7万条社区笔记案例,揭示图文误导机制分布规律
前置知识
多模态虚假信息机制
指图像与文字组合后产生虚假或误导印象的具体方式,例如把真实旧图配上错误时间地点的文字(错配/mismatch)、用真实图片做倾向性解读(歪曲/slanted)、伪造文件或AI生成图像(fake image)等。机制关注的是“如何误导”而非“误导了什么内容”。
本文的核心贡献正是这样一套机制分类体系,全文围绕机制的定义、自动化标注与分布分析展开,理解“机制”这一抽象层级是读懂论文的前提。
Community Notes(社区笔记)
X(原Twitter)的众包事实核查功能:志愿者为可能误导读者的帖子撰写附证据的“笔记”,社区投票评定笔记是否有帮助。每条笔记与用户名、帖子、图像构成结构规整的元组,覆盖多语言和极广的话题范围,每日持续更新。
论文的数据集(26,979条样本)直接构建自社区笔记,其共识审核的质量控制、话题多样性与多语言覆盖是作者选择它而非事实核查文章的根本原因。
视觉语言模型(VLM)
同时接收图像与文本输入、生成文本输出的大模型,可执行图像描述、多模态推理与分类。本文使用开源的Qwen3.5-27B(FP8量化),通过精心设计的提示词把标注拆成多个子步骤逐步完成,每轮约24小时跑完单张L40S GPU。
论文方法部分的核心就是用VLM流水线替代专家标注,其建模方式(多步分解、多轮对话)、提示设计与可靠性评估都依赖对VLM工作方式的理解。
标注一致性(IAA)
衡量不同标注者对同一数据打标签一致程度的指标族:多标签任务常用Jaccard相似度(标签集合交集除以并集),单标签任务用精确匹配率或Cohen's $\kappa$(校正随机一致后的一致性系数),与人工金标对比时用精确率/召回率/$F_1$。
论文用这套指标完成两件关键事:验证分类体系本身是否无歧义可用(人类之间一致性),以及证明VLM标注可靠性接近人类专家。
Fisher精确检验与FDR校正
Fisher精确检验用于判断两个类别变量(如话题×机制)的联合分布是否显著偏离独立假设;Benjamini–Hochberg程序对大量假设检验的 $p$ 值做校正以控制假发现率。共现热图只展示校正后 $p<0.05$ 的单元格。
第6节所有“机制—话题”“机制—语言”共现分析(如冲突话题与地点错配强共现)都建立在该统计方法之上,不看懂它就无法判断哪些交互结论是显著的。
研究动机
多模态虚假信息比纯文本更具说服力和情绪冲击,但研究严重滞后。首要问题是分类体系碎片化:McCulloh(2022)提出7类机制,Newman & Schwarz(2024)提出5类,Dufour et al.(2024)的AMMEBA覆盖11个机制,然而同一机制命名各异(Deepfake vs. AI-generated、Repurposed vs. Out-of-context),粒度、层级结构与覆盖范围互不相容,跨研究结论无法比较;更严重的是覆盖不足——按Dufour et al.自己的体系,约40%的图像无法归入任何预定义子类。其次是规模瓶颈:庞大的分类体系让众包标注者难以执行,判断往往还需要语言流利度、政治文化背景与经济医疗等领域知识,专家标注则缓慢昂贵;而此前的VLM在多模态推理与指令遵循上能力不足,无法可靠自动化。结果是学界对图像与文字在真实场景中如何组合误导读者知之甚少,缓解策略缺乏可操作的依据。
本文的目标是本文目标分三步。第一步,构建大规模、高质量、多语言的真实虚假信息数据集:以X社区笔记为源,覆盖英语、西班牙语、葡萄牙语、日语、法语、德语、希伯来语7种语言,最终得到26,979个(用户名、帖子、图像、笔记)元组,时间跨度2021年1月至2026年1月。第二步,基于对数据的深入定性分析和既有理论工作(Wardle & Derakhshan 2017、Marsh & White 2003、Dufour et al. 2024等),建立统一的分类体系,含6个正交轴与25个机制类别,既能覆盖既有方案又能处理此前无法分类的案例。第三步,用视觉语言模型构建自动化多步标注流水线,把体系以低成本、高速度应用于大规模数据,并经专家人工验证可靠性,从而首次在规模上回答“社交媒体用户如何用图像传播虚假叙事”,为定向检测与缓解提供指导。
与已有工作不同的是,本文的独特切入体现在四个层面。数据上,放弃以专业事实核查文章为基础的常规做法(其类别必然偏窄),改用社区笔记:共识审核保证质量,覆盖事实核查机构忽略或降级的话题,每日更新因而能捕捉新趋势,且(用户名、帖子、图像、笔记)结构规整便于自动化分析。体系构建上,首次系统统一14个既往方案,且统一过程是实证驱动的迭代:定义含糊的类别(如Slanted)在试标注中暴露问题后被细化出exaggeration与scientific errors or conspiracies两个子类,实践中不可区分的类别被合并,低频类别(如Mirrored)被剔除,还新增Textual claim顶层类别,覆盖“图像内嵌虚假文字声明、帖子文本仅作放大”这一无既有类别可归的模式。技术上,用开源中等规模VLM把标注成本降低数个量级,使体系可长期运维。分析上,增设情绪、图像类型、修辞角色、话题与自由文本消息5个正交轴,支持机制×话题×语言×叙事的细粒度交互研究。
核心方法
整体直觉是“先用真实数据定义问题,再用机器放大分析”。技术上分三步:第一步数据构建——以COMMUNITYNOTES(Xing et al. 2026,含10万余条帖子-笔记对)为基础,剔除被社区评为“无帮助”的笔记、仅保留7种语言,通过网络抓取识别并下载带图帖子;再从官方社区笔记发布数据中用Twikit抽样爬取2.5万条补充,去除已删除笔记、“非误导”帖与无图帖,最终合并得到26,979条样本。第二步分类体系构建——按三阶段统一既往分类方案:对齐精确匹配、合并近似类别、组织成层级;再通过迭代标注用实证证据修正定义并补充新类别,最终形成6轴25机制体系(Figure 2)。第三步自动化标注——选用Qwen3.5-27B(FP8),把6个轴拆解为6个顺序执行、各配专用提示词的步骤(Figure 3),每轮约24小时在单张L40S GPU上完成全量标注,共跑3轮评估稳定性,最后由两位专家作者做人工验证。
核心创新是把“分类体系的统一”与“标注的自动化”设计成互相支撑的闭环。与已有工作的本质区别在于:过去各团队各自提出体系(如AMMEBA的Content/Context/Text-based三大类、Newman & Schwarz的Probative/Slanted/Repurposed/False/Decorative),彼此无法对齐更无法自动化;本文首次把14个方案映射到公共框架——精确匹配直接对齐,近似类别在确保标注者不会遇到模糊边界的前提下合并,其余组织为层级。统一过程并非纯概念推演,而是让数据反向塑造体系:Slanted定义过含糊就细化子类;发现既有类别无法描述的新模式就增设Textual claim。自动化方面的关键洞察是把复杂的多模态判断分解为6个认知难度递进的子任务,其中最难的机制识别建模为多轮对话:先判断图像是否主动参与误导(不参与则记为Decorative),再预测9个顶层机制之一,最后仅在五类内细分子机制,逐轮缩小候选空间、降低单次推理难度。
方法步骤详情
流水线六步如下。(1) 图像类型:仅以图像为输入,多标签预测20类视觉形态(简单照片、社交媒体截图、新闻截图、数据可视化、meme、复杂合成图等)。(2) 情绪:以(用户名、帖子、图像)为输入,多标签判断作者借图像激发的情绪(joy/anger/fear/ridicule等11类),刻意排除笔记以防泄漏答案。(3) 分类:以(用户名、帖子、图像、笔记)为输入,判定帖子属misinformation、广告、骗局还是盗用内容,仅虚假信息进入后续步骤。(4) 话题与消息:提取13类多标签话题及自由文本消息描述与抽象版本。(5) 修辞角色:按Marsh & White (2003)判定图像对文本的功能关系(decorate/explain/develop等10类,多标签),输入含第4步的消息。(6) 机制:三轮对话——先判断图像是否参与误导,再预测顶层机制,最后预测子机制。人类验证:两位作者用标注平台给100条样本打全体系标签,计算一致性与覆盖率;另分层抽取630条英文预测、混入一半随机干扰标签,由两位专家逐一判定对错并讨论解决分歧后计算准确率。
技术新颖性
技术新颖性有四。其一,统一性:Table 2系统对比了从Marsh & White (2003)到Liu et al. (2025)的14个方案,本文首次在机制层面把McCulloh、Wardle & Derakhshan、Dufour et al.等异构体系合并为25个可区分机制,超过此前最全的AMMEBA(11个)。其二,实证驱动的体系演化:与先验式构建分类法不同,模糊类别在标注中被发现并细化(Slanted拆出exaggeration与scientific errors or conspiracies),低频类别(Mirrored)被剔除,“实践中不可区分”成为合并标准;两位专家100条中各仅1条和3条落入Other mechanism,证明覆盖率高。其三,消息轴采用自然语言而非固定标签,配合嵌入聚类(all-mpnet-base-v2编码、UMAP降维、KMeans聚类、Claude Sonnet 4.6总结)实现“叙事级”案例研究,这是固定标签体系做不到的。其四,证明开源中等规模VLM即可达到接近专家的标注可靠性,为社区提供可复现的大规模标注范式。
实验结果
(1) 机制分布:社区笔记中Slanted最常见(超7,000条),其后是Decorative与Mismatch;AI生成与伪造图像频率相当并超多数篡改形式。(2) 可靠性:630条人工核查中79.3%的VLM预测正确(Cohen's $\kappa=0.67$);VLM–人类Mechanism匹配率49.1%(人类间65.2%);子机制中Manipulated image–removal超90%,Fake image–staged仅38%。(3) 泛化:AMMEBA上Mismatch F1=0.83、Manipulated image 0.84、AI manipulation 0.82,Time mismatch因提示词仅0.26。(4) 交互:错配与Conflict强共现;Textual claim在法律/经济/健康/科学过表征;葡语Decorative过表征,日语Slanted过表征。(5) 案例:体育谣言偏文本造假;疫苗谣言由scientific errors or conspiracies主导且新闻截图过表征;反移民叙事依赖time/place错配与Anger、Fear情绪。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 机制标注可靠性(630条分层抽样人工核查) | 准确率 | 79.3%(VLM预测经两位专家判定正确) | 人类专家间机制精确匹配率65.2%(100条样本) | VLM标注可靠性接近人类专家水平 |
| AMMEBA对齐类别 Mismatch | F1 | 0.83(准确率0.78、精确率0.98、召回率0.72,n=1723) | 与AMMEBA既有人工标注直接对比 | 全部对齐类别中最高,验证跨数据集泛化 |
| AMMEBA对齐类别 AI manipulation | F1 | 0.82 | 与AMMEBA既有人工标注直接对比 | 在仅21个支持样本的极小类别上仍保持高水平 |
| 图像类型标注一致性 | Mean Jaccard | VLM–人类 0.5653 | 人类–人类 0.6074 | 接近人类间一致性(约93%) |
| 话题标注一致性 | Mean Jaccard | VLM–人类 0.6484 | 人类–人类 0.7047 | 接近人类间一致性 |
| AMMEBA Time mismatch | F1 | 0.26(召回率仅0.16) | 其余对齐类别F1为0.61–0.84 | 显著落后,源于提示词指令(时间与地点同时错配时强制选Place mismatch) |
局限与改进
作者明确承认六点:(1) 因过于模糊、需外部信息或超出范围,放弃了Intent、Recipient等既往轴;(2) 社区笔记数据集虽可观,仍不足以支撑每个叙事的稳健分析,许多叙事样本过少,AMMEBA也仅是3,629条的子样本;(3) 受算力与避免闭源依赖的限制选用Qwen3.5-27B,性能不及最先进VLM;(4) 多语言处理依赖模型内置能力,未用翻译流水线或语言专属模型;(5) 机制轴是单标签,而现实案例可能同时存在时间与地点错配;(6) 两个数据集均含低质量实例,缺乏独立于平台自身标注的质量过滤。我的补充观察:主观轴可靠性堪忧——Rhetorical role的VLM–人类Jaccard仅0.1758(人类–人类也只有0.3547),该轴的下游结论需谨慎对待;数据分布反映的是社区认为值得核查的内容,英语占58.6%,可能存在话题与语言选择偏差;AI生成图像的高占比可能与近年生成技术爆发和社区关注度双重因素耦合,解读趋势时需控制时间因素。
独立分析的弱点
弱点一:机制单标签假设。一帖同时错报时间和地点(旧图新用且配错地点)只能二选一,会系统性低估复合机制;改进方向是把机制轴改为多标签并显式建模机制共现。弱点二:证据推理型子机制失败。Fake image–staged与Slanted–misinterpretation of relevance的准确率均仅38%,需要从图像推断拍摄情境或相关性,超出当前VLM的视觉取证能力;可引入专用检测器(误差分析、噪声指纹、反向图搜)作为外部证据,或按作者建议接入联网RAG核查时间地点。弱点三:主观轴噪声大。Emotion与Rhetorical role即便人类间一致性也低(Jaccard 0.40/0.35),据此得出的“反移民叙事依赖愤怒与恐惧”等结论稳健性有限;可先做小规模定义校准实验,或改用更可操作的修辞角色定义。弱点四:数据源偏差。社区笔记偏英语、偏政治与冲突话题,高热点机制(如AI生成)可能因社区关注度被过表征;可用专业事实核查数据与平台随机抽样三角验证。弱点五:静态快照。体系按2026年初数据校准,而生成技术迭代极快,新机制可能很快出现,需要定期再标注与体系版本管理。
未来方向
作者提出的方向包括:以可靠方式纳入此前舍弃的Intent、Recipient等轴;扩充数据规模以支撑细粒度叙事分析;用更大规模或面向任务微调的VLM替换Qwen3.5-27B;显式多语言处理(翻译流水线、语言专属模型);机制轴多标签化;以及用独立于平台标注的更好过滤机制提升数据质量。基于本文成果还可延伸:其一,把机制标签作为监督信号训练轻量级定向检测器,针对高频机制(Slanted、Mismatch)而非笼统的真假二分类做检测,更可解释且省算力;其二,利用26,979条样本横跨2021–2026的时间戳做时序分析,量化AI生成图像占比的上升曲线及其话题迁移;其三,跨平台复制流水线(Facebook、Reddit、Telegram等),验证机制分布的平台差异;其四,把发现转化为缓解策略——不同叙事偏好不同机制(疫苗谣言借新闻截图、伪科学配阴谋论),可据此为不同机制定制差异化警示标签(如对时间错配显示“此图来自旧事件”)并做A/B效果评估;其五,把消息轴的嵌入聚类发展为开放式叙事监测系统,追踪新兴虚假信息叙事的机制迁移。
复现评估
复现条件总体较好。代码与全部提示词已开源(GitHub: nadavborenstein/MultimodalTaxonomy),六个步骤与聚类总结的提示词在Listing 1–9完整给出;数据基础公开:COMMUNITYNOTES(Xing et al., 2026)与AMMEBA(Kaggle)均可获取,但需自建抓取管道——Twikit爬取X受平台政策约束,存在账号与速率限制风险,旧帖可能已删除。算力门槛低:Qwen3.5-27B-FP8为开源权重,单张L40S GPU约24小时即可完成约2.7万条样本的全量标注,实验室单卡即可复现;案例分析还需all-mpnet-base-v2、UMAP、KMeans与Claude Sonnet 4.6(闭源API,可换开源LLM)。主要难点:一是VLM输出非确定性,论文跑3轮评估稳定性,复现者应多次运行并报告方差;二是人工验证需要领域专家(论文由作者本人标注),第三方难以复制同等标注质量;三是Time mismatch的提示词偏差提示需仔细审视提示细节。综合评估:中等偏低难度,单卡环境数天内可完成核心流水线复现。
论文图表
展示X平台上一条真实的图文虚假信息实例(帖子、图像、社区笔记),并标注出本文分类体系为其分配的各轴标签(机制、图像类型、情绪等)。
读者第一眼就能直观理解“一条多模态虚假信息长什么样、体系如何标注它”,是全文的最佳入口示例。
展示26,979条社区笔记样本在2021年1月至2026年1月间的时间分布。
数据的时间跨度与密度决定了可以做时序趋势分析(如AI生成图像的兴起),也是评估数据集代表性的依据。
四条社区笔记样例(用户名已匿名化),涵盖NBA战绩谣言、气候meme、DeepSeek封禁谣言、地震预测谣言,展示(用户名、帖子、图像、笔记)的数据结构。
直观呈现数据集格式与虚假信息的多样性,帮助理解后续所有定量分析的对象。
疫苗相关且图像类型为新闻截图的实例:如声称mRNA疫苗致白血病、欧盟法院判强制接种医生刑责等,社区笔记附权威链接辟谣。
配合Figure 16说明“借新闻权威背书”的具体操作方式,是该案例研究最直观的证据。