← 返回 2026-08-28

CaRGo-T:因果推理思维图提升多模态幽默理解 CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly 📅 2026-08-24 👍 8 2026-09-01 18:30
因果推理 多模态 幽默理解 提示工程 视觉语言模型

让VLM先生成因果推理图代码再作答,幽默理解提升1-20%

前置知识

因果图与因果推理图(CRG)

因果图是 Pearl 因果推断框架中用有向边表示变量间因果关系的图结构,通常配备概率参数构成结构因果模型。本文使用的“因果推理图”是其受限子类:只保留因果链接(cause-effect 对),附以实体(对象、人、抽象概念、事件)及其属性的轻量元数据,不含任何概率参数,是确定性的、以事件为中心的可解释结构。

本文的核心创新就是把这种受限因果图作为 VLM 的显式推理组件,理解 CRG 的结构(实体、属性、因果对)是读懂方法的前提。

思维链(CoT)提示

让模型在给出最终答案前先显式输出中间推理步骤,把黑盒推理变成可读的推理链。变体包括 Chain-of-Draft(CoD,生成简洁草稿式推理)和 Compositional CoT(CCoT,用自动生成的场景图引导组合推理),但场景图只描述对象属性与关系,不包含因果方向。

CARGO-T 的全部基线都是这类推理增强方法,论文论证 CoT 在主观情绪化场景存在“后验坍缩”,正是 CRG 要解决的痛点。

零样本与上下文学习(ICL)

不更新模型参数,仅靠提示词完成任务:零样本只给任务指令,K-shot 则在提示中拼接 K 个输入-输出示例引导模型模仿输出格式与推理方式,属于纯推理阶段的提示工程。

CARGO-T 全程不训练,仅在零样本(0-shot)和 2/5/6-shot ICL 两种设定下评估,提示模板是方法本体。

文本生成评价指标

BLEU 与 ROUGE-L 基于 n-gram 词面重叠衡量生成文本与参考答案的相似度;BERTScore 用预训练语言模型嵌入计算语义相似度;三者的均值即论文中的 Avg. Score。分类任务则用 Accuracy 和 macro-F1。

幽默理解任务的全部主结果都用这四个指标报告,是解读 Table 1、Table 2 的钥匙。

KL 散度

衡量两个概率分布差异的非对称指标,$KL(P\|Q)=\sum_w P(w)\log\frac{P(w)}{Q(w)}$。论文对两段文本分词后构建平滑词元分布,若 $KL(T_1\|T_2)$ 大于反向值,说明 $T_1$ 含有相对 $T_2$ 更多新词汇信息。配合 Sentence-BERT 句覆盖率 LSF 一起分析。

论文用它从信息论角度证明 CARGO-T 的推理组件比基线包含更多与答案相关的新信息。

研究动机

大规模 VLM 在通用任务上表现出色,但在多模态幽默理解上严重不足。幽默源自人物、对象、抽象概念与事件之间复杂、非线性的交互,需要高级社会推理与文化素养。已有评测显示 SOTA VLM 无法令人满意地理解讽刺、反讽、挖苦等幽默:在双人或群体互动场景中会误判核心情绪状态(如把挖苦误认为惊讶),忽视制造“视觉笑点”的不协调动作-对象关系,并把多模态比喻内容坍缩成单一字面解释。更糟的是显式推理增强也救不回来:CoT 在主观、情绪化语境下出现后验坍缩——只是检索静态先验而非动态推理人际线索,在挖苦识别基准上几乎无提升;多模态自反思框架产生的推理理由嘈杂错位,恰恰漏掉社会幽默所依赖的细粒度情感与关系线索。

本文的目标是本文要让 VLM 在不训练(零样本/上下文学习)的前提下显式建模幽默场景中的因果结构:自动构建因果推理图(CRG),编码图像与文本中实体、对象、概念、事件之间的因果交互,再基于图的系统性因果遍历与组合推理完成两类任务——幽默理解(回答“为什么好笑”,如讽刺理解、梗图配文)与幽默检测(判断是否好笑,如讽刺/挖苦二分类),并在 GPT-4o、GPT-4o-mini、MiniCPM 等不同规模与开源程度的 VLM 上验证框架的通用性与增益。

与已有工作不同的是,独特切入在于推理组件的选择:幽默理解领域此前没有任何工作显式建模因果图或因果关系,本文是第一个。与已有推理方式的本质区别是——不用自然语言推理链(CoT/CoD),也不用知识图谱三元组,而是把只含因果链接与实体元数据的受限因果图序列化为轻量代码,让 VLM 生成并解读。图结构天然支持沿因果链的系统性遍历与组合推理,能捕捉“时尚→穿高跟鞋→脚部不适”这类标准 CoT 无法稳定表达的关系不协调,这正是笑话的“punchline”所在。

核心方法

直觉上,笑话往往源于“因为 X 所以 Y,偏偏结果 Z”的因果链断裂;先把这条链显式画出来再看答案,模型就不容易漏掉笑点。技术上,CARGO-T 是 VLM 无关的两段式提示框架:给定图像 $I$ 与任务提示 $P$,预训练 VLM 输出 $\hat{Y} \subseteq F_\theta(I,P)$,其中先有推理组件 $R$ 再有最终答案。CARGO-T 要求 $R$ 为一段因果推理图代码:提示以原始任务问题开头(如 YesBut 讽刺理解的“Why is this image funny/satirical?”),追加指令“先以代码形式构建连接图中不同对象、人物、实体的因果推理图,再给出最终答案”,输出按“Code: / Final Answer: <答案>”格式。零样本直接推理,依赖 VLM 自身代码能力;ICL 设定则在提示中拼入 K 个带人工修正 CRG 的示例。效果上,GPT-4o 在 YesBut 讽刺理解零样本 Avg. Score 从 CoT 的 0.3337 提高到 0.3726。

核心创新是把“推理组件”从自由文本换成受限因果推理图(CRG)。CRG 只保留因果链接(cause-effect 对),附以对象、人、抽象概念、事件等实体及其属性元数据,完全不含概率参数,是确定性的以事件为中心的结构。相比 CoT 的线性叙述、CoD 的简洁草稿、CCoT 只描述对象属性与关系的场景图(无因果方向),CRG 明确编码“时尚驱动穿高跟鞋→高跟鞋导致脚部不适”这样的传导链,使模型能做系统性因果遍历与组合推理,精准捕捉关系不协调。同时图以 JSON 风格代码序列化,复用 VLM 的代码理解能力,同一模型生成、另一模型解读亦可(VLM 无关)。

方法步骤详情

第一步,构造提示:以任务特定查询开头(附录 C 给出全部四个任务的查询),追加 CRG 指令与输入图像/文本,要求按“Code: <因果推理图代码> / Final Answer: <最终答案>”格式输出。第二步,零样本推理:直接调用 VLM,因依赖代码生成能力,主要使用 GPT-4o 与 GPT-4o-mini。第三步,构建 ICL 示例:从训练集取样本,先用 GPT-4o 以零样本提示生成 CRG 草稿(该提示把 ground truth 答案也喂入作为条件),再人工修正为固定三段结构——先列实体(对象/人/抽象概念/事件),再列各实体属性,最后列因果对,每对形如 {"cause": 事件1, "effect": 事件2},如 Fig. 3 的高跟鞋示例。第四步,K-shot 推理:将 K 个示例(图像+文本+修正后 CRG+标准答案)拼入提示,VLM 为测试样本生成自己的 CRG 与最终答案,全程只推理不训练。

技术新颖性

新颖性有五点:(1) 概念首次——多模态幽默理解中首次显式建模因果图/因果关系;(2) 组件形式——以代码化 CRG 替代自然语言推理(CoT/CoD)或知识图谱三元组(Zhao et al.),是新的推理组件范式;(3) 结构优势——确定性无参图支持因果遍历与组合推理,区别于 CCoT 无向的场景图和易后验坍缩的 CoT;(4) VLM 无关——同一提示可直接套用于闭源(GPT-4o/4o-mini)与开源(MiniCPM-V-2.6)模型;(5) 分析深度——除端到端指标外,用 KL 散度、LSF 句覆盖率和 GPT-4 裁判的 INFERSCORE 从信息论层面证明推理组件信息量更足、与 ground truth 更相关,并消融证明人工修正 ICL 图(UNRECTIFIED 使 2-shot Avg. 从 0.3911 降到 0.3771)与不加图定义(WITH DEFN. 为 0.3687 vs 0.3726)的必要性。

YesBut 数据集图像的因果推理图(CRG)示例
Fig. 1: YesBut 数据集图像的因果推理图(CRG)示例
GPT-4o 生成的 CRG 与人工修正后 CRG 的对比
Fig. 3: GPT-4o 生成的 CRG 与人工修正后 CRG 的对比
YesBut 数据集示例图像(CoT 上下文示例所用)
Fig. 5: YesBut 数据集示例图像(CoT 上下文示例所用)

实验结果

论文在三个基准、四个任务上评估 CARGO-T,提升均经双样本 t 检验显著。(1) 零样本幽默理解:GPT-4o 在 YesBut 讽刺理解上 Avg. Score 0.3726(ROUGE-L 0.2219、BLEU 0.0245、BERTScore 0.8715),超过最佳基线 CoD 的 0.3663;GPT-4o-mini 为 0.3632(Vanilla 0.3372);MemeCap 梗图配文上 MiniCPM 收益最大:0.3295 vs 0.3114(+5.81%)。(2) 少样本:GPT-4o 2-shot Avg. 0.3911(vs Vanilla 0.3602、CoT 0.3551),相对 CoT 增益随示例数递减(0/2/5-shot 分别 +11.66%/+10.14%/+5.86%)。(3) 幽默检测:MMSD 2.0 挖苦检测 2-shot Acc 49.88%(CoT 48.32%,+3.23%)、F1 62.38%(+1.05%);YesBut 讽刺检测 6-shot Acc 45.57%(+1.05%),带配套文本的挖苦检测收益更大。(4) 信息论分析:$KL(R_{\text{CaRGo-T}}\|R_{\text{CoT}})=0.21>0.19$(反向),LSF 为 1 vs 0.85,推理组件含更多新信息;GPT-4 裁判 INFERSCORE 45.11% 高于 CoT 40.78%、CoD 40.68%、CCoT 37.64%。(5) 消融:加图定义反而降分(0.3687 vs 0.3726),未修正 ICL 图掉分明显(2-shot 0.3771 vs 0.3911)。

零样本设定下 CARGO-T 与基线在 YesBut 讽刺理解和 MemeCap 梗图配文上的对比
Table 1: 零样本设定下 CARGO-T 与基线在 YesBut 讽刺理解和 MemeCap 梗图配文上的对比
少样本上下文学习设定下 CARGO-T 与基线对比
Table 2: 少样本上下文学习设定下 CARGO-T 与基线对比
INFERSCORE:CARGO-T 与基线的对比
Table 7: INFERSCORE:CARGO-T 与基线的对比
零样本设定下 CARGO-T 相对基线的百分比提升
Fig. 2: 零样本设定下 CARGO-T 相对基线的百分比提升
查看结构化数据
任务指标本文基线提升
讽刺图像理解(YesBut,零样本) Avg. Score(BLEU/ROUGE-L/BERTScore 均值) 0.3726(GPT-4o:ROUGE-L 0.2219 / BLEU 0.0245 / BERTScore 0.8715) 最佳基线 CoD 0.3663(Vanilla 0.3571) +1.7%(相对 CoD)
讽刺图像理解(YesBut,零样本) Avg. Score 0.3632(GPT-4o-mini) Vanilla 0.3372 +7.7%
梗图配文生成(MemeCap,零样本) Avg. Score 0.3295(MiniCPM:ROUGE-L 0.126 / BLEU 0.0123) 最佳基线 CoD 0.3114 +5.81%
讽刺图像理解(YesBut,2-shot) Avg. Score 0.3911(GPT-4o) Vanilla 0.3602 / CoT 0.3551 +10.14%(相对 CoT)
多模态挖苦检测(MMSD 2.0,2-shot) Accuracy / macro-F1 49.88% / 62.38%(GPT-4o) CoT 48.32% / 61.73% Acc +3.23% / F1 +1.05%
讽刺图像检测(YesBut,6-shot) Accuracy / macro-F1 45.57% / 61.56%(GPT-4o) CoT 45.38% / 61.32% Acc +1.05% / F1 +0.39%

局限与改进

作者坦承并用数据印证的局限:(1) 检测任务收益仅约 1-3%,且绝对准确率很低——MMSD 2.0 上 49.88%、YesBut 上 45.57%,接近随机水平,CRG 只带来边际改进;(2) 零样本依赖闭源模型的代码生成能力,开源 MiniCPM 收益不稳定;(3) ICL 示例的 CRG 需人工逐条修正,成本高、难规模化。我观察到的额外局限:(4) GPT-4o-mini 5-shot 讽刺理解 Avg. 0.3752 反而低于 CoT 的 0.3802,方法在部分设置下会回退;(5) 幽默理解用 BLEU/ROUGE-L 等词面指标评估开放式解释,BLEU 只有 0.01-0.04 量级,本身对该任务的度量有效性存疑;(6) 相对 CoT 增益随示例数递减(+11.66%→+5.86%),说明更多上下文不能换取更强推理;(7) 评测局限于 4 个英文数据集(YesBut 2541 张、MemeCap 559 条、MMSD 2.0 2409 条测试样本),跨文化与跨幽默类型泛化未验证。

独立分析的弱点

弱点一:检测任务的绝对性能接近随机(GPT-4o 挖苦检测 Acc 49.88%、讽刺检测 45.57%),说明 CRG 并未触及幽默判别的根本难点,可能因为二分类信号无法由稀疏因果链充分表达;改进方向是对 CRG 施加自一致性投票——采样多条因果图取答案众数,或用图结构作监督信号微调小模型。弱点二:ICL 示例 CRG 依赖人工修正,作者消融显示未修正图使 2-shot Avg. 从 0.3911 掉到 0.3771;改进方向是训练专门的图结构校验器,或用多轮“生成-批评-修订”自动化流水线替代人工。弱点三:对开源小模型不友好,MiniCPM 零样本部分指标不敌基线,根源是代码生成能力弱;改进方向是把 CRG 序列化为对代码能力要求更低的文本格式(如缩进树或 DOT 语言),或先用代码数据增强小模型。弱点四:确定性无参图丢弃了幽默中常见的模糊因果与反事实空间;可扩展为带权因果图,让“最可能的因果断裂”成为笑点定位信号。弱点五:评测依赖词面指标且无人工评估,INFERSCORE 又用 GPT-4 裁判存在循环偏差,应补充人评。

未来方向

作者在结论中指出 CRG 提升了幽默理解与检测所需的相关推理信息,但未列具体未来方向。基于成果可延伸:(1) 把 CRG 从幽默扩展到其他社会推理任务——视觉隐喻理解、讽刺生成、迷因有害性检测、漫画叙事推理,这些任务同样依赖人物-对象-事件的因果交互;(2) 自动化 ICL 图修正:用规则校验加 LLM 迭代修订替代人工,消除规模化瓶颈;(3) 将 CRG 作为结构化监督信号做参数高效微调,让小模型内化因果遍历能力,摆脱对闭源代码生成能力的依赖;(4) 恢复概率维度的带权因果图,用边的置信度表达反事实与不确定性,定位“最可能的笑点”;(5) 多图采样加自一致性提升检测任务接近随机的准确率;(6) 跨语言、跨文化的幽默泛化研究,检验“因果断裂”是否为幽默的普适信号;(7) 结合视频模态,处理时序因果链上的幽默(如短视频的延迟笑点)。

复现评估

复现条件总体友好。代码已开源(https://github.com/abhi1nandy2/CaRGo-T),三个数据集公开可得:YesBut(1079 张讽刺图用于理解评测、2541 张用于检测)、MemeCap(559 条测试)、MMSD 2.0(2409 条测试);全部提示模板在附录 C 原文给出,ICL 示例的修正方法与反例在附录 A/E 详述。算力方面,闭源路径只需 GPT-4o/GPT-4o-mini API 调用(成本随 2541+2409+559 条测试样本与 0/2/5-shot 设置累加,需预算数百美元量级);开源路径用 MiniCPM-V-2.6,作者使用 2 张 NVIDIA L40(各 48GB 显存)。主要摩擦点:每任务需人工修正 5-6 个 ICL 示例的 CRG(附录 A 展示了修正样例),存在主观性;INFERSCORE 评测需额外调用 GPT-4 作裁判。综合判断:提示工程部分极易复现,端到端完整复现难度中等,主要成本在 API 费用与少量人工标注。