CaRGo-T:因果推理思维图提升多模态幽默理解 CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
让VLM先生成因果推理图代码再作答,幽默理解提升1-20%
前置知识
因果图与因果推理图(CRG)
因果图是 Pearl 因果推断框架中用有向边表示变量间因果关系的图结构,通常配备概率参数构成结构因果模型。本文使用的“因果推理图”是其受限子类:只保留因果链接(cause-effect 对),附以实体(对象、人、抽象概念、事件)及其属性的轻量元数据,不含任何概率参数,是确定性的、以事件为中心的可解释结构。
本文的核心创新就是把这种受限因果图作为 VLM 的显式推理组件,理解 CRG 的结构(实体、属性、因果对)是读懂方法的前提。
思维链(CoT)提示
让模型在给出最终答案前先显式输出中间推理步骤,把黑盒推理变成可读的推理链。变体包括 Chain-of-Draft(CoD,生成简洁草稿式推理)和 Compositional CoT(CCoT,用自动生成的场景图引导组合推理),但场景图只描述对象属性与关系,不包含因果方向。
CARGO-T 的全部基线都是这类推理增强方法,论文论证 CoT 在主观情绪化场景存在“后验坍缩”,正是 CRG 要解决的痛点。
零样本与上下文学习(ICL)
不更新模型参数,仅靠提示词完成任务:零样本只给任务指令,K-shot 则在提示中拼接 K 个输入-输出示例引导模型模仿输出格式与推理方式,属于纯推理阶段的提示工程。
CARGO-T 全程不训练,仅在零样本(0-shot)和 2/5/6-shot ICL 两种设定下评估,提示模板是方法本体。
文本生成评价指标
BLEU 与 ROUGE-L 基于 n-gram 词面重叠衡量生成文本与参考答案的相似度;BERTScore 用预训练语言模型嵌入计算语义相似度;三者的均值即论文中的 Avg. Score。分类任务则用 Accuracy 和 macro-F1。
幽默理解任务的全部主结果都用这四个指标报告,是解读 Table 1、Table 2 的钥匙。
KL 散度
衡量两个概率分布差异的非对称指标,$KL(P\|Q)=\sum_w P(w)\log\frac{P(w)}{Q(w)}$。论文对两段文本分词后构建平滑词元分布,若 $KL(T_1\|T_2)$ 大于反向值,说明 $T_1$ 含有相对 $T_2$ 更多新词汇信息。配合 Sentence-BERT 句覆盖率 LSF 一起分析。
论文用它从信息论角度证明 CARGO-T 的推理组件比基线包含更多与答案相关的新信息。
研究动机
大规模 VLM 在通用任务上表现出色,但在多模态幽默理解上严重不足。幽默源自人物、对象、抽象概念与事件之间复杂、非线性的交互,需要高级社会推理与文化素养。已有评测显示 SOTA VLM 无法令人满意地理解讽刺、反讽、挖苦等幽默:在双人或群体互动场景中会误判核心情绪状态(如把挖苦误认为惊讶),忽视制造“视觉笑点”的不协调动作-对象关系,并把多模态比喻内容坍缩成单一字面解释。更糟的是显式推理增强也救不回来:CoT 在主观、情绪化语境下出现后验坍缩——只是检索静态先验而非动态推理人际线索,在挖苦识别基准上几乎无提升;多模态自反思框架产生的推理理由嘈杂错位,恰恰漏掉社会幽默所依赖的细粒度情感与关系线索。
本文的目标是本文要让 VLM 在不训练(零样本/上下文学习)的前提下显式建模幽默场景中的因果结构:自动构建因果推理图(CRG),编码图像与文本中实体、对象、概念、事件之间的因果交互,再基于图的系统性因果遍历与组合推理完成两类任务——幽默理解(回答“为什么好笑”,如讽刺理解、梗图配文)与幽默检测(判断是否好笑,如讽刺/挖苦二分类),并在 GPT-4o、GPT-4o-mini、MiniCPM 等不同规模与开源程度的 VLM 上验证框架的通用性与增益。
与已有工作不同的是,独特切入在于推理组件的选择:幽默理解领域此前没有任何工作显式建模因果图或因果关系,本文是第一个。与已有推理方式的本质区别是——不用自然语言推理链(CoT/CoD),也不用知识图谱三元组,而是把只含因果链接与实体元数据的受限因果图序列化为轻量代码,让 VLM 生成并解读。图结构天然支持沿因果链的系统性遍历与组合推理,能捕捉“时尚→穿高跟鞋→脚部不适”这类标准 CoT 无法稳定表达的关系不协调,这正是笑话的“punchline”所在。
核心方法
直觉上,笑话往往源于“因为 X 所以 Y,偏偏结果 Z”的因果链断裂;先把这条链显式画出来再看答案,模型就不容易漏掉笑点。技术上,CARGO-T 是 VLM 无关的两段式提示框架:给定图像 $I$ 与任务提示 $P$,预训练 VLM 输出 $\hat{Y} \subseteq F_\theta(I,P)$,其中先有推理组件 $R$ 再有最终答案。CARGO-T 要求 $R$ 为一段因果推理图代码:提示以原始任务问题开头(如 YesBut 讽刺理解的“Why is this image funny/satirical?”),追加指令“先以代码形式构建连接图中不同对象、人物、实体的因果推理图,再给出最终答案”,输出按“Code: / Final Answer: <答案>”格式。零样本直接推理,依赖 VLM 自身代码能力;ICL 设定则在提示中拼入 K 个带人工修正 CRG 的示例。效果上,GPT-4o 在 YesBut 讽刺理解零样本 Avg. Score 从 CoT 的 0.3337 提高到 0.3726。
核心创新是把“推理组件”从自由文本换成受限因果推理图(CRG)。CRG 只保留因果链接(cause-effect 对),附以对象、人、抽象概念、事件等实体及其属性元数据,完全不含概率参数,是确定性的以事件为中心的结构。相比 CoT 的线性叙述、CoD 的简洁草稿、CCoT 只描述对象属性与关系的场景图(无因果方向),CRG 明确编码“时尚驱动穿高跟鞋→高跟鞋导致脚部不适”这样的传导链,使模型能做系统性因果遍历与组合推理,精准捕捉关系不协调。同时图以 JSON 风格代码序列化,复用 VLM 的代码理解能力,同一模型生成、另一模型解读亦可(VLM 无关)。
方法步骤详情
第一步,构造提示:以任务特定查询开头(附录 C 给出全部四个任务的查询),追加 CRG 指令与输入图像/文本,要求按“Code: <因果推理图代码> / Final Answer: <最终答案>”格式输出。第二步,零样本推理:直接调用 VLM,因依赖代码生成能力,主要使用 GPT-4o 与 GPT-4o-mini。第三步,构建 ICL 示例:从训练集取样本,先用 GPT-4o 以零样本提示生成 CRG 草稿(该提示把 ground truth 答案也喂入作为条件),再人工修正为固定三段结构——先列实体(对象/人/抽象概念/事件),再列各实体属性,最后列因果对,每对形如 {"cause": 事件1, "effect": 事件2},如 Fig. 3 的高跟鞋示例。第四步,K-shot 推理:将 K 个示例(图像+文本+修正后 CRG+标准答案)拼入提示,VLM 为测试样本生成自己的 CRG 与最终答案,全程只推理不训练。
技术新颖性
新颖性有五点:(1) 概念首次——多模态幽默理解中首次显式建模因果图/因果关系;(2) 组件形式——以代码化 CRG 替代自然语言推理(CoT/CoD)或知识图谱三元组(Zhao et al.),是新的推理组件范式;(3) 结构优势——确定性无参图支持因果遍历与组合推理,区别于 CCoT 无向的场景图和易后验坍缩的 CoT;(4) VLM 无关——同一提示可直接套用于闭源(GPT-4o/4o-mini)与开源(MiniCPM-V-2.6)模型;(5) 分析深度——除端到端指标外,用 KL 散度、LSF 句覆盖率和 GPT-4 裁判的 INFERSCORE 从信息论层面证明推理组件信息量更足、与 ground truth 更相关,并消融证明人工修正 ICL 图(UNRECTIFIED 使 2-shot Avg. 从 0.3911 降到 0.3771)与不加图定义(WITH DEFN. 为 0.3687 vs 0.3726)的必要性。
实验结果
论文在三个基准、四个任务上评估 CARGO-T,提升均经双样本 t 检验显著。(1) 零样本幽默理解:GPT-4o 在 YesBut 讽刺理解上 Avg. Score 0.3726(ROUGE-L 0.2219、BLEU 0.0245、BERTScore 0.8715),超过最佳基线 CoD 的 0.3663;GPT-4o-mini 为 0.3632(Vanilla 0.3372);MemeCap 梗图配文上 MiniCPM 收益最大:0.3295 vs 0.3114(+5.81%)。(2) 少样本:GPT-4o 2-shot Avg. 0.3911(vs Vanilla 0.3602、CoT 0.3551),相对 CoT 增益随示例数递减(0/2/5-shot 分别 +11.66%/+10.14%/+5.86%)。(3) 幽默检测:MMSD 2.0 挖苦检测 2-shot Acc 49.88%(CoT 48.32%,+3.23%)、F1 62.38%(+1.05%);YesBut 讽刺检测 6-shot Acc 45.57%(+1.05%),带配套文本的挖苦检测收益更大。(4) 信息论分析:$KL(R_{\text{CaRGo-T}}\|R_{\text{CoT}})=0.21>0.19$(反向),LSF 为 1 vs 0.85,推理组件含更多新信息;GPT-4 裁判 INFERSCORE 45.11% 高于 CoT 40.78%、CoD 40.68%、CCoT 37.64%。(5) 消融:加图定义反而降分(0.3687 vs 0.3726),未修正 ICL 图掉分明显(2-shot 0.3771 vs 0.3911)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 讽刺图像理解(YesBut,零样本) | Avg. Score(BLEU/ROUGE-L/BERTScore 均值) | 0.3726(GPT-4o:ROUGE-L 0.2219 / BLEU 0.0245 / BERTScore 0.8715) | 最佳基线 CoD 0.3663(Vanilla 0.3571) | +1.7%(相对 CoD) |
| 讽刺图像理解(YesBut,零样本) | Avg. Score | 0.3632(GPT-4o-mini) | Vanilla 0.3372 | +7.7% |
| 梗图配文生成(MemeCap,零样本) | Avg. Score | 0.3295(MiniCPM:ROUGE-L 0.126 / BLEU 0.0123) | 最佳基线 CoD 0.3114 | +5.81% |
| 讽刺图像理解(YesBut,2-shot) | Avg. Score | 0.3911(GPT-4o) | Vanilla 0.3602 / CoT 0.3551 | +10.14%(相对 CoT) |
| 多模态挖苦检测(MMSD 2.0,2-shot) | Accuracy / macro-F1 | 49.88% / 62.38%(GPT-4o) | CoT 48.32% / 61.73% | Acc +3.23% / F1 +1.05% |
| 讽刺图像检测(YesBut,6-shot) | Accuracy / macro-F1 | 45.57% / 61.56%(GPT-4o) | CoT 45.38% / 61.32% | Acc +1.05% / F1 +0.39% |
局限与改进
作者坦承并用数据印证的局限:(1) 检测任务收益仅约 1-3%,且绝对准确率很低——MMSD 2.0 上 49.88%、YesBut 上 45.57%,接近随机水平,CRG 只带来边际改进;(2) 零样本依赖闭源模型的代码生成能力,开源 MiniCPM 收益不稳定;(3) ICL 示例的 CRG 需人工逐条修正,成本高、难规模化。我观察到的额外局限:(4) GPT-4o-mini 5-shot 讽刺理解 Avg. 0.3752 反而低于 CoT 的 0.3802,方法在部分设置下会回退;(5) 幽默理解用 BLEU/ROUGE-L 等词面指标评估开放式解释,BLEU 只有 0.01-0.04 量级,本身对该任务的度量有效性存疑;(6) 相对 CoT 增益随示例数递减(+11.66%→+5.86%),说明更多上下文不能换取更强推理;(7) 评测局限于 4 个英文数据集(YesBut 2541 张、MemeCap 559 条、MMSD 2.0 2409 条测试样本),跨文化与跨幽默类型泛化未验证。
独立分析的弱点
弱点一:检测任务的绝对性能接近随机(GPT-4o 挖苦检测 Acc 49.88%、讽刺检测 45.57%),说明 CRG 并未触及幽默判别的根本难点,可能因为二分类信号无法由稀疏因果链充分表达;改进方向是对 CRG 施加自一致性投票——采样多条因果图取答案众数,或用图结构作监督信号微调小模型。弱点二:ICL 示例 CRG 依赖人工修正,作者消融显示未修正图使 2-shot Avg. 从 0.3911 掉到 0.3771;改进方向是训练专门的图结构校验器,或用多轮“生成-批评-修订”自动化流水线替代人工。弱点三:对开源小模型不友好,MiniCPM 零样本部分指标不敌基线,根源是代码生成能力弱;改进方向是把 CRG 序列化为对代码能力要求更低的文本格式(如缩进树或 DOT 语言),或先用代码数据增强小模型。弱点四:确定性无参图丢弃了幽默中常见的模糊因果与反事实空间;可扩展为带权因果图,让“最可能的因果断裂”成为笑点定位信号。弱点五:评测依赖词面指标且无人工评估,INFERSCORE 又用 GPT-4 裁判存在循环偏差,应补充人评。
未来方向
作者在结论中指出 CRG 提升了幽默理解与检测所需的相关推理信息,但未列具体未来方向。基于成果可延伸:(1) 把 CRG 从幽默扩展到其他社会推理任务——视觉隐喻理解、讽刺生成、迷因有害性检测、漫画叙事推理,这些任务同样依赖人物-对象-事件的因果交互;(2) 自动化 ICL 图修正:用规则校验加 LLM 迭代修订替代人工,消除规模化瓶颈;(3) 将 CRG 作为结构化监督信号做参数高效微调,让小模型内化因果遍历能力,摆脱对闭源代码生成能力的依赖;(4) 恢复概率维度的带权因果图,用边的置信度表达反事实与不确定性,定位“最可能的笑点”;(5) 多图采样加自一致性提升检测任务接近随机的准确率;(6) 跨语言、跨文化的幽默泛化研究,检验“因果断裂”是否为幽默的普适信号;(7) 结合视频模态,处理时序因果链上的幽默(如短视频的延迟笑点)。
复现评估
复现条件总体友好。代码已开源(https://github.com/abhi1nandy2/CaRGo-T),三个数据集公开可得:YesBut(1079 张讽刺图用于理解评测、2541 张用于检测)、MemeCap(559 条测试)、MMSD 2.0(2409 条测试);全部提示模板在附录 C 原文给出,ICL 示例的修正方法与反例在附录 A/E 详述。算力方面,闭源路径只需 GPT-4o/GPT-4o-mini API 调用(成本随 2541+2409+559 条测试样本与 0/2/5-shot 设置累加,需预算数百美元量级);开源路径用 MiniCPM-V-2.6,作者使用 2 张 NVIDIA L40(各 48GB 显存)。主要摩擦点:每任务需人工修正 5-6 个 ICL 示例的 CRG(附录 A 展示了修正样例),存在主观性;INFERSCORE 评测需额外调用 GPT-4 作裁判。综合判断:提示工程部分极易复现,端到端完整复现难度中等,主要成本在 API 费用与少量人工标注。
论文图表
以讽刺(satire)为例并列展示两类任务的输入、任务描述与 ground truth:理解任务要求生成解释“为什么好笑”,检测任务要求输出 Y/N 二分类标签。
定义了论文评测的两类任务形式化($Y$ 为自然语言或 {“Yes”,“No”}),帮助读者区分 Table 1/2(理解)与 Table 3/4(检测)两组实验的性质差异。
0/2/6-shot 下的 Accuracy 与 macro-F1:CARGO-T 最佳为 2-shot Acc 49.88%(CoT 48.32%,+3.23%)、F1 62.38%(+1.05%),各 shot 数下持续小幅领先。
幽默检测任务的主结果表,同时是理解方法局限的窗口——绝对准确率仅约 50%、提升只有 1-3%,说明 CRG 对二分类判别的帮助远小于对开放式解释。
0/2/6-shot 下的 Accuracy 与 macro-F1:CARGO-T 6-shot Acc 45.57%(CoT 45.38%,+1.05%)、F1 61.56%(+0.39%),各设置提升均不足 1.2%。
与 Table 3 对照可见:带配套文本的挖苦检测收益(最高 +3.23%)大于纯图像的讽刺检测(最高 +1.12%),支撑“附加文本为 CRG 生成提供额外监督”的分析,同时暴露纯视觉幽默检测的难度。
双向计算平滑词元分布的 KL 散度:$KL(R_{\text{CaRGo-T}}\|R_{\text{CoT}})=0.21$ 大于反向的 0.19;对 CoD 为 0.21 vs 0.20;对 CCoT 为 0.25 vs 0.25。
从词汇层面证明 CARGO-T 的推理包含相对基线更多新词元信息,为“CRG 不只是换个格式、而是提供了增量内容”的论断提供第一项信息论证据。
基于 Sentence-BERT(余弦相似度阈值 0.5)计算句覆盖率:CARGO-T 覆盖 CoT 全部句子(LSF=1)而 CoT 仅覆盖其 85%;对 CoD 为 1 vs 0.84;对 CCoT 为 0.98 vs 0.94。
语义层面的补充证据:CARGO-T 的推理不仅词汇更新颖,还包含 6%-16% 基线未覆盖的新语义内容,与 Table 5 共同构成信息量分析。
对比完整 CARGO-T 与两个消融变体:WITH DEFN.(提示中加入 CRG 详细定义,0-shot Avg. 0.3687)与 UNRECTIFIED(ICL 图不人工修正,2/5-shot Avg. 0.3771/0.3758),完整版为 0.3726/0.3911/0.3901。
揭示两个反直觉结论:给 VLM 塞图定义反而有害(可能造成提示混淆);人工修正 ICL 图至关重要。这两点直接决定复现时的工程选择,重要性不亚于主表。
描述按空白分词并小写化、以两文本联合词表构建平滑分布 $D_i(w)=\frac{c_i(w)+\alpha}{|T_i|+\alpha|V|}$、再求和计算 $KL(T_1\|T_2)$ 的完整流程。
Table 5 数值的精确计算口径:平滑参数、词表构建方式都会影响结论方向,复现信息论分析必须依据此伪代码。
描述用 nltk 分句、Sentence-BERT 嵌入、对每句求与对方所有句子的平均余弦相似度、统计低于阈值 $U$ 的句子占比的流程。
Table 6 数值的精确计算口径(相似度判定用均值而非最大值、阈值 0.5),保证语义新颖性分析可被严格复现。