← 返回 2026-07-22

多模态大模型的计算幽默:方法、数据集、评估与挑战 Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin 📅 2026-07-21 👍 2 2026-07-27 18:30
MLLM 多模态幽默 梗图理解 综述 跨模态推理

系统综述多模态幽默理解的能力层级框架与三大建模范式,揭示识别到解释的能力鸿沟。

前置知识

多模态大语言模型 (MLLM)

能联合处理文本与图像的大模型,如 GPT-4o、Qwen-VL、InternVL,通过视觉编码器与 LLM 主干的对齐实现图像描述、视觉问答与跨模态检索。本文用它指代当前幽默理解研究的载体。

本文全部基准与建模范式都围绕 MLLM 展开,Table 3 评测的 11 个模型均为 MLLM,理解其能力边界是读懂识别—解释鸿沟的前提。

跨模态对齐 (Cross-modal Alignment)

把视觉特征 $x^v$ 与文本特征 $x^t$ 映射到共享语义空间,最小化任务损失 $\mathcal{L}=\mathbb{E}[\ell(g_\phi(f_\theta(x^v,x^t)),y)]$,常通过对比预训练(InfoNCE)或指令微调实现。

它是三大建模范式中最基础的'识别导向对齐',Table 1 把它形式化为 $p_\theta(y|x)$,但只能学到'什么共现'而非'为何好笑',是理解机制为何隐式的关键。

思维链推理 (Chain-of-Thought, CoT)

在给出最终答案前先生成中间推理步骤 $r_1,r_2,...,r_K$,把 $p(y|x)$ 分解为 $\prod_{k=1}^{K}p(r_k|r_{<k},x)\cdot p(y|r_{1:K},x)$。可由提示 elicited 或由 rationale 监督学习。

本文第二大范式'接地推理'的核心技术,也是解释为何 Qwen3-VL-8B-Thinking 在 DarkHumor 上 49.43%→66.43% 却在多个解释任务下降的机制基础。

不一致—消解幽默理论 (Incongruity-Resolution)

经典幽默理论,把笑点产生归结为三阶段:铺垫(识别预期场景)、冲突检测(定位被违反的预期)、消解(解释冲突如何产生幽默)。本文以此作为'理论引导分解'建模范式的固定模板。

它是 Section 4.2 '理论引导分解'的理论根基,理解该模板才能明白为何机制级推理优于单遍预测,以及为何模板可能对简单幽默过度分析。

检索增强生成 (RAG)

当缺失信息是社会、文化或时序性而非感知性时,用检索步骤增强预测:$p(y|x,K_x)$,其中 $K_x=R(x;D)$ 是从外部语料库 $D$ 选出的证据,可经密集段落检索、知识图谱注入或特征空间适配器融合。

对讽刺、时效性梗图、文化负载引用至关重要,是理解'幽默感知 RAG'未来方向与检索时机开放问题的前提。

研究动机

现有 MLLM 在图像描述、视觉问答、跨模态检索等'字面感知'任务上已接近人类水平(如 GPT-4o 在 MangaUB 面板定位达 99.21%、背景识别 97.60%),却在理解梗图、漫画、讽刺画等'非字面'创意内容时遭遇结构性瓶颈。这类内容的意义依赖于幽默机制(不一致、夸张、类比)、共享文化知识与交际意图,而非可直接观察的场景元素。具体而言,模型能正确识别燃烧的房子、法庭、笑脸,却无法恢复这些元素共同编码的隐喻、讽刺对象或笑点。表 3 显示,在需要语义/语用解释的任务上模型与人类差距巨大:MemeQA 最佳模型仅 60.41%,人类达 81.90%(差距 21.49 个百分点);NYCC 字幕选择 GPT-4o 82.30% 而 人类 94.00%。这一'感知—解释鸿沟'是 MLLM 评估与建模的结构性盲区,且随内容审核、社交媒体分析、创意辅助等部署场景扩大而愈发紧迫。

本文的目标是本文作为系统综述,目标是构建一个'能力为中心'(capability-centric)的统一框架,把分散在梗图分类、视觉讽刺检测、漫画理解、幽默字幕生成等任务中的研究整合起来。具体包括:(1) 提出三级能力层级——识别(Recognition)、解释与推理(Interpretation & Reasoning)、生成(Generation),明确每级所需的非字面接地、机制感知推理与评估信号;(2) 定义两种表征形式 StaVT(静态图文)与 SeqVN(序列视觉叙事)以规范输入空间 $x$;(3) 梳理三大建模范式 $p_\theta(y|x)$、$p_\theta(y,r_{1:K}|x,K_x)$、$p_\theta(y_{gen}|x,c)$ 及其失败模式;(4) 在 7 个基准、12 个任务设置上跨基准评测最新 MLLM,量化识别到解释的能力鸿沟;(5) 指出评估危机、文化接地、序列叙事推理、安全与统一系统四大瓶颈,并给出可操作的未来方向。

与已有工作不同的是,已有综述覆盖面破碎:基于文本的计算幽默综述聚焦双关、文字游戏等语言现象,完全不涉及视觉接地与跨模态不一致;多模态综述又各聚焦单一任务(讽刺检测或梗图分类),视野狭窄;通用 MLLM 综述则把创意/比喻理解淹没在'通用多模态推理'之下,缺乏专门系统化处理。本文的独特切入有三:第一,不按任务名或模型架构分组,而按'能力递进'组织,使标签预测到证据接地解释的跨越一目了然;第二,把表征形式(StaVT/SeqVN)作为建模容量的决定因素显式建模,强调漫画等序列形式需要跨面板实体共指与因果追踪;第三,首次把对齐、推理、检索、生成四大模块放到'跨范式整合'视角下(Figure 4d),并提出对齐—推理交互、检索时机、生成作为理解诊断三个开放问题,填补了'统一框架'的空白。

核心方法

本文的方法论不是训练新模型,而是构建一个组织性框架来综合文献,整体思路可类比'能力阶梯':把多模态幽默研究映射到三级递进能力上。第一级识别 $p_\theta(y|x)$,从图文联合表征预测幽默标签,强调跨模态对齐与局部线索敏感性;第二级解释与推理 $p_\theta(y,r_{1:K}|x,K_x) \approx \prod_{k=1}^{K} p(r_k|r_{<k},x) \cdot p(y|r_{1:K},x)$,引入中间推理链 $r_{1:K}$ 与可选外部知识 $K_x$ 解释为何好笑;第三级生成 $p_\theta(y_{gen}|x,c)$,在创意控制信号 $c$(机制、目标、语气)条件下生成幽默一致输出。框架同时区分两种表征形式:StaVT 为单图配短文本 $x=\{x_{img},x_{text}\}$,SeqVN 为多面板序列 $x=\{x_1,...,x_T\}$,后者需要追踪实体共指、因果流与铺垫—笑点结构。四种反复出现的创意机制(不一致、类比/概念映射、夸张/夸张法、叙事结构)贯穿所有形式。

核心创新是用'能力为中心'而非'任务/架构为中心'的组织方式。这与已有工作的本质区别在于:同一骨干网络在识别、解释、受控生成下表现截然不同,按能力归类能更准确刻画建模范式。具体地,三大范式各有明确形式化目标——对齐只学 $p_\theta(y|x)$ 标签预测,机制保持隐式且易受捷径学习与幻觉意图影响;接地推理显式建模推理链 $r_{1:K}$,使机制透明可评估,支持文化/时序/社会接地;可控制生成把 $c$ 作为条件,但有效 $c$ 本身预设了解释能力,瓶颈不在流畅而在接地。框架进一步强调'标签预测的进步不会自动迁移到解释或生成',这正是 Section 6 识别—解释落差的实证依据,也解释了为何 Thinking 变体在识别提升却在解释任务下降。

方法步骤详情

框架的应用分为四步。第一步表征形式划分:把输入 $x$ 归类为 StaVT($x=\{x_{img},x_{text}\}$)或 SeqVN($x=\{x_1,...,x_T\}$),决定感知编码与对齐机制(前者用视觉—语言编码器或带交叉注意力的 MLLM,后者需多面板指令微调或区域级编码器)。第二步能力定级:判定任务是识别(二元/多类分类、角色抽取、强度估计)、解释(描述性解释 vs 机制接地推理,含跨面板时序推理)还是生成(字幕、笑点、续写)。第三步范式匹配:识别对应跨模态对齐(指令微调、对比 VL 预训练、MoE 路由、文本中心化);解释对应接地推理(提示式 CoT vs 监督式 rationale、不一致—消解理论引导分解、外部检索 $K_x=R(x;D)$);生成对应可控制生成(机制显式字幕、创意制品合成、人机共创)。第四步评估协议选择:识别用准确率/F1/AUROC/相关,解释用 BLEU/BERTScore + rubric 人工或 LLM-as-judge,生成用人工偏好 + 忠实性检查。强系统往往组合多范式而非替代。

技术新颖性

技术新颖性体现在三个层面。第一,组织粒度的统一:把背景概念、基准设计与建模范式用同一套能力层级串联,使'不同基准究竟测什么'变得可比较——Table 2 首次按能力对齐列出代表性资源及其循环局限(识别层捷径学习、解释层文化覆盖窄、生成层新颖性/忠实性/安全难评分)。第二,范式形式化的精确性:Table 1 把三大范式归结为 $p_\theta(y|x)$、$p_\theta(y,r_{1:K}|x,K_x)$、$p_\theta(y_{gen}|x,c)$ 三个条件分布,并明确各自的优势(可扩展/机制透明/受控)与失败模式(捷径学习/提示敏感与检索噪声/低可控性)。第三,跨范式整合的开放问题:Figure 4d 提出'对齐—推理交互''检索时机''生成作为理解诊断'三个尚未被现有工作系统回答的问题,并把 Section 6 的跨基准实证作为统一评测范例,是首篇把'统一、安全系统'作为整合目标并给出可操作未来方向的幽默综述。

Overview of the survey.
Figure 1: Overview of the survey.
We categorize visual humor data into Static Visual–Textual Artifacts (StaVT) and Sequential Visual Narratives (SeqVN).
Figure 2: We categorize visual humor data into Static Visual–Textual Artifacts (StaVT) and Sequential Visual Narratives (SeqVN).
Capability-centric task hierarchy for multimodal humor.
Figure 3: Capability-centric task hierarchy for multimodal humor.
Four modeling paradigms: (a) Recognition-oriented Multimodal Alignment, (b) Interpretation-oriented Reasoning & Grounding, (c) Generation & Creative Control, (d) Cross-paradigm Integration.
Figure 4: Four modeling paradigms: (a) Recognition-oriented Multimodal Alignment, (b) Interpretation-oriented Reasoning & Grounding, (c) Generation & Creative Control, (d) Cross-paradigm Integration.

实验结果

基于 7 基准、12 任务、11 个 MLLM(含 GPT-4o 与人类)的跨基准评测,论文得出四项核心发现。(1)识别任务整体更高但不均匀:GPT-4o 在 MangaUB 五子任务拿下四个最佳(PanelLoc 99.21%、RecBg 97.60%、Onom 95.80%、NextInf 64.30%),但依赖隐含社会规范的 DarkHumor 最佳仅 66.43%。(2)解释与推理是核心瓶颈:YesBut-v2 道德/标题 84.72%/83.28% vs 人类 91.30%/97.50%(差 6.6/14.2);NYCC GPT-4o 82.30% vs 94.00%(差 11.7);MemeQA 仅 60.41% vs 81.90%(差 21.5)。(3)模型排名碎片化且 Thinking 变体不一致:无单一模型通吃,Qwen3-VL-8B-Thinking 使 DarkHumor 49.43%→66.43% 提升却在多个解释任务下降(NextInf 48.55%→32.76%),显式推理未必提升幽默理解。(4)人类在解释密集任务上显著领先,证实 MLLM 仍难以恢复预期意义与不一致结构。

Modeling paradigms for multimodal humor in the large-model era.
Table 1: Modeling paradigms for multimodal humor in the large-model era.
Capability-aligned summary of benchmark resources.
Table 2: Capability-aligned summary of benchmark resources.
Results on humor understanding benchmarks. All numbers are accuracy (%).
Table 3: Results on humor understanding benchmarks. All numbers are accuracy (%).
查看结构化数据
任务指标本文基线提升
MangaUB PanelLoc (面板定位) 准确率 (%) GPT-4o 99.21% Gemma-4-31B-it 10.01% 识别类视觉接地任务,模型已逼近上限
MangaUB NextInf (下一面板推断) 准确率 (%) GPT-4o 64.30% Gemma-4-31B-it 23.51% 序列叙事推理是序列幽默中最难的识别子任务
DarkHumor (黑色幽默检测) 准确率 (%) Qwen3-VL-8B-Thinking 66.43% Qwen2.5-VL-7B 47.37% 依赖隐含社会规范的识别仍未解决,最佳仅 66%
YesBut-v2 Title (标题选择) 准确率 (%) — 模型最佳 vs 人类 Qwen3.5-27B 83.28% 人类 97.50% 解释类任务模型—人类差距 14.22 个百分点
NYCC Caption (纽约客卡通字幕) 准确率 (%) — 模型最佳 vs 人类 GPT-4o 82.30% 人类 94.00% 解释类任务,差距 11.70
MemeQA Fill (梗图填空) 准确率 (%) — 模型最佳 vs 人类 Qwen3.5-35B-A3B 60.41% 人类 81.90% 解释类任务差距最大 21.49,核心瓶颈

局限与改进

作者明确承认两点局限。第一,综述与数据集偏重西方、互联网中心的视觉幽默形式(梗图、卡通),许多文化传统与非主流媒介未被充分覆盖;非英语/非西方视觉符号与幽默惯例存在系统性盲区。第二,多模态模型快速演进,部分观察未必能推广到未来架构或训练范式。我补充三点观察:(1)跨基准评测仅沿用各基准原始 prompt,未严格控制任务难度,支持的是基准内模型比较与描述性跨基准分析,而非严格受控比较;(2)Table 3 中部分开源模型异常低分(如 Gemma-4-31B-it 在 MangaUB 角色计数仅 12.85%、InternVL3.5-38B 在 HumorDB 仅 51.98%),更可能反映 prompt/格式兼容性而非真实能力,作为跨基准排名结论需谨慎;(3)人类上限数据仅部分任务可得且来自原始基准论文,跨基准的人类可比性同样存疑。

独立分析的弱点

独立分析指出三个可改进点。第一,跨基准评测缺乏统一的 prompt 与采样协议:各基准沿用原始 prompt,导致 Qwen3-VL-8B-Thinking 在 MangaUB NextInf 从 48.55% 骤降到 32.76% 这类异常难以归因(是推理过长干扰视觉匹配,还是格式/解析问题?)。改进方向是设计能力对齐的统一评测套件,固定采样温度、解码超参与输出解析。第二,能力层级是'能力'而非'机制'中心:识别/解释/生成的划分清晰,但未量化'同一机制(如不一致)在不同能力下的迁移',缺少机制级别的迁移实验。改进方向是构建机制标注矩阵,测同一幽默机制在三级能力下的表现相关性。第三,安全维度的评测缺失:综述强调梗图的双用途风险(同一系统既能写机智字幕也能生成骚扰/刻板印象内容),但 Table 3 完全没有安全/有害性任务(如 Hateful Memes),无法量化'幽默能力增强是否伴随有害内容生成风险'。改进方向是把 hateful meme 角色识别与攻击性检测作为第五评测维度。

未来方向

未来方向可从作者提出与成果延伸两条线索展开。作者明确的方向有四:(1)基于 rubric 的生成式评估,沿不一致检测、目标识别、文化接地等解耦维度评分,配合 LLM-as-judge 奖励合理新颖解释、惩罚无支撑或幻觉推理;(2)多元文化、分文化的基准,标注每项所需的背景知识,发展'幽默感知 RAG'检索社区规范、趋势话语与事件时间线,配以周期性知识刷新缓解时序衰减;(3)面板感知架构,显式编码面板顺序与跨帧实体共指,借鉴视频理解的时序注意力与状态追踪归纳偏置,并把铺垫—笑点分解作为显式训练目标;(4)跨能力层级联合训练(识别—解释—生成)与自洽性检查(评分好笑却解释平淡即诊断未真正理解)。基于成果可延伸的方向:(a)把 Thinking 变体的不一致表现做成'推理—视觉匹配'权衡的定量研究,识别哪些任务该用 CoT;(b)把生成质量作为理解能力的诊断探针,建立生成—解释相关性模型;(c)构建对齐—推理—检索—生成的统一基准,在同一制品上联合评测以回答 Figure 4d 的三个开放问题。

复现评估

作为综述,'复现'主要指跨基准评测的可复现性,整体中等偏好。论文报告了协议:每基准沿用原始 prompt 格式与任务定义、用官方评测划分;模型覆盖 Qwen2.5-VL-7B、LLaVA-OneVision-7B、Qwen3-VL-8B(-Thinking)、InternVL3.5 系列、Qwen3.5 系列、Gemma-4-31B-it、GPT-4o 共 11 个,均为公开 checkpoint/API。但有三处难点:(1)未公开评测代码、prompt 模板与原始预测,读者难以精确复现 Table 3 每个数字;(2)人类上限来自各原始基准论文,跨基准可比性有限;(3)部分模型异常低分(如 Gemma-4-31B-it 在 MangaUB 多子任务个位数)提示 prompt/格式适配可能未充分调试,建议把 Table 3 视为定性趋势(识别>解释、人类领先、排名碎片化)而非绝对排名。引用基准大多公开,算力门槛主要在 GPT-4o API 费用与批量推理成本。