C4:基于成语跨概念网络的创造性解码评测框架 Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding
用成语跨概念网络评测多模态模型的创造性解码能力。
前置知识
跨概念理解 (Cross-Concept Understanding)
指感知者从不显然相邻但有意义的概念关联中恢复出被编码意图含义的能力,是接受性创造力 (receptive creativity) 背后的核心认知操作。认知心理学的多种理论——创造性认知的生成性重组、联想理论的远距概念连接、结构映射的类比对齐、概念整合的部分共享输入空间——都把这种'连接非相邻概念并穿越其可解释关系'视为创造力的中心。论文把它形式化为两个方向:跨概念编码 (encoding,把源概念沿联想路径替换为可成像线索) 与跨概念解码 (decoding,观察者从线索反向恢复源概念)。
整个 C4 框架与评测目标都建立在这个概念之上。不理解'编码/解码'的方向性,就无法读懂任务设置 T1–T5 各自测量哪个环节,也无法理解作者为何用候选约束 (T3) 来分离'感知'与'开放答案空间搜索'两种失败。
成语 (Chengyu) 与跨概念网络
中文四字成语是一种固定书写形式的传统表达,其字符、片段、发音、所指对象和文化典故都可作为联想替换的锚点。C4 围绕成语构建了一个手工标注并经第三方评审的'跨概念网络':包含 47 个目标成语、168 个锚定槽位 (target slots)、758 条去重后的桥链 (bridge chains)。每条桥链 $b_{ij}: v_{ij}^0 \to v_{ij}^1 \to \dots \to v_{ij}^{m_{ij}} \mapsto c_{i,s(j)}$ 可穿越语音、词法、语义、对象、角色、整体-部分或文化联想,把可成像的替代概念连接回某个目标槽位。
成语同时满足'答案稳定 (固定书写形式)'与'内部结构支持丰富联想'两个条件,使创造性任务第一次可以做到精确打分。跨概念网络是整个编码组件与难度分层 (L1–L4) 的资源底座,不理解它就无法理解合成数据集是如何生成的。
多模态大语言模型 (MLLM)
能同时处理图像与文本 (乃至更多模态) 并输出回答的大型语言模型。论文评估了 10 个 MLLM,分为两类:API 型闭源模型 (GPT-5.5、Kimi-K2.6、Grok-4.3、MIMO-v2.5、Mistral-Large-3) 与本地开源模型 (GLM-4.1V-9B-Thinking、InternVL3.5-8B、Gemma3n-E4B-it、Nemotron-Nano-12B-v2-VL、Qwen3.5-9B)。本地模型用 vLLM 部署,运行在 A40、L40S、A100、H100 NVL、H200、RTX PRO 6000 Blackwell 等 GPU 上,统一采用 native-context、no-output-cap 策略。
MLLM 是被评测的对象,理解闭源/开源的分层、native-context 与 no-output-cap 等推理策略,才能正确解读 Table 2 中两类模型的差距 (最强闭源 50.7% vs 最强开源 18.1%),以及为何作者强调解析包装器 (reasoning wrapper) 对开源模型的影响。
桥路径与桥深度 (Bridge Paths and Depth)
桥路径是连接可见替代概念与目标槽位的有向联想序列,其长度 (步数) $m_{ij}$ 称为桥深度。编码时从槽位出发沿桥走到替代概念,求解者必须反向穿越。难度等级由桥数量 $|B_i|$ 与桥深度多重集 $M_i=\{m_{ij}\}$ 定义:L1 为 $|B_i|=1, M_i=\{1\}$;L2 为 $|B_i|=2, M_i=\{1,1\}$;L3 为 $|B_i|=2, M_i=\{1,\geq2\}$;L4 为 $|B_i|=2, M_i=\{\geq2,\geq2\}$。
桥数量与桥深度是论文中 RQ3 的核心变量。作者通过相邻等级恰好改变一个参数来分离'槽位数'与'桥深度'对难度的贡献,结论是槽位数主导难度 (L1→L2 的下降约为 L2→L3 的 3 倍)。不熟悉这两个量就无法理解 Figure 3 与 Figure 5 的难度曲线。
研究动机
多模态大语言模型 (MLLM) 在设计、教育、沟通与人机协作中的创造性能力日益重要,但对其进行评测却非常困难。与提供明确目标和直接奖励信号的准确性导向任务不同,创造性任务涉及新颖性、恰当性以及可能存在的多重合理解释,这使得建模目标难以刻画、可扩展评测难以构建。具体而言,现有创造力基准往往依赖多样性代理指标 (diversity proxies)、任务成功率或开放式人工评判,例如发散生成、横向思维 (BRAINTEASER、LatEval)、视觉幽默等;这些方式既不可复现也难以精确定位失败发生在视觉识别、关系推断还是答案空间搜索。与此同时,VQA、CLEVR、GQA、MME、MMMU、REBUS 等多模态基准把答案锚定在可见内容、组合关系、符号线索或领域知识上,却几乎没有系统考察过'从创造性地编码过的图像中恢复约定俗成的含义'这一接受性创造能力。结果是,跨概念理解这一创造力背后的核心认知能力,在当前多模态评测中长期处于盲区。
本文的目标是本文的具体目标是将'跨概念理解'操作化为可度量、可扩展的评测范式,并构造一个能精确定位 MLLM 创造性解码瓶颈的基准。作者希望:(1) 把跨概念理解形式化为编码 (encoding) 与解码 (decoding) 两个方向,让评测有明确的理论锚点;(2) 围绕手工标注并经第三方评审的成语跨概念网络,构建一套框架 C4,使每条替代概念都能追溯到人工撰写并评审过的联想路径,每个数据批次都带有显式的潜在结构、难度等级和精确答案;(3) 实例化为评测集 C4-Eval,包含 184 个合成项与 37 个人工创作的成语图,覆盖 84 个目标成语、884 个主要答题用例;(4) 在严格协议下评测 10 个 MLLM,围绕解码瓶颈、槽位数与桥深度、解释保真度与共性失败四类研究问题给出可复现的定量结论。
与已有工作不同的是,本文的独特切入角度是'用约定俗成的表达 (成语) 把创造性任务变成可精确打分的任务'。与依赖多样性代理或开放式评判的创造力基准不同,C4 既保留了文化根植的创造性联想 (语音、词法、语义、对象、角色、文化典故),又因为成语具有固定书写形式而获得精确答案与可检查的路径。与 REBUS 这类把答案锚定在可见内容或字符串操作的基准不同,C4 通过标注的桥路径把图像与目标间接关联,并保留潜在结构使其可被检视。更关键的是,作者首次把'接受性创造理解'用编码/解码框架与可复用的跨概念网络统一起来——网络只构建一次,之后所有合成编码都从中取样,每条路径立即可用于编码器,从而把认知心理学的创造性理论 (创造性认知、联想理论、结构映射、概念整合) 转化为结构化、可扩展的评测工程。
核心方法
C4 的整体思路是'先建一个可复用的跨概念网络,再从网络中按规则采样合成数据项',从而把创造力评测从一次性数据收集升级为可批量、可分层、可精确打分的工程。直觉上,一个创造性地编码过的图像对应一条成语,图像中出现的不是该成语的字面元素,而是沿联想桥替换后的替代概念;求解者必须先识别这些替代概念,再反向穿越桥路径恢复源成语。技术路线上,框架分三层:(1) 跨概念网络构建——两位标注者独立为每个目标成语标记槽位并向外联想建桥,再交叉核对并由第三方评审,得到 47 目标、168 槽位、758 桥链;(2) 跨概念编码——固定目标 $y_i$,选若干非重叠槽位,沿桥路径取替代概念,组合成替换短语后用图像生成器渲染为视觉线索,目标本身从不出现;(3) 任务实例化——把每项数据实例化为 T1–T5 五种任务设置,统一在严格精确匹配协议下评测。整个网络是可复用的编码资源,新增目标和桥路径后立即可被编码器使用。
核心创新点是'把跨概念理解操作化为编码/解码,并围绕一个人工标注评审过的成语跨概念网络来组织评测'。这与已有方法有本质区别:第一,传统创造力基准依赖多样性代理或任务成功,而 C4 因为成语书写形式固定而获得精确答案与可检查路径,使创造性任务首次可严格打分;第二,REBUS 等基准把答案锚定在可见内容或字符串操作,C4 则通过标注桥路径把图像与目标间接关联,并保留潜在结构使其可被检视,从而能把'视觉识别失败'与'解码失败'区分开;第三,网络只构建一次并复用,桥数量与桥深度 $M_i$ 直接把联想距离翻译为结构化难度等级 L1–L4,使每批数据都带显式潜在结构与精确答案,而不是逐项生成关联;第四,任务套件 T1–T5 通过改变支持程度 (图像/桥提示/候选集/解释) 系统分离感知、关系推断与开放答案空间搜索三种失败来源。
方法步骤详情
方法分四步。第一步跨概念网络构建:两位标注者独立为每个目标成语标记连续字符跨度作为候选槽位,从槽位向外联想写一步或多步桥链 (可穿越语音、词法、语义、对象、角色、整体-部分或文化联想);然后两套标注交叉核对并标记破坏语素结构与不可恢复的桥,再由第三方评审裁定修订,最终解析为成语锚定跨度、展平槽位、按目标-槽位-节点序列去重,保留来源。第二步跨概念编码:固定目标 $y_i$,选若干非重叠槽位,沿桥路径取可成像替代概念,写回槽位组成替换短语,再用场景描述提示图像生成器渲染视觉线索;每项记录哪些槽被替换、沿哪些路径、多深。难度由桥数量 $|B_i|$ 与桥深度多重集 $M_i=\{m_{ij}\}$ 定义 L1–L4:L1 为 $\{1\}$,L2 为 $\{1,1\}$,L3 为 $\{1,\geq2\}$,L4 为 $\{\geq2,\geq2\}$。编码同时施加概念非同一性 $V(I_i) \nRightarrow y_i^{\text{literal}}$ 与桥可恢复性 $V(I_i) \Rightarrow y_i$,防止答案塌缩为字面识别或任意。第三步任务实例化:每项实例化为 T1 (图像→成语)、T2 (图像+桥提示)、T3 (图像+四选一候选)、T4 (图像+JSON 解释)、T5 (图像+黄金答案→解释)。第四步评测:轻量归一化后严格精确匹配 $em(i,t)=1[\nu(\hat{y}_{i,t}^{(m)}) \in \{\nu(a):a \in A_i\}]$,主榜 $\text{Primary}(m)=\frac{1}{4N}\sum_{i,t} em(i,t)$,$N=221$,T5 因含答案不计入。
技术新颖性
技术新颖性可归为五点。第一,可复用网络范式:网络只建一次 (47 目标、168 槽位、758 桥),所有合成编码从中取样,新增路径立即可用,与逐项生成关联的常规做法形成对比。第二,编码/解码形式化:把跨概念理解拆成两个方向 (公式 1、2),桥 $b_{ij}: v_{ij}^0 \to \dots \to v_{ij}^{m_{ij}} \mapsto c_{i,s(j)}$ 把可见替代概念携带回目标槽位,编码正向、求解反向。第三,桥数量与桥深度作为结构化难度代理:相邻等级 L1→L2→L3→L4 恰好改变一个参数,使'槽位数 vs 桥深度'可定量比较 (RQ3 的实验基础)。第四,任务套件 T1–T5 的诊断价值:T3 折叠答案空间隔离搜索负担,T2 用桥提示隔离关系推断,T4/T5 配对隔离解释保真度,从而系统分离感知/关系推断/搜索三种失败来源。第五,精确打分与可检视路径使创造性任务首次可复现评测,并把'视觉识别失败'与'解码失败'区分开——这是 REBUS 等把答案锚定在可见内容的基准做不到的。
实验结果
核心发现围绕 RQ1–RQ4。RQ1 整体性能:Table 2 显示排行榜远未饱和,最强 GPT-5.5 主榜仅 50.7% (T1 35.7/T2 40.3/T3 87.3/T4 39.4),Kimi-K2.6 为 48.0%;闭源与开源形成两个明显梯队,最强开源 GLM-4.1V-9B 仅 18.1%,比最弱闭源 (Mistral-Large-3 13.5) 还低,规模与训练配方主导排名。RQ2 解码瓶颈:候选约束 T3 带来最显著提升,跨所有模型候选识别比 T1/T2/T4 均值高 17.3–56.0 个百分点 (Figure 4),桥提示 T2 增益很小;Table 3 显示'仅候选可解'的项占闭源模型 T3 成功的一半到多数,开源高达四分之三以上,说明视觉识别基本完好、关系推断在答案空间折叠后能浮现,开放答案空间搜索是主导瓶颈。RQ3 槽位 vs 桥深度:Figure 5 显示准确率从 L1→L2 急剧下降、L2→L3 中等下降、L3→L4 不再下降甚至略升;平均看 L1→L2 槽位跃迁造成的下降约为 L2→L3 深度跃迁的 3 倍,结论是槽位数主导难度。RQ4 解释保真度与共性失败:221 项中 83 项在三个开放设置下被所有模型全失败,6 项连候选提供后仍无解;Figure 6 的 $cǎo~mù~jiē~bīng$ 案例中 GPT-5.5 在 T4 正确恢复两条标注桥路径但 T5 遗漏了 monk→木鱼→wood 这条文化中介路径,证明'答案正确或 JSON 合法'并不能证明解释忠实;全失败项 '一叶障目→椰/岳母' 中所有强模型在候选下都选了共享叶字的干扰项 '叶公好龙',但 T5 给出答案后却能重建路径,证明失败是解码失败而非感知或知识缺口。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 主榜精确匹配 (Primary, T1–T4 均值) | 严格精确匹配后的主榜准确率 % | 10 个 MLLM 中最强 GPT-5.5=50.7, Kimi-K2.6=48.0 | 最强开源 GLM-4.1V-9B=18.1; 最弱 Mistral-Large-3=13.5, Qwen3.5-9B=9.2 | 闭源 vs 开源梯队差距达 32.6 个百分点,但即便最强模型仍错失约一半主要用例,远未饱和 |
| 候选约束提升 (T3 - T1/T2/T4 均值) | 百分点提升 (Figure 4) | 跨 10 模型提升 17.3–56.0 个百分点 | 桥提示 T2 提升很小 (例如 GPT-5.5 仅 +4.6, Kimi-K2.6 +6.8) | 候选约束是最大单一增益来源,证明开放答案空间搜索是主导瓶颈而非视觉感知 |
| 槽位数 vs 桥深度对难度的影响 (RQ3) | 平均准确率随等级的下降幅度 | L1→L2 下降幅度约为 L2→L3 的 3 倍 | L3→L4 几乎无进一步下降甚至略升 | 证明槽位数主导难度,首次多步路径后再加深不再带来可测难度 |
| 共性失败项统计 (RQ4) | 全模型失败项数 / 221 | 开放设置下 83/221 项全失败,候选提供后仍有 6 项无解 | T5 给出答案后强模型能重建路径 (如 椰/岳母 例) | 证明失败是解码失败而非感知或知识缺口,为'创造性解码'这一独立能力提供了直接证据 |
局限与改进
作者承认的与可观察到的局限主要有五点。其一,难度等级 L1–L4 仅适用于合成项,网络收集的人工图 (37 项) 难度还受视觉密度、艺术惯例、文化语境和创作者编码习惯影响,作者自己也说明这些等级描述的是合成构造参数而非真实认知难度。其二,相邻等级比较描述的是'与标注编码相关联的现象'而非受控因果效应,因为各等级桶包含不同目标和渲染图像。其三,桥标注存在主观性,尽管做了双标注交叉核对与第三方评审,桥的可恢复性判断仍依赖人工,可能引入标注偏差。其四,评测局限于中文成语这一文化特定载体,跨语言、跨文化泛化能力未验证。其五,严格精确匹配评分较苛刻 (别名集合虽被评分器支持但未被使用),可能低估模型部分正确的能力。可观察到的局限还包括:未报告人类基线、合成图像生成质量可能引入泄漏或失败风险、网络仅覆盖 47 个目标成语规模有限。
独立分析的弱点
独立分析后,以下弱点值得改进。第一,评测载体仅限中文成语,跨文化泛化能力不明——改进方向是把跨概念网络扩展到英文习语、谚语、歇后语、多语言字谜等约定俗成表达,并设计跨语言对照实验验证'解码创造性编码含义'是否是语言无关的能力。第二,跨概念网络仅覆盖 47 个目标成语与 758 条桥,规模偏小且集中在常见成语,长尾成语与多义桥 (一条桥同时服务多个槽位) 的覆盖不足——改进方向是用 LLM 辅助标注+人工评审的半自动流程把网络扩到上千目标。第三,严格精确匹配且别名集合未启用,对部分正确或同义成语过于严苛——改进方向是引入语义等价评分 (如嵌入相似度阈值) 或多答案别名集,更贴近真实创造性任务。第四,未报告人类基线,无法判断 50.7% 究竟离人类天花板多远——改进方向是招募母语者做 T1–T5 并报告人类分数与 95% 置信区间。第五,合成图像依赖外部生成器,可能泄漏黄金成语或渲染失败——改进方向是把生成质量控制、泄漏检测纳入流水线并报告泄漏率。第六,T2 桥提示增益很小但作者未深入分析原因,可能是提示太泛或模型未学会利用——改进方向是做 T2 提示的消融与少样本变体。
未来方向
作者在结论中提出的隐含方向是把 C4 作为'可扩展、可结构化评估 MLLM 跨概念解码创造力的基础'。基于此可延伸四条值得研究的方向。(1) 网络与载体扩展:把跨概念网络从成语扩展到其他约定俗成表达 (英文习语、谚语、字谜、Logo 隐喻),并构建跨语言对照基准,验证解码创造力的语言无关性与迁移性。(2) 可解释性诊断闭环:把 T5 解释保真度分析自动化,开发一个能定量判定'模型是否真的重建了标注桥路径'的评分器,从而把'答案对但解释错'这类隐性失败从案例分析升级为榜单指标。(3) 干预性研究:基于 RQ2 的'搜索是瓶颈'结论,设计受控干预——如在解码阶段注入候选集、在推理阶段注入桥提示前缀——以因果性地分离感知、关系推断与搜索三阶段,而非仅靠任务设置的相关性比较。(4) 训练数据合成:把跨概念编码组件反过来用作数据增广工具,为 MLLM 生成大量带标注桥路径的创造性地编码样本,用于微调以提升接受性创造力,并验证这种'解码训练'能否迁移到开放式生成任务。
复现评估
复现评估分四方面。开源情况:论文摘要末提到'Release details are provided in the appendix',数据集与标注预期会发布,但正文未给出仓库链接与许可证;C4-Eval 的 221 项 (184 合成 + 37 人工图) 与跨概念网络 (47 目标/168 槽位/758 桥) 是复现核心资源,需等附录公开。数据可获得性:标注全为人工 (双标注交叉核对+第三方评审),桥路径与推理过程均经人工构造评审,人工成本较高、难快速复制,但发布后可直接使用。模型可获得性:API 型 (GPT-5.5、Kimi-K2.6、Grok-4.3、MIMO-v2.5、Mistral-Large-3) 走商业 API;开源型 (GLM-4.1V-9B、InternVL3.5-8B、Gemma3n-E4B-it、Nemotron-Nano-12B、Qwen3.5-9B) 均公开,本地用 vLLM 部署在 A40/L40S/A100/H100/H200/RTX PRO 6000 上,native-context、no-output-cap 策略,中等团队可承担。复现难度:协议明确 (固定提示与解析器、严格精确匹配公式),主榜分数可直接复算;主要不确定性在于合成图像生成器细节与开源模型 reasoning wrapper 的最终答案抽取策略,需待附录与代码公开后才能完全锁定。
论文图表
用一个'苹果'例子展示跨概念编码与解码。一个传播者把源概念'苹果 (apple)'沿不同的联想路径投射为间接概念:通过 Newton(牛顿)→gravity(重力)、orchard(果园)→fruit(水果)→nutrition(营养) 等路径,把苹果编码为一组可成像却与源概念表面不相似的线索。观察者整合这些线索并反向解码出潜在的源概念。红色水果与物理学家表面无相似性,却通过苹果这一众所周知的轶事被连接起来。
这张图是整篇论文的直觉入口,用最朴素的可视化讲清楚'跨概念编码/解码'两个方向,读者必须先理解这张图才能进入后续的网络构建、难度分层与任务设计。没有它,'创造性解码'这一核心概念对没有认知心理学背景的读者会非常抽象。
对目标'草木皆兵 (every bush and tree looks like an enemy)'做 T4–T5 配对诊断。共享的视觉证据是草莓(草 homophone)、和尚、士兵头盔。标注的 L3 桥路径:草莓→草(一步)、和尚→木鱼→木(两步,文化中介)。诊断结论:T4 与 T5 在视觉线索层均匹配 (识别出草莓/和尚/头盔),但桥路径层 T4 正确重建两条路径而 T5 遗漏了和尚→木鱼→木这条文化路径,错误地把草莓直接映射到'草木'。失败被定位到'桥链接'这一解码步骤。
这是 RQ4'解释保真度'最有力的案例证据,说明即便模型在 T4 能正确恢复答案与路径,T5 在已知答案下仍可能解释失真,从而证明'答案字段正确或 JSON 合法并不能证明解释忠实',对评估 MLLM 真实理解能力有方法论警示意义。