← 返回 2026-07-23

ENTRAP-VL:视觉语言模型双模态上下文牵引的分类探针数据集 ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani 📅 2026-07-22 👍 2 2026-07-28 18:30
上下文牵引 可解释性 探针数据集 知识冲突 视觉语言模型 鲁棒性

提出双模态上下文牵引分类法与1500条数据集,作为VLM牵引效应诊断工具。

前置知识

上下文牵引 (Contextual Entrainment)

指模型在生成时倾向于让输入中的辅助上下文把输出“拽”过去,与该上下文是否相关、是否真实甚至是否有意义都无关。这一现象由 Niu et al. [15] 在单模态语言模型上给出机制性刻画:模型会对先前出现在上下文中的 token 系统性地赋予更高概率,即便这些 token 是随机的或反事实的;他们还把效应定位到一组“牵引头”(entrainment heads),消融这些头可减弱该效应。它区别于依赖先观察模式再补全的 induction heads,因为牵引会提升任何上下文中出现过的 token 的再出现概率。

整篇论文的核心概念就是 entrainment。若不理解“上下文会独立于相关性把输出拽过去”这一机制,就无法理解作者为何坚持要用专门的双模态工具来研究它,也无法区分本文与一般的视觉干扰/知识冲突研究。

视觉语言模型 (Vision-Language Models, VLMs)

同时以文本和图像为输入、跨两条通道联合条件化输出的多模态模型,常见于视觉问答(VQA)、检索增强生成(RAG-VQA)等场景。在 RAG-VQA 中,输入会被检索到的段落、caption 或辅助图像所丰富,初衷是“多给上下文有助于回答”,但同一机制也制造了失败面:注入内容可能以非预期方式影响生成。与单模态 LLM 不同,VLM 通过视觉编码器和文本编码器分别接入两类辅助上下文,这是本文“双模态牵引”论证的物理基础。

论文的全部论证都建立在“VLM 有文本与视觉两条独立通道、各自都能产生牵引”这一前提上。不理解 VLM 的双通道结构,就无法理解作者为何把 entrainment 视为 dual 现象,以及为何视觉流只有 3 个条件而文本流有 8 个。

知识冲突与干扰 (Knowledge Conflict / Distraction)

一条并行研究线关注当注入上下文与模型参数知识相左时会发生什么,被 Xu et al. [23] 归纳为 context-memory、inter-context、intra-memory 三类冲突。RAG 鲁棒性基准把检索内容拆成相关、无关、反事实噪声,并发现反事实段落破坏性最大 [2,4];context-aware decoding [20] 则用“有无上下文”两种分布的对比来控制对注入材料的依赖。但这些工作都是单模态且仅以世界知识为参照——一条上下文非真即假,没有感知参照物,这与本文提出的 contradictory 级别形成本质区别。

本文的多模态知识冲突相关工作(Zhu et al. [24]、Liu et al. [13])是其 related work 的核心对照。理解这些工作的“世界知识二分法”局限,才能看懂作者为何要引入 scene-relative 的三值 veracity 区分。

研究动机

上下文牵引(contextual entrainment)在单模态语言模型上已被识别并获得机制性解释,但在视觉语言模型中几乎无人系统考察,领域也缺乏专门工具去研究它。问题背景是真实部署中的 RAG-VQA 场景:模型输入被检索段落、caption、辅助图像所丰富,本意是“多给上下文有助于回答”,但同一机制制造了失败面——注入内容会以非预期方式把生成拽离正确答案。已有的相邻工作各有盲区:视觉干扰研究(Sharma et al. [18])只测量无关视觉上下文带来的精度对数衰减;VLM 机制可解释性(Golovanevsky et al. [5]、Wang et al. [21])只定位执行检测/抑制功能的注意力头;多模态知识冲突(Zhu et al. [24])只关注视觉与语言组件间的冲突。这些工作测量的是“相邻但不同”的现象,且都没有一个按分类学组织、双模态的专门工具来直接提出牵引问题。而 Niu et al. [15] 在 LLM 上用的四分类(related/irrelevant/random/counterfactual)是模板化、单模态的,无法干净迁移到多模态设定。

本文的目标是本文的目标不是去测量某个具体 VLM 是否存在牵引,而是明确地提供一件“工具”:一套目的构建的、按分类学组织的、双模态的探针数据集 ENTRAP-VL(Entrainment Assessment Probe for Vision and Language),使社区能够以受控、分类清晰的方式直接对 VLM 提出牵引问题。作者刻意不报告任何模型结果、不声称任何机制或规模结论——这是 by design 的。具体目标包括:贡献一个 position 论证(VLM 牵引是独特的 dual 现象)、一套双模态牵引分类学(八个上下文条件跨两轴)、一个 1,500 条人工标注的数据集(含 800 条文本牵引流 + 700 条视觉牵引流),以及一套评估协议,说明如何用该工具做受控测量、跨条件比较并回答“文本牵引与视觉牵引是否程度相当”这一核心跨流问题。

与已有工作不同的是,本文的独特切入角度有三条,皆无法通过“把文本基准搬成多模态”实现。第一,牵引在多模态下是 plausibly dual:视觉上下文与文本上下文是结构上不同的两个牵引源,经不同编码器进入模型,是“两个独立源”而非“一个源两种伪装”,单模态设定无此对偶性,单纯加图也捕捉不到。第二,感知接地(perceptual grounding)开启了一个单模态世界知识框架下不存在的 veracity 区分——contradictory 级别(对本场景为假但在世界中可能为真,如对“写着 welcome 的门垫”说“门垫写着 departure”)。第三,捕获这些区分必须靠人工、逐项感知的标注,因为不存在“与本图相矛盾的陈述”的模板:矛盾与否取决于这张具体图显示什么,关联性也必须以本场景而非物品类别为参照(论文用 Taj Mahal 物品说明:kite 比 cat 对“飞行的生物”更 relatable,尽管 cat 在类别上更靠近 birds)。

核心方法

方法的整体直觉是:把牵引问题做成两个互为镜像的流,每条流固定一个模态、变动另一个模态作为“伴随变量”,并按双轴分类学组织所有上下文条件。技术路线是手工构建而非模板生成。两条轴分别是 Association(relatable 关联场景 / random 无关)与 Veracity(true 真 / contradictory 对场景假但对世界可能 / counterfactual 对世界假)。文本牵引流固定图像与文本查询、注入八种文本条件;视觉牵引流固定文本查询、注入三种图像条件。数据集共 1,500 条,跨 8 个类别(creatures、electronics、fruits、household_objects、humans、monuments、natural_landscapes、vehicles),类别仅为组织用途,不约束查询类型或关联关系。文本流每类 100 条共 800 条,视觉流去掉 humans 类后每类 100 条共 700 条。每个条件配 3 条语句,文本流因此有 $800 \times 8 \times 3 = 19200$ 次 context-injection,远超条目数所暗示的测量数;三语句设计还支持通过 item 内方差做 item 级别的可靠性估计。

核心创新点是 contradictory 这一 veracity 级别,以及它所立足的“场景作为参照物”思想。在没有场景的单模态设定里,一条陈述相对世界知识非真即假,假的即为 counterfactual,没有第三种。而一旦有感知场景,就出现了一个“对本场景为假、但对世界中某处可能为真”的状态——作者用写着 welcome 的门垫说明:“门垫写着 departure”对本场景为假,但对某个门垫来说是再普通不过的事,它既非真(对所示场景)也非 counterfactual(对世界),而是 contradictory。这一区分是感知接地的 native 产物:矛盾判定的根基在感知而非先前句子(用文字描述场景只能复刻 consistency 测试,无法复刻“注入上下文能否覆盖所见”)。作者因此把主张限制在可辩护的形式:contradictory 条件是感知接地的 native 条件,在单模态世界知识框架中无对应物。八条件中有四条对 Niu et al. [15] 是全新(relatable_true、relatable_contradictory、relatable_distractor_short、random_counterfactual)。

方法步骤详情

构建流程可分为若干步。第一步是确定类别与物品:选定 8 个类别,每类 100 条,物品跨度涵盖活动识别、属性识别、图中文字读取、偶发场景元素检测、计数等多种查询类型——这种多样性是手工标注的属性而非分类学轴线。第二步是文本流构建(800 条):每条含一张图、文本查询、长短两种 ground-truth 答案,以及八个上下文条件,每条件 3 条语句。八条件为 relatable_true(与场景一致且不竞争答案的真陈述)、relatable_contradictory(对本场景假但世界中可能,如“床是玻璃做的”)、relatable_distractor(关联场景实体作为类别的通用真陈述,如“台灯提供环境照明”)、random_distractor(无场景关联实体的通用真陈述,如“水在 100°C 沸腾”)、relatable_counterfactual(涉及所示场景的世界级假陈述,如“狗不会吠”)、random_counterfactual(无关联实体的世界级假陈述,如“电动车会飞”)、relatable_distractor_short(relatable-distractor 家族的裸实体名,如“台灯”)、random_distractor_short(random-distractor 家族的裸实体名)。短形式只限定于两个 distractor 条件,用于纯化关联性探针与“句式脚手架 vs 裸词”的形式对比。第三步是视觉流构建(700 条,去 humans):每条含文本查询(答案为世界知识)与三张候选图——relatable_true(答案实体图)、relatable_distractor(部分满足查询语义描述符的实体图,如大象查询对应犀牛而非山羊)、random_distractor(不满足语义描述符的实体图,如卡车)。第四步是 curation 不变量:每个短触发器被构造为与答案不同(避免触发器碰巧等于正确答案而使牵引不可归因),视觉流还要求干扰实体名与答案无 subword 重叠(用 mango 而非 pineapple 作 apple 的干扰)并尽量在同 item 三图间做色调匹配。第五步是 provenance:文本流完全人工撰写无生成辅助,视觉流查询提示用 LLM 辅助生成后人工审校,图像取自 Unsplash/Pexels/Pixabay 免版税库并验证无水印。最终 release 附带 schema、分类学文档与 data statement。

技术新颖性

技术新颖性可归纳为相对 Niu et al. [15] 的三维升级。在模态上,先前工作只研究单文本通道(LLM),本文把牵引视为 dual(VLM),文本流与视觉流互为镜像、关联性参照点不同(文本流以所示图像为参照,视觉流以文本查询为参照)。在构造上,先前工作用模板化提示,本文用人工逐项标注——这是构建 contradictory 条件的硬要求,因为“与本图矛盾的陈述”无法模板生成。在分类学上,先前工作用 4 个上下文类型,本文文本流用 8 个,其中 4 个直接对应、1 个“最近”对应(relatable_counterfactual 锚定所示场景而非相关邻实体)、4 个全新(Table 1)。更深的创新是场景相对的 veracity 三分把单模态的“真/假”二分扩展为“真/对本场景假但对世界可能/对世界假”,contradictory 这一中间级别在单模态下塌缩为不存在。此外,视觉流八到三的约减是分类学对图像约束的诚实推论:图像是感知参照物而非命题,veracity 轴不适用,因此视觉流只 instantiate 关联轴且所有三条件都是候选牵引条件(连 relatable_true 也可能因模型对图中非答案特征的固着而产生牵引)。

Three items from the visual stream, one per row, showing the three image conditions.
Figure 2: Three items from the visual stream, one per row, showing the three image conditions.

实验结果

必须首先强调:本文按设计不报告任何模型结果——它是一件 instrument/resource 而非 leaderboard 或 accuracy benchmark。因此“发现”全部是关于工具本身的设计属性与它所支持的协议,而非具体 VLM 的牵引数值。关键量化属性如下:数据集共 1,500 条,跨 8 个类别;文本牵引流 800 条(每类 100),每条配 8 个上下文条件、每条件 3 条语句,故全协议产生 $800 \times 8 \times 3 = 19200$ 次 context-injection,远多于条目数暗示的测量数;视觉牵引流 700 条(去 humans 后 7 类每类 100),每条配 3 个图像条件。论文在 Section 6 详细说明工具能支持的协议:在文本流,把固定图像与文本查询连同每种注入条件喂入模型,把其回答与无注入上下文时的回答及 ground truth 比较,向注入内容偏移即为 Textual Entrainment 信号;在视觉流,固定文本查询、轮流提供三张候选图,由于答案是世界知识、不依赖图像,参考基准是模型对该查询的无图回答,任何图像条件下的偏离即为 Visual Entrainment 信号。作者强调视觉流三条件都是候选牵引条件而非仅两个 distractor——relatable_true 在模型对图中非答案特征固着时也能产生牵引。工具支持的核心跨流比较是:同一模型内,文本牵引与视觉牵引是否程度相当,这是 Section 3 dual 论证的经验版本,在先前单通道工作中无先例。

Correspondence between the four context types of Niu et al. [15] and the eight conditions of ENTRAP-VL with respect to the textual entrainment.
Table 1: Correspondence between the four context types of Niu et al. [15] and the eight conditions of ENTRAP-VL with respect to the textual entrainment.

局限与改进

作者自陈的限制集中在三方面。第一是规模与语言:1,500 条是有焦点的诊断工具而非大规模基准,且仅英语;三语句设计在 item 级别缓解规模但无法替代规模,类别与物品选择反映标注者直觉与图像可得性,可能带有固有选择偏差,结果应读作对数据集所 instantiate 的具体条件的证据,而非对所有可能查询/图像/上下文的总体估计。第二是标注主观性与验证:关联性、局部 vs 全局虚假、干净 distractor 的判断由共同作者做出、由 lead 复审;release 会检查结构不变量(schema 完整性、分辨率、水印、标识唯一性、短触发器与答案不相交),但视觉流的两个 confound-reduction 目标(干扰名与答案词汇不相交、item 内色调匹配)是在图像可得性约束下追求的,需要严格控制的用户应自行核验。第三是人脸隐私:humans 类含真实人物图像,查询只回答可观察事物(动作、可见物理状态、由可见线索指示的职业),不做识别或推断受保护/内在属性;该类被完全排除出视觉流,因为为人构造视觉 distractor 需额外配对可识别人物的图像,会引发同意与识别问题。我自己的观察是:作者未提供任何示范性牵引测量来“证明”工具能用,读者只能凭分类学论证信任其诊断价值,这在一定程度上削弱了 position 的说服力。

独立分析的弱点

独立分析的主要弱点有三。第一,工具的“有效性”缺乏任何示范性证据:作者从设计上拒报模型结果,这虽保住了 instrument 的中立性,但也使读者无法判断八条件是否真能在主流 VLM(如 GPT-4V、Gemini、开源 LLaVA)上产生可区分的牵引信号——一个简单的前导实验(例如在某开源 VLM 上测量各条件下答案 token 概率偏移)能极大增强 position。改进方向:随 release 附一份小规模 pilot study。第二,规模偏小且类目不平衡:文本流 800 条虽因三语句放大到 19,200 injection,但 item 级别只有 800,且 8 类每类仅 100,难以做细粒度按类别×条件交叉统计;视觉流 700 条且无 humans,更受限。改进方向:利用分类学可扩展性做众包扩样或多语种扩展。第三,contradictory 条件的“世界中可能为真”判定依赖标注者直觉,存在主观性与可复现性风险——不同标注者对何为“世界可能”可能不一致。改进方向:为每个 contradictory 陈述附上多标注者一致性(如 Cohen's κ)。此外,视觉流把 relatable_true 也列为候选牵引条件,理论上合理但实践中如何把“固着非答案特征”的牵引与噪声分离,论文未给出实操判据。

未来方向

作者明确提到的方向是多语种扩展与更大规模变体,认为分类学原则上支持这些延伸并视为有价值的后续。基于成果可延伸的方向包括:第一,用工具系统测量主流开源/闭源 VLM 的文本流与视觉流牵引,回答“双模态牵引是否程度相当”这一核心跨流问题,并验证 contradictory 是否确实比 counterfactual 产生更强或更弱的牵引(单模态上 Niu et al. 报告 counterfactual 比 factual 拉力更强,多模态下是否仍成立待验)。第二,做条件交叉实验:在同一 item 上同时注入文本与视觉 context,研究双通道牵引是否存在交互或抵消效应——这是 dual 论证最深层的经验检验,但需新协议扩展。第三,机制延伸:把 Niu et al. 的“牵引头”定位思路移植到 VLM,找出分别处理文本牵引与视觉牵引的头,并验证消融效果是否按模态独立。第四,把工具与 context-aware decoding [20] 的有无上下文分布对比结合,评估该解码策略能否在多模态下按模态独立控制牵引。第五,把数据集用于检测 VLM 的语言先验与 sycophancy,与 VLind-Bench [9]、Li et al. [10] 的工作交叉验证。

复现评估

复现性整体良好但有保留。数据将公开发布于 https://huggingface.co/datasets/goyalkaraniit/ENTRAP-VL,附带 schema、分类学文档、provenance 文档与 data statement。文本流完全人工撰写无生成辅助,可逐条核验;视觉流查询提示用 LLM 辅助生成后人工审校,图像取自 Unsplash/Pexels/Pixabay 免版税库并验证无水印——这些图像库的免版税性质降低了第三方复现的法律摩擦。算力成本几乎为零:本文不训练任何模型、不跑任何实验,纯粹的标注与论证工作,任何研究者拿到数据集即可立即在自己的 VLM 上跑协议。主要的复现不确定性在于:(1)contradictory 与 relatable 的判定依赖标注者主观,替代标注者未必能复现相同判断,作者承诺随 release 提供分类学规范以便他人扩展或复现,但具体一致性指标未报告;(2)图像可得性约束可能使完全复现某个 item 的三张图困难;(3)截至当前日期,数据集尚未实际公开(论文称“将公开”),需确认实际 release 状态。