SIGNPOST-Bench:多模态大语言模型的图文冲突消解基准 SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
用视觉地理定位评测多模态大模型在图文冲突中如何取舍的对照事实基准
前置知识
视觉地理定位 (Visual Geolocation)
给定一张照片预测其拍摄经纬度的任务,输出是连续的二维坐标 $(\hat{\text{lat}}, \hat{\text{lon}})$,误差用 haversine 大地距离 $D(\cdot,\cdot)$ 衡量(单位 km)。从早期的 IM2GPS、PlaNet、GeoCLIP 到 PIGEON,方法把图像视觉外观(建筑、植被、路网)映射到地理坐标。
本文选它作为评测载体,正因为输出是连续的、误差有地理含义(282km 与 1347km 是质的差别),才能把『退化幅度』和『方向性漂移』区分开。
对照事实五元组 (Counterfactual Quintuplet)
同一张原始场景衍生出的五种文本条件变体:Original(原图)、Blank(擦除选中文字)、Similar(同区域/同语言兼容替换)、Random(异语言无关替换)、Adversarial(来自另一大洲的真实地名,构成地理冲突)。五张图共享非文字内容,便于在场景内做配对比较。
这是整个基准的核心实验单元,理解了五元组的设计才能看懂 TBS、TFR、TDR 三个度量为何能做到『干净对照』。
场景文字与排版攻击 (Scene Text / Typographic Attack)
图像中的可读文字(招牌、路牌、地址)既是视觉模式又是语言信号。Goh 等人发现把类别名写在图像上可覆盖 CLIP 的视觉识别(typographic attack);后续工作发现场景文字、物体、动作识别之间存在系统性任务竞争。
本文正是研究『当场景文字与视觉上下文冲突时,模型相信谁』,需要先理解场景文字为何能反过来支配视觉判断。
多模态证据仲裁 (Multimodal Evidence Arbitration)
当视觉线索(建筑风格、植被、路况)和文字线索(招牌、地址)指向不同结论时,模型必须决定信任哪一方。自然场景中两者常常一致,但在跨国连锁、搬迁招牌、植入文字等情形下会出现矛盾。
本文把这种『仲裁』形式化到连续坐标空间,是读懂动机和方法的关键视角。
加权定位准确率 WLA
用指数衰减 $\text{WLA}=\exp(-\alpha d)$ 把地理误差 $d$ 压缩到 $[0,1]$,$\alpha=0.005$ 时误差 138km 衰减到 0.5、1000km 衰减到 0.01,作为定位质量的主指标。
WLA 是所有度量(C、R、MCRS)的基础,$\alpha$ 的取值会影响绝对分数,附录验证了不同 $\alpha$ 不改变相对排名。
研究动机
多模态大语言模型(MLLM)在真实场景中常常同时依赖视觉上下文和场景文字(招牌、地址、店名等)来做定位判断。当视觉证据和文字证据一致时,两者联合能提升识别;但当它们冲突时,模型必须决定信任哪一方——而这恰恰是现有评测几乎不触及的盲区。具体而言,已有基准(OCR、视觉识别、幻觉评测、地理定位等)大多只报告最终预测,没有揭示『到底是哪一种证据源驱动了结果』。最近的 ConText-VQA 和 RIO-Bench 开始考察文字提示如何误导模型,但它们只通过离散的分类或 VQA 结果来评判冲突,无法在同一场景内同时比较『兼容、无关、冲突』三类文字替换的影响,更无法在共享的连续输出空间里量化预测漂移的『幅度』和『方向』。一个直接后果是:模型在干净输入上定位准确,并不代表它在面对矛盾文字时还能稳健地拒绝错误线索——这种『能力≠鲁棒性』的鸿沟长期被掩盖。
本文的目标是本文要构建一个可控、能精确刻画 MLLM 图文冲突行为的基准,具体目标有三。其一,把图文冲突消解形式化到一个连续的坐标空间,从而不仅能测出『定位变差了多少』,还能测出『预测是否被对抗文字直接拽向注入的目标地点』,这是任何离散分类任务做不到的。其二,设计一个配对的五条件对照事实方案(Original/Blank/Similar/Random/Adversarial),通过局部编辑保证非文字内容在变体间基本不变,从而把『通用定位退化』和『冲突文字引发的方向性漂移』干净地区分开。其三,跨 7 家厂商 20 个 MLLM 进行约 51 万次评测,揭示『干净输入能力』与『冲突鲁棒性』之间的差异,并测试冲突感知提示(conflict-aware prompting)是否真能修复这一缺陷。
与已有工作不同的是,本文的独特切入角度在于选择『视觉地理定位』作为载体——因为它的输出是连续坐标、误差具有地理含义(282km 和 1347km 是质的差别,而不只是数字大小)。已有地理定位方法(PlaNet、GeoCLIP、StreetCLIP、PIGEON 等)把每张图当作单一视觉输入,无法分离『可读场景文字』与『周边视觉上下文』各自的贡献;而已有的图文冲突评测(ConText-VQA、RIO-Bench)用离散分类任务,丢失了方向性信息。SIGNPOST-Bench 抓住的正是这个被忽视的缝隙:通过局部、保留非文字内容的场景文字编辑,在同一场景、同一坐标系里同时度量『兼容/无关/冲突』三类文字的影响方向和幅度,从而把模糊的『模型被文字带偏了』变成可量化的 TBS、TFR、TDR 三个连续指标。
核心方法
直觉上说,SIGNPOST-Bench 像是一组『受控的双盲实验』:拿同一张照片,只改里面可读的文字(招牌、路牌、地址),分别换成『兼容的相似文字』『无关的随机文字』『指向另一大洲的对抗文字』,再加上『原始』和『擦除文字』两个基准,共五种条件;然后用同一个 MLLM 配同一个提示『这张照片在哪里拍的?给出经纬度』依次跑这五张图,比较它的预测坐标如何变化。技术路线上,给定图像 $I$ 和模型 $f: I \to \mathbb{R}^2$ 预测 $(\hat{\text{lat}}, \hat{\text{lon}})$,用 haversine 大地距离 $D(\cdot,\cdot)$ 衡量误差 $D(f(I), y_{gt})$;一个对照事实组(counterfactual group)由同一原始场景衍生出的五张匹配图像构成,对它们分别跑模型,就能在场景内做配对比较,把文字诱发的预测变化从模型自身的随机性中隔离出来。最终得到 5,111 个组、25,555 张变体,覆盖 4 个数据集。
核心创新在于:用连续的地理坐标空间来定义图文冲突,从而把『退化』和『方向性漂移』拆开。已有评测只能告诉你『模型答错了』,却分不清是『随机地变差』还是『被对抗文字精准地拽向注入的目标城市』。SIGNPOST-Bench 借助 Adversarial 注入的真实地名(经 Nominatim 地理编码得到目标坐标 $y_{trap}$),定义了 Trap-Fit Rate(TFR,预测落在距注入目标 50km 内的比例)和 Trap Distance Reduction(TDR,相对 Blank 基线靠近目标的距离),直接回答『模型是否被文字牵着鼻子走』。同时把 Blank 作为『擦除文字』的对照基线,Text Bias Score $\text{TBS}_k = D(f(I_k), y_{gt}) - D(f(I_{blank}), y_{gt})$ 能干净地量出『编辑文字』相对『无文字』额外引入的误差。这套设计让『能力(Capability $C$)』和『鲁棒性(Robustness $R$)』成为可分离的两条独立维度,而非单一排行榜能概括。
方法步骤详情
完整流程分四个阶段。第一步『数据采集与 OCR 筛选』:从 IM2GPS3K、YFCC4K(带地理标签网络照片)和 GoogleSV、BaiduSV(国际/中国街景)四个来源获得 889,093 张原始图像;用 EasyOCR 检测可读场景文字,全景图投影为 0/90/180/270 度四个朝向并取检测最多的视角,置信度低于 0.3 丢弃,最终保留含至少 2 字符有效字符串的 5,478 张。第二步『文本替换生成』:用 Gemini-3.1-Flash-Lite 为每张图选出至多 3 个地理信息丰富的文字 span,并为每个 span 生成 Similar、Random、Adversarial(另一大洲真实地名)三种替换;若源数据带地理元信息会注入提示以保证 Adversarial 文字与真值冲突,但此信息永不出现在被测模型面前。第三步『对抗目标地理编码』:把 Adversarial 地名通过 Nominatim/OpenStreetMap API 解析为坐标 $y_{trap}$,1,732 组(33.9%)获有效目标,其余仍保留但排除出 TFR/TDR。第四步『对照事实合成』:用 Qwen-Image-Edit-2509 配 ComfyUI 做局部编辑——Blank 删除选中文字、其余条件渲染对应替换——输入约 100 万像素、Lanczos、Lightning LoRA 四步推理,刻意保留周边非文字内容;最终得 5,111 组、25,555 张变体、10,084 个文字 span,按 T1/T2/T3 三级分类做分层分析。
技术新颖性
技术新颖性体现在三方面。其一,相对已有地理定位工作(PlaNet、GeoCLIP、PIGEON 等把整图当单一输入),SIGNPOST-Bench 通过局部文字编辑首次分离了『场景文字』与『周边视觉』各自的贡献——Blank 擦除基线让 TBS 能量出文字单独的边际影响。其二,相对 ConText-VQA/RIO-Bench 这类用离散 VQA 结果的冲突评测,本文把输出放到连续坐标空间,能度量方向性(TDR)和命中注入目标的频率(TFR),而不只是『答对/答错』;TBS 与 TFR 高度相关(Spearman $\rho=0.836, p<0.001$)也验证了这套连续度量的内部一致性。其三,五元组设计(尤其 Similar 兼容对照)让作者能证明模型确实在响应文字与场景的语义关系——Similar 的平均 TBS 在所有数据集上为负(替换文字反而让定位更准 379km),而不是无差别地被任何文字干扰,这是任何单条件评测无法揭示的。
实验结果
核心发现可归纳为五组。其一『冲突文字显著拉胯定位』:Adversarial 让平均 WLA 从 47.11 跌到 29.89(相对降 36.6%),中位误差从 282km 飙到 1,347km(4.8 倍);Acc@25/200/750 从 34.9%/50.1%/71.6% 掉到 20.6%/31.8%/50.1%;误差超 2,500km 的比例从 11.7% 升到 31.7%;80 个『模型×数据集』单元中 79 个 WLA 下降。其二『三类替换可区分』:Similar 平均降低误差 379km(TBS 为负),Random 增加 959km、Adversarial 增加 1,577km;Original WLA 普遍高于 Blank(均值差 9.40 分),证明原生场景文字确有地理信号;T3(地理特异)图像 Original WLA 最高(59.65)但对抗跌幅也最大(25.14 分,相对 42.2%)。其三『方向性漂移真实存在』:1,732 组可地理编码子集上 TFR 从 6.5%(Gemini-2.5-Pro)到 20.1%(Claude-Haiku-4.5);每模型平均配对 TDR 均为正(343–1,926km),但『吸引率』仅 44.5–60.6%,是少数大幅定向漂移拉高了均值。其四『能力与鲁棒性可分离』:Qwen3-VL-30B 的 $C$ 仅 36.55 但 $R$ 高达 80.05(鲁棒第 4),而 Seed-2.0-Pro $C$=55.01 却 $R$=71.21;MCRS 前三为 Gemini-3-Flash(72.70)、Gemini-3.1-Pro(72.23)、Gemini-2.5-Pro(69.80)。其五『提示工程不能可靠修复』:Gemini-2.5-Flash 与 GPT-4o-mini 的 CDA 仅 14.2% 和 32.8%,防御提示把前者提到 49.0% 却把后者降到 19.3%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视觉地理定位(Original→Adversarial) | 中位定位误差 | 1,347 km | 282 km(Original) | 退化 4.8 倍(越差越糟,暴露漏洞) |
| 视觉地理定位(Original→Adversarial) | 平均加权定位准确率 WLA | 29.89% | 47.11%(Original) | 相对下降 36.6 个百分点 |
| 陷阱命中率 TFR(Adversarial) | 预测落在注入目标 50km 内的比例 | 6.5%–20.1%(跨 20 模型) | 理想为 0% | 即每模型仍有可观比例被文字精准带偏 |
| 陷阱距离缩减 TDR(配对) | Blank→Adversarial 靠近注入目标的距离 | 均值 +343 ~ +1,926 km | 0(无方向性影响) | 全部 20 模型均为正,证实定向漂移 |
| MCRS 综合鲁棒性 | MCRS = 100·C^0.40·R^0.60 | 最高 72.70(Gemini-3-Flash) | 最低 38.87(Claude-Haiku-4.5) | 厂商间约 1.9 倍差距,无人免疫 |
局限与改进
作者承认的局限有四。其一,TFR/TDR 只在 33.9%(1,732 组)可地理编码子集上计算,且各数据集编码率不均——BaiduSV 高达 49.7% 而其余仅 27–31%,TFR 部分依赖 Nominatim 对中文地名、地标的解析能力,可能引入系统偏差。其二,防御提示实验只覆盖 Gemini-2.5-Flash 和 GPT-4o-mini 两个模型,作者明确写明『不应推广到全部 20 个模型』,跨任务泛化也仅基于这两个模型的小样本。其三,TFR 的 50km 阈值是经验选择,虽附录在 T3 子集上做了 10–500km 半径敏感性测试,主排行榜的固定阈值仍是简化。其四,中位 TDR 在多数模型上接近 0(如 Gemini-2.5-Pro 为 -0.01km),正向均值主要由少数大幅漂移样本贡献,群体层面『平均靠拢』并不普适。我自己的观察:所有攻击文字都是 Qwen-Image-Edit 合成的,与真实世界『自然存在的误导文字』分布可能不同;5,111 组规模相对专用定位数据集偏小,对低频地理特征覆盖不足。
独立分析的弱点
弱点一『仅评测单轮坐标预测,未考察链式推理』:主实验明确要求模型『不要 CoT』直接输出坐标,但实际部署中 MLLM 常通过多步推理或智能体(如 SpotAgent、REVERSE)来定位;改进方向是增加『自由推理』与『工具调用』评测模式,考察冲突在长链推理中是被放大还是被自我修正。弱点二『合成攻击的生态效度存疑』:Qwen-Image-Edit-2509 渲染的文字虽审计可读性 87.5% 完全可读、自然度 4.00/5,但合成图与真实街景分布仍有差距,Lightning LoRA 四步推理可能丢失纹理细节;改进方向是补充真实来源的『自然冲突』样本(如真实的异地品牌招牌)。弱点三『对抗目标只来自另一大洲的硬冲突』,未覆盖『同大洲异国』『同国异城』等软冲突梯度,TFR 难以反映『部分被带偏』的连续程度;改进方向是设计多级冲突强度目标。弱点四『仅测定位,未覆盖下游应用』:地理定位只是图文冲突的一个载体,模型在医学影像(图表文字 vs 病灶)、自动驾驶(路牌 vs 路况)等场景的冲突行为可能完全不同;改进方向是把 WLA/TBS/TFR 这套度量框架迁移到其他连续输出任务。
未来方向
作者明确提出的方向包括:在更多模型(尤其开源权重模型)上验证防御提示的效果,因为本文提示实验仅覆盖两个模型;扩展跨任务泛化研究(场景文字一致性判断、国家识别、语言检测),本文已做初步尝试但样本与模型有限。基于本成果可延伸的研究有四:其一,把 TBS/TFR/TDR 作为训练信号,通过 RLHF 或 DPO 微调模型学习『何时拒绝文字』,从评测走向对齐;其二,研究 Qwen3-VL-30B 为何能在低能力下保持高鲁棒性($C$=36.55, $R$=80.05),其权重或训练数据中是否隐含某种『视觉优先』归纳偏置,这可能为反幻觉训练提供线索;其三,把场景文字耦合层级 T1/T2/T3 的思想推广到其他多模态冲突场景,建立『证据可信度』的形式化分级;其四,探索检索增强(实时地理知识库)能否在冲突发生时为模型提供第三方证据来仲裁。
复现评估
复现友好度较高。数据集已在 HuggingFace(inorganicwriter/SIGNPOST-Bench,CC-BY-4.0)公开,包含攻击文本、T1/T2/T3 分类标签、真值坐标和人工标注;评测与构造代码在 GitHub(MIT 协议),并提供 ComfyUI 工作流入口。但合成的图像变体因第三方来源(Flickr/IM2GPS、YFCC100M、Google/Baidu 街景)限制不重新分发,只提供源 ID 和确定性重建指令——意味着复现者需自己跑 Qwen-Image-Edit-2509 + ComfyUI 管线(输入约 1MP、Lanczos、Lightning LoRA 四步推理),需要一张能跑图像编辑模型的 GPU。评测 20 个 MLLM 共约 511,100 次 API 调用需要相当预算(作者特别致谢了 7 家厂商的 API 支持),个人研究者复现全表成本较高,但子集复现可行;闭源模型用 temperature 0 单次采样,开源模型可用 vLLM 本地部署。整体复现难度中等,主要瓶颈在 API 预算与图像编辑管线搭建。
论文图表
在 Gemini-2.5-Flash 与 GPT-4o-mini 上比较结构化探测与防御提示下的 WLA(左)和冲突检测准确率 CDA(右)。Gemini 的 CDA 从 14.2% 升到 49.0%,但 GPT-4o-mini 反而从 32.8% 降到 19.3%。
证明提示工程不可靠——同一防御提示对两个模型效果相反,是本文最反直觉、最值得记住的结论。
Virginia 真值场景案例:Adversarial 把『BEKINS/ISUZU』换成『Bondi Removals/Tata Motors』。结构化探测信任文字预测悉尼(误差 15,738.5km),防御提示信任视觉预测弗吉尼亚(误差仅 5.5km),单图改进 15,733km。
用一个极端案例直观展示防御提示『有时有效』,与 Figure 4 的群体结论形成对照,帮助读者理解提示方法的边界条件。