SpanCalib-VLM:视觉语言模型中的校准幻觉片段检测 SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
判别式标注器与生成式VLM互补融合,同时实现幻觉片段定位与概率校准
前置知识
视觉幻觉(Visual Hallucination)
指大视觉语言模型(LVLM)生成的文本与输入图像不符的现象:描述图中不存在的物体、错误刻画属性(颜色、数量、位置)或张冠李戴。与纯文本幻觉不同,它需要对照视觉证据才能判定,检测系统因此必须同时理解图像和文本。
本文的全部任务就是检测并定位这类幻觉,SHROOM-Visions 要求到字符级边界,理解幻觉的具体形态是读懂动机部分的前提。
概率校准(Probability Calibration)与 Pearson 相关
校准指模型输出的置信概率应真实反映预测正确的可能性。SHROOM-Visions 中每条幻觉标注带有人类标注者共识比例 $p \in [0,1]$(如 0.8 表示 80% 标注者认为此处是幻觉),系统输出的连续分数与该共识比例的 Pearson 相关系数即为校准指标。
本文的核心贡献之一是校准而非仅定位:理解 MSE 回归共识比例、Pearson 0.413 这类数字,必须先理解校准分数的监督信号是什么。
判别式序列标注(Discriminative Sequence Tagging)
用一个分类模型对输入序列的每个 token 独立打标签(类似命名实体识别的做法),单次前向传播即可得到全部输出。相比自回归生成,它速度快、概率分布由 softmax/回归头直接给出因而更易校准,但缺乏逐步推理能力,边界预测偏保守。
System 1 就是一个 token 级序列标注器,论文反复对比的『快而准』范式即源于此;其保守性也是融合算法要解决的问题。
交叉注意力多模态融合(Cross-Attention Fusion)
把一个模态的特征作为 Key/Value、另一模态作为 Query 的注意力机制,公式为 $\mathrm{Softmax}(QK^\top/\sqrt{d_h})V$。本文将 SigLIP-2 提取的 196×768 图像 patch 特征投影到 XLM-R 的文本隐空间后,让每个 token 有选择地吸收相关视觉信息。
这是 System 1 实现『多模态』标注的关键结构,也直接关联消融实验中去掉视觉塔仅损失 0.003 IoU 这一耐人寻味的结果。
LoRA 低秩适配微调
冻结原模型权重,只训练注入到各线性层的低秩分解矩阵 $\Delta W = BA$(秩 $r \ll d$),大幅降低显存与算力需求。本文用 $r=16, \alpha=16$ 作用于 Qwen3.5-4B 的全部线性层,配合 BF16 与 8-bit AdamW 在单张 A40 上完成 4.4B 模型的微调。
System 2 的训练配置完全建立在 LoRA 之上,这也是复现门槛低的关键;理解它才能评估论文的算力声明是否合理。
研究动机
大视觉语言模型在视觉问答中频繁产生视觉幻觉——文本描述了场景中不存在的物体或错误属性。SHROOM-Visions 共享任务把检测难度推到极致:系统必须同时(i)给出幻觉片段的字符级边界(span 定位),(ii)输出与人类标注者共识置信度相关的校准概率(用 Pearson 相关衡量)。现有方法分两派且各有硬伤。生成式路线让微调后的 VLM 自回归输出结构化 JSON 标注,span 召回不错但严重过度自信且推理昂贵:基线 BLIP 的 Pearson 仅 0.124、干净响应 IoU 只有 0.650、检测准确率 42.1%;微调 MiniCPM-V 也只有 Pearson 0.245;而 Qwen 级模型的 chain-of-thought 推理每样本高达 23.1 秒(吞吐 0.04 样本/秒)。判别式序列标注路线单次前向即可输出校准概率、速度极快,但 span 边界过于保守、召回不足。没有任何现成方法能同时满足定位与校准这两项官方指标。
本文的目标是本文的目标是构建一个在 SHROOM-Visions 任务上同时优化 span 定位(IoU)与概率校准(Pearson 相关)的混合系统。具体量化目标包括:英文评测集上 Pearson 相关大幅超过 BLIP 基线的 0.124 和微调 MiniCPM-V 的 0.245;干净响应(无幻觉响应)的 IoU 推到 0.9 以上、整体检测准确率超过 70%;并在英、法、意、中四个语言上保持跨语言泛化能力,最终在隐藏测试集上全面超越任务官方基线(官方基线的 Cor+Lbl 在各语言为 0.1549–0.2554)。同时工程上希望推理延迟可控,避免生成式方案动辄数十秒的延迟。
与已有工作不同的是,本文的独特切入角度是把两种对立范式当作互补组件而非竞争对手:生成式 VLM 充当候选 span 提议器(类比目标检测中的 region proposal),判别式标注器充当校准评分器,通过 Union-Calibrated Fusion 把后者的连续概率 $P_{SC}(k)$ 按权重叠加到前者的二值字符掩码 $M_{VLM}(k)$ 上。这与常见的加权平均或取交集集成有本质区别——消融实验显示加权平均只有 0.381 Pearson、交集只有 0.352,而该融合达到 0.413。另一个被忽视的角度是校准监督信号本身:标注器不用分类损失,而是用 MSE 直接回归人类标注者共识比例 $p$,针对 token 级不确定性设计,区别于温度缩放、Platt scaling 这类只调全局温度、无法捕获细粒度不确定性的后校准方法。
核心方法
直觉上,这是一个『快而准的裁判』加『慢而全的搜索单』的组合:生成式模型擅长把幻觉片段完整圈出来(H-IoU 0.182 对标注器的 0.155),但分数不可靠(Pearson 0.285);标注器分数可靠(0.369)但圈得保守。技术路线分三步。第一步,System 1 是多模态序列标注器:XLM-RoBERTa-Large(24 层,$d_h=1024$)把 prompt 和 response 拼接编码至多 512 token,SigLIP-2 提取 196×768 图像 patch 特征,投影到文本隐空间后经交叉注意力 $H_{fused}=\mathrm{LayerNorm}(H_{text}+\mathrm{Softmax}(QK^\top/\sqrt{d_h})U)$ 注入视觉上下文,再接三个并行输出头。第二步,System 2 是 LoRA 微调的 Qwen3.5-4B,对 SHROOM-Visions 数据做监督微调,输出结构化 JSON span。第三步,融合:System 2 的候选 span 转成二值字符掩码 $M_{VLM}(k)$,System 1 的 token 概率经子词-字符对齐映射为 $P_{SC}(k)$,按 $w_1=0.55$、$w_2=0.45$ 加权得到 $P_{ens}(k)$,再以阈值切出连续 span 并附类别标签。
核心创新有三。第一,MSE 校准头:标注器专设回归头,以人类标注者共识比例 $p\in[0,1]$ 为目标直接做 $\mathcal{L}_{MSE}$ 监督(权重 $\lambda_1=1.0$),学的是『多少比例的人认为这里是幻觉』而非简单二分类——消融中去掉它后 Pearson 从 0.413 跌至 0.318(−0.095),是影响最大的单项。第二,Union-Calibrated Fusion:生成式 span 的二值掩码 $M_{VLM}(k)$ 不直接决定输出,而是作为空间提议权重参与评分,$P_{ens}(k)=w_1\cdot P_{SC}(k)+w_2\cdot M_{VLM}(k)$,0.55/0.45 来自验证集网格搜索——让校准更好的 System 1(0.369 对 0.285)锚定分数幅度,让召回更好的 System 2 提升覆盖面;这与加权平均(0.381)和取交集(0.352)的常规集成有本质区别。第三,多任务正则:五分类错误类别头($\lambda_2=0.5$)迫使共享编码器捕捉细粒度语义类别边界。与 POPE、CHAIR、MME 等句级或物体级评测的工作不同,本文是对 token 级定位与不确定性估计的联合建模。
方法步骤详情
完整流程五步。第一步,数据准备:SHROOM-Visions 多语言训练集(EN/FR/IT/ZH),每条样本含图像、prompt、响应及字符级标注 $G=\{(s_i,e_i,c_i,p_i)\}$,$p_i$ 为标注者共识置信度。第二步,训练 System 1:A40 上 5 epoch,AdamW 学习率 $1.5\times10^{-5}$、线性衰减加 10% 预热、batch 16、512 token;损失 $\mathcal{L}=\mathcal{L}_{BCE}+1.0\,\mathcal{L}_{MSE}+0.5\,\mathcal{L}_{CE}$,按验证 Pearson 选 checkpoint,第 2 epoch 最佳(0.369)。第三步,训练 System 2:Qwen3.5-4B 经 LoRA(r=16、α=16、BF16、8-bit AdamW、$2.0\times10^{-4}$、3 epoch、2048 token)微调成 JSON 输出器。第四步,推理:System 2 生成候选 span 集 $S_{VLM}$ 并转为字符掩码 $M_{VLM}(k)$;System 1 逐 token 打分,经子词-字符偏移对齐得到 $P_{SC}(k)$。第五步,融合:按 $P_{ens}(k)=0.55\,P_{SC}(k)+0.45\,M_{VLM}(k)$ 逐字符计分,以 τ=0.30 切出连续 span,同时输出校准概率与错误类别。
技术新颖性
技术新颖性体现在三个层面。架构上,把『提议—校准』流水线引入幻觉检测:以往集成多为同质模型投票或简单加权平均,本文利用两个系统误差结构的天然互补——一个召回高但分数糊、一个分数准但边界紧——融合分数分布呈双峰(VLM 提议 span 内字符得分高、其余低,接近决策边界的样本极少),因此阈值在 τ∈[0.25,0.45] 区间内 IoU 稳定在 0.391,鲁棒性罕见地好。训练上,用 MSE 对连续共识比例回归替代常规 BCE 或全局后校准(温度缩放、Platt scaling 只调全局温度,捕获不了 token 级不确定性),且 MSE 项兼作主任务的多任务正则(类别头 $\lambda_2=0.5$)。工程上,推理路径可分级:只走标注器时 0.19 秒/样本(5.25 样本/秒),比 Qwen 标准推理快 4.5 倍、比 CoT 快 120 倍,融合仅在需要高召回时启用,这种可裁剪的部署形态在共享任务系统中少见。
实验结果
英文验证集主结果(Table 1):SpanCalib-VLM 达 Pearson 0.413、Overall IoU 0.391、H-IoU 0.196、Clean IoU 0.913、检测准确率 70.7%,全面超过 BLIP 基线(0.124/0.210/42.1%)、微调 MiniCPM-V(0.245/0.298/51.5%)与任何单系统——标注器单用 0.369/0.326/58.0%,Qwen SFT 单用 0.285/0.375/68.2%。官方隐藏测试集(Table 2):EN 的 Cor+Lbl 0.2418 对基线 0.1549,FR 0.2885 对 0.1679,IT 0.2918 对 0.1635,ZH 0.3347 对 0.2554,四语全胜。跨语言(Table 7):中文最强,IoU 0.437、Clean IoU 0.958,比 Qwen 基线高 +0.169,作者归因于汉字 token 与字符边界对齐好;FR/IT 的 H-IoU 暴涨 +0.182/+0.180(FR 基线仅 0.020,非英语幻觉严重欠检)。消融(Table 10):去 MSE 校准损失伤最重(−0.095 至 0.318);加权平均集成 0.381/0.345、交集 0.352/0.310 均逊于 Union 融合;去 SigLIP 视觉塔 Pearson 不变、IoU 仅 −0.003。阈值(Table 3):τ∈[0.25,0.45] IoU 恒 0.391,τ=0.50 崩至 0.317 但 C-IoU 升至 0.990。速度(Table 4):标注器 0.19 秒/样本(5.25 样本/秒),比 Qwen 标准快 4.5 倍、比 CoT 快 120 倍;训练至第 2 epoch 后验证 Pearson 0.369 达峰即过拟合(Table 9)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SHROOM-Visions 英文验证集(幻觉 span 检测+校准) | Pearson 校准相关 | 0.413 | BLIP 0.124;微调 MiniCPM-V 0.245;最佳单系统(多模态标注器)0.369 | 比最强基线 MiniCPM-V +0.168,比最佳单系统 +0.044 |
| SHROOM-Visions 英文验证集 | Overall IoU / 检测准确率 | 0.391 / 70.7% | BLIP 0.210 / 42.1%;MiniCPM-V 0.298 / 51.5% | IoU +0.093(对 MiniCPM-V),准确率 +19.2 个百分点 |
| 官方隐藏测试集(四语言) | Cor+Lbl | EN 0.2418 / FR 0.2885 / IT 0.2918 / ZH 0.3347 | 任务官方基线 EN 0.1549 / FR 0.1679 / IT 0.1635 / ZH 0.2554 | EN +0.087、FR +0.121、IT +0.128、ZH +0.079,四语全面超越 |
| 中文(ZH)验证集 | Overall IoU / Clean IoU | 0.437 / 0.958 | Qwen-3.5-4B 基线 0.268 / 0.556 | IoU +0.169,Clean IoU +0.402 |
| 推理效率(NVIDIA A40 48GB) | 秒/样本 与 吞吐 | 标注器 0.19 秒/样本,5.25 样本/秒 | Qwen-4B 标准 0.85 秒;Qwen-4B CoT 23.10 秒 | 较标准推理快 4.5 倍,较 CoT 快 120 倍 |
局限与改进
作者承认五点局限:其一,复杂但正确的语言(精细描述、习语、罕见却准确的视觉细节)会被误报为幻觉,尤其依赖表层分布模式而非视觉接地(visual grounding)的标注器;其二,512-token 输入上限导致长响应中超出截断边界的幻觉完全不可见;其三,虽然整体校准好(Pearson 0.413),幻觉 span 的 H-IoU 仍只有 0.196(官方测试 IoU 0.2549),字符级精确定位仍是短板;其四,超参与融合阈值主要在英文验证集上调优,对其他语言未必最优;其五,集成无法挽回两个系统都漏掉的幻觉。我自己的观察还包括:0.55/0.45 的融合权重只来自单一英文验证集的网格搜索,其跨语言普适性存疑;SigLIP 视觉塔贡献极小(IoU +0.003),所谓多模态可能名不副实;模型在第 2 epoch 后明显过拟合,13,594 个训练样本对 355M+86M 参数的标注器偏小;且 Pearson 0.413 的绝对水平仍然偏低,距离可信赖的实用校准还有相当距离。
独立分析的弱点
第一,视觉信息利用不足:消融中去掉 SigLIP-2 只损失 0.003 IoU 且 Pearson 不变,说明交叉注意力融合没有真正把视觉证据注入判断,系统可能主要靠文本流畅性模式检测幻觉,对『文本通顺但与图不符』的幻觉天然钝感;改进方向是引入对比学习对齐、更强的视觉编码器或显式的视觉一致性验证模块。第二,长文本失效:512 token 上限对长响应是硬伤,超出部分幻觉零检出;可用滑动窗口推理加跨窗口 span 合并,或采用位置外推技术。第三,校准绝对水平低:Pearson 0.413 意味着与人类共识仍有大半方差未解释,复杂正确句式的误报会伤害用户信任;可引入分段校准、保形预测输出置信区间。第四,跨语言混杂变量:中文占优源于分词粒度而非语言能力,空格语言需要字符对齐的边界回归头而非照搬子词对齐。第五,双系统部署成本:System 2 的 CoT 推理 23.1 秒/样本不现实,即便标准推理也要 0.85 秒,实际部署需把提议器蒸馏成单次前向模型。第六,融合权重静态:0.55/0.45 全局固定,无法按样本难度或语言自适应,可用门控网络按输入动态加权。
未来方向
作者的结论隐含的方向:既然证明了『快速校准+深思定位的原则性融合』有效,自然延伸是把线性加权升级为可学习的门控或交叉注意力融合,甚至训练第三阶段模型直接消费两系统输出做端到端精修。基于本文成果可延伸的研究:把 token 级校准分数用作 DPO/RLHF 的奖励信号,实现幻觉感知的偏好优化,让 LVLM 在生成时就压低低共识片段的概率;将 span 级校准扩展到视频-语言模型的时间维幻觉定位;利用五分类错误类别头做自动错误分析与模型诊断,反向指导训练数据构造;针对英文调优的全局阈值 τ=0.30 做跨语言自适应或逐样本阈值学习;用保形预测把 Pearson 校准转化为对终端用户的可解释置信区间;以及在 SHROOM 数据上研究标注者共识 $p$ 本身的噪声结构,改进 MSE 回归目标的鲁棒性。
复现评估
复现条件总体较好:作者公开了模型权重、代码与评测产物(GitHub 仓库 Aman-byte1/Hallucination-Detection-in-LVLMs),数据依赖公开的 SHROOM-Visions 数据集(共 20,000 样本,四语各 5,000:训练 13,594、验证 1,508、无标签测试 4,898)。算力需求温和:System 1(XLM-R-Large 355M + SigLIP 86M)在单张 NVIDIA A40(48GB)上 5 个 epoch 即可完成;System 2 用 LoRA(r=16、全线性层、BF16、8-bit AdamW)微调 4.4B 的 Qwen3.5-4B,单卡 A40 也可行。不确定性因素:论文未报告随机种子与多次运行的方差,最佳 epoch 依赖单一验证划分;官方测试集无标签,独立复现只能自建评测。总体难度中等:拥有单张 24GB 以上 GPU 和 LoRA 经验的团队可在数天内复现主体结果,但需自行确认 Qwen3.5-4B 权重获取与 SHROOM 数据使用授权。
论文图表
官方共享任务隐藏测试集成绩:EN 上 Cor+Lbl 0.2418 对基线 0.1549(IoU 0.2549),FR 0.2885 对 0.1679(IoU 0.2994),IT 0.2918 对 0.1635(IoU 0.3109),ZH 0.3347 对 0.2554(IoU 0.3425),四语全面领先。
验证集结果可能有调参过拟合之嫌,这张表给出盲测集的官方排名成绩,是系统能力的最终裁定,也是论文声称『competitive results』的依据。
推理效率对比:SpanCalib-VLM 标注器 0.19 秒/样本、5.25 样本/秒;Qwen-4B 标准推理 0.85 秒、1.18 样本/秒;Qwen-4B chain-of-thought 23.10 秒、0.04 样本/秒。
量化了判别式路线的工程优势(快 4.5 至 120 倍),这是论文主张混合系统中标注器应承担校准评分角色的实际依据,也说明了生成式方案的部署代价。