← 返回 2026-08-11

视觉语言定位即双向概念对应 Vision-Language Grounding as Bidirectional Concept Correspondence

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna 📅 2026-08-08 👍 7 2026-08-16 18:30
多模态大模型 开放词汇分割 指代消解 结构化预测 视觉语言定位

把视觉定位重构为文本片段与图像实例的双向对应预测,一个模型统一多种定位任务

前置知识

视觉语言定位

把自然语言中的语言单元(短语、类别名、指代表达)与图像中的具体区域(框或掩码)关联起来的任务族。传统做法是查询驱动的单向定位:文本作为检索条件,模型输出最匹配的图像区域,代表工作包括 Grounding DINO、MDETR、GLIP 等。

本文的全部出发点就是重新审视这一任务定义,把“给定文本找区域”改为双向对应恢复。只有理解旧范式的假设(文本跨度已知),才能看出新范式到底改变了什么。

指代消解

自然语言理解任务,判断代词或名词短语究竟指向哪个实体。本文场景中,同一实体可能在字幕里被多次提及(如 a dog ... the dog ... it),模型需要把这些不连续的文本跨度合并成同一个掩码,这正是共指消解能力的体现。

论文定义的文本掩码 $t_i$ 允许覆盖多个不连续跨度,设计动机就是共指合并。不理解共指,就无法理解为什么单向定位框架在这个任务上会系统性失败。

开放词汇检测与分割

模型不限于固定类别集,而是接受任意文本(类别名列表或自由文本)作为输入,为任意概念输出框或掩码。代表方法有 GLIP、Grounding DINO、X-Decoder、SAM3 等,通常需要把大词表切块多次推理。

论文把它视为双向对应的一个特例(文本仅为类别列表),LVIS 零样本实验直接对比的就是这类方法,并强调 ConCor-1 单次前向即可处理全部词表。

匈牙利匹配

集合间一对一最优指派算法,在代价矩阵中寻找总代价最小的组合。集合预测模型(如 DETR)在训练时用它把固定数量的预测与数量不定的真值一一配对,避免多个预测重复负责同一目标。

ConCor-1 训练时用匈牙利匹配(以掩码 IoU 或文本/掩码 IoU 几何均值为代价)把真值对应指派给桥接令牌,评估时也用它对齐预测与真值,是训练与评测的公共基础设施。

桥接令牌与查询式预测

一组可学习的嵌入向量(类似 DETR 的 object queries),被追加到图像与文本 token 组成的序列中。它们不编码输入内容,而是通过双向自注意力从两侧 token 收集信息,各自代表一个候选对应假设,最后由预测头解码为输出。

桥接令牌是本文方法的灵魂:文本掩码头、图像掩码头、存在性头三个预测头全部挂在这组令牌上,所有实验分析(注意力可视化、逐层探测)也都围绕它展开。

BCE 与 Dice 损失

BCE(二元交叉熵)逐像素或逐 token 监督二值掩码;Dice 损失衡量预测与真值集合的重叠度 $Dice = 2|A \cap B|/(|A|+|B|)$,对前景占比小的分割更稳健。PointRend 风格损失是在不确定的采样点上计算二者组合以节省算力。

论文的图像掩码监督用 PointRend 式 BCE+Dice 组合,文本掩码与存在头用 BCE。理解损失设计才能读懂训练细节,以及消融中各组件对比的含义。

JointF1 与 mJS 指标

JointF1 是联合对应 F1:以文本跨度 IoU 与掩码 IoU 的几何均值做匈牙利匹配,两者都 $\geq 0.5$ 才算一次正确对应;mJS 是软化的联合分数,取匹配对的几何均值再平均,未匹配的真值记零。二者同时惩罚文本侧与图像侧的错误。

论文所有主结果都围绕这两个指标展开。不读懂定义就无法解释为什么某些检测式基线软 IoU 高但 JointF1 低——它们定位尚可,却判定不准哪些文本-图像配对真正成立。

研究动机

现有工作把视觉语言定位简化为单向的“语言到图像”定位:给出预先指定的短语或类别名,在图中找出对应区域。早期是指代表达理解(如 ReferItGame 中的 squirrel),随后是短语定位(对齐 a brown dog、the wooden bench 这类字幕片段),再扩展到 GLIP、Grounding DINO 等开放词汇检测与分割。这些方法都假设“要找什么”已由输入文本给定,但真实的语言交流并非如此——听者必须自己判断话语里哪些部分具有视觉指涉性、对应场景中哪些实体。数据层面问题同样突出:现有 grounded caption 数据集(如 GoldG、COCONut-PanCap)标注不完整,同一实体的多次共指提及往往只在首次出现时标注,部分被提到的实体根本没有对应掩码。实验也印证了瓶颈所在:GPT-5.4(medium)+SAM 在 COCONut-PanCap 上文本跨度 TextF1 高达 88.9,但联合对应 JointF1 只有 43.8,说明“读出文本”容易,“把文本和图像区域完整对齐”才是真正的难点。

本文的目标是本文目标是将视觉语言定位重新形式化为图像-文本对上的双向概念对应。给定一张图和配对文本,模型要恢复完整的对应集合 $\mathcal{C} = \{(t_i, s_i)\}_{i=1}^{K}$,其中 $t_i$ 是文本字符上的二值掩码,允许覆盖不连续、重复或共指的多次提及;$s_i$ 是对应的实例级图像掩码;同时判断每个提议配对是否真实有效。关键在于:文本侧“哪些片段有视觉指涉”本身就是输出的一部分,而非先验假设。这一形式化把多个现有任务统一为特例——短语定位对应文本跨度已知的情况;开放词汇检测对应文本仅为类别列表;指代表达定位对应给了查询但还需额外定位表达中提到的上下文实体。作者还希望该任务能反向服务多模态评测,例如检验生成字幕是否真的被图像支撑、文生图输出是否忠实呈现了提示词中的实体与关系。

与已有工作不同的是,独特切入角度来自认知科学的启发:语言理解中的指称是说话者与听者之间的联合活动,依赖共享的感知上下文与共同基础;空间语言研究表明人会从描述构建结构化的空间心理模型,而非把词当作孤立标签;视觉认知则要求先通过选择性注意和对象绑定把图像区域分组,语言才能指涉它们。据此,定位不应建模为“查询驱动的检索”,而应是恢复结构化语言表示与结构化视觉表示之间的对应关系。这与两类主流实现都不同:检测器路线(MDETR、GLIP、Grounding DINO、GLEE)依赖区域候选和框-词相似度;自回归 VLM 路线(Florence-2、Kosmos-2、Molmo、LISA、GLaMM)把掩码当作生成的多边形 token 序列。本文改为把文本分割、图像分割、跨模态对齐合并成一个非自回归的对应预测问题,并利用预训练 VLM 的深层联合表征而非其生成能力来完成它。

核心方法

ConCor-1 的直觉是给每个“候选对应关系”配一个专属槽位。模型构建在 Qwen3.5-0.8B 视觉语言骨干之上(选它是因为长上下文与文本理解能力强、规模与现有定位模型可比),把一组可学习的桥接令牌追加到图像 token 与文本 token 组成的联合序列中;由于改用双向注意力,每个桥接令牌通过自注意力同时聚合两侧上下文,形成关于某个潜在对应的假设表示。每个桥接令牌接三个轻量预测头:图像分割头预测实例掩码,文本分割头在文本 token 上预测二值掩码,存在性头输出该配对是否有效的标量分数。训练时用多尺度空间分配策略(1、2×2、3×3 等网格划分)配合匈牙利匹配,把真值对应指派给具有空间与尺度先验的桥接令牌,鼓励不同令牌特化于不同位置与大小的对象。整个模型在 8 张 H100 上训练 100K 步、有效批大小 96,使用 653K 图文对、3.1M 对应关系的数据,骨干保持原状、只加最小化的任务接口。

核心创新是把定位的输出空间从“给定文本找区域”改为“同时预测文本掩码、图像掩码与配对有效性”的结构化集合预测。与已有方法的本质区别有三点。其一,桥接令牌是对象级对应假设而非检索查询:它们与整段文本、整幅图交互后自行决定绑定哪个文本片段、哪个图像实例,甚至能把 the dog ... the dog 这类不连续共指提及编成一个文本掩码——这是现有短语定位方法做不到的。其二,训练采用多尺度空间分配:对每个真值掩码与各尺度网格单元计算 IoU 后做匈牙利匹配,给无序的桥接令牌注入位置与尺度先验,消融显示比光栅顺序分配 JointF1 高出 9.0 点(52.4 对 43.4)。其三,骨干只作为上下文编码器使用,且把因果注意力换成双向注意力(JointF1 从 49.3 提到 51.3),彻底抛弃自回归生成,从而能在单次前向中处理整份 LVIS 大词表,而检测式基线都必须分块多次推理。

方法步骤详情

第一步,数据统一化:用 LLM 改写流水线把共指提及合并为共享文本掩码、删去无掩码支撑的提及,将 GoldG(框经 SAM3 转伪掩码)与 COCONut-PanCap(真值掩码)转为对应格式,再由 LLM 从 COCO 全景分割生成 GroundedRef-train 字幕;加上 COCO、COCONut、EntitySeg、ADE20K 与 PixMo-Point 计数子集,共 653K 图文对、3.1M 对应、约 12M 实例掩码。第二步,编码:视觉 token(2×2 patch 合并)与文本 token 拼接后追加桥接令牌,全序列做双向自注意力。第三步,桥接令牌分配:按多尺度网格(1、2×2、3×3…)以 $IoU(m_{gt}, cell)$ 为代价做匈牙利匹配。第四步,三头预测:存在头是桥接令牌末层隐状态上的轻量 MLP;文本头把桥接与文本 token 特征投影到共享空间后用可学习双线性函数打分;图像头先把视觉 token 还原到 patch 网格、与编码器特征融合,经两层卷积上采样解码后同样双线性打分。第五步,损失:文本掩码用 BCE,视觉掩码用 PointRend 风格 $\mathcal{L}_{BCE} + \mathcal{L}_{Dice}$,存在头用单独 BCE。

技术新颖性

技术新颖性体现在三个层面。任务层面:首次把文本侧分割(含共指合并)作为模型输出而非输入假设,对应集合 $\mathcal{C}=\{(t_i,s_i)\}$ 中的 $t_i$ 允许多个不连续跨度,从而把短语定位、指代表达与开放词汇分割三条研究线统一进同一输出空间,并连接到视觉共指消解与 Winograd 风格指代歧义。架构层面:与 DETR 系“object queries 出检测框”不同,桥接令牌同时预测双向掩码与有效性,且充分利用 VLM 深层跨模态交互——逐层探针显示定位信息随层数递增(第 20 层 Attn-IoU 0.57 远高于第 4 层 0.29),说明方法是“显式化”预训练表征而非从零学习。训练层面:LLM 改写流水线系统性修复了 grounded caption 数据共指标注不全的缺陷,并配合 PointRend 点采样损失处理高分辨率掩码监督。消融还给出可迁移结论:双线性打分在阈值化 F1 上优于点积(49.3 对 48.7)、两层卷积上采样解码器最优、融合视觉特征在软 IoU 上最好(mMaskIoU 62.7)。

Model overview(模型总览)
Figure 2: Model overview(模型总览)
Bridge-token attention and prediction(桥接令牌的注意力与预测)
Figure 6: Bridge-token attention and prediction(桥接令牌的注意力与预测)

实验结果

图像-字幕设定(Table 1):在长而密集的 COCONut-PanCap 上 ConCor-1 达到 JointF1 88.8、mJS 89.5,比最强基线 Qwen3.5-FT(59.9/63.3)相对提升 48% 与 41%,MaskF1 91.9、TextF1 93.4 全面领先;GroundedRef 上 JointF1 70.3 对次优 LLMDet+SAM 的 54.6;Flickr30k 上 91.4 对 MM-GDINO+SAM 的 84.6。图像-类别设定(Table 2):COCO 上 JointF1 72.4 对 65.7;零样本 LVIS-minival 上 29.9 对 GLaMM 的 23.1,相对提升 29%,且单次前向处理全部 1203 类词表而检测式基线必须分块;EntitySeg 上 49.8 对 31.1。消融(Table 3):双向注意力优于因果注意力(51.3 对 49.3),多尺度空间分配远超光栅顺序(52.4 对 43.4),融合视觉特征取得最佳 mMaskIoU 62.7。分析实验(Figure 3、Table 4)显示桥接注意力随层数单调增强,第 20 层 Attn-IoU 0.57、Top-1 命中 0.75、熵 0.54,均显著优于原始 Qwen3.5(0.21/0.40/0.73),说明该训练目标还重塑了骨干内部的跨模态对齐。

Image-caption results on COCONut-PanCap, GroundedRef, and Flickr30k validation sets(图像-字幕结果)
Table 1: Image-caption results on COCONut-PanCap, GroundedRef, and Flickr30k validation sets(图像-字幕结果)
Image-category results on COCO validation set, LVIS-minival, and EntitySeg validation set(图像-类别结果)
Table 2: Image-category results on COCO validation set, LVIS-minival, and EntitySeg validation set(图像-类别结果)
Ablation study(消融实验)
Table 3: Ablation study(消融实验)
Quantitative text-to-image attention analysis across full-attention layers(逐层文本-图像注意力定量分析)
Table 4: Quantitative text-to-image attention analysis across full-attention layers(逐层文本-图像注意力定量分析)
Grounding emerges progressively across language model layers(定位能力随语言模型层逐步涌现)
Figure 3: Grounding emerges progressively across language model layers(定位能力随语言模型层逐步涌现)
Qualitative comparison on COCONut-PanCap(COCONut-PanCap 定性对比)
Figure 4: Qualitative comparison on COCONut-PanCap(COCONut-PanCap 定性对比)
Text-to-image attention visualization(文本到图像注意力可视化)
Figure 5: Text-to-image attention visualization(文本到图像注意力可视化)
查看结构化数据
任务指标本文基线提升
长字幕密集定位(COCONut-PanCap) JointF1 88.8 次优 Qwen3.5-FT 59.9(检测系最强 GDINO+SAM 仅 34.1) 相对最强基线提升 48%
长字幕密集定位(COCONut-PanCap) mJS(软联合分数) 89.5 Qwen3.5-FT 63.3 相对提升 41%
组合式指代字幕定位(GroundedRef) JointF1 70.3 LLMDet+SAM 54.6 +15.7 点(约 29%)
自然字幕定位(Flickr30k) JointF1 91.4 MM-GDINO+SAM 84.6 +6.8 点
零样本大词表定位(LVIS-minival) JointF1 29.9(单次前向处理全词表) GLaMM 23.1(其余检测式基线需分块多次推理) 相对提升 29%
类别定位(COCO) JointF1 72.4 MM-GDINO+SAM 65.7 +6.7 点
实例分割类别定位(EntitySeg) JointF1 49.8 Qwen3.5-FT 31.1 +18.7 点

局限与改进

作者承认的局限主要体现在展望中:当前只在静态图像上验证,对应关系尚未扩展到时间维度,也未把对应预测用作预训练目标。我自己观察到更多问题。其一,零样本 LVIS 的绝对 JointF1 仅 29.9,大词表设定远未解决,且 mJS 39.8 与 mMaskIoU 51.4 显示软定位质量与 F1 之间存在明显差距。其二,训练与评测数据都经过 LLM 改写流水线(Flickr30k/COCONut-PanCap 验证集虽有人工过滤但规模仅约 2K),标注噪声与 LLM 偏置会直接进入监督信号;GroundedRef 完全是 LLM 生成的字幕,分布可能偏模板化、偏简单。其三,桥接令牌数量固定(消融对比 8×8 与 11×11 网格),对极端密集或极稀疏的对象分布可能不匹配。其四,把因果注意力换成双向注意力后骨干不再能直接自回归生成,牺牲了 VLM 的通用接口。其五,IoU≥0.5 的阈值化判定与较小验证集会掩盖部分定位质量差异——作者自己也指出阈值化 F1 与软 IoU 揭示的是不同维度的强弱。

独立分析的弱点

弱点一:对 LLM 改写流水线强依赖。训练监督的核心(共指合并、剔除无支撑提及)由 LLM 完成,653K 训练对难以全面人工质检,系统性标注错误会同时误导文本头与存在头。改进方向:引入置信度加权的伪标签净化,或用模型预测与人工校验形成迭代闭环。弱点二:检测式基线在软 IoU 指标上仍有竞争力(GDINO+SAM 在 COCONut-PanCap 的 mMaskIoU 达 67.9,高于部分消融变体),说明 ConCor-1 的优势集中在“判定哪些配对有效”,纯掩码精度并非碾压;可给图像头外接 SAM 级精分割模块补齐边界细节。弱点三:固定数量的桥接令牌与静态多尺度网格是硬编码先验,难以自适应被遮挡、极端长尾尺寸的对象;可引入动态令牌生成或由粗到细的级联细化。弱点四:双向注意力改造后失去生成接口,同一骨干无法兼做字幕生成等任务;可用 LoRA 式旁路或混合注意力让对应预测与生成共存。弱点五:仅在英文字幕与英文类别词表上评测,跨语言与领域迁移(医学影像、文档、中文场景)完全未验证,泛化声明需要更多证据。

未来方向

作者明确提出的方向:把概念对应扩展到视频,让文本-视觉对齐随时间持续存在(对应关系需要跨帧追踪与消解);把对应预测本身作为预训练目标,训练出对齐更好的视觉语言模型;将任务用作评测工具,检查生成字幕的视觉落地性、以及文生图输出是否忠实实现提示词中的实体与关系。基于本文成果还可延伸:一是与视觉共指消解和 Winograd 风格歧义(如 The trophy does not fit into the suitcase because it is too large 中的 it)结合,把对应预测当作视觉因果推理的可解释探针;二是利用逐层注意力分析结论(第 20 层最集中、Attn-IoU 0.57)发展 VLM 内部表征的诊断工具与模型选择标准;三是把单次前向处理大词表的能力用于机器人、自动驾驶等实时开放词汇系统,替代滑窗多次推理;四是把非连续文本掩码的对应建模推广到文档理解、网页图文对齐等更广的多模态场景。

复现评估

论文给出了项目主页(uwgzq.github.io/papers/ConCor-1),但正文未明确承诺开源代码与权重,复现的首要不确定性在此。可行路径:骨干 Qwen3.5-0.8B 公开可得;训练数据基本来自公开数据集(GoldG、COCO、COCONut、EntitySeg、ADE20K、PixMo-Point、Flickr30k、LVIS),但需要自行实现 LLM 改写流水线并调用 SAM3 生成伪掩码,这一步成本与不确定性最高;GroundedRef 的 LLM 生成字幕也需复刻提示词与人工校验流程。算力门槛较高:8 张 H100、100K 步、有效批大小 96,完整复现约需数十 GPU·天。低成本验证路径是消融设置——每个变体只需 15K 步且可冻结视觉编码器。评测协议(匈牙利匹配、IoU≥0.5 阈值、JointF1/mJS/mSpanIoU 定义)在论文中描述清晰,验证集规模小(各约 2K 样本),评估本身容易复现。总体判断:对拥有 8 卡 A100/H100 的团队,难度中等偏上,最大风险在数据改写环节的质量对齐。