ConceptFormer:面向视觉文档检索的自适应潜在概念学习 ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval
用查询条件、长度自适应的潜在概念作中间监督,桥接局部视觉证据与语义相关性
前置知识
视觉文档检索(Visual Document Retrieval, VDR)
给定自然语言查询和由文档页截图组成的候选集合,检索器把查询和每页图像编码为稠密向量(通常取 EOS 位置的表示并做 $\ell_2$ 归一化),按余弦相似度排序返回最相关页面。它绕过 OCR 的识别错误与信息丢失,能直接利用版式、图表、颜色等视觉线索,是多模态 RAG 管线的第一环。
本文的全部动机、方法与评测都建立在 VDR 的'整页编码 + 页级对比学习'标准范式之上,不懂这个基线就无法理解改进点。
InfoNCE 对比学习
批内对比目标:对 mini-batch 中 $B$ 个查询-正例对,用温度 $\tau$ 把相似度 softmax 成候选集上的排序分布 $P(d|q_i,\mathcal{D}_i)$,最大化正例页面的对数似然 $\mathcal{L}_{\text{cons}}=-\frac{1}{B}\sum_{i=1}^{B}\log P(d_i^+|q_i,\mathcal{D}_i)$,并把批内其他页面当负例推开。
论文指出这种监督只给页级'相关/不相关'信号、不指明页内证据位置,这正是 ConceptFormer 要在其上叠加概念级监督的出发点。
KL 散度与分布蒸馏
KL 散度 $\mathrm{KL}(P\|Q)=\sum_d P(d)\log\frac{P(d)}{Q(d)}$ 度量两个分布的差异。本文用前向 KL 把'查询诱导的排序分布'蒸馏给'潜在概念诱导的排序分布',即 $\mathrm{KL}\big(P(d|q_i,\tilde{\mathcal{D}}_i)\,\|\,P(d|\hat{c}_i,\tilde{\mathcal{D}}_i)\big)$,保留候选页面之间的相对偏好结构。
分布级蒸馏是本文的核心监督形式,消融显示换成对比式匹配会损失约 0.8 个平均 NDCG@10 点,理解 KL 才能明白其优势。
NDCG@10 与 Recall@10
Recall@10 衡量前 10 名中是否包含正例页面的命中率;NDCG@10 在此基础上按相关性等级和排名位置做折损累积增益并归一化,能区分'第一名命中'与'第十名才命中'。排名越靠前、相关性越高,NDCG 越接近 1。
本文多数基准上 R@10 已饱和(如 OWID Charts 各模型几乎都是 99.24),真正的区分度来自 NDCG@10,论文所有关键结论都以此为主指标。
潜在推理 / 潜在 token
让模型在连续隐空间而非自然语言中做中间推理:在输入序列插入特殊 token(如本文的 <|lcon|>),其隐藏状态直接作为'思维状态'参与后续计算,不经语言解码。代表工作有 LVR、MCOUT、LanteRn 等,普遍使用固定长度的潜在序列。
ConceptFormer 首次把这类连续潜在表示改造成检索监督信号,并根据证据规模动态定长,这是理解其新颖性的背景。
LoRA 参数高效微调
低秩适配:冻结原模型权重,只训练注入的低秩矩阵 $\Delta W=BA$(秩 $r\ll d$)。本文设置 $r=8$、$\alpha=64$、dropout 0.1,作用于 q/k/v/o/down/up/gate 投影,用 BF16 精度训练。
它决定了论文的算力成本与复现门槛:7B 骨干的微调能在 4 张 A100-40GB 上完成。
多向量检索(ColPali 路线)
不同于单向量把整页压成一个 embedding,ColPali 等保留页面多个 patch 级向量,用后交互(late interaction)计算查询 token 与页面 patch 的细粒度匹配分数,检索精度高但推理时的存储和计算开销成倍增长。
ColPali 是重要基线,也是本文'训练期细粒度监督、推理期零额外开销'这一卖点的主要对照对象。
研究动机
视觉文档检索要求在文本、版式、图表、视觉符号混合的页面图集合中找出与查询相关的页面,是多模态 RAG 的基础环节。现有主流方法(DSE、VisRAG-Ret、VDocRetriever 等)直接用 VLM 编码整页截图,仅靠页级 InfoNCE 对比学习优化查询-页面相关性。这种监督只告诉模型'这一页相关或不相关',不指明页内哪块局部证据支撑了相关性,导致模型难以学会关注细粒度线索。实测数据很不均衡:OCR 路线的 BM25 在六基准上平均 NDCG@10 仅 49.27,在几乎纯图形的 Wikimedia Maps 上只有 3.26;即便最强的视觉检索器 VisRAG-Ret,在 Wikimedia Maps 上也只有 29.04、TQA 上只有 32.18。近期的细粒度方案分两派:ReAlign 等让 VLM 对相关区域生成文字描述作为辅助监督,ColPali 等做区域级多向量匹配;但文字描述难以忠实表达图表结构、地图配色和空间布局,区域视觉特征又缺乏文档级语义与全局上下文,两条路各有硬伤。
本文的目标是本文的目标是给视觉文档检索器引入一种不依赖 OCR、不依赖文字化描述、也不依赖显式区域特征匹配的细粒度监督信号,让检索器在保持'整页编码 + 页级对比学习'推理管线完全不变的前提下,学到查询相关证据的细粒度表示。具体做法是把查询相关证据建模为连续的、以查询为条件的潜在概念:训练时用一个强 VLM 在正例页面上定位查询相关区域,按这些区域在检索器视觉 token 网格上的覆盖量自适应地决定潜在概念的容量(token 数),再让潜在概念诱导的排序分布逼近原始查询诱导的排序分布,把查询级相关性知识蒸馏进概念表示,最终经由共享参数反哺检索器的嵌入空间。
与已有工作不同的是,本文的独特切入是把'多模态潜在推理'这条新兴路线(LVR、MCOUT、LanteRn 等用连续潜在状态替代自然语言思维链)首次系统性引入视觉文档检索监督。与 ReAlign 一类文字化证据方案相比,潜在概念不经语言瓶颈,能保留图表布局、颜色编码等文字难以表达的结构;与 ColPali、Argus-Retriever 一类区域匹配方案相比,它不增加推理期多向量交互开销,只作为训练期中间监督存在。同时,已有潜在推理工作普遍使用固定长度潜在 token,无法适配查询相关证据规模的巨大差异;ConceptFormer 借鉴 Matryoshka 分层容量的思想,按证据区域在具体检索器视觉 token 网格上的覆盖 patch 数动态分配概念长度,并采用分布级 KL 蒸馏(而非概念级对比匹配)做监督——'自适应容量的潜在概念 + 排序分布蒸馏'这一组合是文献中首次出现。
核心方法
直觉上,ConceptFormer 想让检索器知道'这一页为什么与查询相关',而不只是'这一页是否相关'。它在训练期为每个查询-页面对构建一个潜在概念空间作为中间桥梁:一端锚定在页面上的查询相关视觉区域,另一端对齐查询级语义相关性。技术路线分三步。第一步,用强 VLM(Qwen3.6-Plus)作为证据提议器,对训练对 $(q_i, d_i^+)$ 联合推理查询与页面图像,输出若干自包含的查询相关区域框。第二步,把每个框投影到检索器自身的视觉 token 网格,统计覆盖的 patch 数 $t_{i,n}$,求和得到该样本需要的潜在概念长度 $T_i=\sum_{n=1}^{N_i} t_{i,n}$,据此在检索器上下文中插入对应数量的特殊 token <|lcon|>。第三步,检索器 $\pi_\theta$ 在查询、正例页面和概念前缀条件下产出隐藏状态序列,均值池化得到潜在概念表示 $\hat{c}_i$,再用 KL 散度把查询诱导的排序分布 $P(d|q_i,\tilde{\mathcal{D}}_i)$ 蒸馏给概念诱导的分布 $P(d|\hat{c}_i,\tilde{\mathcal{D}}_i)$。总损失为 $\mathcal{L}=\mathcal{L}_{\text{cons}}+\lambda\mathcal{L}_{\text{align}}$,其中 $\mathcal{L}_{\text{cons}}$ 是原始页级对比损失,$\lambda=0.2$。推理时完全走原始检索管线,不生成任何概念 token,零额外开销。
核心创新是把查询相关证据表示为'查询条件化的连续潜在概念',并用排序分布蒸馏来训练它,与已有方法的本质区别有三点。其一,证据代理的选择:ReAlign 等用 VLM 生成区域文字描述,文字通道天然丢失图表结构、地图配色、空间关系(论文的嵌入空间分析显示文字概念代理在 Wikimedia Maps 这类图像密集基准上明显退化);ColPali 等直接聚合区域视觉特征,又缺乏查询级语义抽象(视觉代理的查询判别力和检索对齐度都偏弱)。潜在概念被训练去复现查询的排序行为,论文用三维几何分析证明它落在查询与页面之间的中间空间,同时保留视觉接地与语义抽象。其二,容量自适应:已有潜在推理用固定长度潜在 token,而本文按证据覆盖的视觉 patch 数动态定长——实测概念长度中位数仅 50,但 7.9% 的样本需要超过 256 个 token、P90 达 224,任何固定长度都无法同时覆盖两端。其三,监督形式:不做'查询-概念'的对比匹配,而是 KL 对齐整个排序分布,保留了候选之间相对偏好这一更丰富的结构信息。
方法步骤详情
完整训练流程如下。(1) 证据提议:对每个训练对 $(q_i, d_i^+)$,用 Qwen3.6-Plus(解码温度 0.2、16 路并发)按'视觉接地助手'系统提示逐步推理,输出若干自包含区域 $\mathcal{R}_i$,解析为结构化标注 $\{b_{i,n}\}_{n=1}^{N_i}$,其中 $b_{i,n}=(x_1,y_1,x_2,y_2)$ 为边界框并附文字标签(该标签后续用于消融中的文字概念代理)。(2) 容量估计:把框坐标投影到检索器 $\pi_\theta$ 的视觉 patch 网格,得覆盖索引集 $\mathcal{I}_{i,n}=\{m \mid P_m(d_i^+)\cap b_{i,n}\neq\varnothing\}$,局部概念规模 $t_{i,n}=|\mathcal{I}_{i,n}|$,总长 $T_i=\sum_n t_{i,n}$。(3) 概念生成:在检索器上下文插入 <|lcon_start|> 与 $T_i$ 个 <|lcon|>,第 $k$ 个概念状态为 $c_{i,k}=\pi_\theta(q_i, d_i^+, \text{<|lcon_start|>}, \ell_{i,1:k})$,均值池化得 $\hat{c}_i=\text{MeanPool}(c_{i,1},\dots,c_{i,T_i})$。(4) 分布对齐:候选集 $\tilde{\mathcal{D}}_i$ 含正例页与批内负例,以温度 $\tau=0.01$ 分别计算查询分布与概念分布,最小化前向 KL 得 $\mathcal{L}_{\text{align}}$。(5) 联合优化:$\mathcal{L}=\mathcal{L}_{\text{cons}}+\lambda\mathcal{L}_{\text{align}}$,$\lambda=0.2$;骨干为 Qwen2.5-VL-7B-Instruct 或 Phi3V-4B(DSE 初始化 + VDocRetriever LoRA 起点),LoRA $r=8,\alpha=64$,AdamW、BF16、学习率 $1\times10^{-4}$、3 个 epoch、有效批大小 128、4×A100-40GB。(6) 推理:查询与页面各取 EOS 位置表示,$\ell_2$ 归一化后按余弦相似度排序,与原始管线完全一致。
技术新颖性
从技术新颖性看有四点。第一,监督范式新:以往细粒度监督要么落在文本空间(区域描述、文字标注),要么落在视觉空间(区域特征、多向量交互),本文首次把监督信号放到两者之间的连续潜在空间,用'查询排序分布 → 概念排序分布'的 KL 蒸馏约束这个中间表示,等价于给检索器增加了一条概念级相关性通路。第二,容量分配机制新:把 Matryoshka 式嵌套容量思想落到'证据区域在具体检索器 token 网格上的物理覆盖量'上,使概念长度随骨干的分辨率与 tokenization 自动适配(同一页面在不同检索器下会得到不同长度)。第三,训练-推理解耦:潜在概念只在训练期存在,推理零开销,这与 ColPali 类多向量方法(推理时间和存储成倍增长)及查询条件 MoE 方案形成鲜明对比。第四,实证发现新:论文用查询判别力、页面判别力、检索对齐度三个度量证明学习到的潜在概念同时超越文字代理与视觉代理,并用大规模长度分布统计证明'查询相关证据规模差异巨大、固定容量必然次优'这一此前未被量化的事实。
实验结果
主实验(Table 1):在六个视觉文档检索基准上,ConceptFormer(Qwen2.5-VL 骨干)平均 Recall@10 达 88.33、NDCG@10 达 75.97,相对最强视觉检索基线 DSE(平均 NDCG@10 65.05)提升 16.7%,相对最强 OCR 文本基线 NV-Embed-v2(62.24)提升 22.1%。分数据集看:域内 InfoVQA 上 NDCG@10 79.23(R@10 93.03),比 VisRAG-Ret 的 69.16 高逾 10 分;ChartQA 95.79 比 VDocRetriever 的 86.79 高 9 分;SlideVQA 82.41 对 78.96;TQA 41.30 略超 ColPali 的 40.99;OWID Charts 95.39 为全场最高;最突出的是 Wikimedia Maps,NDCG@10 61.69 是此前最强视觉检索器 VisRAG-Ret(29.04)的两倍多,说明证据空间分散、单向量难以覆盖时自适应概念收益最大。骨干分析:Phi3V-4B 版本平均 NDCG@10 67.00 已比最强视觉基线高约 4%,换 Qwen2.5-VL-7B 再提升逾 10%,说明收益来自方法本身而非单纯骨干变强。消融(Table 2):文字概念代理 74.85、视觉概念代理 72.81,均低于潜在概念 75.97;把 KL 分布对齐换成对比式 Query-Concept Matching 降到 75.15;去掉均值池化(只用 <|lcon_end|> 隐状态)为 75.43,说明相关信息分布在多个概念 token 上;$\lambda=0$(去掉概念监督)为 74.22。超参(Table 3):$\lambda=0.2$ 最优且非单调,过强的分布对齐会挤压查询-页面判别信号。容量分析(Figure 3):概念长度中位数 50,超半数样本 ≤64,但 15.1% 需 129-256、7.9% 超 256、P90=224;所有固定长度变体的 NDCG@10 均低于自适应分配且随长度非单调,证明收益来自按需分配而非更多 token。嵌入几何(Figure 2):潜在概念在三个指标上全面领先文字/视觉代理,文字代理在 Wikimedia Maps 上退化。案例(Figure 4):对'2011 世界杯半决赛新西兰得分'一问,InfoNCE 激活松散区域,文字对齐强于局部字词弱于全局上下文,视觉对齐相反,ConceptFormer 同时响应赛事年份区域与中心圆图中的比分。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六基准平均 · 视觉文档检索 | NDCG@10 | 75.97(Qwen2.5-VL 骨干) | 65.05(DSE,最强视觉检索基线) | 相对提升 16.7% |
| 六基准平均 · 视觉文档检索 | NDCG@10 | 75.97 | 62.24(NV-Embed-v2,最强 OCR 文本基线) | 相对提升 22.1% |
| InfoVQA(域内信息图) | NDCG@10 / Recall@10 | 79.23 / 93.03 | 69.16 / 86.36(VisRAG-Ret) | +10.07 / +6.67 |
| ChartQA(图表问答页) | NDCG@10 | 95.79 | 86.79(VDocRetriever) | +9.00 |
| SlideVQA(幻灯片) | NDCG@10 | 82.41 | 78.96(VDocRetriever) | +3.45 |
| TQA(教科书页) | NDCG@10 | 41.30 | 40.99(ColPali) | +0.31 |
| OWID Charts(统计图) | NDCG@10 | 95.39 | 94.79(NV-Embed-v2) | +0.60 |
| Wikimedia Maps(地图) | NDCG@10 / Recall@10 | 61.69 / 76.04 | 29.04 / 44.84(VisRAG-Ret) | NDCG@10 超过 2 倍(+32.65 / +31.20) |
| 消融 · 去掉 KL 概念监督(λ=0) | 平均 NDCG@10 | 75.97(完整模型) | 74.22(λ=0)/ 75.15(对比式 Query-Concept Matching) | +1.75 / +0.82 |
局限与改进
论文未设独立局限性章节,以下结合文中证据与个人观察。其一,训练期依赖强证据提议器:容量分配与概念接地质量完全取决于 Qwen3.6-Plus 输出的框质量,提示词甚至要求'不确定时用更大的框保证完整性',这会把无关上下文计入容量,且提议器错误无法在训练中被纠正。其二,容量启发式偏几何而非语义:token 覆盖数衡量的是区域物理大小,大面积的简单横幅会消耗大量概念 token,而面积小但数字密集的关键图表可能容量不足。其三,潜在概念推理后即被丢弃:不带来任何推理期可解释性或证据定位能力,用户无法知道检索器为何判相关;概念空间也只在训练分布内有效,查询风格偏移时没有兜底。其四,评测语料偏小:OWID Charts 仅 131 页、Wikimedia Maps 455 页,各模型 R@10 普遍饱和到 99.24,区分度几乎全靠 NDCG@10;六个基准中只有 InfoVQA 是域内;TQA 上绝对值仍只有 41.30,说明密集文本-图形混合场景提升空间还很大。其五,$\lambda=0$ 时已达 74.22,相对完整模型 75.97 的总增益约 1.75 个点,概念监督的边际收益需与训练复杂度(额外的提议器调用、框解析与网格投影)权衡。
独立分析的弱点
独立分析几点弱点并给出改进方向。(1) 证据提议器是单点故障:框错了,容量与接地全错。建议用检索器自身注意力或多提议器投票做交叉验证,或以最终检索指标(如 NDCG 变化)为奖励信号做强化学习(如 GRPO)迭代优化提议策略,让框质量可自我修正。(2) '容量 = patch 覆盖数'的启发式把视觉尺寸当作语义复杂度:可改为不确定性驱动的分配——逐个增加概念 token 直到概念排序分布收敛,或训练一个小型容量预测器,把语义复杂度与物理大小解耦。(3) 概念只活在训练期:可把概念暴露到推理期用于多页/多跳证据聚合,或作为重排序器的查询展开输入,也可对概念 token 做探针分析输出伪文字证据以增强可解释性。(4) 单向量 EOS 读出可能成为长页信息瓶颈:可尝试概念引导的多向量读出,在不牺牲检索效率的前提下保留区域信息。(5) 评测停留在页面级检索,未报告下游 RAG 生成正确率、端到端延迟与存储成本,需补齐端到端评估才能支撑'训练期概念、零推理开销'的实际价值主张。
未来方向
论文结论指向的延伸方向:把潜在概念从页面级扩展到跨页、跨文档的证据组合,支撑多跳视觉 RAG(与 VisRAG 2.0 的多图推理衔接);把概念空间与生成端打通,让读取器直接以概念 token 为条件生成答案,实现检索-生成同构的潜在接口;用强化学习以最终检索指标优化证据提议器,形成自我改进闭环;从理论上刻画容量律,即 $T_i$、证据信息熵与检索性能之间的定量关系,指导容量分配;将自适应潜在概念迁移到其他密集视觉模态(幻灯片、UI 截图、医学影像、地图)。基于本文'中间表示优于两种单模态代理'的发现,还可探索文字与视觉代理的混合课程学习、概念空间在跨骨干之间的可迁移性,以及训练期概念蒸馏与推理期按需多向量展开的混合架构。
复现评估
复现条件相当好。代码与数据已在 GitHub(Neuir/ConceptFormer)开源;训练集约 38K 查询-页面对来自 DocVQA、InfoVQA、VisualMRC、OpenWikiTable、DUDE、MHDocVQA 六个公开数据集,处理后的 JSONL(含查询、正例页、边界框与文字线索)随代码发布,可跳过证据提议步骤直接训练;六个评测基准均给出 HuggingFace 数据集标识(Table 6),全部基线 checkpoint 一并列出(Table 8)。算力门槛:4×A100-40GB,LoRA $r=8$、3 个 epoch、BF16、有效批 128,属于中等规模实验室可负担的范围;关键超参集中在 Table 7(温度 $\tau=0.01$、$\lambda=0.2$、前向 KL、EOS 读出、均值池化等),证据抽取系统/用户提示词全文公开(Figure 5),显著性用置换检验($P<0.05$)。主要摩擦点:证据提议器使用 Qwen3.6-Plus 这类 API 模型,若不复用发布标注而自行重新生成框,需要 API 预算且结果会随模型版本漂移;此外 KL 方向与温度等细节需严格对齐,否则概念蒸馏易不稳定。综合评级:拥有 4 卡 A100 的团队复现难度中低,纯消费级显卡则受限于 7B 骨干微调。
论文图表
展示证据提议器 Qwen3.6-Plus 的系统与用户提示词全文。系统提示要求模型逐步思考、找出包含回答所需全部证据的区域,每个区域必须自包含,不确定时用更大的框保证完整性与可读性,并给出五条区域选择准则(完整覆盖关键证据及上下文、不裁切文字数字、优先完整信息单元、表格含表头与相关行列、多区域用多框),输出格式为 bbox_2d 坐标加简短描述标签。
证据提议的质量决定概念容量分配与接地监督的上限,这份提示词是复现训练数据的关键工程细节,也解释了为什么框会偏大。