CoVeR:面向视觉语言模型多视角3D推理的基于覆盖率的词元剪枝 CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs
仅用3D坐标、免训练地把多视角词元精确剪到目标数量,8%词元保留93.5%性能
前置知识
视觉词元与多视角3D推理
视觉词元(visual token)是 VLM 把图像切 patch 后经视觉编码器输出的最小视觉单元,例如 LLaVA-OneVision-7B 每张 384×384 图输出 729 个词元。多视角 3D 推理的思路是把 3D 场景渲染成多张带位姿 RGB-D 视图喂给 2D VLM,复用其预训练先验回答 3D 问题,绕开 3D 标注数据稀缺。代价是词元数随视角线性增长:12 视角即产生 8,748 个词元。
本文要解决的核心问题就是多视角词元的几何冗余与计算膨胀,不理解词元如何产生、数量如何随视角增长,就无法理解剪枝的对象与收益来源。
有向 Hausdorff 距离与 k-center 问题
有向 Hausdorff 距离 $d_H(\mathcal{X},\mathcal{C})=\max_{t\in\mathcal{X}}\delta(t;\mathcal{C})$,其中 $\delta(t;\mathcal{C})=\min_{j\in\mathcal{C}}\|t-t_j\|_2$,度量『最欠覆盖的词元离最近保留词元有多远』,值小说明没有场景区域被整体丢弃。在恰好保留 $B$ 个点的约束下最小化该距离,就是离散欧氏 k-center 问题(NP-hard)。
CoVeR 的目标函数与全部理论结果($\sqrt{3}v_s$ 覆盖界、$d_H$ 单调不增、2-近似)都建立在这两个概念上,是读懂方法与附录证明的前提。
最远点采样(FPS)
FPS 是经典的覆盖率驱动采样算法:从空集开始,每轮选出距当前已选集合最远的点加入,并用它更新其余各点到已选集的最小距离($d_{min}(m)\leftarrow\min(d_{min}(m),\|t_m-t_{m^*}\|_2^2)$),重复直到取满预算。它天然把新样本落在最欠覆盖的区域,总代价约 $O(BM)$,工程上很便宜。
CoVeR 第二阶段『覆盖扩展』就是以体素代表为种子的 FPS,其贪心的 max-min 性质直接给出 $d_H$ 单调不增与对 k-center 最优解的 2-近似保证。
体素化词元剪枝(VTC/DTC)
把每个词元按 3D 坐标反投影并分入边长 $v_s$ 的立方体(体素),同一占据体素内的词元合并为一个:VTC 对体素内特征取平均得到合成词元,DTC 提高体素分辨率后再按特征相似度合并。覆盖好,但输出数量由几何 occupancy 决定而非预算控制:约 31% 词元跨视角空间重叠,使可达保留率停在约 69%,高冗余场景只能压到 46.2%–57%。
它是本文被剖析的两大基线家族之一;理解其『体素饱和』与『单场景预算不可控』两大缺陷,才能体会 CoVeR 两阶段设计的针对性。
预填充 TFLOPs 与 KV cache
LLM 处理提示词(含视觉词元)的预填充计算量包含 $O(n^2 d)$ 的注意力项和 $O(nd^2)$ 的线性层项($n$ 为序列长度),保留词元越少越省;KV cache 大小与 $n$ 成正比,是多视角长序列下显存的主要瓶颈。论文同时报告剪枝耗时、端到端推理时延与峰值 GPU 显存。
这些是论文效率主张的度量口径:例如 9% 保留时 LLM TFLOPs 降 13.3 倍、KV cache 降 10.7 倍、显存从 24.1GB 降到 17.2GB,读懂指标才能评估实际部署价值。
研究动机
用 2D VLM 做多视角 3D 推理时,视觉词元数量随视角数线性膨胀:LLaVA-OneVision-7B 输入 12 个视角(每张图 729 个词元)会产生 8,748 个视觉词元,LLM 的预填充计算量、KV cache 和显存随之暴涨。现有词元剪枝方法分两族,都在该场景下失效。学习重要性一族(VisPruner、SeGPruner 等)用注意力或视觉特征给词元打分后保留 top-K,但多视角下冗余本质是几何性的——不同相机拍到同一片物理区域,与几何无关的重要性分数会把预算花在少数显著区域的近重复词元上,让场景大部分区域完全失去表示。体素化一族(VTC、DTC)把词元反投影回 3D 再合并同体素词元,虽改善覆盖却控制不了输出数量:固定体素尺寸 $v_s$ 下,作者实测约 31% 的词元跨视角空间重叠,仅靠体素化平均只能保留约 69% 词元,最冗余场景只能压到 46.2%–57%;且同一 $v_s$ 在不同场景产出数量不同,在 $v_s=0.2$ m、预算 $B=1342$ 时 56% 的场景低于预算、44% 超出,无法给出单场景的显存或时延保证。
本文的目标是本文目标是设计一个只用几何信息(词元 3D 坐标)的确定性、免训练词元选择器:给定精确预算 $B$,对每个场景(而非数据集平均)都恰好返回 $B$ 个词元,并让这些词元在空间上覆盖整个观测场景。作者用有向 Hausdorff 距离 $d_H(\mathcal{X},\mathcal{C})=\max_{t\in\mathcal{X}}\min_{j\in\mathcal{C}}\|t-t_j\|_2$ 刻画覆盖质量,把它形式化为离散欧氏 k-center 问题:在保留恰好 $B$ 个词元的约束下最小化最差覆盖距离。同时希望方法不依赖注意力、编码器特征或辅助编码器,成为即插即用、跨 VLM 迁移的通用模块,并在保持精度的前提下大幅降低 TFLOPs、KV cache、推理时延和峰值显存,使多视角 3D 推理能在单卡上扩展到更多视角。
与已有工作不同的是,独特切入在于把剪枝目标从『挑重要的词元』换成『让保留集合覆盖场景』。此前两族方法分别以注意力/特征重要性或体素 occupancy 为准:前者保留近重复词元导致欠覆盖,后者覆盖好但预算不精确且受体素饱和限制。CoVeR 首次用统计指标(NNI、NND95、NND100)把空间覆盖率与 3D 推理性能正相关起来,并指出体素化饱和的本质是跨视角近重复观测:约 31% 的词元在 3D 中重叠,使可达保留率封顶在约 69%。方法上它把体素化和最远点采样(FPS)两种经典几何工具组合成『初始化+扩展』两阶段:体素化一步铺开粗覆盖,FPS 突破饱和上限补足预算,整个过程免训练、确定性、逐场景精确控制预算,填补了『有覆盖无预算』与『有预算无覆盖』之间的空白。
核心方法
直觉上,剪枝不该问『哪些词元重要』,而该问『保留哪些词元能让场景每个角落都有代表』。CoVeR 把 posed RGB-D 多视角输入经冻结视觉编码器得到的 $M$ 个 patch 词元反投影到世界坐标 $\mathcal{X}=\{t_i\}_{i=1}^M$($t_i\in\mathbb{R}^3$),然后求解带预算约束的 k-center 问题:$\mathcal{C}^*=\arg\min_{\mathcal{C}\subseteq\{1..M\},|\mathcal{C}|=B} d_H(\mathcal{X},\mathcal{C})$。技术路线分两阶段:阶段一『覆盖初始化』按场景自适应地二分搜索体素尺寸 $v_s$,让占据体素数 $G(v_s;\mathcal{X})$ 落在目标 $B_{init}=\max(1,\lfloor\alpha B\rfloor)$ 的容差内,每个占据体素保留一个代表性词元,快速去除跨视角近重复并铺开粗覆盖;阶段二『覆盖扩展』以阶段一结果为种子做最远点采样,每步选择距当前已选集合最远的词元,直到恰好凑满 $B$ 个。两阶段互补:体素化便宜且一步覆盖全场但数量受分辨率封顶,FPS 数量灵活但从零构建覆盖慢。
核心创新有三点。第一,把覆盖作为显式优化目标并给出可证明保证:贪心 FPS 每步都在做 max-min(Lemma 3),使 $d_H$ 在扩展阶段单调不增(Lemma 2);同体素内任两点距离不超过体素对角线,故 $d_H(\mathcal{X},\mathcal{C}_{init})\le\sqrt{3}v_s$(Lemma 1);整体有 $d_H\le 2\cdot\mathrm{OPT}_{B_{expan}}$ 的 2-近似(Proposition 1)。第二,与已有方法的本质区别在『保留原始词元而非合成特征』和『用空间距离而非学习信号』:消融显示保留编码器原生词元比体素内特征平均在最小预算下高 7.7/18.1 EM@1(ScanQA/SQA3D),纯空间距离比空间+语义混合 FPS 高 1.7/2.1、比纯语义 FPS 高 2.9/4.3——语义相似度会把 3D 位置不同的相似物体错误压缩,空间距离则保留它们。第三,逐场景二分搜索 $v_s$ 加预算保护机制(若 $|\mathcal{C}_{init}|>B$ 则只保留最拥挤的 $B$ 个体素的代表),保证任何可行预算 $B\le M$ 下精确输出 $B$ 个词元,这是体素化方法做不到的。
方法步骤详情
完整流程输入为词元 3D 坐标 $\mathcal{X}$、预算 $B$ 和比例 $\alpha$(全文取 0.4),输出恰为 $B$ 个索引。步骤一:每个词元按 $v_i=\lfloor t_i/v_s\rfloor$ 索引到体素。步骤二:在固定区间 $[v_{min},v_{max}]=[0.02,5.0]$ 米内二分搜索 $v_s$(最多 $T=16$ 轮、容差 $\tau=0.05$):若占据体素数 $G(v_s;\mathcal{X})>(1+\tau)B_{init}$ 则调大 $v_s$,过小则调小,使 $G$ 接近 $B_{init}$。步骤三:每个占据体素用 $i_{rep_k}=\arg\min_{i\in V_k}\|t_i-\frac{1}{|V_k|-1}\sum_{j\in V_k,j\ne i}t_j\|_2$ 选最靠近体素均值的真实词元作代表(而非 VTC 式特征平均),得到 $|\mathcal{C}_{init}|=\min(G(v_s;\mathcal{X}),B)$。步骤四:计算每个未选词元到 $\mathcal{C}_{init}$ 的最小平方欧氏距离 $d_{min}(m)$,迭代 $B_{expan}=B-|\mathcal{C}_{init}|$ 轮,每轮取 $m^*=\arg\max_m d_{min}(m)$ 加入扩展集并更新所有距离。步骤五:返回 $\mathcal{C}=\mathcal{C}_{init}\cup\mathcal{C}_{expan}$,保持原生序列顺序插入 LLM 输入(所有词元仍通过投影层,仅被剪词元不进入 LLM),从而兼容不同投影器结构。
技术新颖性
技术新颖性体现在多个层面。与 VTC/DTC 相比,CoVeR 不受体素饱和封顶——实测体素化在 $v_s=0.02$ m 附近保留率停滞在约 69%(高冗余场景 46.2%–57%),而阶段二 FPS 能突破该上限达到任意预算;与 SeGPruner/VisPruner/Geo3DPruner 相比,CoVeR 完全不用注意力、视觉特征、语义相似度或辅助编码器(Geo3DPruner 需引入 VGGT-1B 编码器并全量重训骨干),因此免训练、确定、跨架构迁移。理论上它给出可证明的保证链:逐场景精确预算(Theorem 1)、$\sqrt{3}v_s$ 覆盖界、$d_H$ 单调不增、以及对 k-center 最优解的 2-近似,实证上 9% 保留率时 $d_H$ 仅为场景对角线的 2.3%,远低于 9.6% 的理论界,说明界保守而实用。工程上,把体素代表作为 FPS 种子的设计使剪枝时间缩短约 1.5 倍(0.126→0.082 s @23% 保留),纯几何选择的开销只占端到端推理的零头(0.034 s vs 0.174 s @9% 保留)。
实验结果
主实验(Table 2,LLaVA-OV-7B、12 视角)显示 CoVeR 在所有预算上聚合最优:约 8% 词元保留下平均保持全词元性能的 93.5%,超过 SeGPruner 的 89.6% 和 VisPruner 的 85.9%,比 SOTA 平均高 3.9 个百分点。分任务看:ScanQA 在 23% 保留时 EM@1 达 28.5、CIDEr 85.5,反超全词元基线(28.2/83.6);压到 9% 时仍有 27.1/81.4/41.5,显著高于 SeGPruner(24.5/71.2/37.0)和 VisPruner(23.4/66.9/35.6);SQA3D 在 8% 保留时 48.6 EM@1(全词元 51.7);OpenEQA 在激进预算下同样领先。几何覆盖分析(Table 3)证实机制:CoVeR 的 NNI=0.924 vs SeGPruner 0.458,NND95=0.980 vs 0.967,NND100=0.977 vs 0.917(均为最紧 9% 预算,配对 t 检验和 Wilcoxon 显著)。方向性距离(Table 4)显示 TR=0.009、TE=0.020:SeGPruner 选的每个区域 CoVeR 都保住(距某 CoVeR 词元 3.1% 场景对角线内),而约 20% 的 CoVeR 词元落在 SeGPruner 未覆盖的新区域。效率上(Table 5),9% 保留时 LLM TFLOPs 降 13.3 倍(145.5→10.9)、KV cache 降 10.7 倍(480→44.7 MB)、推理加速 2.9 倍(0.497→0.174 s)、显存从 24.1 降到 17.2 GB,精度只掉 1.1 点;14% 保留时 TFLOPs 降 8.6 倍、KV cache 降 7 倍、加速 2.5 倍、相对损失仅 1.1%。跨骨干(Fig 5):不改任何超参迁移到 Qwen2.5-VL-7B 和 Qwen3-VL-8B,20% 以上保留时保持 >96%(ScanQA)/>95%(SQA3D),9% 时仍 >93%。类别层面(Table A4/A5),17% 保留时 OpenEQA 空间理解类得分超全词元模型(GPT-4 评委 45.1 vs 43.6;GPT-4o 评委 50.5 vs 49.1)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ScanQA(3D 空间理解,EM@1,9% 词元保留) | EM@1 | 27.1 | SeGPruner 24.5 / VisPruner 23.4 / DTC 26.1 | 较最强基线 SeGPruner +2.6,且仅比全词元基线(28.2)低 1.1 |
| ScanQA(CIDEr,9% 词元保留) | CIDEr | 81.4 | SeGPruner 71.2 / VisPruner 66.9 | +10.2(vs SeGPruner),ROUGE-L 41.5 vs 37.0 同步领先 +4.5 |
| 三基准平均性能保持率(8–9% 词元保留) | Rel.(相对全词元性能 %) | 93.5% | SeGPruner 89.6% / VisPruner 85.9% | +3.9 个百分点(论文宣称的平均 SOTA 提升幅度) |
| SQA3D(情景推理,8% 词元保留) | EM@1 | 48.6 | SeGPruner 48.4 / VisPruner 45.7 / 全词元 51.7 | 较 SeGPruner +0.2、VisPruner +2.9,保留全词元性能的 94.0% |
| OpenEQA(开放词汇具身问答,8% 词元保留) | LLM-Match (GPT-4o) | 53.0 | SeGPruner 52.5 / VisPruner 51.5 / 全词元 59.1 | 激进预算下领先两个学习重要性基线,保持全词元性能的 89.7% |
| 效率(ScanQA,9% 词元保留,LLaVA-OV-7B) | LLM TFLOPs / KV cache / 时延 / 显存 | 10.9 TFLOPs / 44.7 MB / 0.174 s / 17.2 GB | 全词元:145.5 TFLOPs / 480.0 MB / 0.497 s / 24.1 GB | 13.3× / 10.7× / 2.9× / 1.4× 降低,EM@1 仅 -1.1 |
| 跨骨干泛化(Video-3D LLM,16 视角,10% 预算) | ScanQA EM@1 / Rel. | 26.5 / 93.5% | Geo3DPruner 26.0 / 90.7%(需 VGGT-1B 编码器 + 全量重训) | +0.5 EM@1、+2.8pp 保持率,且免训练、零额外编码器 |
局限与改进
作者承认的局限:CoVeR 需要深度和相机位姿(posed RGB-D 输入),专为室内场景设计,性能依赖几何估计质量;室外大场景和位姿噪声大的情形未验证。我自己的观察:其一,纯几何选择对『几何上分散但语义关键』的物体没有偏好,虽然实验显示它通常把学习重要性所选的显著区域都保留下来(TR=0.009,Fig A3 中 TR 曲线在所有预算都达 1),但没有机制保证小而关键的证据(如提问所指的小物体)一定存活,极端查询下存在丢证据风险;其二,反投影要求有效深度通道,对无深度的纯 RGB 视频 VLM 场景(长视频理解等)不适用,适用范围窄于通用单图剪枝器;其三,评测集中在 ScanNet/HM3D 系问答(ScanQA 4,306 题、SQA3D 3,519 题、OpenEQA 1,636 题),任务类型均为 QA,对导航、dense prediction 等下游任务未验证;其四,safeguard 情形($|\mathcal{C}_{init}|>B$)下 $\sqrt{3}v_s$ 覆盖界不再成立,理论上覆盖退化为无保证(虽然实验中该情形从未触发);其五,FPS 逐点选择的 $O(BM)$ 距离更新在词元数极大、预算极高时会成为可感知开销(0.189 s @54%)。
独立分析的弱点
独立分析几点弱点并给出改进方向。(1) 深度与位姿依赖:当前管线假设 posed RGB-D 输入,最直接的扩展是与单目度量深度估计或轻量 SfM 结合,用估计几何替代传感器深度,但需系统评估几何噪声对体素占据和 FPS 选择的传播影响。(2) 均匀覆盖未必等于任务最优:k-center 目标对全场景一视同仁,可引入轻量查询相关性作为加权覆盖(如用问题文本与词元的相似度做分层预算),在保持几何覆盖底线的同时向任务相关区域倾斜。(3) 静态单次剪枝:所有词元在进入 LLM 前一次性剪掉,无法随推理进程回收信息;可发展为作者提到的层级/流式选择,或在后续层按注意力从被剪词元池中召回少量 token 的两段式方案。(4) 代表点选择的鲁棒性:体素代表取『最靠近其余点均值』的词元,在墙面掠射形成的极扁体素占据下可能偏在角落,可对每个体素内部再解一个微型 k-center。(5) 评测广度:应在具身导航、3D grounding、需要细粒度计数的任务上验证,并测试深度噪声、位姿误差的敏感性曲线。
未来方向
作者提出的未来方向:把覆盖选择与可靠的深度/位姿估计结合,降低对输入几何质量的依赖;发展面向室外大场景的层级式(hierarchical)或流式(streaming)选择。基于本文成果可延伸的方向:(1) 把『覆盖率-性能正相关』这一统计发现(NNI/NND 与精度在所有消融变体上完全同序,Fig 8)提炼为视频时序、医学影像、遥感等多视角场景词元压缩的通用设计准则;(2) 与 token merging 混合:消融已证明原生词元优于平均特征,但在极低预算下可对低相关区域合并、对查询相关区域保留原生词元,进一步推低保留率;(3) 理论上把 2-近似推广到带任务权重的加权 k-center,并给出 safeguard 激活时的覆盖下界;(4) 与 3D 位置编码类方法(如 Video-3D LLM 的正弦编码)叠加,或在语义分割、导航策略中作为通用前端压缩器;(5) 在线机器人场景做增量覆盖维护——新视角到来时只更新受影响体素与 FPS 距离队列,实现真正的流式多视角推理。
复现评估
复现评估:论文提供项目主页 humansensinglab.github.io/CoVeR,正文未明确承诺开源代码;基线中 VTC/DTC 与 Geo3DPruner 官方代码不公开(作者按其论文协议取报告分数),VisPruner/SeGPruner 用官方实现在同一环境复现(重要性比例 0.5)。数据均为公开基准:ScanQA val(4,306 问/71 场景)、SQA3D test(3,519 问/67 场景)、OpenEQA(1,636 问/152 场景,ScanNet+HM3D),依赖 posed RGB-D。算力需求低:全部实验在单张 NVIDIA H100 上完成,方法免训练,只需各 VLM 前向推理;剪枝器仅做二分搜索(≤16 轮)+ FPS,超参极少($\alpha=0.4$、$\tau=0.05$、$T=16$、$[0.02,5.0]$ 米),消融显示 $\alpha$ 在 0.1–0.9 间性能变化很窄,对超参不敏感。Algorithm 1 伪代码完整、理论证明在附录,核心实现约数百行。唯一外部依赖是 OpenEQA 的 LLM-Match 需调用 GPT-4/GPT-4o 评委,引入少量 API 成本与评分方差。总体属中低复现难度,主要工作量在搭建多视角输入管线与复现各基线。
论文图表
(a) 约 31% 词元跨视角空间重叠;(b) 高冗余场景体素化只能压到 46.2%–57% 保留率;(c) 固定 $v_s=0.2$ m 时 56% 场景低于预算、44% 超出;(d) 占据体素数随 $v_s$ 减小的饱和曲线(约 69% 封顶);(e) CoVeR 在所有场景与预算下都精确命中目标词元数。
动机部分的实证核心:同时证明体素化的两大缺陷(饱和、预算不可控)与 CoVeR 的逐场景精确预算保证,是说服读者接受新范式的关键证据。