← 返回 2026-08-04

3DZip:面向3D问答的空间感知特征多样性引导Token压缩 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

Changwoo Baek, Kyeongbo Kong 📅 2026-08-02 👍 17 2026-08-09 18:30
3D视觉语言模型 3D问答 Token压缩 体素化 决定性点过程

三阶段压缩3D VLM的token,仅用128个token保留94.7%性能并加速1.92倍

前置知识

投影式3D视觉语言模型(LLaVA-3D)

投影式3D VLM用预训练图像编码器提取多视角2D视觉token,再借助深度图和相机位姿 $T_m\in SE(3)$ 把这些token反投影到世界坐标系,并用可学习的3D位置嵌入 $\phi(\mathbf{p})$ 与视觉特征相乘结合,形成几何感知3D token $v_i=(\tilde{\mathbf{f}}_i,\mathbf{p}_i)$。LLaVA-3D是代表,它把每个场景M个视角、每视角 $N_{2D}$ 个token聚合,总token数 $N=M\times N_{2D}$ 可达上千(本文约1410)。

本文压缩对象正是这种投影产生的3D token,理解其生成方式与token膨胀成因是理解压缩动机的前提。

视觉Token压缩

视觉token数量直接决定LLM注意力计算和KV缓存开销。Token压缩通过剪枝(丢弃不重要token)或合并(融合多token)在送入LLM前减少token数,从而降低计算与内存。常见思路包括基于LLM交叉注意力(如FastV)、基于CLS token注意力(如VisionZip/VisPruner)等。

Token压缩是本文核心主题,需要先理解token数量为何是3D VLM的效率瓶颈。

决定性点过程(DPP)

DPP是一种概率点过程,给定相似度核矩阵L,选中子集A的概率正比于 $\det(L_A)$。它天然鼓励“既高质量又彼此不相似”的子集——两个元素越相似行列式越接近0。常用基于Cholesky分解的贪心近似求解,本文用它做特征空间多样性锚点选择。

第2阶段核心算法是DPP,理解它才能理解“特征多样性选择”为什么能缓解物体级冗余。

注意力/CLS-Token选择

现有2D VLM压缩常用两类信号:LLM解码时的交叉注意力(保留被文本token高度关注的视觉token,如FastV/SparseVLM)或视觉编码器CLS token的注意力(如VisionZip/VisPruner,选全局显著token)。前者依赖解码、对FlashAttention不友好且偏向靠后token;后者常忽略局部几何细节。

本文把这些方法作为基线,理解其设计与局限才能理解3DZip为何更适合3D空间token。

研究动机

投影式3D VLM(以LLaVA-3D为代表)通过把多视角2D特征提升到世界坐标系来构建几何感知3D token,能复用强2D预训练表示并实现3D推理,但代价是单场景生成上千token——LLaVA-3D每场景约1410个token,带来巨大的计算和内存开销(FLOPs达9.18T、KV缓存722MB)。虽然token压缩在2D VLM中已广泛研究,但现有方法依赖语义相关性或注意力选择(如FastV、SparseVLM基于LLM注意力;VisionZip、VisPruner基于CLS注意力),它们忽视了3D token结构化的空间特性。更关键的是,作者发现投影式多视角聚合引入两种冗余:同一物理表面被多视角重复观测产生的“点级冗余”,以及同一物体(如沙发的前、侧、背面)被多个token表征、空间坐标分离而无法靠空间聚合塌缩的“物体级冗余”,后者会导致token在物体间呈长尾分布。

本文的目标是本文目标是设计一个几何感知的3D token压缩框架3DZip,在显著降低token数量(从1410压缩到128/64/32)的同时,最大程度保留3D问答所需的语义与空间信息。形式化地,希望构造压缩token集 $\mathcal{V}'$,使得在语言模型g上的推理输出满足 $g(\mathcal{V}',t)\approx g(\mathcal{V},t)$,即与未压缩时接近,同时大幅减少token基数以降低注意力计算和KV缓存。作者希望先诊断再对症下药,针对两种不同冗余来源设计互补的压缩阶段,而不是简单套用2D压缩方法。

与已有工作不同的是,本文的独特切入角度是“对症下药地分解冗余”。作者通过实证分析揭示:即便做了体素空间聚合,token在物体间仍高度不均衡(长尾分布);空间分散性选择(XYZ-DPP)只能覆盖51%的物体实例,而特征空间多样性选择(Feature-DPP)能把覆盖率提升到70%。这一发现说明单纯的空间聚合不足以解决物体级冗余,特征分散才是更有效的判据。这把2D压缩(只看注意力/语义相关性)和3D空间聚合(只看几何邻近)各自的盲点统一起来,是本文区别于已有工作的核心洞察。

核心方法

3DZip的整体思路是“分而治之”——按冗余来源分三阶段渐进压缩。直觉上:先粗粒度把几乎重合的点合并(空间近邻),再用特征多样性挑出代表性锚点(语义去重),最后把剩余语义相近、空间也不远的token并入锚点(几何一致性)。技术路线对应:Stage1粗体素化(voxel size $\delta$)对每个体素内token做均值池化得到 $\mathcal{V}_{vox}$,先把1410个token降到几百;Stage2在 $\mathcal{V}_{vox}$ 上用DPP选K个特征多样的锚点集 $\mathcal{A}$,最大化 $\det(L_A)$,其中 $L_{kl}=\hat{\mathbf{f}}_k^\top\hat{\mathbf{f}}_l$;Stage3对每个非锚点j找特征空间最相似的锚点 $a^*(j)=\arg\min_{a}\hat{\mathbf{f}}_j^\top\hat{\mathbf{f}}_a$,仅当栅格空间距离 $d_g(j,a)\le\tau_g$ 才并入,否则丢弃,最终token数恰为K。

核心创新点是用“特征空间多样性”而非“空间分散性”作为锚点选择准则来攻克物体级冗余。本质区别在于:空间DPP倾向于在几何上铺开,但一面大墙或地板的不同位置在空间上相远却视觉相似,会被冗余选中,反而加剧长尾、把token集中在少数大物体上(覆盖率仅51%);而特征DPP直接度量语义相异性,倾向于挑出代表不同物体的token,使token在物体间更均衡(覆盖率70%)。其次,作者把“去重”(DPP选锚点)与“补全”(空间约束合并)解耦——锚点保证语义代表性,合并把互补上下文喂给锚点,同时用栅格距离 $\tau_g=5$ 守住几何一致性,并丢弃空间孤立的token。

方法步骤详情

对应Algorithm 1的三阶段。Stage1粗体素化:给定3D token集 $\mathcal{V}$ 与体素大小 $\delta=0.2$m,把空间分成轴对齐体素组 $\{G_k\}$,每组成员均值池化得到降维token集 $\mathcal{V}_{vox}$(特征 $\mathbf{f}_k$ 与位置 $\mathbf{p}_k$ 均取组内平均)。Stage2特征多样性锚点选择:归一化体素特征后构造余弦相似核 $L_{kl}=\hat{\mathbf{f}}_k^\top\hat{\mathbf{f}}_l$,用基于Cholesky分解的贪心DPP最大化 $\det(L_A)$,选出K个特征多样的锚点 $\mathcal{A}$。Stage3空间约束合并:对每个非锚点token,先在特征空间找最相似锚点 $a^*$,再换算成栅格距离 $d_g$,仅当 $d_g\le\tau_g$($\tau_g=5$)才并入该锚点、否则丢弃;锚点特征更新为自身与被并入token的均值,最终压缩集 $|\mathcal{V}'|=K$,直接送入LLM推理。

技术新颖性

新颖性可归纳为四点。第一,首次系统诊断投影式3D VLM中物体级token不平衡这一现象,并证明它即便在空间聚合后仍然存在,点明了空间聚合的盲点。第二,把DPP从“空间分散”改造成“特征多样性”判据用于3D token选择,并用object coverage(51%→70%)量化论证特征分散更优,支持“特征分散胜于几何分散”这一假设。第三,提出“选锚+约束合并”的解耦设计,三阶段分别针对点级冗余、物体级冗余、几何一致性,形成互补且可解释的管线,而非单一启发式。第四,方法是一次性(one-pass)几何感知选择,避免DTC式迭代匹配与精炼的开销,与FlashAttention兼容;在相同token预算下理论FLOPs与DTC相当但实际更快(178ms vs 196ms)。

几何感知3D token构建与压缩目标概览
Fig. 2: 几何感知3D token构建与压缩目标概览
三阶段token压缩pipeline概览
Fig. 3: 三阶段token压缩pipeline概览
3DZip算法概览
Algorithm 1: 3DZip算法概览

实验结果

Table 1显示在ScanQA/SQA3D/OpenEQA上3DZip在128/64/32 token预算下全面领先。128 token(1410的9.1%)时3DZip达24.2/53.2/58.6,保留94.7%,超过VisPruner(90.0%)、Voxelization(90.7%)、DTC(88.8%)、FastV(88.9%)等全部基线;64 token保留92.3%、32 token仍88.9%,SQA3D在32 token达51.1远高于DTC的48.8。Table 2类别分析显示3DZip在属性识别(128token时64.2逼近未压缩的64.0)和物体识别(32token时+6.7领先)增益最大。消融(Table 3):特征距离52.8显著优于空间距离50.1@64token;体素 $\delta=0.2$m最佳(52.8);合并步+0.3、空间约束+0.5。效率(Table 4):延迟342→178ms(1.92×加速),FLOPs 9.18T→0.90T(−90.2%),KV缓存722→101MB(−86.0%),EM仅降2.5。

token压缩方法在ScanQA/SQA3D/OpenEQA上的对比
Table 1: token压缩方法在ScanQA/SQA3D/OpenEQA上的对比
OpenEQA按类别结果
Table 2: OpenEQA按类别结果
SQA3D上的组件消融(a)(b)(c)
Table 3: SQA3D上的组件消融(a)(b)(c)
RTX 4090上SQA3D的效率与精度对比
Table 4: RTX 4090上SQA3D的效率与精度对比
保留3D token的定性对比
Fig. 4: 保留3D token的定性对比
查看结构化数据
任务指标本文基线提升
SQA3D 3D问答(test set) EM(exact match accuracy) 53.2 @128token LLaVA-3D未压缩 55.7 @1410token 仅丢2.5分(保留94.7%),且优于同预算最强基线VisPruner(52.0)
OpenEQA 具身推理 GPT-4o LLM-Match score 58.6 @128token LLaVA-3D未压缩 60.3;DTC 54.8 @128token 相对保留94.7%,比DTC高+3.8
ScanQA 室内问答(val split) EM 24.2 @128token LLaVA-3D未压缩 26.5;Voxelization 23.6 比最强空间基线Voxelization高+0.6
推理效率(RTX 4090, SQA3D) Latency (ms/sample) 178 @128token DTC 196 @128token;LLaVA-3D 342 @1410token 比DTC快9.2%,比未压缩快1.92×,FLOPs降90.2%

局限与改进

作者承认两点局限。一是Stage1粗体素化可能削弱小物体的细粒度线索——小物体的token会被并入同一体素内的邻近物体或背景(见Supp B.8分析)。二是超参数($\delta$、$\tau_g$)跨场景固定,未随场景复杂度自适应,而场景尺寸会影响物体密度与物体间距离,固定超参在不同环境下未必最优(Supp B.9分析了场景尺度敏感性)。我的补充观察:实验主要基于LLaVA-3D单一骨干(虽Supp补了Video-3D-LLM、SR-3D);DPP贪心近似在极大规模token上的工程开销未充分讨论;object coverage分析依赖GT物体mask,方法在无标注真实场景中的鲁棒性未被直接验证。

独立分析的弱点

弱点一:小物体在 $\delta=0.2$m体素下易被淹没,改进方向是自适应体素(按局部点密度/物体尺度缩小体素)或多尺度体素金字塔。弱点二:固定 $\delta$、$\tau_g$、锚点数K三个超参,改进方向是按场景bounding box或物体密度自适应设定K,以及学习式阈值。弱点三:DPP锚点选择纯依赖余弦特征相似,未结合3D几何或语义先验,可考虑在DPP核中融合空间正则(软约束)或引入实例分割先验引导。弱点四:仅在室内ScanNet类场景验证,对大尺度户外/机器人场景(物体更稀疏、尺度变化大)的泛化未知,建议补充ScanNet++或室外点云基准。

未来方向

作者明确提到:开发兼顾场景复杂度与小物体密度的自适应超参数选择是有前景的未来方向。基于成果可延伸:把特征多样性DPP思想推广到视频3D VLM(如Video-3D-LLM)的长时序token压缩;将3DZip作为即插即用模块集成到具身智能/3D机器人pipeline,利用其低KV缓存(101MB)做端侧部署;探索与FlashAttention/投机解码结合的进一步加速;把“点级/物体级冗余”这套诊断框架迁移到其他模态(如多模态长视频、多视角重建)的token压缩问题。

复现评估

复现评估中等偏好。论文给出了关键超参($\delta=0.2$m、$\tau_g=5$、temperature=0)、完整三阶段算法(Algorithm 1)、骨干模型(LLaVA-3D)、三个公开基准(ScanQA、SQA3D、OpenEQA)及标准评测协议(EM、GPT-4o LLM-Match)。项目主页cvsp-lab.github.io/3DZip暗示有代码,但正文未明确开源license与发布状态。算力需求中等:评测在单卡RTX 4090上完成。难点在于DPP贪心Cholesky实现、3D token构建依赖深度图与位姿,以及ScanNet系列数据需申请许可,这些对完全独立复现构成一定门槛。