REBASE:基于参考背景子空间消除的免训练上下文分割 REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation
消除共享背景子空间的免训练单样本分割新框架
前置知识
免训练上下文分割 (Training-Free In-Context Segmentation)
给定一张带标注掩码的参考图像和一张查询图像,模型在推理时直接预测查询图中的同类目标,无需任何微调或参数更新。当前主流配方来自 PerSAM:用 DINOv2 等自监督 ViT 提取稠密特征,计算参考前景原型与查询 patch 的余弦相似度,再用相似度峰值作为点提示驱动 SAM 的掩码解码器。
本文正是针对这条配方的关键瓶颈(跨图相似度质量)做改进,理解这一管线是读懂全文的基础。
段任意模型 SAM (Segment Anything Model)
Meta 提出的通用分割基础模型,在超 10 亿掩码上训练,接受点、框或粗掩码等稀疏提示,输出高质量类别无关掩码,并有 SAM 2、SAM 3 等后继版本。其掩码输入分支还可接收一张低分辨率稠密 logit 图作为先验,是本文重点激活的通道。
本文冻结使用 SAM ViT-H 解码器,并首次系统性利用了被既有免训练方法忽视的稠密掩码输入分支。
自监督视觉 Transformer DINOv2 / DINOv3
通过自蒸馏在大规模无标注图像上训练的 ViT,输出的 patch 嵌入在不同图像间表现出强语义一致性,是稠密跨图对应估计的利器。但全局自注意力会让每个 token 都混入周围场景信息,产生所谓的上下文污染。
REBASE 的核心正是清洗 DINOv2 特征中的场景上下文方向,理解这一点才能抓住方法本质。
正交投影与子空间消除 (Orthogonal Projection)
给定正交基 $B\in\mathbb{R}^{C\times s}$(满足 $B^\top B=I_s$),投影矩阵 $P_B=I_C-BB^\top$ 会把任意向量中沿 $B$ 列方向的分量清零、保留正交分量。本文对参考背景特征做 SVD 取前 $s$ 个右奇异向量得到 $B$,再用 $eF=F P_B$ 同时清洗参考与查询特征。
这是全文唯一真正的数学操作,理解正交投影就理解了背景子空间消除的全部机理。
最远点采样 (Farthest-Point Sampling, FPS)
一种贪心采样策略:先选一个种子点,随后每步选择距离已选点集最远的候选点,从而在空间上均匀散布样本。本文把它与相似度加权结合(SW-FPS),用 $\alpha\tilde d(p)+(1-\alpha)\tilde s(p)$ 兼顾空间分散与相似度大小。
SW-FPS 解决了 PerSAM 单点提示在细长或铰接目标上不完整的问题,是方法三大组件之一。
研究动机
免训练上下文分割(如 PerSAM、Matcher、GF-SAM、INSID3)的准确率上限由跨图像相似度图的判别质量决定。在自然单样本数据中,参考图与查询图虽属同类,却往往共享统计相关的背景分布:羊伴着草地、鸟伴着天空、家具伴着室内结构、动物身体不同部位共享解剖区域。在 DINOv2 这类自监督 ViT 中,全局自注意力使每个 patch 嵌入都不可避免地编码了周围场景信息,于是这些共享上下文方向会同时出现在两张图的背景特征里。当用参考前景原型计算余弦相似度时,这些方向对内积的贡献恒为正,无论查询 patch 是否落在目标上——结果相似度图在非目标区域被系统性抬高,既污染注入 SAM 的稠密先验,又让选出的点提示发生空间漂移。该现象在前景只占 patch 网格很小比例的部位级或铰接目标上尤为严重,共享上下文 patch 会霸占相似度排名靠前的候选位置。
本文的目标是本文要构建一个完全免训练、零参数更新的单样本上下文分割管线,在不更换冻结的 DINOv2 主干和 SAM 解码器的前提下,把跨图像相似度图的判别力提升到能在五个差异极大的基准(ISIC 皮肤病变、Chest X-Ray 肺部分割、FSS-1000 通用物体、PASCAL-Part 与 PACO-Part 部位级)上全面刷新免训练 SOTA。具体目标包括:在 ISIC 上达到 $63.8\%$ mIoU(较此前最佳 INSID3 的 $54.4\%$ 提升 $9.4$pp)、在 X-Ray 上达到 $86.3\%$(较 INSID3 提升 $7.5$pp)、在 FSS-1000 上达到 $88.2\%$,并仅暴露一个全局超参(背景子空间秩比例 $r$)即可在所有数据集上一致迁移,无需逐数据集调参。
与已有工作不同的是,已有的特征去偏工作(如 INSID3 的位置去偏、SINDER、DVT)针对的是自监督 ViT 中冻结的、全局性的位置先验或奇异缺陷,所用基底要么从合成噪声图一次性估计、要么基于数据集级统计。本文抓住了一个被忽视的维度:同一对参考-查询图像之间存在的是场景级、语义级的共享上下文偏置(相机内参、光照场、低频纹理、共现背景语义),这些方向每个 episode 都不同。因此本文把基底改为每 episode 从参考图自身背景动态估计,消除的是语义上下文而非空间坐标,与位置去偏在概念上正交——作者用替换/堆叠实验证明二者在医学图像 ISIC 上还能叠加 $1.66$pp 增益。
核心方法
直觉上,REBASE 像是给两张图先减去共同的背景噪声,再比对谁更像。既然背景上下文(草地、天空、皮肤纹理)在参考和查询里都存在,就可以把参考图的背景特征做奇异值分解,找出它们聚集出的少数几个主方向,再让参考和查询的所有 patch 特征都垂直于这些方向——这样背景再相似也不会拉高相似度。技术路线分四步:冻结 DINOv2 ViT-L/14 提取 $518\times518$ 参考与查询的稠密 patch 特征 $F_R, F_Q$;从参考背景 patch 矩阵做薄 SVD 取前 $s$ 个右奇异向量构成基底 $B$,用投影 $P_B=I_C-BB^\top$ 对称清洗两路特征得到 $eF_R, eF_Q$;用前景覆盖率加权计算相似度图 $S$;通过相似度加权最远点采样(SW-FPS,$K=8$)产出空间分散的点提示,并把标准化后的 $S$ 注入 SAM 的稠密掩码输入分支,最后冻结的 SAM ViT-H 一次前向给出掩码。
最本质的创新是参考条件化的逐 episode 背景子空间消除。与 PerSAM 直接用原始 DINOv2 特征算相似度、或 INSID3 投影掉全局位置基底都不同,REBASE 用闭式解 $\tilde F = F(I-BB^\top)$ 把当前这张参考图的背景长什么样显式建模出来并剔除。公式上 $B = V[:,1:s]$ 来自参考背景特征矩阵 $X_R$ 的薄 SVD $X_R=U\Sigma V^\top$,秩 $s=\lceil r\cdot n_{BG}\rceil$ 随每张图背景 patch 数自适应。因为 $B$ 完全从参考背景估计,任何与该背景共享上下文的查询 patch 都会在 $\mathrm{span}(B)$ 上有大投影而被 $P_B$ 衰减,而真正与目标相关的 patch 投影较弱从而被保留。这一操作零参数、闭式、每 episode 仅需一次 SVD,却同时改善了稠密先验保真度与点提示的空间定位精度。
方法步骤详情
完整流程分六步。①冻结 DINOv2 ViT-L/14 以 $518\times518$ 编码参考与查询,得 $F_R,F_Q$;下采样掩码到 patch 网格得软前景覆盖率 $\bar M_R(p)\in[0,1]$。②以 $\tau_b=0.08$ 选背景 patch 堆叠为 $X_R$ 做薄 SVD,取 $B=V[:,1:s]$,秩 $s=\lceil r\cdot n_{BG}\rceil$($r=0.005$);投影 $P_B=I_C-BB^\top$ 对称清洗两路特征。③按 $\bar M_R(p)$ 加权算参考前景原型与查询 patch 的余弦相似度图 $S(q)$ 并上采样。④SW-FPS:候选集 $\Omega=\{p:S(p)\geq\mu_++\sigma_+/2\}$,首点取全局最大,后续按 $\alpha\tilde d(p)+(1-\alpha)\tilde s(p)$ 贪心选点,兼顾空间分散与相似度($\alpha=0.5$、$K=8$)。⑤稠密先验:$S$ 标准化为零均值单位方差,正支集作粗前景、其余赋 $\ell_{bg}=-2$,腐蚀后重采样到 SAM 的 $256\times256$ 掩码输入分支。⑥点提示与稠密先验送入冻结 SAM ViT-H,单次前向输出掩码。
技术新颖性
新颖性有三层。其一,去偏对象独特:既有方法(INSID3 位置去偏、SINDER 与 DVT 的奇异缺陷修复)针对全局、静态、空间坐标类的偏置,而 REBASE 针对逐 episode 动态、语义场景级的偏置,二者从概念上正交,作者用替换/堆叠实验证明在 ISIC 上还能叠加 $1.66$pp。其二,稠密先验通道的系统性启用:PerSAM、Matcher、GF-SAM 几乎只用稀疏点提示,REBASE 把整张相似度图标准化后注入 SAM 一直被冷落的掩码输入分支,消融显示该模块在 ISIC 上单独贡献 $12.37$pp。其三,自适应秩与单超参:秩 $s=\lceil r\cdot n_{BG}\rceil$ 随每图背景 patch 数伸缩,使单一 $r=0.005$ 在五个基准间一致迁移,敏感性实验显示 $r$ 在 $0.005$ 到 $0.01$ 间波动不超过 $0.7$pp,鲁棒性远超固定秩方案。
实验结果
论文在覆盖自然图像、部位级、医学的五个基准上评估。医学提升最大:ISIC 达 $63.8\%$ mIoU,较此前最佳免训练方法 INSID3($54.4\%$)高 $9.4$pp;Chest X-Ray 达 $86.3\%$,较 INSID3($78.8\%$)高 $7.5$pp,仅比全量微调的 SegGPT($87.5\%$)低 $1.2$pp——医学图像场景上下文结构化,背景子空间投影收益最显著。FSS-1000 达 $88.2\%$,超过 GF-SAM($88.0\%$)、INSID3($83.7\%$)甚至微调基线 SegGPT($85.6\%$)。部位级上 PACO-Part 达 $39.3\%$(较 INSID3 $+0.6$pp、GF-SAM $+3.0$pp);PASCAL-Part 达 $46.6\%$ 排第二,落后用 DINOv3-L 的 INSID3($50.5\%$)。消融显示从 argmax 单点出发,加 SW-FPS、稠密先验、REBASE 在 ISIC 上累计各提升 $9.07/12.37/3.93$pp。秩敏感性表明 $r$ 从 $0.005$ 升到 $0.9$ 会使 FSS-1000 掉 $13.7$pp,只需保留少数主奇异方向。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ISIC 皮肤病变分割 | mIoU (%) | 63.8 | INSID3 54.4 | +9.4pp(免训练 SOTA) |
| Chest X-Ray 肺部分割 | mIoU (%) | 86.3 | INSID3 78.8(微调 SegGPT 87.5) | +7.5pp,仅比全量微调低 1.2pp |
| FSS-1000 通用物体分割 | mIoU (%) | 88.2 | GF-SAM 88.0 / 微调 SegGPT 85.6 | +0.2pp,超越最强微调基线 |
| PACO-Part 部位分割 | mIoU (%) | 39.3 | INSID3 38.7 / GF-SAM 36.3 | +0.6 / +3.0pp |
| PASCAL-Part 部位分割 | mIoU (%) | 46.6 | INSID3 50.5(用 DINOv3-L) | −3.9pp,排名第二 |
局限与改进
作者承认在 PASCAL-Part 上落后 INSID3 约 $3.9$pp,部分归因于 INSID3 使用了更新的 DINOv3-L 编码器;补充实验显示 REBASE 换到 DINOv3-L 后确实能改善,但并未在主干论文表 1 中体现。其次,REBASE 与 INSID3 位置去偏并非总是互补:在自然图像基准(PASCAL-Part、COCO-20i)上二者去除的成分高度重叠,堆叠几乎无额外收益,说明 REBASE 不能简单视为位置去偏的替代品。我观察到两点:表 S6 写 $r=0.05$ 与正文及敏感性实验的 $r=0.005$ 不一致,存在排版错误风险,复现时需谨慎确认;此外 SW-FPS 的 $K=8$ 与 $\alpha=0.5$ 在所有基准固定,但论文未给出对极小目标或极大场景图的敏感性分析,固定参数是否全局最优存疑。
独立分析的弱点
第一,背景子空间秩 $r$ 虽被宣传为单一全局超参一致迁移,但敏感性实验只在 FSS-1000 与 PASCAL-Part 上做,对极端小目标(前景 patch 极少、$n_{BG}$ 接近总数)时 $s=\lceil r\cdot n_{BG}\rceil$ 的实际秩可能过大而误伤目标信息,改进方向是引入前景/背景比自适应或奇异值能量阈值截断。第二,REBASE 完全依赖参考背景代表性假设:若参考图背景与查询图背景差异很大(如跨域 episode),$\mathrm{span}(B)$ 无法覆盖查询的真实上下文,去偏失效,可改进为参考-查询联合估计背景子空间或加跨图一致性约束。第三,整条管线把 SAM 掩码输入分支首次密集使用,但仅以 $S$ 经阈值二值化后注入,信息利用仍粗,可改进为端到端可微的软注意力或用 SAM 2 的 memory 机制做迭代精修。第四,REBASE 的 SVD 在大图上成本不低($84.5$ms,占单 episode $281$ms 的约三成),对实时场景可改用随机化 SVD 或增量更新。
未来方向
作者明确指出 SAM 3 的提示接口(面向自然语言与概念)与本文稀疏点提示范式不兼容,导致基线偏低、增益变小,把如何为新一代 SAM 设计更匹配的提示策略留作未来工作。基于成果可延伸的方向包括:把参考条件化去偏推广到多参考或视频时序分割(用多帧背景联合估计更稳的子空间)、把 SW-FPS 与稠密先验迁移到 SAM 2 的 memory bank 以处理长视频、以及将逐 episode 动态子空间消除思想用于其他受上下文污染困扰的自监督特征任务(如深度估计、光流)。此外 REBASE 与位置去偏在 ISIC 上的互补性暗示二者可联合学习一个统一的上下文加位置去偏模块,进一步榨取冻结特征的判别力。
复现评估
复现性良好。代码已在 https://github.com/ai-and-lab/rebase 发布;主干与解码器(DINOv2 ViT-L/14、SAM ViT-H)及全部超参($K=8$、$\alpha=0.5$、$\ell_{bg}=-2$、$r=0.005$、$\tau_b=0.08$)均在正文与表 S6 列明;五个基准(FSS-1000、PASCAL-Part、PACO-Part、ISIC2018、Chest X-Ray)均为公开数据集。算力门槛低:单张 A100 上每 episode 仅 $281$ms,其中 REBASE 自身(SVD 加投影)$84.5$ms、相似度加 SW-FPS $16.3$ms、SAM 编码器 $135.9$ms、解码器 $6.6$ms,全程无需训练。主要风险是表 S6 中 $r=0.005$ 与 $0.05$ 的笔误,需对照正文敏感性图确认取值;INSID3 在 FSS-1000 上的 $83.7\%$ 系作者自行复现(原文未报),跨实现比对时需留意。整体属于照着表抄参数即可复现的难度。
论文图表
展示两行分割任务(上、下),每行从左到右依次为带标注的参考图、带真值的查询图,以及 GF-SAM、INSID3 与本文(Ours)的预测。本文方法产生的目标边界明显比 GF-SAM 与 INSID3 更干净、更贴合真值。
用一张图直观说明为什么需要 REBASE——既有方法的掩码会泄漏到共享背景区域,而本文边界更贴合真值,是 motivation 的最佳佐证。