基于多模态大模型分割的结构化全掩码预测方法 Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
提出结构化全掩码预测,单次前向传播完成多目标分割,破解三难困境
前置知识
多模态大语言模型 (MLLM)
把视觉编码器(如 ViT)通过适配器或交叉注意力接到预训练 LLM 上,让模型既能理解图像又能用自然语言对话与推理,典型代表有 LLaVA、Qwen2-VL。其本质仍是「下一个 token」的自回归文本生成,输出离散文本而非稠密像素。
本文核心矛盾正在于:MLLM 天生擅长生成文本却不擅长输出稠密的像素级掩码,必须在原生文本接口内寻找新的分割范式。
自回归与非自回归生成
自回归(autoregressive)生成指模型逐个 token 顺序预测,每步依赖前面所有 token,质量高但慢;非自回归(non-autoregressive)则一次性并行预测所有 token,速度快但需更强的上下文建模。本文用自回归做对话、用非自回归做掩码,两者解耦。
理解这种解耦是看懂 STAMPlus 为何能在保留对话质量的同时把多目标延迟从 13.50s 降到 5.16s 的关键。
指称与推理分割
指称分割(referring segmentation,RefCOCO 系列)要求按一句自然语言描述分割目标;推理分割(ReasonSeg)需先推理「这句话到底指什么」再分割,例如「适合反手击球的设施」。两者输出通常合并成一个二值前景掩码。
这是 STAMP 的核心评测任务,也是 STAMPlus 必须保留并扩展到多目标语义/实例/遥感的基础能力。
SAM 与外部掩码解码器
SAM(Segment Anything)等解码器可由点、框或 embedding 触发输出像素掩码。LISA 等嵌入预测方法让 MLLM 产出一个特殊 [SEG] token 的 embedding 驱动此类解码器;本文的 只是词表内的触发符号,不绑定外部解码器,掩码由 patch 分类直接得到,冻结 SAM 仅作可选细化后处理。
这是本文与嵌入预测范式最本质的区别,决定了它能否做到 token-only 监督与 decoder-free。
交叉熵与 Dice 损失
二值交叉熵 BCE 衡量每个像素的前景/背景分类误差,Dice 补偿类别不平衡(前景往往很小)。STAMP 用 $\mathcal{L}_{BCE}+\mathcal{L}_{Dice}$;STAMPlus 多类版本用多类交叉熵 $\mathcal{L}_{CE}$ 加按通道的 Dice。
训练目标直接决定掩码质量,是复现本方法时必须精确实现的细节。
研究动机
把分割塞进 MLLM 存在一个根本的「分割三难困境」:分割精度高、对话能力保留、推理快,三者难以兼得。现有两大范式都在某一边妥协。其一是嵌入预测范式(LISA、GSVA、PixelLM、READ),它让 MLLM 输出一个 embedding 去驱动 SAM 等外部解码器,但这个像素级监督目标偏离了原生语言建模空间,会损害对话能力——实测 LISA-7B 在 MMMU、MMBench 等通用多模态基准上几乎全得 0 分,出现「对话坍塌」。其二是下一 token 预测范式(VisionLLM 多边形坐标、Seg-Zero/SegAgent 思维链坐标、Text4Seg 逐 patch 分类),虽保住了语言接口,却要为每个目标自回归生成长序列,每多一个类别就多一整套 token,dense mask 推理极慢。即便 CVPR'26 的 STAMP 通过二值全掩码预测破解了单目标场景,到了多目标场景(开放词汇语义、实例、遥感小目标)仍只能为每个目标重复一次预测,12 类延迟高达 13.50s,且用模糊自然语言指称区分相似目标会出错。
本文的目标是本文目标是把 STAMP 的二值全掩码预测推广为「结构化全掩码预测」(Structured All-Mask Prediction),在统一检查点下同时达成三件事:第一,在指称、推理、开放词汇语义(ADE20K-150、Pascal Context-59、Pascal VOC-20)、实例感知(MUSE)以及遥感小目标(RRSIS-D、EarthReason)等多种设置上取得领先或持平最强基线的分割精度;第二,在 LLaVA-665k 视觉指令数据混训后保留 Qwen2-VL 主干的通用对话能力,避免 LISA 式对话坍塌;第三,把多目标掩码生成的延迟从逐目标重复预测的 13.50s 降到 5.16s(12 类),并且全部任务共享一个检查点、不做任务级微调。
与已有工作不同的是,本文的独特切入点在于:它意识到二值全掩码的瓶颈不在 Phase 2 的预测机制,而在 Phase 1 生成的「目标描述」是否结构化、是否可解析。过去 STAMP 的自由文本响应只能定义一个被合并的前景目标,无法在共享标签空间里保留多个语义或实例身份。STAMPlus 抓住了一个被忽视的点——既然 Phase 1 本就是自回归生成,完全可以让它先输出一张 JSON 风格的结构化目标清单(显式 ID + 文本标签 + 可选 bbox),再用这张清单动态定义 Phase 2 的多类标签空间。这样 N 个目标不再需要 N 次独立预测,而是在同一次非自回归前向传播里共享一套掩码图,把复杂度从 $O(N)$ 降到 $O(1)$,同时保留了 STAMP 已验证的 token-only 监督与 decoder-free 优势。
核心方法
直觉上,STAMPlus 像一位先「读完整张点单」再「一次性出菜」的厨师:第一阶段先把用户指令理解清楚,列出本张图里到底要分割哪些目标、给每个目标编一个号、必要时附上定位框;第二阶段不再逐个目标反复跑,而是在一次前向传播里同时回答每个图像 patch「你属于几号目标还是背景」。技术路线分两阶段、共用同一主干。Phase 1 是标准自回归对话生成,ViT 先抽 patch 特征 $F_p \in \mathbb{R}^{N\times D}$ 拼到文本嵌入前面,MLLM 生成自然语言回复并在结尾输出结构化目标清单,最后发出一个词表内的 触发符,同时缓存 KV 状态。Phase 2 把 N 个 [MASK] 占位符拼到历史后面,每个 [MASK] 与对应 patch 特征做视觉增强融合得到 $E_{mask}$,用混合注意力在单次前向传播里并行分类全部 patch,再可选地用冻结 SAM 细化。
核心创新是「结构化全掩码预测 + 动态 ID 绑定」,与已有方法最本质的区别有两点。其一, 只是一个普通的词表内符号,绝不把它的 embedding 绑定到任何外部解码器(不像 LISA),因此全部监督都停留在 token 接口内,不引入破坏语言建模的像素级损失。其二,Phase 1 主动产出可解析的指令条件化映射,例如「cls:1、label:curtain、bbox:[...]」,其中 cls 为 0 表示背景、正整数 ID 标记各目标;Phase 2 用一个固定容量 200 的多类掩码头,其前景类别与 Phase 1 生成的 ID 一一对应、按样本动态绑定。于是同一数值 ID 在不同指令下可指代不同目标,但同一张图内始终唯一对应 Phase 1 指定的语义类或实例。这把掩码生成步数从 STAMP/LISA 的 $O(N)$、Text4Seg 的 $O(N\times N_{patches})$ 一举压到 $O(1)$,且全部任务共用同一套机制与同一检查点。
方法步骤详情
训练与推理统一在 $\mathcal{L}=\mathcal{L}_{text}+\mathcal{L}_{mask}$ 下。第一步(Phase 1):输入图像 $I$ 与指令 $T$,ViT 抽 patch 特征与文本嵌入拼接后送入 Qwen2-VL,自回归生成结构化 JSON 目标清单(每条含 cls、label,实例任务再加 bbox),结尾发出 ,并把此前全部 token 的 KV 状态存入缓存。第二步(Phase 2):以对话历史后接 N 个 [MASK] 占位符构造输入 $S_{in}$,每个 [MASK] 的初始 embedding 与对应 patch 特征和位置嵌入融合为 $E_{mask}$;用混合注意力 $A_{hyb}$ 让历史保持因果注意力、让 [MASK] 之间双向注意,单次非自回归前向传播复用 Phase 1 缓存,取 [MASK] 末端隐藏态 $Z_{mask}$ 送线性头。STAMP 输出二分类用 $\mathcal{L}_{BCE}+\mathcal{L}_{Dice}$;STAMPlus 输出 200 类分布,按目标 ID 把真值转成结构化 patch 标签图,用多类交叉熵加按通道 Dice 监督。小目标场景把输入分辨率与掩码 token 预算从 1024–1280 同步提到 2560–3200,其余机制不变。
技术新颖性
相对嵌入预测范式,本文彻底摆脱外部掩码解码器, 只是词表内触发符,全部监督在 token 接口内,避免了像素级损失污染语言建模空间(实测避免 LISA 式对话坍塌)。相对下一 token 范式,它把 dense mask 从自回归序列变成一次性并行分类,无需逐 patch 生成。相对自身的 CVPR 前作 STAMP,新颖性有三:把 Phase 1 输出从自由文本升级为可解析的结构化目标清单;把二值掩码头升级为按样本动态绑定 ID 的多类掩码头(容量 200、多目标 $O(1)$);以及把图像对齐的掩码 token 预算随分辨率同步放大,使同一接口适用于遥感小目标等更高空间尺度。整个设计保持一个统一检查点跨任务工作,而非每个基准单独微调。
实验结果
实验覆盖单目标到多目标、自然图到遥感。RefCOCO 系列(表 II)STAMPlus-7B 平均 cIoU 81.0、STAMP-7B 80.7,超过 Text4Seg++ 的 78.9,统一检查点略胜任务专用 STAMP。ReasonSeg(表 IV)STAMPlus-7B 平均 64.0 为最优。遥感 RRSIS-D(表 V)7B 平均 76.2,胜最强专用基线 74.4 与 Text4Seg++ 70.8;EarthReason(表 VI)7B 达 74.0,胜 70.1。开放词汇语义分割(表 VIIa)尤为突出:STAMPlus-7B 在 ADE20K-150 取 42.2 mIoU,远超 Text4Seg 的 16.5,三基准平均 63.7。实例感知 MUSE(表 VIIb)7B 平均 63.5,测试集 gIoU/cIoU 以 65.8/66.9 反超 Text4Seg++。效率上 STAMPlus 把 12 类延迟从 13.50s 降到 5.16s。消融(表 X)去掉 $A_{hyb}$ cIoU 从 79.1 掉到 76.2,去掉 $E_{mask}$ 掉到 73.3;高分辨率缩放在 RRSIS-D 上 gIoU +5.5、EarthReason +4.9。交互分析显示注入人工 bbox 后 cIoU 从 77.4 跃到 89.1,「看两遍」推理 STAMPlus-2B 平均 71.1,超过 Qwen2-VL-2B 的 68.5,暗示分割接地能反哺理解;表 IX 混训后 MMMU 39.3、MMBench 68.9,无对话坍塌。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RefCOCO 系列指称分割 | 平均 cIoU (8 个划分) | 81.0 (STAMPlus-7B) | 78.9 (Text4Seg++) | +2.1 |
| ReasonSeg 推理分割 | 平均 gIoU/cIoU | 64.0 (STAMPlus-7B) | 61.1 (READ) | +2.9 |
| RRSIS-D 遥感小目标指称分割 | 平均(Acc@0.5/gIoU/cIoU) | 76.2 (STAMPlus-7B) | 74.4 (SegEarth-R1 FT) | +1.8 |
| EarthReason 地理像素推理 | 平均 gIoU/cIoU | 74.0 (STAMPlus-7B) | 70.1 (Text4Seg++) | +3.9 |
| ADE20K-150 开放词汇语义分割 | mIoU | 42.2 (STAMPlus-7B) | 16.5 (Text4Seg) | +25.7 |
| MUSE 实例感知多目标分割 | 平均 gIoU/cIoU | 63.5 (STAMPlus-7B) | 63.8 (Text4Seg++) | 持平,测试集反超 |
| 12 类多目标推理延迟 | 秒(s) | 5.16 (STAMPlus) | 13.50 (STAMP 重复推理) | 约 2.6× 加速 |
局限与改进
作者坦承若干局限:第一,多类掩码头容量固定为 200,超过 199 个目标的样本需截断或剔除,并非真正的开放集合预测;第二,Phase 1 生成的 bbox 是精度瓶颈——注入人工 bbox 后 cIoU 从 77.4 飙到 89.1,说明模型自产的空间线索仍有明显提升空间,这正是未来用强化学习或专用定位工具增强的方向;第三,「看两遍」实验只用注意力而非预测掩码做二次推理,因为模型尚未训练把离散掩码回灌进 VQA,所以「分割反哺理解」目前只是初步证据。补充观察:高分辨率缩放只在遥感做了受控验证,自然图小目标未必同样受益;cIoU 在多目标语义分割上会被大区域主导,小类别真实质量可能被平均稀释;且多数对比缺乏严格的同主干、同算力对齐(如 STAMPlus 用 Qwen2-VL,部分基线用 Vicuna)。
独立分析的弱点
弱点一:Phase 1 自产 bbox 质量直接决定 Phase 2 上限,但论文未对 bbox 生成做专门优化,建议用 RL(如 GRPO)或外部检测器蒸馏专门强化定位,把 89.1 这种「Oracle 上限」逼近。弱点二:200 类固定容量与截断策略在极端密集场景(如全景分割的几百个实例)会失效,可改为动态容量或集合预测头(类似 DETR 的 Hungarian 匹配)。弱点三:KV 缓存在 3200 token 高分辨率下显存压力大,部署到边缘端困难,可引入 token 剪枝或稀疏注意力。弱点四:高分辨率缩放仅用遥感验证,对医学影像、显微等同样小目标密集的领域未做实验,泛化性存疑,建议补充。弱点五:评测偏 cIoU 这类会被大区域主导的指标,应补充每类 mIoU、边界 F-measure 等更公平的小目标指标。
未来方向
作者明确指向:用 RL 优化 Phase 1 目标生成、用专用定位工具辅助、把分割学到的空间接地反馈给视觉理解。基于成果可延伸的方向:第一,训练模型把 Phase 2 预测的离散掩码真正回灌进 VQA,从「注意力反哺」升级到「掩码反哺」,兑现分割-理解协同的全部潜力;第二,把结构化接口扩展到视频分割与 3D/点云,验证 $O(1)$ 多目标范式在时序与更高维度的可迁移性;第三,结合 DETR 式集合预测或可变容量头,去掉 200 类硬上限,迈向真正的全景级开放实例分割;第四,在更大主干(如 Qwen3-VL)上验证范式的 scaling 性质。
复现评估
复现可行性较高但算力门槛不低。论文承诺完整代码库(数据准备、训练、推理、评测脚本与文档)随补充材料发布,主干为公开的 Qwen2-VL(2B/7B),训练数据全部来自公开数据集(RefCLEF、RefCOCO 系列、gRefCOCO、ReasonSeg、RRSIS-D、EarthReason、COCO-Stuff、COCO Panoptic、MUSE、LLaVA-665k),在 NVIDIA H800 上用 AdamW 训练并沿用 STAMP 的优化配方。多类头容量、混合注意力、KV 缓存复用、损失组合(多类 CE + 通道 Dice)等关键细节均给出公式,便于对齐。难点在于:统一检查点训练需要较大的混合数据工程与多卡资源,200 类头与高分辨率(3200 token)会放大显存与通信开销;不过各基准共用同一检查点反而降低了「逐基准调参」的复现负担。整体属中等偏难,适合有充足 H800/A800 的实验室复现。
论文图表
三角形示意图,三个顶点分别是「高分割性能」「快生成速度」「通用对话能力」。嵌入预测偏高性能但伤对话;下一 token 预测要么快但差、要么靠长输出(CoT/逐 patch 分类)换性能却牺牲速度;坐标式下一 token 预测偏快但性能弱。
整篇论文的问题定义建立在这张三角图上,理解它才能理解 STAMPlus 要同时满足的三条约束。
(a) 嵌入预测:MLLM 出 embedding 驱动外部解码器,像素级监督损害对话;(b) 下一 token 预测:自回归生成长序列表示掩码,性能与速度难以兼得;(c) 本文全掩码预测:对话(自回归)与掩码(非自回归)解耦,单次并行分类所有 token。
它直观展示了本文范式与前两类的本质差异,是理解方法定位的核心图。
横轴为推理时间、纵轴为 cIoU(越高越左越好),按范式着色,标注分辨率与模型规模。STAMP 处于精度高且延迟低的有利区间,远胜自回归长序列方法。
它在单目标场景上验证了三难困境已被 STAMP 破解,是效率-精度权衡的总览。
横轴为目标类别数 N,纵轴为单卡 H800 推理延迟(含均值带与标准差带)。LISA 与 STAMP 每类都要单独预测一次,延迟随 N 线性陡增;STAMPlus 的额外开销集中在 Phase 1 生成结构化清单,Phase 2 全类共享一次预测,斜率显著更平。
这张图是「效率」这一侧三难困境的关键证据,量化了 STAMPlus 把多目标延迟从 13.50s 压到 5.16s 的来源。
(a) 给 Phase 1 注入人工 bbox 后 STAMPlus-2B 在 RefCOCO 系列平均 cIoU 从 77.4 升到 89.1,证明 Phase 1 目标描述质量是 Phase 2 精度上限;(b) 看两遍推理下 STAMPlus-2B 在 TextVQA/InfoVQA/POPE/DocVQA 平均 71.1,超过 Qwen2-VL-2B 的 68.5,暗示分割带来的空间接地能反哺视觉理解。
这张表支撑了论文的两个诊断性结论——结构化 Phase 1 直接影响 Phase 2,以及分割学到的空间接地可被下游理解复用。
用同一 STAMPlus-2B 检查点与相同评测图,把 token 预算从 1024–1280 提到 2560–3200(对应更高输入分辨率)。RRSIS-D 的 gIoU 从 58.1 升到 63.6(+5.5),EarthReason 的 gIoU 从 69.4 升到 74.3(+4.9)。
它是高分辨率缩放有效性的受控证据,隔离了「分辨率/token 预算」这一设计变量对遥感小目标的作用。