ENEAS:嵌入引导的神经集成自适应分割 ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
级联嵌入匹配加按需VLM裁决,让文本提示分割既追得稳,又能识破雕像画作等相似干扰。
前置知识
SAM 系列与可提示概念分割
Segment Anything 家族把分割变成提示驱动任务:SAM 接受点/框/掩码提示,SAM 2 加入流式记忆库实现单次标注的视频目标追踪,SAM 3 提出 Promptable Concept Segmentation——给定名词短语即可检测、分割并追踪所有匹配实例。它们是本文的对比基线与掩码生成组件。
ENEAS 用 SAM 2.1 作为分割算子,并在本体论歧义场景与 SA-Co/VEval 上直接对标 SAM 3,理解其能力边界(视觉先验强、语义验证弱)是理解本文动机的前提。
SeC 概念级记忆追踪器
SeC 在 SAM 2 之上引入大视觉语言模型,从过去关键帧中逐步构建目标的『概念级』高层表征(它是什么),并在检测到场景变化时注入掩码解码器,而不是仅靠外观匹配传播,因此对剧烈视角变化和目标暂时离场更鲁棒。
ENEAS 的实例追踪模式直接构建在 SeC 之上,并补上它缺失的文本接口;论文的时间鲁棒性结论(抗消失、抗尺度剧变)全部继承自该架构。
SigLIP 2 与 sigmoid 独立打分
SigLIP 把 CLIP 的 softmax 对比损失替换为成对 sigmoid 损失,每个图像-文本对被当作独立二分类问题打分,类别之间互不竞争;SigLIP 2 进一步增强语义理解与定位,并提供按原生宽高比处理图像的 NaFlex 变体。
本文嵌入过滤级的关键设计——sigmoid 独立打分、提示集平均、原生宽高比编码——全部来自 SigLIP 2 的特性,用于规避 softmax 互斥归一化导致的分数抑制问题。
VLM 裁判与约束输出
用指令微调的视觉语言模型(如 Qwen3-VL)充当裁判,对另一个模型的输出做真伪判定。为控制成本与输出稳定性,通常限制其为固定格式作答、禁用自由推理 token;级联系统中只把昂贵的模型留给困难输入。
语义验证级的核心就是一个小型 VLM 裁判:只裁决嵌入分数落在不确定区间的候选,这是本文『精度高、延迟低』以及发现『过度推理』现象的基础。
开放词汇检测与 Florence-2
开放词汇检测器能把任意自然语言短语定位为图像区域,不限于固定类别。Florence-2 把视觉基础任务统一为序列到序列模型,通过任务提示完成检测、短语定位与描述,被广泛用作 detect-then-segment 管线的提议前端(如 Grounded SAM 链路)。
ENEAS 两种模式都用 Florence-2 做 grounding 算子:既在参考帧上把文本提示定位为追踪初始框,也在语义发现中逐帧生成候选区域——它的召回上限决定了整个级联的召回上限。
HOTA 及其分解指标
HOTA 是视频多目标追踪的综合指标,可分解为检测质量 DetA、时序关联一致性 AssA 与定位质量 LocA 三个子项;TETA 是另一项同时衡量三者的指标,数值均为越高越好。
在 SA-Co/VEval 基准上论文用这些指标对比 ENEAS 与 SAM 3,结论『增益主要来自关联一致性 AssA 而非定位』需要读懂该指标体系才能正确解读。
3D 重建中的瞬态干扰物
NeRF 与 3D Gaussian Splatting 假设场景静态,穿行的行人会在重建结果中留下鬼影与漂浮物。已有方法(NeRF in the Wild、RobustNeRF、SpotlessSplats 等)从光度残差、不确定性或通用视觉特征出发在重建内部降权这些瞬态,但不知道干扰物『是什么』。
ENEAS 的应用场景正是重建前的语义清理:在进入重建前就把行人剔除、保留雕塑。理解这个精度优先、错误代价不对称的应用背景,才能理解其设计取舍。
研究动机
现有文本提示分割模型在无约束场景中存在三类顽固失败模式。其一是时间幻觉:检测驱动的追踪器没有身份概念,目标离开视野后被重新检测到相似物上,例如 Grounded SAM 在 Blue Painting 序列中把窗帘甚至人物头发误分割为目标,无法在目标不可见时输出真负例。其二是空间碎片化:极端特写下 Grounded SAM 与 SAM 3 只分割笔触、画中人物等高频局部细节,而非把画作作为完整实体分割。其三是本体论误分类:语义发现完全依赖视觉先验,在为 3D 重建实拍的 Church Statues 数据上,SAM 3 对提示 person 的精确率仅 11.1%、召回 83.7%、F1 只有 19.5%,平均每检对一个真人就误报约 8 个超写实雕像或波普画。作者在早期方案中还实测过密集描述加复合视觉提示的做法,单帧延迟至少 15 秒且产生随意人名等开放集幻觉,证明这些问题无法靠堆砌 VLM 的朴素方案解决。
本文的目标是本文目标是构建统一的文本提示分割方法 ENEAS:输入自然语言提示与一组帧(可为有序视频或无序图像集合),输出二值掩码,同时支持两种工作模式。对特定实例查询(如 the blue painting),要求目标消失时输出空掩码而不漂移到相似物,且在目标充满整个视野的极端特写下保持空间完整;对类别查询(如 person),要求逐帧发现所有实例,并把雕像、蜡像、画作、倒影等长得像但不是的本体论干扰物剔除。设计以 3D 重建为应用背景,强调精度优先——误报会掩盖资产的一部分并将其毁坏,误检只是留下可见伪影,两种错误代价不对称。同时要求工程上可实现于低成本硬件:单张 24GB L4 GPU,鲁棒配置约每帧 3.29 秒,Fast 模式每帧 1.14 秒,且成本随场景歧义度而非物体数量扩展。
与已有工作不同的是,本文的独特切入点是把所有失败归结为一个共同根源——强感知、弱验证,并据此把几何提议与语义验证在结构上解耦。已有 detect-then-segment 系统(Grounded SAM 等)逐帧检测、无记忆,必然身份漂移;SAM 3 端到端解决概念分割,但视觉先验压倒本体论判断。ENEAS 不重训任何基础模型,而是组合现成组件:Florence-2 开放词汇提议、SigLIP 2 嵌入过滤、按需调用的 Qwen3-VL 裁决、SAM 2.1 掩码生成,外加为 SeC 追踪器补上文本初始化接口。两个关键洞察构成与已有方法的本质差异:一是用 sigmoid 独立配对打分替代 softmax 互斥归一化,避免裁剪图中其他物体压制目标分数;二是只在嵌入分数的不确定区间内调用 VLM,使昂贵语义推理的成本随场景歧义度扩展——论文实测这比全量 VLM 裁决既快约 35% 又更准。
核心方法
直觉上 ENEAS 是一条便宜的眼、昂贵的脑分工流水线:先用高速组件把绝大多数候选分对,只把真正拿不准的少数候选交给 VLM 仔细判断。技术上 ENEAS 是单一方法,输入提示 $p$ 与帧序列,共享两个算子:grounding 算子 $\mathcal{G}(I, p)$ 由 Florence-2-Large 实现,把提示定位为图像区域;分割算子 $\mathcal{S}(I, r)$ 由 SAM 2.1 实现,把区域变成掩码。实例追踪模式扩展 SeC 架构:在参考帧 $I_{t_0}$ 上用 $\mathcal{G}$ 定位提示对象得 $r_0$,其后每帧掩码由记忆追踪器给出 $M_t = \mathcal{T}(I_t \mid r_0, \mathcal{H}_t)$,其中 $\mathcal{H}_t$ 是 SeC 逐步构建的概念级记忆,因此目标离场时输出空掩码而不漂移,也支持点交互以获得最高精度。语义发现模式则逐帧运行四阶级联:区域提议、嵌入验证、语义验证、掩码生成,每一级比前级更贵、但只处理前级无法裁决的更少候选。
核心创新是不确定性区间上的条件语义验证。候选区域先由 SigLIP 2 打分 $s(r) \in [0,1]$:由于 SigLIP 采用成对 sigmoid 损失,每个图像-文本对被独立二分类,目标分数不受裁剪图内其他物体干扰——论文 Phase 2 实验显示 softmax 互斥约束曾导致『人拿着麦克风』时目标类被配件标签压制;再用多条措辞的提示集平均缓解全图预训练与裁剪推理之间的域偏移,并利用 NaFlex 原生宽高比编码保留变长裁剪的稠密特征。两个阈值 $\tau_{rej} < \tau_{acc}$ 把候选分为三段:$s(r) \geq \tau_{acc}$ 直接接受,$s(r) < \tau_{rej}$ 直接丢弃,中间的不确定区间才送入 Qwen3-VL(2B/4B)裁决。VLM 被问到该区域是否真的是该类别实例而非雕像、假人或图画,相邻候选像素被涂黑以隔离判断,输出限定为固定格式的二值判定 $v(r) \in \{0,1\}$ 并禁用自由推理,每次裁决约 1 秒。这使成本随场景歧义度而非物体数量扩展。
方法步骤详情
完整流程分四步。第一步区域提议:Florence-2 在每帧上对提示类别生成候选区域集合 $R_t = \mathcal{G}(I_t, p)$ 并合并重复提议,此级刻意宽松以保证召回。第二步嵌入验证:每个候选裁剪与类别的多条措辞做 SigLIP 2 嵌入匹配并平均得 $s(r)$;$s(r) \geq \tau_{acc}$ 直接接受,$s(r) < \tau_{rej}$ 直接丢弃。第三步语义验证:不确定区间的候选送入 Qwen3-VL 裁判,裁剪中相邻候选的像素被涂黑隔离,结构化分析提示附带明确的批判性思维约束,模型以固定格式返回二值判定 $v(r)$,不生成内部推理 token。第四步掩码生成:接受集 $A_t$ 中每个区域经 SAM 2.1 得 $M_t^{(i)} = \mathcal{S}(I_t, r_i)$。实例追踪模式共享第一步:在参考帧上定位得 $r_0$ 后交给 SeC 记忆追踪器逐帧传播,支持文本与点两种交互,参考帧可取序列任意位置;目标离场时输出空掩码,而非像 Grounded SAM 那样在窗帘或头发上补检。
技术新颖性
技术新颖性体现在四点。其一,为 SeC 追踪器补上文本接口:SeC 原生只支持点交互、需要人工指认,本文用开放词汇 grounding 做文本驱动初始化,从而继承其概念级记忆带来的抗消失与抗尺度剧变能力,得到文本提示的记忆型追踪器。其二,sigmoid 独立打分替代 softmax 归一化是对比式过滤的关键修正;论文的四阶段设计演化(Phase 1 密集描述与复合视觉提示、单帧至少 15 秒且产生 Saint Christian 式幻觉人名;Phase 2 softmax 分数抑制;Phase 3 sigmoid 独立性与原生宽高比;Phase 4 裁判优化)本身构成一份渐进式消融论证。其三,级联成本随歧义度扩展:同一 Robust 配置下 VLM 激活率在 Church Statues 为 78.1%,在普通的 Moving Boxes 仅 27.0%。其四,发现并利用了过度推理现象:让 2B VLM 裁决全部候选反而把 F1 从 82.8% 拉低到 79.1%——无歧义样本由简单的嵌入过滤器处理更稳,昂贵的语义推理应只花在刀刃上。
实验结果
核心结果集中在自建的 Church Statues 本体论基准(提示 person):SAM 3 召回最高 83.7% 但精确率仅 11.1%、F1 19.5%,即每检对一个真人误报约 8 个雕像;ENEAS-2B 达到精确率 94.7%、召回 73.5%、F1 82.8%,约为基线的四倍;换 4B 裁决后召回恢复至 79.6%、F1 87.6%。组件消融(Table 4)显示:仅 RPN 时 F1 只有 18.6%;加嵌入过滤后,灵活阈值($T>0.50$)F1 65.5% 但漏掉雕像,严格阈值($T>0.80$)精确率 94.3% 却漏掉真人;级联的区间裁决同时拿到 94.7% 精确率与 73.5% 召回,证明 VLM 恰好在嵌入拿不准的区间是必要的。阈值敏感性(Table 5):Robust 配置(0.10–0.90)F1 82.8%、延迟 3.29 秒/帧,而 VLM-Only 全量裁决 F1 反而降至 79.1%、延迟升至 5.05 秒。VLM 规模(Table 6):4B 比 2B 高 4.8 个 F1 点,但延迟增加 52% 至 5.02 秒。SA-Co/VEval 上 ENEAS 与 SAM 3 相当或更好:实例追踪 HOTA 26.70 对 26.51、TETA 17.86 对 16.65,增益主要来自关联一致性 AssA 90.77 对 90.18;语义发现侧 HOTA 9.23 对 9.19、TETA 9.53 对 9.10。场景自适应(5.3 节):Moving Boxes 用 Fast 模式(接受阈值 0.40)延迟 1.14 秒/帧、VLM 激活率降至 27.0%,F1 达 98.0% 且零误报,说明系统按需分配算力。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Church Statues 语义发现(提示 person) | F1-Score (%) | 82.8(ENEAS-2B)/ 87.6(ENEAS-4B) | 19.5(SAM 3) | +63.3 / +68.1 个百分点(约 4.2–4.5 倍) |
| Church Statues 语义发现(提示 person) | Precision (%) | 94.7(ENEAS-2B)/ 97.5(ENEAS-4B) | 11.1(SAM 3) | +83.6 / +86.4 个百分点 |
| SA-Co/VEval 实例追踪 | HOTA (%) / TETA (%) | 26.70 / 17.86 | 26.51 / 16.65(SAM 3) | +0.19 / +1.21,主要来自 AssA +0.59 |
| SA-Co/VEval 语义发现 | HOTA (%) / TETA (%) | 9.23 / 9.53 | 9.19 / 9.10(SAM 3) | +0.04 / +0.43,整体追踪质量持平略优 |
| Church Statues 验证策略对比 | F1 (%) / 平均延迟 (s) | 82.8 / 3.29(区间裁决,VLM 激活率 78.1%) | 79.1 / 5.05(VLM-Only 全量裁决) | F1 +3.7 个百分点且延迟降低约 35% |
| Moving Boxes 语义发现(Fast 模式,提示 chair) | 延迟 (s/帧) 与 F1 (%) | 1.14 秒/帧,F1 98.0%,零误报 | 3.29 秒/帧(Robust 模式) | 约 3 倍加速,VLM 激活率 78.1%→27.0% |
局限与改进
作者承认的局限包括:语义发现召回被 Florence-2 提议阶段封顶——Table 4 中所有配置的召回都受限于基线的 79.6%,漏检多为背景、远小或严重遮挡目标;VLM 裁决依赖上下文,极端特写或小尺寸低分辨率裁剪缺乏材质与场景线索时会和视觉模型犯同样的错(Figure 4 最后一列双模型同时失败);验证成本随每帧候选数增长,拥挤街道等密集场景超出设计范围;发现模式逐帧独立,不产生跨帧持久身份;不输出置信度分数;Robust 配置在单张 L4 上约 3 秒/帧,非实时。我自己的观察是:Church Statues 为自建数据、GT 由作者手工标注、规模小,主结果缺少第三方本体论基准的外部验证;SA-Co/VEval 子样本上双方绝对指标都很低(语义发现 HOTA 仅约 9.2),说明该低帧率无序采集协议本身极难、改进幅度也小;消融未报告统计显著性;过度推理结论仅基于 2B 模型,未必适用于更大裁判。
独立分析的弱点
独立分析如下弱点。第一,提议瓶颈:级联召回上限由 Florence-2 决定,对远、小、遮挡目标系统性漏检(Table 4 各配置召回同为 79.6% 或更低),改进方向是多检测器提议融合、切片推理,或直接用 SAM 3 的高召回检测器做提议源、再交 ENEAS 做语义过滤。第二,发现模式无时序关联,逐帧独立判定会导致实例 ID 跳变与掩码闪烁,不利于视频下游任务,可复用追踪模式的记忆传播把每帧发现链接成持久轨迹。第三,VLM 裁决是单帧二元判定,无置信度、无跨视角一致性,而 3D 重建场景本可利用同一 3D 位置的多个观测投票来进一步压低误报,这一信息被浪费了。第四,密集场景成本失控:候选数增多时 VLM 激活率随之上涨,需要批处理、跨帧缓存或蒸馏式过滤。第五,评估以自建单一场景为主,Church Statues 的结论应在美术馆、蜡像馆、古装街等更多本体论歧义数据上复验。第六,过度推理现象只给出了经验观察(F1 82.8% 对 79.1%),缺乏对何时 VLM 反而引入随机误差的机理分析。
未来方向
作者明确提出的方向有三:把发现模式的逐帧结果用实例追踪的记忆传播链接成时序一致的持久实例;从嵌入与 VLM 两级导出校准的置信度分数以兼容基于分数的评测协议;把 VLM 的裁决蒸馏进嵌入过滤器,使不确定区间与延迟随使用收缩。基于成果可延伸的方向:其一,把 ENEAS 做成 3D 重建的语义前处理闭环,利用多视角一致性验证——同一空间点在不同视图的语义标签矛盾时才触发 VLM 复核,可进一步压低误报且几乎不增加单帧成本;其二,研究不确定性区间的自适应设定,例如用 conformal prediction 给出带统计保证的接受域,替代手工调参的 0.10–0.90;其三,在更大规模裁判上系统研究过度推理的成因,探索自适应推理深度或路由式混合专家;其四,把管线推向实时(批处理、量化、TensorRT 化)以覆盖在线视频场景,并扩展到 4D 动态重建与 Gaussian Splatting 的瞬态去除。
复现评估
复现条件相当好。代码与模型在 github.com/speridlabs/eneas 公开,所用组件全部是开放权重:Florence-2-Large(提议)、SigLIP 2(嵌入)、Qwen3-VL 2B/4B(裁判)、SAM 2.1(分割),整套管线无需训练、纯推理,可在论文刻意选定的低成本硬件(单张 24GB NVIDIA L4 + 12 vCPU Xeon)上运行,云端成本可控。延迟数据包含数据加载与 CPU 预处理等端到端开销,作者的复现性说明较诚实。关键超参披露完整:Robust 配置区间 0.10–0.90、Fast 模式接受阈值 0.40、VLM 裁决禁用自由推理并采用涂黑隔离与结构化分析提示。需要注意的点:Church Statues 的 GT 由作者手工标注,论文未明确说明是否随代码发布;SA-Co/VEval 评测使用官方 SAM 3 评测器与相同设置,可对齐。总体复现难度中等:组件均现成,工程难点在于多模型级联整合与提示工程,一张消费级或云端 GPU 即可验证主要结论。
论文图表
提示 person:第 1 行 SAM 3 无法区分超写实宗教雕塑与真人,给场景中几乎所有雕像生成掩码;第 2 行 ENEAS 语义严格地拒绝了雕像。两个模型在背景行人上都有少量漏检(红叉),但 ENEAS 消除了基线的大规模误报噪声。
与 Figure 4 构成双重本体论挑战(艺术品与雕像),直接呼应 Table 1 的定量结果来源场景,是论文动机最直观的呈现。
Church Statues 上与基础模型的定量对比:SAM 3 精确率 11.1%、召回 83.7%、F1 19.5%;ENEAS-2B 精确率 94.7%、召回 73.5%、F1 82.8%;ENEAS-4B 精确率 97.5%、召回 79.6%、F1 87.6%。以精确率换召回的策略使 F1 提升约四倍,且随裁判规模扩大而继续改善。
全文最重要的定量结果表,量化了视觉基础模型与本体论验证架构之间的差距,是论文核心主张的数据支撑。
官方 SA-Co/VEval 评测器下的实例追踪对比:ENEAS 对 SAM 3 的 HOTA 26.70 对 26.51、DetA 7.92 对 7.84、AssA 90.77 对 90.18、LocA 87.86 对 89.22、TETA 17.86 对 16.65。ENEAS 在关联一致性上占优、定位略逊,整体追踪质量更好。
证明在常规基准(而非自建数据)上方法不落后于 SAM 3,排除只在特制场景有效的质疑;AssA 主导的增益也印证了记忆追踪的价值。
SA-Co/VEval 语义发现子集对比:ENEAS 对 SAM 3 的 HOTA 9.23 对 9.19、DetA 6.16 对 6.21、AssA 14.28 对 13.85、LocA 74.25 对 75.38、TETA 9.53 对 9.10。双方绝对值都很低,ENEAS 在 TETA 与 AssA 上略优。
与 Table 2 互补,覆盖多实例语义发现协议;同时其极低的绝对分数揭示了低帧率无序采集设定本身的难度,是评估局限的重要参照。
组件消融:仅 RPN(Florence-2)时精确率 10.5%、召回 79.6%、F1 18.6%;加嵌入匹配的灵活阈值(T>0.50)F1 65.5% 但保留雕像;严格阈值(T>0.80)精确率 94.3%、召回跌至 67.4%;ENEAS-2B(0.10<T<0.90 区间裁决)94.7/73.5/82.8;ENEAS-4B 97.5/79.6/87.6。注:所有配置召回受 RPN 封顶。
逐级证明每个组件的必要性,特别是嵌入过滤器无法通过调阈值同时做到高精确与高召回、VLM 恰好在不确定区间必要这一核心论点。
不确定性区间(2B 模型,Church Statues)的精度-延迟权衡:Aggressive(0.40–0.60)VLM 激活率 16.2%、延迟 1.04 秒、F1 74.3%;Balanced(0.15–0.75)59.4%、2.48 秒、79.6%;Robust(0.10–0.90)78.1%、3.29 秒、82.8%;VLM-Only(0.00–1.00)100%、5.05 秒、F1 反而降至 79.1%。
揭示过度推理现象的关键数据:全量 VLM 裁决既更慢又更不准,为条件式调用 VLM 的设计提供了直接证据,也是部署时选型参考。
裁判模型规模影响(Robust 配置):2B 模型延迟 3.29 秒、F1 82.8%;4B 模型延迟 5.02 秒(增加 52%,慢 1.5 倍)、F1 87.6%。4B 能解决 2B 拿不准的剩余歧义样本,是语义精度的上限。
给出裁判规模这一最后一处可调权衡,与 Table 5 一起构成完整的配置空间(区间 × 模型规模),指导读者按场景选择 2B 实时或 4B 离线。