← 返回 2026-08-14

CW-BASS v2:基础模型教师下饱和感知的伪标签选择 CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers

Ebenezer Tarubinga 📅 2026-08-13 👍 8 2026-08-19 18:30
DINOv2基础模型 伪标签选择 半监督语义分割 置信度校准 自训练 阈值机制审计

用一次留出前向测量教师置信集可靠性,自动在严格阈值与自适应下限间切换

前置知识

自训练与伪标签

模型先在标注数据上训练,再用自己的预测(伪标签)给无标注数据打标并继续训练自己。半监督语义分割的主流实现是:EMA 教师在弱增广视图上输出每像素类别后验,取 argmax 得伪标签、取 max 得置信度;学生在强扰动视图上拟合被阈值筛选后的伪标签。伪标签必然含噪,训练会自我强化错误(确认偏差)。

全文讨论的对象就是这条自训练回路中「哪些伪标签该保留」的选择规则,所有定理和实验都围绕这个筛选环节展开。

弱到强一致性与 UniMatch V2

FixMatch 确立了弱视图伪标签监督强视图的范式;UniMatch 把它移植到分割并加特征扰动;UniMatch V2 在 DINOv2 骨干上用固定严格阈值 $\tau=0.95$、两路独立强视图和互补通道 dropout,把 Pascal VOC 1/8 推到 87.9 mIoU,是当前 SOTA。

本文的训练骨架(除阈值规则外)完全对齐 UniMatch V2,它既是被复现的基线,也是「严格过滤在强教师上最优」这一结论的来源。

EMA 教师与保留率

EMA(指数滑动平均)教师是学生权重的滑动平均,$\theta'_{t+1}=d_t\theta'_t+(1-d_t)\theta_t$,比学生更稳、是标准评估模型。保留率 $\rho_t$ 是每步被阈值放行、参与训练的像素比例;$\rho_t\to 1$ 意味着几乎全部伪标签(含错误)都进入损失。

论文用「掩码泛洪」($\rho_t$ 冲到 1)作为失效链条的关键实测证据,Theorem 1 的内容就是证明下限规则能把 $\rho_t$ 钉在固定分位数。

置信度校准与 ECE

校准衡量模型置信度与实际正确率是否一致,ECE(期望校准误差)用分箱统计偏离程度。论文的关键区分:DINOv2 教师 ECE 仅 0.007(整体校准好)却依然让自适应阈值失效,因为病因不是整体失准而是置信分布动态范围坍缩(98% 像素 ≥0.95),剩余的低置信带恰好是错误富集区。

门控判据 $\pi_{\mathrm{kept}}$ 本质是一次留出校准测试;读懂「聚合校准良好≠阈值规则可用」这一反转是理解全文的前提。

动态阈值家族(FlexMatch/FreeMatch/SoftMatch)

这一类方法不做固定截止,而是按某种信号自适应调整阈值:FlexMatch 按逐类学习状态设课程式阈值,FreeMatch 用置信度 EMA 做自适应全局阈值并逐类调制,SoftMatch 用截断高斯软权重替代硬阈值。它们都读取同一个信号——像素/类别间的置信度差异,这在 ResNet 弱教师上很丰富。

它们是被审计的对象:论文证明 DINOv2 教师把置信度差异压扁后,这些机制的判别信号消失,逐类阈值和全局动态阈值一样失效。

DINOv2 与 DPT 解码器

DINOv2 是自监督训练的 ViT 基础编码器,无需标签即可产出适合密集预测的强特征;配上 DPT 式轻量解码器微调后,其伪标签精度远超 ResNet 骨干。本文用 DINOv2-Base(ViT-B/14)+ DPT-lite,并扫过 S/B/L 尺度族。

正是这个骨干带来了「机制反转」:置信度饱和与动态范围坍缩是 DINOv2 教师的几何性质,是一切失效分析的出发点。

研究动机

密集像素标注是计算机视觉中最昂贵的监督形式之一:标注一张 Cityscapes 图像约需 90 分钟。半监督语义分割(SSSS)用小标注集加大规模无标注图像自训练来摊薄成本,但伪标签必然含噪,「该信哪些伪标签」遂成核心问题。在 ResNet-50/101 + DeepLabV3+ 时代,教师置信度铺展在 [0.3, 1] 上、噪声项主导权衡,于是一整代选择机制——动态阈值(原 CW-BASS)、逐类课程阈值(FlexMatch)、自适应全局阈值(FreeMatch)、软置信权重(SoftMatch)、逐类自适应(CAFS/ENCORE)——都靠「按置信度自适应放宽截止、换取覆盖」取胜。DINOv2 等自监督基础编码器加 DPT 解码器改变了游戏规则:UniMatch V2 仅用固定严格阈值 $\tau=0.95$ 就把 Pascal VOC 1/8 从 ResNet 时代的中 70 段 mIoU 推到 87.9。此时教师在 Pascal 上有 98% 的像素置信度 ≥0.95(ResNet 仅 53%),ECE 反而更低(0.007 vs 0.024):置信分布动态范围坍缩,为欠自信教师设计的自适应滤波不仅失效,还会放行恰好集中在低置信带的教师错误,把自训练拖入确认偏差。

本文的目标是本文目标是把伪标签选择从「承诺单一规则」升级为「读取教师所处置信度状态后再选规则」:当教师的置信集可靠时部署严格固定阈值(复现 SOTA 操作点),当教师「自信但不可靠」时启用带稳定性保证的自适应机制;且这个选择必须由可一次前向测得的统计量驱动——置信集可靠性 $\pi_{\mathrm{kept}}=\Pr[\hat{y}=y\mid c\geq\tau]$,其边界就是运行阈值本身而非在下游 mIoU 上调出的数值——从而保证部署后的方法在任何教师上都不差于严格 SOTA 配方,并在不可靠教师上改进它。配套地,作者要用一次批次匹配的机制级审计,把「自适应规则为何在强教师上失效」的每一环都实测出来,使方法的设计有据可查而非直觉押注。

与已有工作不同的是,独特切入在于把阈值规则当作唯一变量做受控审计,而非当超参数调优:同一 DINOv2-Base 骨干、同一损失脚手架、同批次(16)、同数据切分、多种子下,比较严格阈值与五条自适应规则,并逐环节测量失效因果链——置信度饱和(98% 像素 ≥0.95)→ 动态范围坍缩(截止被钉在 [0.300,0.331],恰在解析上限 $\tau_0\sigma(\beta/2)\approx 0.34$ 之下)→ 掩码泛洪(保留率 epoch 7 过 0.95、epoch 8 过 0.99、最终 1.000)→ 早期见顶后衰减(逐类规则 EMA 掉 6.14 mIoU)。据作者所知,这是首个基础模型骨干上批次匹配的自适应伪标签阈值机制级研究。同时,论文用留出校准指出批内噪声估计的向下偏差(ADE 教师批内读数 98.4% vs 留出 89.3%),并纠正流行误读:ADE 上自适应获胜不是因为教师欠自信(它同样饱和),而是因为它「自信但不可靠」($\pi_{\mathrm{kept}}\approx 89\%$)。

核心方法

直觉:没有一条阈值规则在所有置信度状态下都对,与其押注单一规则,不如先花一次前向测量教师置信集的可靠性再决定。技术路线沿用 UniMatch V2 骨架——DINOv2-Base(ViT-B/14)编码器 + DPT-lite 解码器、EMA 教师、弱视图产伪标签、图像强增广+CutMix 与特征通道 dropout 两路强视图共享一次骨干前向——并保留 CW-BASS 的置信度加权交叉熵与 Sobel 边界辅助。在此之上新增三个构造:(1) 留出校准:把标注集切出 $\alpha=5\%$ 的校准片 $L_{cal}$,仅在其上估计逐类伪标签噪声,证明估计无偏;(2) 自自适应置信下限:随教师平均置信度缩放的下限,可证明把保留率钉在固定分位数、防止坍缩;(3) 一次前向的饱和门控:在留出片上测 $\pi_{\mathrm{kept}}$,≥0.95 选严格、否则选下限。除门控的红色组件外,整个流水线与 UniMatch V2 对齐;各组件均可独立开关以支持消融。

核心创新是「先测量后选择」的门控及其判据:$\pi_{\mathrm{kept}}=\Pr[\hat{y}=y\mid c\geq 0.95]$ 在留出片上一遍前向即可测得,$\pi_{\mathrm{kept}}\geq\tau$ 时用严格、否则用自适应下限,边界是运行阈值本身,从不接触下游 mIoU。与已有方法的本质区别有三:其一,FlexMatch/FreeMatch/SoftMatch 等承诺单一自适应规则,本文证明该信号在饱和教师下必然退化——动态阈值被解析上限 $\bar{\tau}=\tau_0\sigma(\beta/2)\approx 0.34$ 卡死,保留率 $\to 1$(Corollary 1),而基础模型教师的置信质量几乎全部堆在 1 附近,任何「向下自适应的空间」都是放行错误富集带的空间。其二,批内(学生训练像素上的)噪声估计被证明向下有偏,偏差恰为教师在置信类像素上的泛化差距(Proposition 1),留出校准从构造上切断「估计噪声下降→阈值下探」的自我确认回路。其三,下限 $\tau^{\mathrm{floor}}_k=s\bar{c}_t\mu_k/\max_j\mu_j$ 在尺度族假设下可证明保留率与整体置信水平无关、钉在固定分位数 $1-G_k(sr_k)$(Theorem 1),是唯一被证明能防坍缩的自适应规则。

方法步骤详情

每个 epoch 的完整流程(Algorithm 1):(1) 校准遍历:EMA 教师前向 $L_{cal}$(Pascal 1/8 约 $0.05\times 183\approx 9$ 张图),统计每类 $n_k(\tau)$ 与正确数 $n^c_k(\tau)$,得无偏噪声估计 $\hat{\epsilon}_k(\tau)=1-n^c_k/n_k$,直方图每 epoch 重置以反映当前教师。(2) 对每个无标注 batch:弱视图过 EMA 教师,$\hat{y}=\arg\max_k p$、$c=\max_k p$。(3) 更新置信度 EMA $\bar{c}_t$(动量 $m=0.99$)与逐类均值 $\mu_k$。(4) 计算动态阈值 $\tau^{dyn}=\mathrm{clip}\big(\tau_0/(1+e^{-\beta(\bar{c}-1/2)}),\,\tau_{\min},\,\tau_{\max}\big)$(原常数 $\tau_0=0.6,\beta=0.5,\tau_{\min}=0.3,\tau_{\max}=0.95$)。(5) 计算逐类下限 $\tau^{\mathrm{floor}}_k=s\bar{c}_t\cdot\mu_k/\max_j\mu_j$($s=0.95$),取 $\tau^{\mathrm{final}}_k=\max(\tau^{dyn},\tau^{\mathrm{floor}}_k)$。(6) 构造保留掩码 $\mathcal{M}=\{(h,w): c_{h,w}\geq\tau^{\mathrm{final}}_{\hat{y}_{h,w}}\}$。(7) 两路强视图训练学生,总损失 $\mathcal{L}=\tfrac12\mathcal{L}_x+\tfrac12(\mathcal{L}_s+\mathcal{L}_{fp})$,无监督项为掩码上按 $c^{\gamma}$($\gamma=1$)加权的 CE 加 Sobel 边界项($\beta_b=0.5$),随后 EMA 更新教师。(8) 部署时门控:在留出片测 $\pi_{\mathrm{kept}}$,≥0.95 则整轮采用严格 $\tau=0.95$,否则采用下限规则;判定只需一次前向、无需任何学生更新,额外墙钟开销不到 1%。

技术新颖性

技术新颖性体现在四个层面。诊断层面:把置信学习/噪声标签领域的留出消偏原理改造成分割专用的在线实例,并精确刻画批内估计的偏置来源(训练误差的乐观性,即泛化差距),实测 9.1 个百分点的乐观差(98.4% vs 89.3%)正是门控「必需而非装饰」的证据。理论层面:下限的稳定性保证建立在一个可证伪的尺度族假设(Assumption 1:逐类置信分布随整体均值等比缩放)上,预测「加下限掩码轨迹平坦、不加则上升」,经验曲线在 epoch 6 后 ±0.03 内吻合;作者坦诚 Theorem 1 不涉精度,只是把会坍缩到全保留的量变成可控分位数。方法论层面:首个批次匹配、机制级的自适应阈值审计,规则是唯一变量,据此测出自适应家族 5.0 mIoU 的离散度(79.36–84.35),比损失形式+校准片可解释的 ≈1.2 大一个数量级。工程层面:门控二值、一次前向、零额外参数,校准遍历约 9 次/epoch 对比 649 次学生迭代;与 CAFS 用留出校准设逐类阈值追覆盖的目的相反——本文用同一工具解释为什么追覆盖会失败。

The CW-BASS v2 pipeline. A weak view passes through the EMA teacher to produce pseudo-labels and confidences; the threshold rule (red, gated component) turns c into a retention mask; two strong views drive the student; the green held-out calibration estimates unbiased per-class noise feeding the gate. All but the red block matches UniMatch V2.
Fig. 3: The CW-BASS v2 pipeline. A weak view passes through the EMA teacher to produce pseudo-labels and confidences; the threshold rule (red, gated component) turns c into a retention mask; two strong views drive the student; the green held-out calibration estimates unbiased per-class noise feeding the gate. All but the red block matches UniMatch V2.
Dynamic-range collapse, measured. (a) The bare dynamic threshold stays pinned near its lower clamp while the teacher's mean confidence climbs past 0.88. (b) The floor forces the operative threshold upward (0.577→0.922, Theorem 1) but only to a quantile still retaining ≈91% of the mass.
Fig. 9: Dynamic-range collapse, measured. (a) The bare dynamic threshold stays pinned near its lower clamp while the teacher's mean confidence climbs past 0.88. (b) The floor forces the operative threshold upward (0.577→0.922, Theorem 1) but only to a quantile still retaining ≈91% of the mass.

实验结果

复现校验:严格基线三种子均值 86.19±1.82、最好种子 87.40(epoch 42),落在 UniMatch V2 报告 87.9 的 ±0.5 内,证明实验平台忠实。决定性对照(Pascal 1/8、匹配 batch 16、三种子):严格 87.40 领先所有规则——动态 84.35±0.24、逐类 83.79±0.43、SoftMatch 82.99±0.66、下限+校准 81.88±0.57、FreeMatch 79.36±0.51;15 个自适应运行无一触及 87.40,任意种子最好 84.52(差 2.9)。Welch t 检验仅对下限(p=0.044)与 FreeMatch(p=0.017)显著;唯一输掉的一格是种子 1 严格停摆 84.09、低于该种子动态的 84.46。通用性(表 VI,六教师):Pascal 各尺度严格领先 3.3–5.1,Cityscapes 打平(差 ≤0.7),ADE20K 下限 50.58 对严格 49.10(+1.48,单种子),并超 UniMatch V2-B 报告的 49.8。门控盲测(表 VII / Fig.5):$\pi_{\mathrm{kept}}$ 在 Pascal/Cityscapes 为 98.1–98.5%、ADE 为 89.2–89.3%,六次 strict-vs-floor 判对全部正确。失效链(表 XI / Fig.8/9/11):98% 像素 ≥0.95 → 截止钉在 [0.300,0.331] → 保留率 epoch 7 过 0.95、epoch 8 过 0.99、至 1.000,放行 99.9% 的教师错误(严格 63%)→ 自适应规则 epoch 4–20 见顶后衰减,逐类 EMA 由 84.07 跌至 77.93(−6.14),学生 −6.0;严格只跌 1.06。消融(表 VIII):边界辅助在 DINOv2 上失效(−1.9)、置信加权 +1.2、下限家族内最大 +2.7、校准对精度中性(−0.5)。排除替代解释(表 XV/XVI/XVII):参数扫描($\tau_{\min}$ 0.5/0.7/0.9、$\tau_0$ 1.2/1.7)最好 84.67 仍差 2.7;损失形式+校准片只解释 ≈1.2;$\alpha$ 扫描精度平坦(≤0.5);缩小规模三种子下下限把衰减从 15.8±7.3 压到 1.7±0.6。逐类(表 XII/XIII):匹配 batch 16 下严格在 18/21 类领先,逐类规则在其针对性放水的六个最难类上仅平局(尾部均值 58.6 对 59.2),印证「对饱和教师,难类的不确定性意味着教师错了,而非被不公平过滤」。

Pascal VOC SSSS landscape (val mIoU vs. labeled-image budget). CW-BASS v2's strict operating point sits in the top DINOv2 tier; the audited adaptive rules fall a fixed 3.3–5.1 mIoU below it, a gap dwarfed by the backbone jump over the ResNet-101 field.
Fig. 4: Pascal VOC SSSS landscape (val mIoU vs. labeled-image budget). CW-BASS v2's strict operating point sits in the top DINOv2 tier; the audited adaptive rules fall a fixed 3.3–5.1 mIoU below it, a gap dwarfed by the backbone jump over the ResNet-101 field.
The reliability gate, demonstrated blind. Adaptive-vs-strict gap (∆ = floor − strict mIoU) against πkept, measured one-pass on held-out labels with no access to ∆. All six strict teachers fall on the correct side of the boundary πkept = τ = 0.95.
Fig. 5: The reliability gate, demonstrated blind. Adaptive-vs-strict gap (∆ = floor − strict mIoU) against πkept, measured one-pass on held-out labels with no access to ∆. All six strict teachers fall on the correct side of the boundary πkept = τ = 0.95.
Qualitative comparison across the three teachers. Two favourable validation rows per dataset; columns: input, ground truth, strict τ=0.95, CW-BASS v2 adaptive; cyan contours mark large error regions. Even on rows chosen to favour it, the adaptive rule is visibly noisier on Pascal; on ADE20K the floor removes a large mislabeled region strict introduces.
Fig. 6: Qualitative comparison across the three teachers. Two favourable validation rows per dataset; columns: input, ground truth, strict τ=0.95, CW-BASS v2 adaptive; cyan contours mark large error regions. Even on rows chosen to favour it, the adaptive rule is visibly noisier on Pascal; on ADE20K the floor removes a large mislabeled region strict introduces.
The decisive control, visualized. EMA-teacher mIoU over training (Pascal VOC 1/8, DINOv2-Base; thin lines per seed, bold the 3-seed mean). Strict separates from the dynamic band by epoch 8 on two of three seeds; strict's stalled seed 1 drops into the orange band early and stays inside it.
Fig. 7: The decisive control, visualized. EMA-teacher mIoU over training (Pascal VOC 1/8, DINOv2-Base; thin lines per seed, bold the 3-seed mean). Strict separates from the dynamic band by epoch 8 on two of three seeds; strict's stalled seed 1 drops into the orange band early and stays inside it.
Confidence saturation: the chain's first link. Per-pixel max-softmax confidence of the strict EMA teacher over Pascal VOC val, split into correct vs incorrect pixels (log y-axis). 98% of pixels exceed 0.95; the dynamic threshold (≈0.33) admits 99.9% of all teacher errors but strict τ=0.95 keeps only 63%.
Fig. 8: Confidence saturation: the chain's first link. Per-pixel max-softmax confidence of the strict EMA teacher over Pascal VOC val, split into correct vs incorrect pixels (log y-axis). 98% of pixels exceed 0.95; the dynamic threshold (≈0.33) admits 99.9% of all teacher errors but strict τ=0.95 keeps only 63%.
Per-class IoU across all 20 Pascal VOC foreground classes. The strict fixed threshold (batch 16) matches or exceeds the dynamic and per-class adaptive rules (both batch 4) on every class; the gap is largest on hard indoor classes. The batch-matched comparison is dynamic vs per-class: the two adaptive rules are near-indistinguishable.
Fig. 10: Per-class IoU across all 20 Pascal VOC foreground classes. The strict fixed threshold (batch 16) matches or exceeds the dynamic and per-class adaptive rules (both batch 4) on every class; the gap is largest on hard indoor classes. The batch-matched comparison is dynamic vs per-class: the two adaptive rules are near-indistinguishable.
The saturation analysis in one figure: strict climbs, adaptive peaks early. (a) EMA-teacher mIoU: strict climbs to 87.4 and holds; every adaptive rule peaks early (ep 4–20) then declines (per-class −6.1, floor −2.2, dynamic −0.7). (b) Retention ρt: dynamic and per-class flood toward ≈1; the floor stays bounded (≈0.91); strict reaches 0.989 but rejects the error-enriched band throughout.
Fig. 11: The saturation analysis in one figure: strict climbs, adaptive peaks early. (a) EMA-teacher mIoU: strict climbs to 87.4 and holds; every adaptive rule peaks early (ep 4–20) then declines (per-class −6.1, floor −2.2, dynamic −0.7). (b) Retention ρt: dynamic and per-class flood toward ≈1; the floor stays bounded (≈0.91); strict reaches 0.989 but rejects the error-enriched band throughout.
查看结构化数据
任务指标本文基线提升
Pascal VOC 1/8 半监督分割(DINOv2-B,门控→严格) mIoU (%) 87.40(最好种子;三种子 86.19±1.82) UniMatch V2 报告 87.9 −0.5(复现级;门控下无自适应机制参与,等于忠实复现 SOTA)
Pascal VOC 1/8 严格 vs 自适应(匹配 batch 16、三种子) mIoU (%) 严格 87.40 最佳自适应 84.52(动态规则,任意种子) +2.9(严格领先;对下限 p=0.044、对动态 p=0.22)
ADE20K 1/8 半监督分割(DINOv2-B,门控→自适应下限) mIoU (%) 50.58 自身严格基线 49.10;UniMatch V2-B 报告 49.8 +1.48 / +0.78(单种子,符号在 S/B 复现)
Cityscapes 1/8 半监督分割(DINOv2-B,门控→严格) mIoU (%) 83.96 UniMatch V2-B 报告 84.3 −0.34(近平局,自适应规则差 ≤0.7)
饱和门控盲测(六个 DINOv2 严格教师) strict-vs-floor 判对次数 6/6 判对(边界 $\pi_{\mathrm{kept}}=\tau=0.95$) 无对照($\pi_{\mathrm{kept}}$ 未接触 $\Delta$ 即判定) Pascal/CS $\pi_{\mathrm{kept}}$≈98%→严格正确;ADE≈89%→下限正确
掩码保留率稳定性(Pascal 1/8,自适应下限 vs 裸动态) 保留率 $\rho_t$(终值) 下限 0.914(从未越过 0.95,Thm 1) 裸动态 1.000(epoch 7 过 0.95、epoch 8 过 0.99) 坍缩被消除(但精度仍不及严格,82.32 vs 87.40)
缩小规模下限稳定性研究(3 种子,8GB GPU) EMA 峰值→终值 mIoU 下降 1.7±0.6(加下限) 15.8±7.3(无下限) 晚期坍缩基本消除,种子方差从 ±7.3 收敛到 ±0.6

局限与改进

作者承认的局限:(1) 全部教师均为 DINOv2 家族,$\pi_{\mathrm{kept}}$ 原则上是校准性质、应当骨干无关,但未在 CLIP/SAM 类编码器上验证;(2) ADE20K 的 +1.5 是单种子,符号(下限≥严格)在 S/B 复现但幅度在种子噪声内;(3) 门控是事后验证而非在线部署——$\pi_{\mathrm{kept}}$ 在收敛教师的验证集(200 张、仅前向)上测得,而非训练中仅 9 张图的 $L_{cal}$,因此验证的是判据本身而非部署系统;(4) 严格自身种子方差大:一粒 84.09 停摆,其上动态 84.46 反超,是整个 3×6 网格中自适应唯一获胜的格子;(5) 严格臂与自适应臂的无监督损失不同(UniMatch V2 双强流 vs CW-BASS 单强流+特征扰动),双强流差异完全未消融;(6) CAFS/ENCORE 经忠实重实现而非官方代码审计;(7) DINOv2-L 的 strict-ADE 超显存、L-Cityscapes 未跑,batch-4 实验被计算截止截断且混合批次。我的补充观察:门控是二值的,不排序动态与逐类规则(Cityscapes-S、ADE-S 上二者略优于下限);六个教师不足以标定边界的精确形状,只能证明「能分开」;校准片虽无偏但统计功效极低,在线门控在 98% 与 93% 之间可能误判;确认偏差仅靠筛选防范,未与特征失真缓解(LP-FT 类)结合。

独立分析的弱点

独立分析的弱点:第一,门控边界 $\pi_{\mathrm{kept}}=0.95$ 是约定而非标定结果,且只在六个 DINOv2 教师上验证「能分开」而非「分在哪」——改进方向是把门控做成软混合,按 $\pi_{\mathrm{kept}}$ 连续插值严格与下限的权重,并在更多数据集/教师上标定 $\pi_{\mathrm{kept}}$–$\Delta$ 曲线。第二,留出校准在极低标注预算下吃掉 5% 标签(Pascal 1/8 仅 ≈9 张图),估计无偏但方差大,实时部署可能在 98% 与 93% 之间翻转判定——改进方向是按图像级聚合误差、用 Beta-Binomial 层次收缩、或跨 epoch 累积统计而非每 epoch 重置。第三,审计的最大混淆是严格臂损失不匹配:双强流差异未消融,尽管规则本身的可比离散度(5.0 mIoU)远超已测混淆(≈1.2),改进即在 CW-BASS v2 循环内加 drop-in 严格臂。第四,方法只回答「选哪条阈值」,对不可靠教师仅提供软化损失,未利用错误的结构信息(如噪声转移矩阵、逐类校正);下限在可靠教师上稳定但最差(82.32 对 87.40),说明稳定性与正确性正交,软化机制的上限未探。第五,ADE 结论单种子、batch-4 严重度梯度只是定性,跨数据集的结论强度不均衡,读者容易把 +1.5 高估为稳健增益。

未来方向

作者明确提出的方向:(1) 在 CW-BASS v2 循环内训练 drop-in 严格臂,使 strict-vs-adaptive 成为单因子比较——被称为「最有价值的未做实验」;(2) 把门控改为训练中实时用 $L_{cal}$ 测 $\pi_{\mathrm{kept}}$ 的在线部署,并测量其实际表现;(3) 将验证扩展到 CLIP、SAM 等非 DINOv2 基础教师;(4) 用更多教师标定门控边界的精确位置;(5) 逐类阈值方向只保留给置信集不可靠的教师。基于本文成果可延伸的方向:把 $\pi_{\mathrm{kept}}$ 随训练的轨迹做成动态/课程式门控——训练早期教师本就不可靠,「先下限后严格」的日程可能优于固定判定;对不可靠教师设计超出下限的机制,如留出校准驱动的逐类噪声转移矩阵校正、或对低置信带施加一致性/对比目标而非直接丢弃(作者自己的 PixCon 走嵌入空间辅助路线,可与之互补);把四条实践检查(测 $\pi_{\mathrm{kept}}$、匹配 batch、报轨迹、查 best-vs-final)推广为深度估计、目标检测等密集预测伪标签流程的标准审计;以及研究为何逐类置信统计在饱和教师下坍缩到同一值,能否用温度缩放等校准手段在推理端恢复逐类可分性。

复现评估

复现条件相当好:代码、配置、检查点与实验矩阵运行器在 GitHub(psychofict/CW-BASS-v2)开源,附 scripts/plot_*.py 与 gate_stat.py,可从运行产物重新生成论文每张图表;DINOv2 运行严格遵循公开的 UniMatch V2 协议(AdamW 双群组学习率,backbone 5e-6 / decoder 2e-4,batch 16,bf16,crop 518/686,60/120 epochs),三个数据集(Pascal VOC 2012、Cityscapes、ADE20K)全部公开。算力需求:全量复现需能容纳 DINOv2-Base 训练的 GPU(作者在 DINOv2-L + ADE 上即 OOM);核心结论(表 IX)需要 6 条 60-epoch Pascal 训练(3 种子 × 严格/最强自适应),加上其余规则约 15 条自适应运行;缩小规模稳定性研究单张 8GB GPU 即可(batch 2、15 epochs、1200 张无标注子集);门控检查只需一次前向。总体难度中等偏上:脚本齐全、协议公开,但要独立确认「严格领先」必须保持批次匹配与多种子纪律,且 ADE 的 +1.5 本身在种子噪声内,复核需预留多种子预算。