CW-BASS v2:基础模型教师下饱和感知的伪标签选择 CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers
用一次留出前向测量教师置信集可靠性,自动在严格阈值与自适应下限间切换
前置知识
自训练与伪标签
模型先在标注数据上训练,再用自己的预测(伪标签)给无标注数据打标并继续训练自己。半监督语义分割的主流实现是:EMA 教师在弱增广视图上输出每像素类别后验,取 argmax 得伪标签、取 max 得置信度;学生在强扰动视图上拟合被阈值筛选后的伪标签。伪标签必然含噪,训练会自我强化错误(确认偏差)。
全文讨论的对象就是这条自训练回路中「哪些伪标签该保留」的选择规则,所有定理和实验都围绕这个筛选环节展开。
弱到强一致性与 UniMatch V2
FixMatch 确立了弱视图伪标签监督强视图的范式;UniMatch 把它移植到分割并加特征扰动;UniMatch V2 在 DINOv2 骨干上用固定严格阈值 $\tau=0.95$、两路独立强视图和互补通道 dropout,把 Pascal VOC 1/8 推到 87.9 mIoU,是当前 SOTA。
本文的训练骨架(除阈值规则外)完全对齐 UniMatch V2,它既是被复现的基线,也是「严格过滤在强教师上最优」这一结论的来源。
EMA 教师与保留率
EMA(指数滑动平均)教师是学生权重的滑动平均,$\theta'_{t+1}=d_t\theta'_t+(1-d_t)\theta_t$,比学生更稳、是标准评估模型。保留率 $\rho_t$ 是每步被阈值放行、参与训练的像素比例;$\rho_t\to 1$ 意味着几乎全部伪标签(含错误)都进入损失。
论文用「掩码泛洪」($\rho_t$ 冲到 1)作为失效链条的关键实测证据,Theorem 1 的内容就是证明下限规则能把 $\rho_t$ 钉在固定分位数。
置信度校准与 ECE
校准衡量模型置信度与实际正确率是否一致,ECE(期望校准误差)用分箱统计偏离程度。论文的关键区分:DINOv2 教师 ECE 仅 0.007(整体校准好)却依然让自适应阈值失效,因为病因不是整体失准而是置信分布动态范围坍缩(98% 像素 ≥0.95),剩余的低置信带恰好是错误富集区。
门控判据 $\pi_{\mathrm{kept}}$ 本质是一次留出校准测试;读懂「聚合校准良好≠阈值规则可用」这一反转是理解全文的前提。
动态阈值家族(FlexMatch/FreeMatch/SoftMatch)
这一类方法不做固定截止,而是按某种信号自适应调整阈值:FlexMatch 按逐类学习状态设课程式阈值,FreeMatch 用置信度 EMA 做自适应全局阈值并逐类调制,SoftMatch 用截断高斯软权重替代硬阈值。它们都读取同一个信号——像素/类别间的置信度差异,这在 ResNet 弱教师上很丰富。
它们是被审计的对象:论文证明 DINOv2 教师把置信度差异压扁后,这些机制的判别信号消失,逐类阈值和全局动态阈值一样失效。
DINOv2 与 DPT 解码器
DINOv2 是自监督训练的 ViT 基础编码器,无需标签即可产出适合密集预测的强特征;配上 DPT 式轻量解码器微调后,其伪标签精度远超 ResNet 骨干。本文用 DINOv2-Base(ViT-B/14)+ DPT-lite,并扫过 S/B/L 尺度族。
正是这个骨干带来了「机制反转」:置信度饱和与动态范围坍缩是 DINOv2 教师的几何性质,是一切失效分析的出发点。
研究动机
密集像素标注是计算机视觉中最昂贵的监督形式之一:标注一张 Cityscapes 图像约需 90 分钟。半监督语义分割(SSSS)用小标注集加大规模无标注图像自训练来摊薄成本,但伪标签必然含噪,「该信哪些伪标签」遂成核心问题。在 ResNet-50/101 + DeepLabV3+ 时代,教师置信度铺展在 [0.3, 1] 上、噪声项主导权衡,于是一整代选择机制——动态阈值(原 CW-BASS)、逐类课程阈值(FlexMatch)、自适应全局阈值(FreeMatch)、软置信权重(SoftMatch)、逐类自适应(CAFS/ENCORE)——都靠「按置信度自适应放宽截止、换取覆盖」取胜。DINOv2 等自监督基础编码器加 DPT 解码器改变了游戏规则:UniMatch V2 仅用固定严格阈值 $\tau=0.95$ 就把 Pascal VOC 1/8 从 ResNet 时代的中 70 段 mIoU 推到 87.9。此时教师在 Pascal 上有 98% 的像素置信度 ≥0.95(ResNet 仅 53%),ECE 反而更低(0.007 vs 0.024):置信分布动态范围坍缩,为欠自信教师设计的自适应滤波不仅失效,还会放行恰好集中在低置信带的教师错误,把自训练拖入确认偏差。
本文的目标是本文目标是把伪标签选择从「承诺单一规则」升级为「读取教师所处置信度状态后再选规则」:当教师的置信集可靠时部署严格固定阈值(复现 SOTA 操作点),当教师「自信但不可靠」时启用带稳定性保证的自适应机制;且这个选择必须由可一次前向测得的统计量驱动——置信集可靠性 $\pi_{\mathrm{kept}}=\Pr[\hat{y}=y\mid c\geq\tau]$,其边界就是运行阈值本身而非在下游 mIoU 上调出的数值——从而保证部署后的方法在任何教师上都不差于严格 SOTA 配方,并在不可靠教师上改进它。配套地,作者要用一次批次匹配的机制级审计,把「自适应规则为何在强教师上失效」的每一环都实测出来,使方法的设计有据可查而非直觉押注。
与已有工作不同的是,独特切入在于把阈值规则当作唯一变量做受控审计,而非当超参数调优:同一 DINOv2-Base 骨干、同一损失脚手架、同批次(16)、同数据切分、多种子下,比较严格阈值与五条自适应规则,并逐环节测量失效因果链——置信度饱和(98% 像素 ≥0.95)→ 动态范围坍缩(截止被钉在 [0.300,0.331],恰在解析上限 $\tau_0\sigma(\beta/2)\approx 0.34$ 之下)→ 掩码泛洪(保留率 epoch 7 过 0.95、epoch 8 过 0.99、最终 1.000)→ 早期见顶后衰减(逐类规则 EMA 掉 6.14 mIoU)。据作者所知,这是首个基础模型骨干上批次匹配的自适应伪标签阈值机制级研究。同时,论文用留出校准指出批内噪声估计的向下偏差(ADE 教师批内读数 98.4% vs 留出 89.3%),并纠正流行误读:ADE 上自适应获胜不是因为教师欠自信(它同样饱和),而是因为它「自信但不可靠」($\pi_{\mathrm{kept}}\approx 89\%$)。
核心方法
直觉:没有一条阈值规则在所有置信度状态下都对,与其押注单一规则,不如先花一次前向测量教师置信集的可靠性再决定。技术路线沿用 UniMatch V2 骨架——DINOv2-Base(ViT-B/14)编码器 + DPT-lite 解码器、EMA 教师、弱视图产伪标签、图像强增广+CutMix 与特征通道 dropout 两路强视图共享一次骨干前向——并保留 CW-BASS 的置信度加权交叉熵与 Sobel 边界辅助。在此之上新增三个构造:(1) 留出校准:把标注集切出 $\alpha=5\%$ 的校准片 $L_{cal}$,仅在其上估计逐类伪标签噪声,证明估计无偏;(2) 自自适应置信下限:随教师平均置信度缩放的下限,可证明把保留率钉在固定分位数、防止坍缩;(3) 一次前向的饱和门控:在留出片上测 $\pi_{\mathrm{kept}}$,≥0.95 选严格、否则选下限。除门控的红色组件外,整个流水线与 UniMatch V2 对齐;各组件均可独立开关以支持消融。
核心创新是「先测量后选择」的门控及其判据:$\pi_{\mathrm{kept}}=\Pr[\hat{y}=y\mid c\geq 0.95]$ 在留出片上一遍前向即可测得,$\pi_{\mathrm{kept}}\geq\tau$ 时用严格、否则用自适应下限,边界是运行阈值本身,从不接触下游 mIoU。与已有方法的本质区别有三:其一,FlexMatch/FreeMatch/SoftMatch 等承诺单一自适应规则,本文证明该信号在饱和教师下必然退化——动态阈值被解析上限 $\bar{\tau}=\tau_0\sigma(\beta/2)\approx 0.34$ 卡死,保留率 $\to 1$(Corollary 1),而基础模型教师的置信质量几乎全部堆在 1 附近,任何「向下自适应的空间」都是放行错误富集带的空间。其二,批内(学生训练像素上的)噪声估计被证明向下有偏,偏差恰为教师在置信类像素上的泛化差距(Proposition 1),留出校准从构造上切断「估计噪声下降→阈值下探」的自我确认回路。其三,下限 $\tau^{\mathrm{floor}}_k=s\bar{c}_t\mu_k/\max_j\mu_j$ 在尺度族假设下可证明保留率与整体置信水平无关、钉在固定分位数 $1-G_k(sr_k)$(Theorem 1),是唯一被证明能防坍缩的自适应规则。
方法步骤详情
每个 epoch 的完整流程(Algorithm 1):(1) 校准遍历:EMA 教师前向 $L_{cal}$(Pascal 1/8 约 $0.05\times 183\approx 9$ 张图),统计每类 $n_k(\tau)$ 与正确数 $n^c_k(\tau)$,得无偏噪声估计 $\hat{\epsilon}_k(\tau)=1-n^c_k/n_k$,直方图每 epoch 重置以反映当前教师。(2) 对每个无标注 batch:弱视图过 EMA 教师,$\hat{y}=\arg\max_k p$、$c=\max_k p$。(3) 更新置信度 EMA $\bar{c}_t$(动量 $m=0.99$)与逐类均值 $\mu_k$。(4) 计算动态阈值 $\tau^{dyn}=\mathrm{clip}\big(\tau_0/(1+e^{-\beta(\bar{c}-1/2)}),\,\tau_{\min},\,\tau_{\max}\big)$(原常数 $\tau_0=0.6,\beta=0.5,\tau_{\min}=0.3,\tau_{\max}=0.95$)。(5) 计算逐类下限 $\tau^{\mathrm{floor}}_k=s\bar{c}_t\cdot\mu_k/\max_j\mu_j$($s=0.95$),取 $\tau^{\mathrm{final}}_k=\max(\tau^{dyn},\tau^{\mathrm{floor}}_k)$。(6) 构造保留掩码 $\mathcal{M}=\{(h,w): c_{h,w}\geq\tau^{\mathrm{final}}_{\hat{y}_{h,w}}\}$。(7) 两路强视图训练学生,总损失 $\mathcal{L}=\tfrac12\mathcal{L}_x+\tfrac12(\mathcal{L}_s+\mathcal{L}_{fp})$,无监督项为掩码上按 $c^{\gamma}$($\gamma=1$)加权的 CE 加 Sobel 边界项($\beta_b=0.5$),随后 EMA 更新教师。(8) 部署时门控:在留出片测 $\pi_{\mathrm{kept}}$,≥0.95 则整轮采用严格 $\tau=0.95$,否则采用下限规则;判定只需一次前向、无需任何学生更新,额外墙钟开销不到 1%。
技术新颖性
技术新颖性体现在四个层面。诊断层面:把置信学习/噪声标签领域的留出消偏原理改造成分割专用的在线实例,并精确刻画批内估计的偏置来源(训练误差的乐观性,即泛化差距),实测 9.1 个百分点的乐观差(98.4% vs 89.3%)正是门控「必需而非装饰」的证据。理论层面:下限的稳定性保证建立在一个可证伪的尺度族假设(Assumption 1:逐类置信分布随整体均值等比缩放)上,预测「加下限掩码轨迹平坦、不加则上升」,经验曲线在 epoch 6 后 ±0.03 内吻合;作者坦诚 Theorem 1 不涉精度,只是把会坍缩到全保留的量变成可控分位数。方法论层面:首个批次匹配、机制级的自适应阈值审计,规则是唯一变量,据此测出自适应家族 5.0 mIoU 的离散度(79.36–84.35),比损失形式+校准片可解释的 ≈1.2 大一个数量级。工程层面:门控二值、一次前向、零额外参数,校准遍历约 9 次/epoch 对比 649 次学生迭代;与 CAFS 用留出校准设逐类阈值追覆盖的目的相反——本文用同一工具解释为什么追覆盖会失败。
实验结果
复现校验:严格基线三种子均值 86.19±1.82、最好种子 87.40(epoch 42),落在 UniMatch V2 报告 87.9 的 ±0.5 内,证明实验平台忠实。决定性对照(Pascal 1/8、匹配 batch 16、三种子):严格 87.40 领先所有规则——动态 84.35±0.24、逐类 83.79±0.43、SoftMatch 82.99±0.66、下限+校准 81.88±0.57、FreeMatch 79.36±0.51;15 个自适应运行无一触及 87.40,任意种子最好 84.52(差 2.9)。Welch t 检验仅对下限(p=0.044)与 FreeMatch(p=0.017)显著;唯一输掉的一格是种子 1 严格停摆 84.09、低于该种子动态的 84.46。通用性(表 VI,六教师):Pascal 各尺度严格领先 3.3–5.1,Cityscapes 打平(差 ≤0.7),ADE20K 下限 50.58 对严格 49.10(+1.48,单种子),并超 UniMatch V2-B 报告的 49.8。门控盲测(表 VII / Fig.5):$\pi_{\mathrm{kept}}$ 在 Pascal/Cityscapes 为 98.1–98.5%、ADE 为 89.2–89.3%,六次 strict-vs-floor 判对全部正确。失效链(表 XI / Fig.8/9/11):98% 像素 ≥0.95 → 截止钉在 [0.300,0.331] → 保留率 epoch 7 过 0.95、epoch 8 过 0.99、至 1.000,放行 99.9% 的教师错误(严格 63%)→ 自适应规则 epoch 4–20 见顶后衰减,逐类 EMA 由 84.07 跌至 77.93(−6.14),学生 −6.0;严格只跌 1.06。消融(表 VIII):边界辅助在 DINOv2 上失效(−1.9)、置信加权 +1.2、下限家族内最大 +2.7、校准对精度中性(−0.5)。排除替代解释(表 XV/XVI/XVII):参数扫描($\tau_{\min}$ 0.5/0.7/0.9、$\tau_0$ 1.2/1.7)最好 84.67 仍差 2.7;损失形式+校准片只解释 ≈1.2;$\alpha$ 扫描精度平坦(≤0.5);缩小规模三种子下下限把衰减从 15.8±7.3 压到 1.7±0.6。逐类(表 XII/XIII):匹配 batch 16 下严格在 18/21 类领先,逐类规则在其针对性放水的六个最难类上仅平局(尾部均值 58.6 对 59.2),印证「对饱和教师,难类的不确定性意味着教师错了,而非被不公平过滤」。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Pascal VOC 1/8 半监督分割(DINOv2-B,门控→严格) | mIoU (%) | 87.40(最好种子;三种子 86.19±1.82) | UniMatch V2 报告 87.9 | −0.5(复现级;门控下无自适应机制参与,等于忠实复现 SOTA) |
| Pascal VOC 1/8 严格 vs 自适应(匹配 batch 16、三种子) | mIoU (%) | 严格 87.40 | 最佳自适应 84.52(动态规则,任意种子) | +2.9(严格领先;对下限 p=0.044、对动态 p=0.22) |
| ADE20K 1/8 半监督分割(DINOv2-B,门控→自适应下限) | mIoU (%) | 50.58 | 自身严格基线 49.10;UniMatch V2-B 报告 49.8 | +1.48 / +0.78(单种子,符号在 S/B 复现) |
| Cityscapes 1/8 半监督分割(DINOv2-B,门控→严格) | mIoU (%) | 83.96 | UniMatch V2-B 报告 84.3 | −0.34(近平局,自适应规则差 ≤0.7) |
| 饱和门控盲测(六个 DINOv2 严格教师) | strict-vs-floor 判对次数 | 6/6 判对(边界 $\pi_{\mathrm{kept}}=\tau=0.95$) | 无对照($\pi_{\mathrm{kept}}$ 未接触 $\Delta$ 即判定) | Pascal/CS $\pi_{\mathrm{kept}}$≈98%→严格正确;ADE≈89%→下限正确 |
| 掩码保留率稳定性(Pascal 1/8,自适应下限 vs 裸动态) | 保留率 $\rho_t$(终值) | 下限 0.914(从未越过 0.95,Thm 1) | 裸动态 1.000(epoch 7 过 0.95、epoch 8 过 0.99) | 坍缩被消除(但精度仍不及严格,82.32 vs 87.40) |
| 缩小规模下限稳定性研究(3 种子,8GB GPU) | EMA 峰值→终值 mIoU 下降 | 1.7±0.6(加下限) | 15.8±7.3(无下限) | 晚期坍缩基本消除,种子方差从 ±7.3 收敛到 ±0.6 |
局限与改进
作者承认的局限:(1) 全部教师均为 DINOv2 家族,$\pi_{\mathrm{kept}}$ 原则上是校准性质、应当骨干无关,但未在 CLIP/SAM 类编码器上验证;(2) ADE20K 的 +1.5 是单种子,符号(下限≥严格)在 S/B 复现但幅度在种子噪声内;(3) 门控是事后验证而非在线部署——$\pi_{\mathrm{kept}}$ 在收敛教师的验证集(200 张、仅前向)上测得,而非训练中仅 9 张图的 $L_{cal}$,因此验证的是判据本身而非部署系统;(4) 严格自身种子方差大:一粒 84.09 停摆,其上动态 84.46 反超,是整个 3×6 网格中自适应唯一获胜的格子;(5) 严格臂与自适应臂的无监督损失不同(UniMatch V2 双强流 vs CW-BASS 单强流+特征扰动),双强流差异完全未消融;(6) CAFS/ENCORE 经忠实重实现而非官方代码审计;(7) DINOv2-L 的 strict-ADE 超显存、L-Cityscapes 未跑,batch-4 实验被计算截止截断且混合批次。我的补充观察:门控是二值的,不排序动态与逐类规则(Cityscapes-S、ADE-S 上二者略优于下限);六个教师不足以标定边界的精确形状,只能证明「能分开」;校准片虽无偏但统计功效极低,在线门控在 98% 与 93% 之间可能误判;确认偏差仅靠筛选防范,未与特征失真缓解(LP-FT 类)结合。
独立分析的弱点
独立分析的弱点:第一,门控边界 $\pi_{\mathrm{kept}}=0.95$ 是约定而非标定结果,且只在六个 DINOv2 教师上验证「能分开」而非「分在哪」——改进方向是把门控做成软混合,按 $\pi_{\mathrm{kept}}$ 连续插值严格与下限的权重,并在更多数据集/教师上标定 $\pi_{\mathrm{kept}}$–$\Delta$ 曲线。第二,留出校准在极低标注预算下吃掉 5% 标签(Pascal 1/8 仅 ≈9 张图),估计无偏但方差大,实时部署可能在 98% 与 93% 之间翻转判定——改进方向是按图像级聚合误差、用 Beta-Binomial 层次收缩、或跨 epoch 累积统计而非每 epoch 重置。第三,审计的最大混淆是严格臂损失不匹配:双强流差异未消融,尽管规则本身的可比离散度(5.0 mIoU)远超已测混淆(≈1.2),改进即在 CW-BASS v2 循环内加 drop-in 严格臂。第四,方法只回答「选哪条阈值」,对不可靠教师仅提供软化损失,未利用错误的结构信息(如噪声转移矩阵、逐类校正);下限在可靠教师上稳定但最差(82.32 对 87.40),说明稳定性与正确性正交,软化机制的上限未探。第五,ADE 结论单种子、batch-4 严重度梯度只是定性,跨数据集的结论强度不均衡,读者容易把 +1.5 高估为稳健增益。
未来方向
作者明确提出的方向:(1) 在 CW-BASS v2 循环内训练 drop-in 严格臂,使 strict-vs-adaptive 成为单因子比较——被称为「最有价值的未做实验」;(2) 把门控改为训练中实时用 $L_{cal}$ 测 $\pi_{\mathrm{kept}}$ 的在线部署,并测量其实际表现;(3) 将验证扩展到 CLIP、SAM 等非 DINOv2 基础教师;(4) 用更多教师标定门控边界的精确位置;(5) 逐类阈值方向只保留给置信集不可靠的教师。基于本文成果可延伸的方向:把 $\pi_{\mathrm{kept}}$ 随训练的轨迹做成动态/课程式门控——训练早期教师本就不可靠,「先下限后严格」的日程可能优于固定判定;对不可靠教师设计超出下限的机制,如留出校准驱动的逐类噪声转移矩阵校正、或对低置信带施加一致性/对比目标而非直接丢弃(作者自己的 PixCon 走嵌入空间辅助路线,可与之互补);把四条实践检查(测 $\pi_{\mathrm{kept}}$、匹配 batch、报轨迹、查 best-vs-final)推广为深度估计、目标检测等密集预测伪标签流程的标准审计;以及研究为何逐类置信统计在饱和教师下坍缩到同一值,能否用温度缩放等校准手段在推理端恢复逐类可分性。
复现评估
复现条件相当好:代码、配置、检查点与实验矩阵运行器在 GitHub(psychofict/CW-BASS-v2)开源,附 scripts/plot_*.py 与 gate_stat.py,可从运行产物重新生成论文每张图表;DINOv2 运行严格遵循公开的 UniMatch V2 协议(AdamW 双群组学习率,backbone 5e-6 / decoder 2e-4,batch 16,bf16,crop 518/686,60/120 epochs),三个数据集(Pascal VOC 2012、Cityscapes、ADE20K)全部公开。算力需求:全量复现需能容纳 DINOv2-Base 训练的 GPU(作者在 DINOv2-L + ADE 上即 OOM);核心结论(表 IX)需要 6 条 60-epoch Pascal 训练(3 种子 × 严格/最强自适应),加上其余规则约 15 条自适应运行;缩小规模稳定性研究单张 8GB GPU 即可(batch 2、15 epochs、1200 张无标注子集);门控检查只需一次前向。总体难度中等偏上:脚本齐全、协议公开,但要独立确认「严格领先」必须保持批次匹配与多种子纪律,且 ADE 的 +1.5 本身在种子噪声内,复核需预留多种子预算。
论文图表
示意图(非实测图)概括两个失效模式:(a) 置信度饱和教师的动态阈值被钉在约 0.33 的下限附近,保留率漂向 1,训练被残余噪声淹没;自适应下限则把保留率钉在固定分位数。(b) 在学生训练像素上估计伪标签噪声会随训练塌缩到 0(无论真实质量如何),留出校准则无偏。
这是全文机制的一页速览:门控存在的理由就是规避这两个实测失效,Fig.11a 与表 VII 是它们的实测版本。
两个面板对比 ResNet-50 与 DINOv2-B 教师的置信分布与可靠性曲线:DINOv2 的置信质量几乎全部堆在 [0.95,1],整体校准反而更好,但稀疏的低置信带明显过度自信、错误富集。
定义了「机制反转」的核心事实:问题不是聚合失准而是动态范围坍缩——这是理解为何自适应规则失效的入口。
完整训练配置:DINOv2-Base + DPT-lite、bf16、各数据集 crop/epoch(518/60、686/120)、batch 16、backbone LR 5e-6、decoder LR 2e-4,以及各规则超参:严格 τ=0.95、τ0=0.6、下限 s=0.95 与动量 m=0.99、校准 α=0.05、边界权重 βb=0.5、置信权重 γ=1。
复现与理解实验控制的必备信息:明确哪些变量被固定、严格臂与自适应臂在损失形式和标注保留上的两处已知差异。
Pascal VOC 各标注比例的文献全景:从 ResNet-101 方法的 65–78,到 SemiVL 的 84.0–87.3,再到 DINOv2-B 的 UniMatch V2(86.3/87.9/88.9/90.0/90.8);本文(门控→严格)为 84.47/87.40/88.59。
确定本文在领域全景中的位置:处于 DINOv2 顶层但落后报告值 0.3–0.5,诚实说明这些行是复现证据而非新 SOTA。
Cityscapes 各标注比例对比:UniMatch V2-B 为 83.6/84.3/84.5/85.1,本文(门控→严格)为 83.16/83.96/83.99,均差 0.3 左右,属可靠教师上的近平局。
提供第二张饱和基准的全景证据,支撑「可靠教师上门控选严格、结果即复现」的一致结论。
ADE20K 各标注比例:UniMatch V2-B 为 38.7–52.0;本文严格复现 49.10、门控→下限 50.58(1/8),是唯一一个本文机制真正工作的数据集行。
呈现门控「改进区间」的正面结果:在自信但不可靠的长尾教师上,自适应下限同时超过自身严格基线与文献报告值(单种子)。
DINOv2-S/B/L × 三数据集 × 四规则的 mIoU 矩阵(batch 16):Pascal 上严格领先(如 B:87.40 vs 84.07/82.32/84.07),Cityscapes 打平(差 ≤0.7),ADE20K 下限反超(50.58 vs 49.10);L-ADE 仅动态 52.00 可比(严格 OOM)。
把单数据集结论升级为跨尺度、跨数据集的规律性证据,并直接指向「分隔变量是 $\pi_{\mathrm{kept}}$ 而非饱和度」的门控设计。
六教师的置信几何:饱和度 82.1–97.8%(全部高度饱和),$\pi_{\mathrm{kept}}$ 为 Pascal-B 98.5 / Pascal-S 98.4 / CS-B 98.4 / CS-S 98.1 / ADE-B 89.3 / ADE-S 89.2;对应 $\Delta$ 为 −5.08/−4.52/−0.49/−0.35/+1.48/+0.67,门控判定与符号完全一致。
全文最关键的数据表:同时排除「欠自信」解释(ADE 同样饱和)并证明 $\pi_{\mathrm{kept}}$ 才是预测自适应收益的正确统计量。
累加式消融:仅 CWLoss 77.93 → 加边界 76.08(−1.9,ResNet 时代的增益未迁移)→ 加下限 78.76(+2.7)→ 加校准 78.28(−0.5,精度中性)。整条阶梯都在严格基线之下。
量化 CW-BASS 各组件在 DINOv2 上的真实贡献:证明边界辅助是骨干依赖的,校准的价值在无偏诊断而非 mIoU。
六条规则 × 三种子完整矩阵:严格 87.40/84.09/87.08(86.19±1.82),动态 84.35±0.24,逐类 83.79±0.43,SoftMatch 82.99±0.66,下限+校准 81.88±0.57,FreeMatch 79.36±0.51;Welch t 检验仅对下限(p=0.044)与 FreeMatch(p=0.017)显著。
论文的决定性受控实验:规则是唯一变量的三种子比较,既给出「严格领先」的统计支撑,也如实标注唯一失利的种子格与显著性边界。
匹配 batch 16 的轨迹统计:严格 87.40@ep42(EMA 仅回落 1.06);动态 84.07@ep20(回落 0.68,靠不涨而非跌);下限+校准 82.32@ep4(回落 2.24);逐类 84.07@ep4 后暴跌至 77.93,EMA 回落 6.14、学生 6.0——评估模型本身坍缩。
用「峰值-终值落差」揭示 best-checkpoint 表格掩盖的确认偏差指纹:自适应规则见顶于 epoch 4–20,严格独占 87.4 模式。
保留率实测:动态规则起点 0.569,epoch 7 过 0.90/0.95、epoch 8 过 0.99、终值 1.000;严格 epoch 10 才过同样水平、终值 0.989;下限最高 0.914、从未过 0.95(与 Theorem 1 一致);逐类 epoch 8 过 0.90、终值 0.893。
给失效链第三环(掩码泛洪)提供逐 epoch 数字证据,并精确区分「保留多少」与「保留哪些像素」:严格高保留但成分正确。
六个最难类(bicycle/chair/diningtable/pottedplant/sofa/tvmonitor)的逐类 IoU:逐类规则对它们专门降低阈值,但尾部均值 58.6 仅与全局动态阈值 59.2 打平(种子噪声内),严格(batch 16 参照)为 71.9。
对「逐类自适应」动机最尖锐的直接检验:降低难类阈值换不来该类精度,直接证伪逐类方向在饱和教师上的价值。
21 类完整对比(87.4 vs 84.1):严格在 18/21 类领先;逐类规则仅在 bicycle(+0.5)、train(+1.6)、tvmonitor(+4.3)获胜,却在 sofa(−21.0)、chair(−17.8)、bottle(−5.6)上因放行自信错误而重创。
展示逐类放水的代价分布:在杂乱室内场景,降低阈值把「教师不确定」直接转化为标签噪声,这是确认偏差的逐类解剖。
batch 4 补充运行:Pascal 1/8 动态 80.40@ep5(raw 回落 2.2)、下限+校准 80.50@ep1(5.3)、逐类 79.96@ep2(12.6);1/4 分割同样早峰陡降。作者声明这些运行混合批次且被计算截止,只作定性读数。
展示坍缩对批次大小的敏感性:每个噪声更新权重更大时自适应规则劣化更狠,佐证「早期见顶后衰减」是确认偏差而非偶然。
参数扫描:τmin=0.5/0.7/0.9 与 τ0=1.2/1.7 的最好成绩 84.67@ep7(仍差 2.73),全部早期见顶;τmin=0.95 的极限情形被刻意略去——那在代数上就是严格规则本身。
排除「只是旧常数没调好」的自然反驳:保留任何自适应空间的设定都追不上严格阈值,失败源于机制而非参数化。
三种子缩小规模对比:无下限的动态阈值 1/8 分割峰值 72.3±7.3、终值 56.5(掉 15.8);加下限后 78.5±0.6、终值 76.8(掉 1.7);1/4 分割掉幅 9.9→0.0。两者仍远低于严格基线。
实验验证 Theorem 1 的稳定性承诺:下限把不稳定规则变成稳定规则,但作者同时强调稳定≠准确,这正是门控必要的实验注脚。
校准片比例 α∈{0, 0.02, 0.05} 的消融:最好 EMA mIoU 为 78.76/78.49/78.28,差异在 0.5 mIoU 内,留出 5% 标注几乎零精度代价。
证明留出校准是「免费」的:其价值在于 Proposition 1 的无偏噪声估计(支撑门控),而非精度本身,回应「占用标注是否值得」的疑问。