← 返回 2026-08-31

生成式语义场景补全 Generative Semantic Scene Completion

Shi Chen, Weifeng Ge 📅 2026-08-27 👍 2 2026-09-01 18:30
LiDAR 合成数据 模型修正 流匹配 离散扩散 自动驾驶 语义场景补全 长尾分布

一套离散扩散框架身兼三职:合成配对数据、从噪声补全、一步修正冻结模型,达38.8% mIoU

前置知识

语义场景补全(Semantic Scene Completion, SSC)

给定一帧稀疏 LiDAR 扫描,预测完整 3D 体素网格中每个体素的占用状态与语义类别。SemanticKITTI 的网格为 $256\times256\times32$、0.2 m 分辨率、覆盖 $51.2\times51.2\times6.4$ m,含 19 个语义类加空类。单帧扫描只命中约 1% 的体素,其余体素的几何与语义都要靠上下文推断,是典型的稠密预测任务。

本文的所有任务定义、训练网格、官方评测协议和逐类 IoU 指标都建立在该基准之上;读懂论文需要知道 SSC 的输入输出形态以及'单帧观测极稀疏'这一根本约束。

多项式(离散)扩散

把连续扩散的高斯噪声换成类别转移:每个体素标签以概率 $1-\beta_t$ 保持不变,否则从 $K$ 类中均匀重采样,前向终态收敛到均匀分布 $u$;累积保留率 $\bar\alpha_t=\prod_{r=1}^{t}(1-\beta_r)$ 刻画信号残留。反向过程把网络输出的单纯形估计 $\hat{x}_0$ 代入解析后验 $q(x_{t-1}|x_t,\hat{x}_0)$ 完成去噪。

GSSC 的三个组件(PS3/SGSC/S2D2)全部复用这一套离散扩散数学,只是更换了源分布与条件;不理解它就无法看懂后文的插值路径、后验 KL 目标和采样器。

流匹配与直线插值

流匹配学习一个速度场,把源分布沿直线路径 $z_s=(1-s)z_0+s z_1$ 搬运到目标分布,网络拟合常位移 $z_1-z_0$。当路径是直线、位移沿路径恒定时,理论上一个欧拉步即可走完全程,无需多步迭代。

S2D2 把扩散时钟 $\bar\alpha_t$ 直接读作流时间,在'冻结基模型预测 → 真值'两个固定端点之间学一条直线传输,这正是它能单步部署、且误差可伸缩求和(telescope)而不放大的原因。

mIoU 与长尾类别不均衡

mIoU 对 19 个类别的 IoU 取等权平均,因此对稀有类极其敏感。SemanticKITTI 中植被占标注点 26.7%,摩托车手(motorcyclist)仅占 0.0037%,类别频率与 SCPNet 已发表的隐藏测试逐类 IoU 的 Pearson 相关高达 0.80——训练集中越稀少的类,模型得分越低。

论文的核心动机(安全关键的稀有类恰恰学不到)与自创指标(VRU-IoU、安全关键 mIoU、DW-IoU)都源于对 mIoU 长尾敏感性的理解;作者也坦诚单步修正对最稀有类的收益无法复现。

从噪声生成 vs. 从结构化源修正

标准扩散从纯噪声 $u$ 出发重建整个场景,会把基模型已确定的部分(路面、建筑立面)重画一遍;结构化源扩散把噪声先验换成冻结网络的 one-hot 预测 $x_{src}$,前向路径变为两端单纯形点的凸组合 $x_t=\bar\alpha_t x_0+(1-\bar\alpha_t)x_{src}$,只在源出错的体素上做功。

这是 S2D2 一步部署的理论核心,也是它与 SegRefiner(随机扩散修正)、离散流匹配(随机核)等已有方法的本质分野:确定性直线使误差上界塌缩为'单步残差 + 小偏移'。

BEV(鸟瞰图)条件流

把 3D 体素预测沿高度轴投影成 2D 网格,取每列最上层非空类别,得到一张 BEV 语义图;再配一个冻结 LiDAR 分割骨干(LSK3DNet)输出的逐体素特征流,两条流以加性方式注入去噪 U-Net 的每一层(而非 FiLM 仿射调制),让部分语义先于几何补全到达生成器。

消融显示 BEV 流是修正算子的主导成分(去掉后增益从 +2.5 掉到 +1.1 pp),而 SGSC 在 oracle BEV 下 42.3%、换成预测 BEV 时两轮类崩塌——理解'生成质量继承自条件质量'离不开这个概念。

研究动机

自动驾驶车辆不能只对传感器碰巧看到的表面做规划,它必须推理停放的汽车背后、最后一束回波之外的空间。SemanticKITTI 通过聚合整段序列的扫描来标注当前帧被遮挡的体素,但这种构造把类别直方图固定在了采集车开过的地方:植被占标注点的 26.7%,而摩托车手仅占 0.0037%,类别失衡超过 7,000 倍;且类别频率与前一方法已发表的隐藏测试逐类 IoU 强相关(Pearson $r=0.80$)——规划器最需要的类恰恰是训练集供给最少的类。传感器进一步加剧问题:单帧扫描只返回约百分之一的体素,其后方、内部与超出的所有东西都要推断,于是稀有类、薄结构、幽灵轨迹、边界错误与遮挡五类失败模式全部暴露(论文在 SCPNet 的验证集预测上实测了这些比例)。现有两类补救都不增加场景:类别加权或 focal loss 只改变已有样本计数的权重;蒸馏(SCPNet 的多帧教师)、测试时适应(TALoS)等只是从同样序列里榨取更多监督——两者面对的直方图纹丝不动。

本文的目标是本文把户外 LiDAR 语义场景补全从判别式回归重构为生成式建模,提出 GSSC 框架:用同一个多项式离散扩散公式承担三个角色。其一,配对稀疏-稠密场景合成 PS3 从源头制造训练数据——先生成稠密语义场景,再用硬件感知的 LiDAR 光线追踪模型反向渲染出'会产生它的稀疏扫描',并通过稀有类对象库把安全关键类放大(最终把 SemanticKITTI 训练集从 19,130 对扩到 51,169 对,2.67 倍)。其二,语义引导生成补全 SGSC 覆盖没有基模型可用的情形,从均匀噪声出发、以 BEV 语义图与稀疏 3D 特征流为条件生成完整场景。其三,结构化源离散扩散 S2D2 把同一架构对准任一冻结模型的预测,用一步确定性流修正其输出,不重训、不做测试时适应。量化目标是:在'单帧扫描、不用未来时刻、不集成'的因果谓词下取得 SemanticKITTI 隐藏测试的最佳成绩,并给出单步部署可行的理论保证(精确似然恒等式与不放大误差的伸缩界)。

与已有工作不同的是,作者的独特切入是把'能生成 3D 数据的两大家族'各自缺口摆上台面后取中间路线。无条件生成器(如金字塔扩散)只复现训练分布,同样很少放置稀有类,而且不提供与稠密场景配对的稀疏扫描——CarlaSC 的场景来自 CARLA 模拟器,分布与 SemanticKITTI 不匹配;已有生成式 SSC 要么用连续高斯扩散(DiffSSC、OccGen)不落在体素标签空间内,要么只在合成数据上报告。修正已有预测虽不新鲜——SemCity 用连续三平面扩散先验增强补全输出、LiDiff 扩散点云、ESSC-RM 与 OccFiner 依赖相机或多帧——但没有一个方法在它将被评分的分辨率和标签空间内修正场景。GSSC 占据两条空轴:PS3 为生成的场景配一个'本会产生它的观测'(HALO 按 HDL-64E 真实光束反向追踪),让放大量跟着对象库供给走而非跟着类稀有度走;S2D2 把扩散的源设为冻结网络自己的预测,把损坏过程解读为两个固定端点间的确定性直线插值,从而把'从噪声重建'变成'从预测修正'。

核心方法

直觉上:与其训练更大的判别式网络去回归唯一的确定性补全,不如学习'完整标注场景'的分布,再从这一个分布读出三件工作。技术路线是统一的多项式离散扩散:语义网格嵌入到乘积单纯形 $\mathcal{M}=(\Delta^{K-1})^{L\times W\times H}$($K=20$ 类),前向过程以累积保留率 $\bar\alpha_t=\prod_{r=1}^t(1-\beta_r)$ 把标签向均匀噪声 $u$ 混合,反向过程由去噪网络的 $\hat{x}_0=\mathrm{softmax}\,f_\theta(x_t,t,c)$ 代入解析后验完成。PS3 离线制造配对数据:三级金字塔扩散($32^2\times4\to64^2\times8\to256^2\times32$,各 100 步)由粗到细生成场景,经结构检查与 JSD 筛选后从对象库粘贴稀有类实例,最后由 HALO 光线追踪器按 Velodyne HDL-64E 的真实光束布局渲染出稀疏扫描。SGSC 用一个四层稠密 3D U-Net(通道 32→256,约 35M 参数)从均匀噪声生成场景,条件是基模型导出的 BEV 语义图 $B$ 与冻结 LSK3DNet 的逐体素稀疏特征 $F$,两条流加性注入每一层。S2D2 复用同一 U-Net 架构但从零训练:源是冻结基模型(如 SCPNet)的 one-hot argmax 预测 $x_{src}$,目标是one-hot 真值 $x_0$,中间走一条确定性直线,部署时单步欧拉修正。

核心创新是把扩散的噪声源换成'结构化源'——冻结基模型自己的预测。标准离散扩散从 $x_T\approx u$ 出发,路径横跨几乎整个单纯形,重建一切,包括基模型已经答对的路面与建筑;S2D2 的插值是 $$x_t=\bar\alpha_t\,x_0+(1-\bar\alpha_t)\,x_{src},$$ 两端固定、路径为直线,待估位移 $x_0-x_{src}$ 只在基模型出错的体素上有支撑(高 top-1 精度下很小)。这带来三点本质区别。第一,线性路径让逐步误差伸缩求和而非级联放大:$$\|\tilde{x}_{t_0}-x_0\|_1\le\max_i\varepsilon_i+2\bar\alpha_T,$$ 单步部署($N=1$)时塌缩为'单次评估的残差 $\varepsilon_1$ + 终点偏移 $2\bar\alpha_T\approx0.011$';作者还证明在严格递减且精确终止的时刻表下,变分界塌缩为精确的条件似然恒等式而非不等式。第二,训练跨全时刻表进行、部署只用一步,训练与推理共享同一 $\hat{x}_0$ 参数化,中间不需要任何蒸馏阶段。第三,基模型的权重与 logits 完全不动,增益不可能是'重训基模型'的伪装——这也是它能做成基模型无关算子的前提。与 SegRefiner 从 mask 出发的随机传输、离散流匹配的随机核不同,这里继承的是 Cold Diffusion 式的确定性制度。

方法步骤详情

PS3 四步流水线:(1) 场景生成——在 SemanticKITTI 真实标签(10 序列 19,130 帧)上训练三级级联多项式扩散,每级以上一级输出的三线性上采样为条件,$S_3$ 把 $256^2$ 网格切成 4 个 $144^2\times32$ 子场景按先见先得拼接;(2) 分布过滤——三个廉价结构检查(合理占用率、道路加至少一个结构类、重力一致竖直布局)剔除空场景、单类场景与几何不可能场景,幸存者再按与真实场景直方图的 Jensen–Shannon 散度筛选($D_{JS}\le0.35$ 取低者的一半);(3) 稀有类粘贴——从真实训练标签按连通域收集 8 个稀有类共 57,789 个实例入库,每场景按固定顺序访问稀有类、以共享预算(每场景至多 10 次粘贴)把各类提到最小体素数,粘贴必须装入网格、不覆盖他类、落在可行驶表面上;(4) HALO 渲染——从固定原点按 HDL-64E 的 64 条非均匀光束 × 2,048 个方位角 = 131,072 条射线步进光线,双回波恢复薄结构,逐回波注入距离与角度抖动($\sigma_r=3$ cm),得到共享几何的稀疏扫描 $\tilde{x}$。SGSC 训练最小化逐步后验 KL(式 5)并辅以 Lovász-softmax 与瓶颈辅助项,推理从 $u$ 出发做全后验采样($T=100$,EMA 0.9999)。S2D2 训练:条件 $c=\{B,L\}$(基模型 BEV 语义图 + 原始扫描占据网格),训练在类别抽样 $\check{x}_t\sim\mathrm{Cat}(x_t)$ 上评估源替换后的后验 KL(式 8),并按 focal、有效数类平衡与观测感知(扫描命中的体素权重三倍)加权,外加全域与占域两个 Lovász 项(式 10);推理从 $x_{src}$ 出发按 $$\tilde{x}_{t-1}=\tilde{x}_t+(\bar\alpha_{t-1}-\bar\alpha_t)\cdot(\hat{x}_0-x_{src})$$ 的欧拉步修正(式 11),$N=1$ 即部署点。

技术新颖性

技术新颖性有三层。第一,'一个公式三个角色'的框架设计:同一多项式扩散在 PS3(数据合成)、SGSC(条件生成)、S2D2(输出修正)之间只换源与条件——把 $x_{src}=u$ 代回即严格退化为从噪声的扩散,作者在附录 B 中把它与 D3PM、DDPM/DDIM、矫正流、InDI、Cold Diffusion 的关系逐一摆正,指明哪些是字面特例。第二,离散情形下从结构化源出发的确定性传输:已有的 SegRefiner 与离散流匹配都带随机核、从 mask 或均匀源出发;本文把扩散时钟 $\bar\alpha_t$ 读作流时间、源固定为基模型预测,证明该设定下变分目标退化为精确条件似然(Prop 3),单步解码的正确性可归结为端点估计超过 0.503 的间隔(推论),并明确声明界'可行而非可证充分'——$\varepsilon_1$ 是网络误差,理论不为其担保,一步够用是实验事实。第三,硬件感知的数据合成:HALO 复现真实扫描的环形结构与距离衰减,双回波避免一击即中的光线抹掉薄结构,使粘贴的稀有类在训练分布中像真扫描而非悬浮贴片;PS3 把 LiDAR copy-paste 这一老传统带入了体素标签空间和场景级规模,且整个语料库不依赖任何被训练网络,是一次性可复用的增强。

PS3: the offline data-augmentation pipeline.
Fig. 2: PS3: the offline data-augmentation pipeline.
One PS3 pair.
Fig. 3: One PS3 pair.
The SGSC denoiser in its generation role.
Fig. 4: The SGSC denoiser in its generation role.
S²D² refinement: the shared denoiser's second role.
Fig. 5: S²D² refinement: the shared denoiser's second role.

实验结果

隐藏测试上,对冻结 SCPNet 做一步修正($N=1$、无测试时增强)达到 38.8% mIoU,比其已发表的 36.7% 高 2.1 pp,是作者所称'因果、单帧、单样本'谓词下的最佳榜单成绩;四步加八视角 D4 集成为 39.2%(超出该谓词,SCPNet 四帧聚合为 47.5%)。逐类分解(val seq 08,表 II)显示 19 类中 18 类提升:骑行者与卡车各 +5.3、道路 +4.6、交通标志 +4.2、地形 +2.6、停车 +2.4,但薄结构几乎不动(杆 +0.1、栅栏 +0.3、树干 +0.4),摩托车 −0.1;motorcyclist 的 +8.3 在从零重训中只剩 +0.3、隐藏测试仅从 1.8 升到 3.1,作者判定为种子-划分伪影并拒绝认领。基模型无关性(表 III):同一架构对每个基各训一次,LMSCNet 14.8→16.6(+1.8)、JS3C-Net 22.7→24.3(+1.6,但 person 8.7→5.9、骑行者 2.6→1.2 倒退,VRU-IoU 3.8→2.4)、SCPNet +2.36。消融(表 IV):去掉 BEV 流增益从 +2.5 降到 +1.1,去掉 32K 合成池约 +1.7;把 KL 换成对 $\hat{x}_0$ 的交叉熵塌到 10.3%(比自身输入低 25.9 pp),KL 单独 36.1% 稳定但惰性——+2.36 是'KL 锚定后验、Lovász/focal 供给唯一梯度'的交互效应。训练路径消融:端点直接拟合的监督对照只有 27.0(−11.5),只在 $t=T$ 训练 32.74 对匹配的 38.1,说明多时刻表路径整体有真实贡献但无法归因到单一部件。步数扫描中 38.65% 的浅峰出现在 $N=4$,单步距峰仅 0.11 pp、落在作者承认的 0.3–0.5 pp 单种子带内——一步换来 100 倍加速。零样本迁移:SemanticPOSS 上 mIoU 1.0→6.5、补全 IoU 31.8→54.9;SSCBench-KITTI360 补全 IoU 18.1→19.5。PS3 把稀有类体素频率最多提高 3,907 倍(合成池自身相对真实频率为 4.6×–6,239×)。从噪声的 SGSC 达 30.5%、自修正后 32.8%。BEV 二次任务 36.1% mIoU,其中 34.8 来自无参投影,S2D2 贡献 +1.3,超 2D S3CNet 9.1 pp。

Qualitative comparison on val seq. 08.
Fig. 6: Qualitative comparison on val seq. 08.
Our completions on val seq. 08 (rows: frames 004025, 001850).
Fig. 7: Our completions on val seq. 08 (rows: frames 004025, 001850).
The generator inherits the quality of its guidance.
Fig. 8: The generator inherits the quality of its guidance.
PS3 rebalances the long tail.
Fig. 9: PS3 rebalances the long tail.
Six rare-class val scenes, one per class.
Fig. 10: Six rare-class val scenes, one per class.
Qualitative BEV semantic predictions on SemanticKITTI validation.
Fig. 11: Qualitative BEV semantic predictions on SemanticKITTI validation.
查看结构化数据
任务指标本文基线提升
SemanticKITTI 隐藏测试单帧补全(单扫描、无未来帧、无集成、无 TTA) mIoU(19 类) 38.8%(SCPNet + S2D2,N=1) SCPNet 已发表 36.7%;TALoS 37.9%(测试时适应) +2.1 pp,同谓词下已发表最佳
SemanticKITTI 隐藏测试(4 步修正 + 8 视角 D4 TTA) mIoU 39.2% TALoS 37.9%(单帧);SCPNet 四帧聚合 47.5%(多扫描,谓词外) 单帧范围内 +1.3 pp
SemanticKITTI val seq 08:修正冻结 SCPNet 移植版 mIoU / 补全 IoU 38.54% / 52.7 36.17% / 49.9(冻结基);SemCity 在官方权重上 38.19% +2.36 pp;与 SemCity 相比锚点弱 1.4 pp 下仍高 0.35 pp
val seq 08:修正 LMSCNet(轻量 2D-3D 混合基) mIoU 16.6% 14.8%(冻结基) +1.8 pp,补全 IoU 不变(增益来自剪除假阳性占据)
val seq 08:修正 JS3C-Net(点-体素基) mIoU / VRU-IoU 24.3% / 2.4 22.7% / 3.8(冻结基) +1.6 pp,但三个 VRU 类中两个倒退(person 8.7→5.9)
零样本迁移到 SemanticPOSS(不同传感器,无微调) mIoU / 补全 IoU 6.5% / 54.9% 1.0% / 31.8%(冻结 SemanticKITTI 检查点) +5.5 / +23.1 pp(真值为作者重建,非官方)
零样本迁移到 SSCBench-KITTI360(val seq 06,16 共享类) mIoU / 补全 IoU 6.2% / 19.5% 5.8% / 18.1%(冻结基) +0.4 / +1.4 pp(mIoU 差在单种子带内,主张靠补全 IoU 支撑)
SGSC:从噪声条件生成完整场景(val) mIoU 30.5%(全后验采样);加 S2D2 自修正 32.8% DiffSSC 隐藏测试 27.4%(点云输出后体素化,协议不同);PaSCo 单子网 28.2%(评测器不同,仅并列参考) 在生成式 SSC 中具竞争力,但仍比判别式基低 3.3 pp

局限与改进

作者用实验而非论辩界定了四条边界。其一,不能超越其引导:生成器继承条件的上限(把 oracle BEV 换成预测 BEV 时道路使用者崩塌,图 8),修正器继承源的上限(弱基 JS3C-Net 上一步反而把 person IoU 从 36.6 抹到 0.7%,在基能恢复该类的帧中 74.7% 的 person 帧、92.5% 的骑行者帧被拉低)。其二,最稀有类不复现:motorcyclist 的 +8.3 pp 只在 val 成立,重训后 +0.3,隐藏测试 1.8→3.1,安全叙事最想要的这一类作者明确不认领。其三,安全指标不领先:单帧行中 2021 年的 S3CNet 以 VRU-IoU 32.6 对 21.6 领先每一个 VRU 类。其四,延迟未偿付:修正一遍 107 ms,基+修正器整管线 3.23 FPS 对基的 4.95 FPS,在 1 秒反应窗内 DW-VRU-IoU 反而低于冻结基(test 54.9→49.7)。我自己的观察还有三点:薄结构(杆、栅栏、树干增益 ≤0.4)几乎不动,说明一步修正依赖源已有的几何证据而非无中生有;官方指标排除了从未被观测的体积,而那正是生成先验最可能自由发挥的地方,附录 E 只给出预测占据占比的上界,幻觉无从检验;所有证据仅覆盖两个稠密分类任务,修正算子能否推广到任意逐元素分类单纯形输出是未检验的开放问题。

独立分析的弱点

弱点一:弱基上的擦除失败模式。源中某类支撑稀少时,KL 项在基正确的体素上梯度为零,Lovász 项反而惩罚源外预测,导致 JS3C-Net 基上行人被系统性抹除。改进方向:利用基模型的逐体素后验(当前只有 argmax,信息已被丢弃)做置信度排名的条件稠密化,或对条件 BEV 中出现而源中缺席的 VRU 类加最小保留约束。弱点二:延迟。107 ms 的稠密 3D U-Net 前向让管线低于 10 Hz 传感器节拍,单步虽把 100 步压成 1 步,但架构本身太重。改进方向:稀疏卷积骨干、只在基预测不确定的体素上做局部修正、或对去噪器做一致性蒸馏。弱点三:统计强度不足。全部结果单种子无误差棒,+2.36 的头号增益、$N=4$ 浅峰的 0.11 pp 差距都落在作者自认的 0.3–0.5 pp 噪声带内;逐类 delta 虽然在重训列中 18 类一致(±1.6 pp 内),但绝对 mIoU 的排名主张缺乏方差支撑。改进方向:至少三个种子的均值±标准差。弱点四:PS3 收益的适用面窄。池对体素网格基有效、对点-体素架构的 JS3C-Net 反而 −3.8 pp(其头部把体素导出的点云视为分布外),且 32K 不是随规模单调的最佳点。改进方向:对点云原生基改用 HALO 的点级输出而非体素化导出,并研究池规模-基架构的匹配规律。

未来方向

作者明确提出的方向:当前结果最需要的不是更好的去噪器而是更快的去噪器——只有把修正一遍压进延迟包络,精炼才真正可部署;SGSC 的少步蒸馏是列出的未来工作(从噪声生成目前要 100 步);缩小与 S3CNet 在 VRU 类上的差距(32.6 对 21.6)是开放问题;没有实验隔离遮挡这一失败模式,需要专门的遮挡对照;把修正算子推广到任意'逐元素分类单纯形'输出未经检验。基于成果可延伸的:S2D2 的直线残差传输已在 2D BEV 分割上验证(2D 变体 +9.1 pp),可继续移植到深度估计、占据预测等稠密分类头;当前确定性采样无法输出置信度,给修正过程加入随机核以量化不确定性对安全部署很有价值;HALO 的传感器参数化天然支持域适配,可生成不同型号 LiDAR、不同城市的配对语料检验跨域能力;把多帧基模型(SCPNet 四帧 47.5%)作为源,检验修正器在高基线上的边际收益是否仍然显著;理论上把单步可行性从'经验可行'推进为对 $\varepsilon_1$ 的可证上界,需要把网络误差纳入假设。

复现评估

开源情况良好:代码、检查点与 PS3 合成数据集公开在 github.com/BillyChern/GSSC-S2D2,作者还在 codabench 竞赛 13814 上维护自己的 SemanticKITTI 榜单入口,透明度高于多数同期工作。算力需求:2×H100 80GB,AdamW 学习率 $10^{-4}$、有效批 4、$T=100$;头号 S2D2 检查点 40K 步约 37 GPU 小时,SGSC 与备选基 100K 步——单张高端 GPU 的实验室可负担,但 $256^2\times32$ 稠密 3D U-Net 的显存要求不低。复现难点有三:SCPNet 官方发布依赖已从 PyPI 移除的 spconv 1.0,作者须在 spconv 2.3 上打补丁复刻 v1 的共享索引键行为,移植版 36.17% 仍比原论文 37.2% 低 1.0 pp,复现者要过同一道坎;SemanticPOSS 的补全真值是作者重建而非官方;独立研究已把 SCPNet 标记为不可复现、TALoS 标记为多帧测试时优化,基线数字本身有协议争议。所有 mIoU 出自官方 semantic-kitti-api、单种子,复现者应对比'相对冻结基的逐类 delta'而非绝对 mIoU——这也是作者自己建议的读法。