面向视网膜眼底图像的可解释基础模型 Towards Interpretable Foundation Models for Retinal Fundus Images
BagNet+t-SimCNE,打造天生可解释的眼底图像基础模型
前置知识
基础模型 Foundation Model
在海量无标注数据上(通常通过自监督学习)预训练的大型模型,学习通用表征,可适配多种下游任务。眼底领域代表是 RETFound,它用 ViT-Large 在 160 万张视网膜图像上训练。
本文的对手就是 RETFound,理解基础模型的预训练-微调范式才能看懂为何要在不损失表征质量的前提下追求可解释性。
自监督学习 SSL / SimCLR
不依赖标签,通过对同一图像施加两次数据增广得到正样本对,用对比损失(NT-Xent)拉近正对、推远负对来学习表征。SimCLR 在 128 维投影空间计算损失,编码器输出用于下游任务。
Dual-IFM 的预训练算法 t-SimCNE 是 SimCLR 的变体,理解对比损失和投影头的作用才能看懂 2D 投影是怎么塞进去的。
BagNet(天生可解释网络)
一种把每个空间位置的感受野严格限制在小 patch(如 33×33)的 CNN 架构。由于每个特征图位置只依赖局部图像区域,分类证据图直接反映真正参与决策的图像内容,是决策过程的内在部分而非事后归因。
BagNet 是 Dual-IFM 实现'忠实'局部可解释性的根基,也是它和 RETFound(依赖 post-hoc LRP)的本质区别。
t-SimCNE(参数化 t-SNE 对比神经网络)
SimCLR 的变体,把投影头输出维度从 128 改成 2,并用欧氏相似度替代余弦相似度,分三阶段训练,让模型本身学会一个高维到 2D 的参数化映射函数,新样本可直接前向得到 2D 嵌入。
这是 Dual-IFM 数据集级结构可视化的关键技术,解决了 t-SNE 不能前向、需重拟合的问题。
研究动机
当前眼底图像基础模型(如广泛使用的 RETFound)虽然在多种眼科任务上表现优异,但都不具备内在可解释性,无法对每个预测给出内置解释。研究者只能依赖 post-hoc 归因方法(如 LRP、显著性图)来事后解释模型决策,但这些局部解释常常不忠实——它们并不真正反映模型的决策过程。在医疗影像这类高风险场景中,这种'不忠实的解释'严重阻碍了基础模型的临床采纳。此外,传统表示空间可视化(如 t-SNE)是非参数的:它不学习显式的高维到低维映射函数,每加入新样本都要重新拟合,在大规模数据集上代价高昂;它也只提供数据集级视图,无法揭示个体预测的局部依据。
本文的目标是作者的目标是构建一个'天生可解释'的眼底彩色照片(CFP)基础模型 Dual-IFM,同时满足两个层面的解释需求:一是局部可解释性——对每张图片的每个预测,提供忠实于决策过程的 class evidence map,直接标出图像中哪些区域促成了该预测;二是数据集级的表示空间可视化——学一个参数化的 2D 投影层,把整个数据集直接嵌入二维空间,揭示疾病分级等语义结构以及潜在的虚假相关性。关键约束是:在获得这两层可解释性的同时,表征质量不能显著下降,下游任务性能要能媲美参数量大 16 倍的 RETFound。
与已有工作不同的是,本文的独特切入角度是把'架构层面的局部可解释性'和'参数化的全局结构可视化'统一进一个自监督基础模型。不同于 post-hoc 归因(事后叠加、不忠实),Dual-IFM 直接采用 BagNet 小感受野骨干,让可解释性成为决策过程的内在部分;不同于非参数的 t-SNE,它通过 t-SimCNE 学习一个前向可用的 2D 投影函数,新样本无需重拟合即可嵌入。这种'局部+全局'双重可解释性的统一在眼底基础模型领域尚属首次,且作者实证它几乎不损失表示质量。
核心方法
Dual-IFM 的核心直觉是'用受约束的架构换取忠实性'。整体技术路线分两条:骨干用 BagNet-33(每个空间位置只看 33×33 像素的小 patch),让特征图的每个位置只依赖局部图像区域,从而 class evidence map 忠实反映真正参与决策的内容;预训练算法用 t-SimCNE,把 SimCLR 的 128 维投影换成 2 维,同时学一个编码器 $f: \mathcal{X} \to \mathcal{H} \subset \mathbb{R}^D$ 和一个投影层 $g: \mathcal{H} \to \mathcal{Z} \subset \mathbb{R}^2$。预训练在 802,360 张眼底图上进行,预训练后可挂载一个 1×1 卷积分支做下游微调,同时保留 2D 投影用于可视化。
核心创新是把'局部可解释性'和'全局表示可视化'两个看似冲突的目标同时塞进一个 SSL 基础模型。BagNet 通过限制感受野保证 class evidence map 是决策过程的内在组成(而非事后解释),1×1 卷积分支把 n 个类别的激活图直接对应到图像区域,全局平均池化得到类分数,使预测成为局部证据的显式空间聚合。t-SimCNE 则把投影头压到 2D 并用欧氏相似度计算对比损失,让模型本身学会参数化的 2D embedding 函数 $z = g \circ f(x)$,嵌入新图像只需一次前向。这两条线在架构上并行:预训练分支学表征+2D 投影,微调分支学分类证据图。
方法步骤详情
1) 预训练数据:合并 EyePACS(567,384 张)、AREDS(110,690 张)、UKBiobank(132,010 张),共 802,360 张 CFP。2) t-SimCNE 三阶段训练:stage 1 用 128D 投影在全模型上训练(cosine 相似度);stage 2 把投影最后一层换成 2D 输出,只训练投影层对齐编码器表征;stage 3 全模型解冻、学习率降 1000 倍端到端训练。优化器 LARS,batch=1024,weight decay $10^{-6}$,base lr $0.075 \times 32$,cosine 退火+10 epoch warmup,混合精度(t-SimCNE 需 bfloat16 防溢出)。3) 微调:冻结投影层,编码器加 1×1 卷积分类头端到端训练,先训线性头 10 epoch 再解冻全模型,最多 50 epoch+early stopping,加稀疏约束提升证据图定位,5 折交叉验证。4) 评估:线性探测用带 elastic net 的逻辑回归(类别平衡权重)。8×H100 预训练约 6 天 8 小时。
技术新颖性
新颖性体现在三点。其一,首次把 BagNet + t-SimCNE 组合用于大规模 CFP 基础模型,统一了局部证据图和数据集级 2D 结构可视化。其二,作者通过实验发现与 t-SimCNE 原文相反的现象:stage 1 用 cosine 相似度反而比全程欧氏相似度得到更好的 2D 可视化质量(k-NN AUROC 0.821 vs 0.745),由此确定最终采用 cosine 变体作为 Dual-IFM。其三,提出在微调后可低成本地对投影层做 realignment(只重训投影层),以补偿编码器表征漂移,使 2D 投影在下游任务中仍保持有效。这三点共同构成了对'可解释基础模型'这一目标的新颖技术路径。
实验结果
Dual-IFM(18.3M 参数)在多数任务上与参数量大 16 倍的 RETFound(303.3M)持平或更优。线性探测(Table 2)相比任务训练 BagNet 基线在 7 个数据集中 4 个提升,相比 RETFound 在 6/7 上提升:EyePACS 0.849 vs 0.794、IDRiD 0.758 vs 0.668、PAPILA 0.757 vs 0.577。微调(Table 3)EyePACS 达 0.821±0.036(RETFound 0.767±0.040)、AREDS 0.923±0.009。结构可视化(Table 4)Dual-IFM 直接学到的 2D embedding 平均 k-NN AUROC 为 0.821,低于 post-hoc t-SNE(0.904/0.914)与 PCA 2D(0.851/0.839),但已捕获疾病分级结构。局部可解释性(Fig. 3)IDRiD 上证据图病灶定位精度 0.674,远高于 RETFound LRP 的 0.384。推理 81ms vs 140ms。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| EyePACS 糖尿病视网膜病变检测(线性探测) | AUROC | 0.849 | RETFound 0.794 | +0.055 |
| PAPILA 青光眼分级(线性探测) | AUROC | 0.757 | RETFound 0.577 | +0.180 |
| IDRiD 局部证据图病灶定位精度 | Precision@10 | 0.674 | RETFound LRP 0.384 | +0.290 |
| 模型参数量 | 参数数 | 18.3M | RETFound 303.3M | 少 16× |
| 推理速度(V100, batch=16) | 每批耗时 | 81 ms | RETFound 140 ms | 快 1.7× |
局限与改进
作者明确承认的局限有二:一是仅限于彩色眼底照片(CFP)单一模态,未覆盖 OCT 等其他眼科成像;二是微调阶段超参搜索较为有限,导致在 PAPILA 和 FIVES 等小数据集上微调性能有时反而下降(疑为过拟合)。我自己的观察还包括:2D 投影的 k-NN AUROC(0.821)明显低于 post-hoc t-SNE(0.904),说明把投影压到 2D 确实付出了一定的结构保真代价;BagNet 的大空间特征图导致其相对参数量的显存占用偏高(1.12GB),训练时 batch 受限;定位精度评估只在 IDRiD 一个数据集上做了,且依赖病灶分割标注,泛化性证据不足。
独立分析的弱点
第一个弱点是 2D 投影质量上限受限:把表征强行压到 2 维会损失多因子信息,k-NN AUROC 落后 post-hoc t-SNE 约 0.08,改进方向是学习一个可逆或分层投影,或保留一个小的高维投影头同时附带 2D 视图。第二个弱点是 BagNet 小感受野对需要全局上下文的任务(如血管走形、视盘整体形态)可能不利,改进方向是引入多尺度感受野或结合全局注意力。第三个弱点是局部证据图评估只在 IDRiD 单一数据集上做,且强依赖病灶分割标注,可扩展到更多任务(青光眼、AMD)并用临床专家一致性来验证。第四个弱点是预训练数据均为 CFP,模态单一,跨模态(OCT、OCTA)迁移能力未知。
未来方向
作者提出的未来方向包括扩展到更多成像模态、探索其他可解释骨干与 SSL 目标以提升预训练性能,并指出 Dual-IFM 的内在可解释性使其特别适合多模态场景,可在跨模态层面做数据集级探索。基于本成果可延伸的研究有:把 2D 投影 realignment 流程自动化,研究微调过程中表征漂移的量化监测;探索稀疏约束与分类性能的更优权衡曲线;将 class evidence map 与临床知识图谱结合做因果归因,而非仅相关性定位;在更大规模、多中心数据上验证虚假相关性的发现与修复。
复现评估
复现性较好。代码和预训练权重已在 github.com/berenslab/interpretable_FM 公开,超参配置也提供在仓库。数据方面,EyePACS、AREDS、UKBiobank、APTOS、IDRiD、DeepDRiD、Messidor-2、PAPILA、FIVES、Glaucoma Fundus 均为公开数据集,但部分(AREDS、UKBiobank)需申请使用许可。算力门槛较高:预训练需 8×H100(80GB)约 6 天 8 小时,微调需 1×V100。主要挑战在于大规模对比学习的工程实现(batch=1024、混合精度需 bfloat16 防 t-SimCNE 欧氏距离溢出)和三阶段训练流程的调参,普通研究者完整复现预训练成本不低,但可直接用公开权重做下游评估与可视化。
论文图表