← 返回 2026-07-29

OPERA:面向通用生物医学图像分析的离线策略引导专家路由与自适应 OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong 📅 2026-07-27 👍 1 2026-08-03 18:30
专家路由 测试时自适应 生物医学图像分析 离线策略学习 置信度校准 集成学习

把多专家权重分配建模为离线策略学习,推理时分层融合实现零重训练的通用医学影像分析。

前置知识

集成学习 (Ensemble Learning)

把多个预测器的输出组合起来以降低误差、提升鲁棒性的方法。其理论基础是歧义分解:当各模型误差不相关时,集成的方差会被相互抵消,从而优于任一单模型。常见做法包括简单平均、加权平均、stacking 和 boosting。

OPERA 本质上是一种推理期集成框架,理解集成为何有效是理解其性能增益来源的前提。

测试时自适应 (Test-Time Adaptation, TTA)

在部署阶段仅利用未标注的测试数据(不使用训练标签)动态调整模型,以应对训练-测试分布漂移。典型做法是对模型做无梯度的统计归一化更新或伪标签微调,目标是让模型在新域上仍保持判别力。

OPERA 的 DAA 和 IER 两个模块正是无梯度的测试时自适应机制,是它在分布漂移下保持鲁棒的关键。

置信度校准与温度缩放 (Confidence Calibration / Temperature Scaling)

校准指模型输出的概率应与真实正确率一致。温度缩放用一个标量 $T$ 缩放 logit:$\hat{p}_T=\sigma(z/T)$,$T>1$ 软化预测、$T<1$ 锐化预测,它保持预测排序不变只改变置信度的尖锐程度。

PECC 模块靠温度缩放把不同专家的概率拉到可比的尺度上,否则不同模型的置信度差异会让加权融合失去意义。

离线强化学习 (Offline Reinforcement Learning)

完全从固定的历史数据集学习策略、不做任何环境交互的强化学习范式。其核心挑战是分布外动作导致 Q 值高估,常用行为约束或悲观价值估计来缓解,保证策略不外推到未见过的状态-动作对。

OPERA 把『专家权重学习』类比为离线策略学习问题(从固定验证集学路由策略、不做交互),这是其方法论命名与设计哲学的来源。

混合专家 (Mixture-of-Experts, MoE)

用一个可学习的稀疏门控函数为每个输入只激活少数专家子模块的架构,兼顾参数效率与专家专精化。门控根据输入特征决定路由,使不同样本由不同专家处理。

OPERA 的 IER 模块借鉴了 MoE 的『按输入路由到合适专家』思想,理解 MoE 有助于理解其实例级路由设计。

研究动机

医学 AI 面临一个核心的部署悖论:专精模型在特定任务上表现出色,却对分布漂移极为脆弱。同一个在某数据集上训练良好的模型,一旦迁移到新的临床环境(不同扫描仪、采集协议、患者群体),性能就会显著下降,迫使每个新部署点都要重新做代价高昂的微调;而当目标域标注稀缺或隐私法规限制数据共享时,这种『重训练循环』几乎无法实施。另一方面,基础模型虽承诺泛化能力,却依赖海量预训练数据与算力,多数医疗机构难以承受;SAM 这类通用分割模型在医学影像上的零样本表现也很有限,适配仍需标注与重训练。传统集成学习虽能提升鲁棒性,但往往需要联合重训练、stacking 或迭代微调,显著推高推理成本与延迟。论文 Figure 1 给出了一个典型场景:基线模型对一张眼底图在糖尿病视网膜病变、视网膜炎、脉络膜炎之间给出高度不确定的模糊预测,最终导致高置信度的误判。

本文的目标是本文目标是找到一条兼得专精模型与基础模型各自优势、又规避其代价的『第三条道路』。具体而言,作者希望构建一个可直接部署的通用生物医学图像分析框架,满足三点:在跨眼底照相、胸片、CT、MRI 与多模态诊断等多种模态上稳定提升性能与校准质量;部署阶段对专家模型不做任何反向传播或参数更新(即所谓『零重训练』);只需一个小规模带标签验证集做一次性离线校准,在极端情况下甚至完全无标签也能工作(OPERA* 模式)。可量化的目标包括在 9 个基准、对 30+ 基线,在分类、分割、多模态三类任务上持续取得最优,例如把眼底多病种分类的 mAP 推到新的 SOTA 水平。

与已有工作不同的是,本文的独特切入点在于:它把『集成权重学习』重新框定为离线强化学习问题。作者注意到,标准集成要联合优化的痛点,恰好对应离线 RL 那个核心难题——『如何从固定历史数据学到好策略而不与环境交互』。于是他们抓住了一个被多数医学影像工作忽视的对应关系:专家是冻结的、行为固定的『智能体』,而协调器(routing policy)可以从一个小验证集离线学到,部署时再配合测试时自适应处理残余的分布差。与依赖联合重训练的传统集成、依赖标注加参数更新的 PEFT/TTA、依赖大规模预训练的基础模型都不同,OPERA 把所有融合都搬到推理阶段,用一套分层(模型级 × 类别级 × 实例级)的无梯度加权机制,在不重训任何专家的前提下逼近甚至超过专门化模型。

核心方法

直觉上,OPERA 像一个『医学多专家会诊委员会』:每位专家(智能体)擅长不同病种,协调器根据病种和具体病例决定该信任谁。技术路线分两阶段。Phase 1(离线策略学习)一次性完成:冻结所有专家,在一个带标签验证集上只做前向传播,计算每个模型在每个类别上的 AUC,解析地得到模型级权重 $w_{model}$、类别级权重 $W_{class}$ 和温度参数 $\{T_m\}$,整个过程无梯度优化。Phase 2(部署期多智能体协调)纯在推理时进行:专家输出先经 PECC 做温度校准,再由 DAA 根据测试批次的置信统计动态调整类别权重,最后由 IER 为每个样本(分割任务里则是每个像素)生成实例级权重,三层权重相乘并归一化得到最终融合预测。整套流程对专家参数零更新,融合开销相对前向计算可忽略(小于 1%)。

核心创新是把『组合异构冻结专家』形式化为离线策略引导的推理期协调,并用一个分层加权结构同时捕获模型质量、类别专长和实例可靠性三个尺度。最本质的区别在于:传统集成要么简单平均、要么需要联合训练/stacking/meta-learning;PEFT 与 TTA 要么要标签要么要参数更新;而 OPERA 的三层乘性权重 $W_{final,i,m,c} = w_{model,m} \cdot w'_{class,m,c} \cdot w^{(i)}_m$ 要求『模型整体强 + 对该类在行 + 对这个具体样本可靠』三个条件同时成立才能拿到高权重,这天然带来对单专家失效的鲁棒性——失效专家在实例层会被降权到接近零,不会污染集成输出(Corollary A.13)。作者还用 bias-variance 分解、歧义分解($e_{ens}=\bar{e}-D$)和校准理论为这一设计提供了理论支撑,强调它是『协调冻结智能体』而非『训练新模型』。

方法步骤详情

(1)EPM 离线策略学习:在验证集 $D_{val}$ 上对每个冻结专家前向,得性能矩阵 $A \in \mathbb{R}^{M\times C}$,元素 $A_{m,c}=\text{AUROC}(y_{\cdot,c},\,p^{(m)}_{\cdot,c})$。模型级权重 $w_{model,m}=\text{softmax}(\tau\bar{A}_m)$,类别级 $W_{class,m,c}=\text{softmax}(\tau A_{m,c})$,$\tau=10.0$,本文 $M=3$。同时记录初始温度 $\{T_m\}$。(2)PECC 逐专家校准:对每个模型算批次平均锐度 $s_m=\frac{1}{BC}\sum|p-0.5|$,据此选 $T_m=1.5(s_m>0.4)\,/\,0.7(s_m<0.1)\,/\,1.0$,经 logit 反变换 $z=\log\!\big(\tfrac{p}{1-p}+\epsilon\big)$ 后除以温度再 sigmoid 回概率,$\epsilon=10^{-7}$。(3)DAA 测试时自适应:每 100 个测试批次用置信统计 $W^{conf}$ 与当前权重 $W^{curr}$ 按 EMA 规则更新类别权重 $W'_{class}=(1-\alpha-\beta)W^{orig}_{class}+\beta W^{conf}_{class}+\alpha W^{curr}_{class}$,$\alpha=\beta=0.1$,该更新是压缩映射故收敛。(4)IER 实例级路由:算模型间余弦一致度 $a_i$ 与预测方差 $\sigma_i^2$;高一致($a_i>0.90,\,\sigma_i^2<0.03$)用基础权重;高分歧($a_i<0.60$ 或 $\sigma_i^2>0.12$)按熵反比加权 $w^{(i)}_m\propto\exp(\gamma/h_{i,m})$,$\gamma=2.0$;中间情况按极值度加权 $w^{(i)}=\zeta\cdot\text{softmax}(\mu e_i)+(1-\zeta)w_{model}$,$\mu=3.0,\,\zeta=0.7$。(5)最终融合:三层权重相乘 $W_{final,i,m,c}=w_{model,m}\cdot w'_{class,m,c}\cdot w^{(i)}_m$,跨模型归一化、加权求和得 $\hat{p}_{i,c}$。

技术新颖性

新颖性体现在三方面。其一,首次把 agentic vision ensemble 与离线策略学习结合:把冻结专家视为固定行为智能体,协调权重离线从验证集学到,部署时再用测试时自适应做 offline-to-online 式微调,这区别于任何要梯度更新的集成或适配方法。其二,分层推理期自适应策略(PECC 校准 + DAA 动态加权 + IER 实例路由)协同工作,覆盖模型/类别/实例三个粒度,而现有 TTA 多只针对单模型、单一粒度。其三,全程零参数更新、权重可缓存、甚至可全无监督运行(OPERA*)。与 MoE / Mixture-of-Agents 相比,OPERA 不训练门控网络、不增加参数,纯用解析统计做路由;与 SAM 适配方法相比,无需对齐标注与重训练。Table 13 的 same-expert-pool 对照最能说明问题:把同样三个冻结专家喂给 stacking/MoE/TTA/测试时集成等,OPERA 仍领先最强同池基线 +5.17% AUC、+1.09% Dice,且预算(峰值显存、单样本延迟)与标准集成相当,证明增益来自路由/自适应机制本身而非『用了更多模型』。

Overview of the OPERA framework
Figure 2: Overview of the OPERA framework

实验结果

实验在 9 个数据集、跨眼底/胸片/CT/MRI/多模态诊断、对比 30+ 基线上展开,OPERA 在分类、分割、多模态三类任务全面领先。眼底分类 RFMiD(Table 1)全微调下 OPERA 达 89.47% AUC、58.93% mAP,较 RET-CLIP 提升 3.35% AUC、7.66% mAP,甚至超过专为眼底优化的 VisionFM、FLAIR、RETFound。OIA-DDR(Table 2)线性探针 84.95% AUC、微调 88.06% AUC,超 RETFound 2.10% AUC;其无监督变体 OPERA* 仍有 86.30% AUC,逼近有监督 SOTA。胸片 Chest X-Ray14(Table 3)83.05% AUC、92.64% ACC、30.58% mAP,超 Ark+(82.42% AUC)与 ELF 等集成基线;腹部 CT 的 OrganSMNIST 98.83% AUC、84.31% ACC、80.12% mAP。分割任务上,COVID-Xray 的 QaTa-COV19 达 82.12% Dice/73.26% Jaccard,超 STPNet(80.63%/71.42%);COVID-CT 的 MosMedData+ 77.03% Dice/64.39% Jaccard;在仅 20% 标注下 LA-MRI 92.71% Dice、Pancreas-CT 82.44% Dice,均超 MC-Net+、MiDSS、SASNet 等半监督方法。多模态诊断(Table 6)只用三个较弱 MLLM(InstructBLIP/Mini-Gemini/Qwen-VL),OPERA 平均准确率 79.31%,反超更强的 InternVL2(77.35%)与 Janus-Pro(68.92%)。消融(Table 7-10)显示各模块逐级增益、三专家最优、$\alpha=\beta=0.1$ 最佳、过度混合反而退化。

Performance evaluation on RFMiD
Table 1: Performance evaluation on RFMiD
Multiple-choice accuracy of MLLMs on ten diseases
Table 6: Multiple-choice accuracy of MLLMs on ten diseases
Ablation study of proposed strategies on OIA-DDR
Table 7: Ablation study of proposed strategies on OIA-DDR
Same-expert-pool comparison
Table 13: Same-expert-pool comparison
Qualitative results on COVID-19 datasets
Figure 3: Qualitative results on COVID-19 datasets
Representative case studies of multimodal LLM diagnosis
Figure 6: Representative case studies of multimodal LLM diagnosis
查看结构化数据
任务指标本文基线提升
RFMiD 眼底多病种分类(全微调) mAP 58.93% RET-CLIP 51.27% +7.66 个百分点
OIA-DDR 眼底分类(线性探针) AUC 84.95% FLAIR 82.48% +2.47 个百分点
Chest X-Ray14 胸片分类 AUC 83.05% Ark+ 82.42% +0.63 个百分点
QaTa-COV19 COVID 胸片分割 Dice 82.12% STPNet 80.63% +1.49 个百分点
LA-MRI 分割(仅 20% 标注) Dice 92.71% SASNet 91.82% +0.89 个百分点
眼底十病多模态多选诊断 平均准确率 79.31% InternVL2 77.35% +1.96 个百分点

局限与改进

作者坦承的局限有三点。一是 EPM 仍需要一个带标签验证集来初始化权重(尽管这是一次性、约 5 分钟、可缓存,且 OPERA* 全无监督模式仍具竞争力)。二是运行多个专家仍会增加推理成本与系统延迟,需要靠 GPU 并行或级联式推理缓解。三是『零重训练』严格指部署期对专家零参数更新,并非完全不需要任何数据。我额外观察到几点:IER 里的一致度阈值(0.90/0.60/0.03/0.12)和 $\gamma=2.0$、$\mu=3.0$、$\zeta=0.7$ 等超参都是经验调出来的,跨域鲁棒性存疑;实验仅用 3 个专家,专家池规模的缩放规律未被充分验证;多模态诊断依赖从模型最终 softmax 层提取各选项 token 的 log-prob,假设了对模型内部的可访问性,纯黑盒 API 场景不适用。

独立分析的弱点

弱点一:路由阈值与超参是一组『魔数』。$a_i$ 与 $\sigma_i^2$ 的 0.90/0.60/0.03/0.12 分界,以及 $\gamma$、$\mu$、$\zeta$、$\tau$ 都是在论文基准上经验选定,换到长尾分布或全新模态可能失效。改进方向:用验证集自适应地学习这些阈值,或换成连续可微的软门控(soft routing)替代硬分支。弱点二:专家池太小(仅 3 个),分层加权在更大、更多样专家池下收益是否单调上升并不清楚,且 N 增大后一致度计算 $O(M^2)$ 也会变贵。改进:扩展到更多专家并引入稀疏 Top-k 路由(类 Switch Transformer)控制成本。弱点三:『离线策略学习』更多是概念类比,实际是解析的 AUC 加权,并非真正的 Q 学习或 Bellman 更新,名实略有落差。改进:若要名副其实,可引入基于伪标签奖励的真正在线策略精炼。弱点四:延迟敏感场景下多专家前向仍是瓶颈。改进:实现论文提到但未落地的『不确定性触发的级联推理』,先轻量专家筛查、仅对不确定样本启用全集成,并量化加速比。

未来方向

作者明确提出的方向有三个:代价感知的专家选择与路由、把专家池扩展到更广模态与任务、以及针对真实部署与临床可解释性的亚组分析。基于本文成果还可延伸:一是把硬阈值的 IER 替换为可学习的软门控网络,使路由端到端可微并随数据自适应;二是把 offline-to-online 思想进一步发挥,引入真正的强化学习信号(如基于伪标签/临床反馈的奖励)做在线策略精炼;三是把分层加权从分类/分割推广到检测、配准、生成等任务;四是研究专家多样性的自动度量与构造,从理论上指导最优专家组合;五是把 ECE/可靠性图纳入评估,给出可临床解读的置信区间而非仅一个准确率数字。

复现评估

复现性总体较好。代码已开源(GitHub: HUANGLIZI/OPERA);所有数据集(RFMiD、OIA-DDR、Chest X-Ray14、OrganSMNIST、QaTa-COV19、MosMedData+、LA-MRI、Pancreas-CT、多选基准)均为公开基准;硬件为 NVIDIA RTX A6000(48GB),随机种子固定 42,启用 cudnn.benchmark;关键超参($\tau=10$、$\alpha=\beta=0.1$、温度档位、$\gamma=2.0$ 等)和两阶段权重调优协议(Adam、lr=0.01、20 epochs、early stop)均已给出。难点在于:要复现 15+ 基线(多为各自预训练权重)需较大工程量;MLLM 路径需要能访问选项 token 的 log-prob,需本地部署 InstructBLIP/Mini-Gemini/Qwen-VL;EPM 的一次性校准需准备一个小验证集。算力需求中等偏上(多专家并行推理),但训练成本极低(无专家训练)。整体对有 GPU 资源的研究团队是可复现的。