← 返回 2026-07-21

OCT-Bench:面向 OCT 视网膜图像理解的多模态大语言模型综合评测基准 Can Multimodal Large Language Models Understand OCT?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song 📅 2026-07-18 👍 8 2026-07-25 18:30
OCT医学影像 临床推理 基准测试 多模态大模型评测 视网膜疾病

按临床工作流分 20 个细粒度任务,分层评估 MLLM 从视觉感知到临床推理的 OCT 理解能力

前置知识

光学相干断层扫描(OCT, Optical Coherence Tomography)

OCT 是眼科最核心的在体成像技术之一,利用低相干光干涉原理获取视网膜的高分辨率(微米级)横截面图像。它能清晰呈现视网膜的多层解剖结构(如神经纤维层、IS/OS、RPE 等)以及各种病理改变(液体潴留、出血、瘢痕等),是黄斑变性、糖尿病视网膜病变、青光眼等疾病诊断、治疗规划和随访的金标准。理解 OCT 需要同时具备精细的视觉判读能力和眼科医学知识。

整篇论文围绕 OCT 图像展开,所有 20 个评估任务都建立在 OCT 的解剖层次和病理特征之上。不熟悉 OCT 的成像特点与视网膜分层,就无法理解为何「细粒度形态描述」「视网膜分层识别」会成为模型的能力瓶颈。

多模态大语言模型(MLLM)

MLLM 将视觉编码器(如 CLIP、ViT)与大语言模型结合,使模型既能「看图」又能「对话」。代表性闭源模型有 GPT-5.4-mini、Gemini-2.5-flash、Grok-4-fast,开源通用模型有 Qwen2.5-VL、InternVL2.5、LLaVA、Phi-3-Vision、Gemma-3,医学专用模型有 HealthGPT、MedGemma、Lingshu、Hulu-Med、MediX-R1、Fleming-VL 等。它们通过视觉 token 对齐到语言空间,再由 LLM 完成推理与生成。

本文的评估对象正是 20 个代表性 MLLM。理解 MLLM 的工作机制(视觉感知→语言推理)是理解作者为何把能力拆分为 Perception/Cognition/Reasoning 三个维度,以及为何会出现「感知强但推理弱」的层级性失败的关键。

分层能力分类体系(Hierarchical Capability Taxonomy)

作者把 OCT 的判读过程建模为一条递进的认知链:Perception(视觉感知,提取图像证据)→ Cognition(医学认知,把视觉信息映射为解剖/病理概念)→ Reasoning(临床推理,结合知识做出诊断、治疗与预后决策)。每个维度再细分为能力组(共 9 个)和细粒度任务(共 20 个,T01–T20),任务之间刻意降低重叠,使错误可被归因到具体层级。

这是 OCT-Bench 区别于「单一疾病分类」基准的核心设计。整篇论文的结论——感知到推理准确率下降 32.9 个百分点——完全依赖这一分层结构,看不懂这套分类法就看不懂论文的全部发现。

多选题评测范式(MCQ Benchmark)与准确率指标

为了实现标准化、客观、可复现的评测,作者把所有任务统一为四选一(A–D)多选题,模型只需输出选项字母,与真值比对计算准确率,无效回答计为错误。基线随机猜约为 25%。这种范式避免了开放式生成的评分主观性,但代价是难以评估模型的解释深度与自由推理能力。

论文中所有数字(如 GPT-5.4-mini 的 62.0% 整体准确率)都建立在这一评测范式之上。理解 MCQ + accuracy 的设计,以及 25% 的随机基线,是正确解读「模型远未达到可靠水平」这一结论的前提。

研究动机

尽管多模态大语言模型在自然图像分析上已取得显著进展,但将其用于医学影像仍面临严峻挑战:医学判读不止于识别视觉模式,还需整合专业知识进行疾病分析与临床决策。论文指出现有评测体系存在两大缺陷。其一,通用多模态基准(如 MMBench、MME-RealWorld、MathVista、SEED-Bench)几乎只针对自然场景,无法评估 OCT 这类眼科解剖与病变。其二,已有的眼科基准要么只测文本医学知识、眼底彩照、手术视频,要么把 OCT 理解粗暴地降级为粗粒度疾病分类或孤立的视觉问答。即便覆盖了 OCT 的 LMOD 基准,也仅含少量粗粒度任务。更关键的是,这些基准把「从图像到诊断」的整条认知链揉在一个任务里,模型答错时根本无法判断错误究竟源于视觉感知不足、医学认知缺陷还是临床推理失败,既妨碍公平比较,也无法为针对性改进提供指引。

本文的目标是作者的目标是构建一个能忠实反映真实临床判读流程、并支持细粒度能力诊断的 OCT 评测基准 OCT-Bench。具体而言,他们希望基准:(1) 覆盖完整的 OCT 认知过程,从低层视觉感知到高层临床推理;(2) 数据规模大、质量高且经过专家核验;(3) 能把整体表现拆解到具体能力层面,从而精确定位瓶颈所在。最终 OCT-Bench 由 4,137 张来自 7 个公开数据集的 OCT 图像构建而成,包含 10,076 道专家核验的高质量四选一题目,组织成 Perception、Cognition、Reasoning 三个维度、9 个能力组、20 个细粒度任务(T01–T20),覆盖图像质量、视网膜解剖、病变特征、空间关系、疾病评估、治疗决策与预后管理,可作为系统评估 20 个代表性 MLLM 的统一平台。

与已有工作不同的是,OCT-Bench 的独特切入角度在于「以临床工作流为骨架的能力分层」。与既往把 OCT 理解压缩成单一疾病分类或孤立 VQA 的做法不同,作者显式地复现了眼科医生「先看图像质量与解剖→再看病变形态与空间关系→最后整合知识做诊断治疗与预后」的递进过程,并用三个相互独立又层层递进的维度把它结构化。这种设计带来两点本质区别:第一,错误可归因——当模型在某层失败时,能清楚区分是视觉 grounding 不足还是推理缺陷;第二,能力可诊断——20 个细粒度任务配合 9 个能力组,能像「能力体检」一样指出模型在「视网膜分层识别」「病变定位」「治疗规划」等具体环节的短板。这正是论文标题「MLLM 能否真正理解 OCT」得以被严谨回答的基础。

核心方法

整体思路是:先把 OCT 理解建模为一条从视觉感知到医学认知再到临床推理的递进认知链,再围绕这条链设计任务、采集知识、生成题目、核验质量,最终得到一个既能算总分又能分层诊断的基准。技术路线上,作者构建了一条五阶段的系统化流水线:数据收集→任务设计→医学知识收集→视觉问答生成→专家质量控制。所有评测任务被统一为四选一多选题,使评估标准化、客观、跨模型可比。直觉上,作者希望基准本身像一份「标准化临床能力考试卷」,既能反映模型整体水平,又能像分项成绩单一样指出它在「看图」「认解剖」「下诊断」「定治疗」各环节的强弱。

核心创新点是「临床工作流对齐的分层能力分类体系」。它的本质区别在于:既有基准用一个混合任务(疾病分类/VQA)同时卷入感知、认知、推理三种能力,导致错误原因不可分离;OCT-Bench 则把这三种能力显式拆开成三个维度,并进一步细化为 9 个能力组、20 个细粒度任务,任务之间刻意降低能力重叠。这样当模型出错时,可以根据它在哪个维度/任务失败,反推瓶颈是「视觉 grounding 不准」「解剖概念缺失」还是「临床推理链断裂」。配合「图像证据+医学知识」联合驱动的题目生成与两阶段专家核验,这一体系让评测从「打总分」升级为「做能力诊断」,是论文方法学上最根本的贡献。

方法步骤详情

方法分五步。第 1 步数据收集:从 OCT5k、OIMHS、OCT-C8、AMD-SD、OCTDL、MMC-AMD、GOALS 七个公开数据集采集 OCT 图像,统一异构标注(类别、边界框、分割掩码、临床属性)。第 2 步任务设计:按临床判读工作流组织成 Perception/Cognition/Reasoning 三层,细分为 9 个能力组、20 个细粒度任务(T01 模态感知到 T20 随访调整),定义各任务目标与知识边界并最小化重叠。第 3 步医学知识收集:从 AAO/CMA 循证指南、专家共识及 OCT 参考书(如 Duker《Handbook of Retinal OCT》)提取疾病评估、治疗、预后、随访的条目化知识约束。第 4 步题目生成:为每任务设计专用指令,把任务描述、图像、标注与知识喂给 GPT-4o,生成覆盖视觉属性、解剖、病变、疾病、治疗与预后的四选一候选题。第 5 步质量控制:两阶段策略——先由 GPT-4o 自动检查题目质量、答案唯一性、图文一致性,再由专家审核医学正确性与歧义,问题样本修订或删除,最终得 10,076 道专家核验题。

技术新颖性

技术新颖性体现在三方面。第一,规模与覆盖面:4,137 张图、10,076 道题、20 个任务,远超现有眼科基准(如表 1 所示,MMBench 仅 20 个任务、OphNet 4 个、LMOD 3 个),且是唯一同时覆盖 OCT 专属、多模态、疾病分类、解剖识别、病变识别、视觉感知、医学认知、临床推理 8 项的基准。第二,结构化能力分层:把单一任务拆成可归因的三维九组二十任务体系,使「整体准确率」能被分解为可诊断的能力剖面,这是既往基准不具备的诊断粒度。第三,临床对齐的题目构造:以真实判读工作流为骨架,并用「图像证据+医学知识」双驱的 GPT-4o 生成配合两阶段(自动+专家)核验,既保证了题目的临床效度,又通过图像 grounding 检查剔除了只能靠语言线索作答的退化样本,从源头控制了标注伪影与标签集中问题。

Task taxonomy of OCT-Bench.
Figure 2: Task taxonomy of OCT-Bench.
Construction pipeline of OCT-Bench.
Figure 3: Construction pipeline of OCT-Bench.

实验结果

零样本评测 20 个 MLLM,四点发现。其一,模型远未可靠:整体最优 GPT-5.4-mini 仅 62.0%,Gemini-2.5-flash 60.5%、Hulu-Med-32B 58.4%,最强模型仍 38% 答错,无模型三维度领先。其二,能力越深准确率越低:感知 75.8%→认知 64.2%→推理 42.9% 降 32.9 个点,GPT-5.4-mini 感知最高但推理仅 38.5%。其三,专业化与放大不保证全面提升:HealthGPT-M3、MedGemma-4B 反弱于多个通用模型;Lingshu 7B→32B 认知涨 14 点、推理仅涨 1.2 点。其四,细粒度任务差异巨大:T01、T02 平均 97.9%、97.6% 近饱和,但 T03 形态描述平均仅 23.4%最优 45.4%;T10 分层平均 30.9%、最优 56.8%;T17 诊断平均 30.1%、最优 47.7%,按病种极不均衡(MH 58.4%、CSC 53.0% 好,AMD 16.74%、青光眼 7.8%、RAO 5.5%、RVO 2.5% 几乎全错);T19、T20 平均仅 33.8%、33.9%。

Comparison of OCT-Bench with existing general-domain and ophthalmology-specific benchmarks.
Table 1: Comparison of OCT-Bench with existing general-domain and ophthalmology-specific benchmarks.
Overall and dimension-average performance on OCT-Bench (%).
Table 2: Overall and dimension-average performance on OCT-Bench (%).
Performance of different models on tasks T01–T20 (%).
Table 3: Performance of different models on tasks T01–T20 (%).
Retina and choroid recognition accuracy for task T09 across different models.
Figure 4: Retina and choroid recognition accuracy for task T09 across different models.
Disease-category-level diagnosis accuracy for task T17.
Figure 5: Disease-category-level diagnosis accuracy for task T17.
Case study of Region Identification.
Figure 6: Case study of Region Identification.
查看结构化数据
任务指标本文基线提升
OCT-Bench 整体准确率(20 任务平均) Accuracy (%) GPT-5.4-mini:62.0%(最强模型) 随机猜:25.0% 最强模型仅比随机基线高约 37 个点,仍有 38% 题目答错,远未可靠
三维能力对比(同一最优模型剖面) 各维度最高 Accuracy (%) 感知 75.8(GPT-5.4-mini)/ 认知 64.2(Gemini-2.5-flash)/ 推理 42.9(Hulu-Med-32B) 随机基线 25.0% 从感知到推理下降 32.9 个百分点,显示能力随层级递进而显著退化
细粒度视觉任务 T01/T02(模态感知/标注识别) 20 模型平均 Accuracy (%) T01 平均 97.9%、T02 平均 97.6% 随机 25.0% 低层识别接近饱和,说明模型能认出「这是 OCT」但缺乏精细判读
细粒度视觉任务 T03(病变形态描述) 20 模型平均 / 最优 Accuracy (%) 平均 23.4%,最优 45.4% 随机 25.0% 平均分甚至低于随机基线,揭示模型对视网膜形变与病变形态缺乏精确表征
视网膜分层识别 T10 20 模型平均 / 最优 Accuracy (%) 平均 30.9%,最优 56.8%(GPT-5.4-mini) 随机 25.0% 仅略高于随机,细粒度分层判读是公认的难点
疾病诊断 T17(按病种) Accuracy (%) MH 58.4、CSC 53.0 表现较好;AMD 16.74、青光眼 7.8、RAO 5.5、RVO 2.5 极差 随机 25.0% 高度依赖病种,提示模型靠显著/高频模式而非鉴别诊断,多数病种低于随机

局限与改进

作者承认的局限主要包括:所有任务统一为四选一多选题并以准确率为唯一指标,这种范式虽然保证了客观与可复现,却无法评估模型的开放式解释深度、自由推理质量与不确定性表达;评测主要面向二维 OCT 切片,未覆盖三维体积扫描、B-scan 序列或 OCTA 等更丰富的临床数据形态;题目语言以英文为主,未系统评估跨语言(如中文临床场景)的泛化。从我的观察看还有几点值得补充:第一,基准的「金标准」高度依赖 GPT-4o 自动生成+专家核验,专家数量、一致性(如 κ 系数)和标注成本均未披露,质量控制的严格程度难以独立验证;第二,10,076 道题源于 4,137 张图,平均每张图被反复用于多任务,可能存在跨任务数据泄漏或图像级记忆偏置,论文未说明训练集模型是否见过这些公开数据;第三,仅报告准确率而未报告置信区间或显著性检验,模型间数个百分点之差的排名(如 62.0 vs 60.5)在统计上是否稳健并不清楚。

独立分析的弱点

独立来看,OCT-Bench 有几个可改进的弱点。其一,评测范式的天花板:四选一多选题让模型只需「选字母」,无法衡量它在临床真实场景中生成结构化报告、给出鉴别诊断列表或表达「不确定」的能力;改进方向是引入开放式自由作答+临床医生评分(如基于放射学报告评估规范)的混合评测。其二,数据形态单一:只用 2D 切片,遗漏了临床实际依赖的 3D 体积、en-face 图与 OCTA 血管图;可扩展到 3D 体数据与多模态(OCT+眼底彩照+OCTA)联合判读。其三,潜在记忆污染:4,137 张图来自公开数据集,很可能已进入主流 MLLM 训练集,而论文未做污染审计;建议补充「训练数据是否包含这些图像」的探测实验或保留私密 hold-out 集。其四,统计稳健性不足:仅报准确率无误差棒,小差距排名不稳;应补充 bootstrap 置信区间与两两显著性检验。其五,跨语言与跨人群泛化缺失:可增加中文临床语境题目及多中心、多人种数据,检验模型在不同临床实践下的稳健性。

未来方向

作者明确提出的方向是借 OCT-Bench 推动具有更强视觉 grounding 和更可靠眼科推理的 MLLM 发展,特别针对细粒度视网膜结构识别、疾病诊断与图像驱动临床推理的短板。基于成果可延伸的方向包括:第一,开发「层级化训练与诊断」范式——按 Perception/Cognition/Reasoning 分阶段微调或强化学习,专门修补被基准诊断出的薄弱能力组(如 T10 分层、T17 鉴别诊断)。第二,把基准从 MCQ 扩展为开放式生成+临床评分,并加入 3D 体积、OCTA 与多模态联合任务,更贴近真实判读。第三,构建能力归因的「错误传播分析」方法,量化感知错误如何向上传导至认知与推理层(论文已观察到 GPT-5.4-mini 感知最强却推理最弱,值得深入建模)。第四,探索检索增强与知识注入(如把 AAO/CMA 指南作为外部知识源)以缓解「推理靠不住」的瓶颈。第五,开展跨语言、跨人群与对抗鲁棒性研究,检验模型在分布偏移下的可靠性。

复现评估

复现性总体良好。作者已公开代码仓库(https://github.com/baochenfu/OCT-Bench/),评测统一为零样本四选一多选题,指标为准确率,设定清晰、协议标准化,便于复跑。数据来源透明——4,137 张图全部来自七个公开数据集(OCT5k、OIMHS、OCT-C8、AMD-SD、OCTDL、MMC-AMD、GOALS)可追溯。20 个被测模型既有 API 闭源模型(GPT-5.4-mini、Gemini-2.5-flash、Grok-4-fast),也有开源权重通用模型与医学模型,算力门槛主要在于运行这些模型本身,复现评测无需训练。难点在于:题目的「专家核验」标准(专家人数、一致性、修订记录)披露不足,难以独立验证标注质量;且未提供模型是否见过这些公开图像的污染分析,可能影响「零样本」结论的纯净度。整体而言作为评测基准其复现成本可控、可重复性较高。