面向CT扫描空间关系验证的模块化智能体:可靠且可审计 A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
用YOLO定位加确定性几何验证取代VLM直接预测,CT空间问答准确率达94.1%
前置知识
视觉语言模型(VLM)
视觉语言模型是同时接收图像和文本作为输入、并生成文本输出的多模态大模型,典型代表有 Qwen2-VL、MedGemma、GPT-4o 等。它把图像编码为视觉特征序列,与文本 token 一起送入Transformer 进行联合推理,从而可以回答关于图像的问题、生成描述或报告。
本文的对照组就是直接提示的端到端 VLM,同时也是混合智能体的控制器;理解 VLM 的输入输出方式和它在空间推理上的短板,才能明白为什么要绕开它直接预测答案。
YOLO 目标检测
YOLO(You Only Look Once)是一类单阶段目标检测器,一次前向传播即可在图像上输出所有目标的边界框、类别和置信度分数。它速度快、训练成熟,常被用作感知工具。本文用覆盖 61 个解剖类别的 YOLO 模型在轴位 CT 切片上定位器官,每个类别只取置信度最高的边界框。
YOLO 是本系统的感知核心,所有空间判断都建立在它输出的边界框之上;最终 55 个错误案例中 28 个来自定位不准,理解它的工作方式有助于读懂失败归因分析。
空间关系验证与 MIRP 基准
空间关系验证指判断形如「肝脏是否在脾脏左侧」的二元命题在给定图像中是否成立。MIRP 基准(MICCAI 2025 提出)的 RQ1 任务由轴位 CT 切片加成对解剖结构二元空间问题组成,要求模型输出 1(真)或 0(假)。强 VLM 在该基准上准确率接近 50% 的随机水平。
MIRP RQ1 是本文唯一的评测基准,held-out 测试集含 938 个图像-问题对;读懂数据划分(患者级隔离)和指标定义是理解实验结果的前提。
智能体编排与 LangChain
AI 智能体指以大模型为核心、能调用外部工具完成任务的系统。LangChain 是常用的编排框架,负责提示管理、工具调用、路由和中间状态维护,本身不做额外推理。模块化智能体把推理过程拆给专门工具,中间结果显式可见。
本文用 LangChain 做编排层,VLM 控制器据此把空间问题路由到专用验证通路;理解「编排不做推理、工具产出结论」的分工,是理解其可审计性的关键。
研究动机
放射学报告要求对发现给出明确的解剖定位,空间语言是影像报告的核心组成部分,而空间定位错误可能带来严重临床后果,例如脊柱手术节段错误、肿瘤与邻近结构关系的误读。然而现代视觉语言模型存在系统性的空间推理缺陷:已有工作表明 VLM 难以处理左右、上下等基础空间概念和组合关系;在医学影像的受控空间推理基准 MIRP 上,代表性强模型接近随机水平——MIRP RQ1 排行榜显示 GPT-4o 准确率仅 50.5%(F1 35.2),Gemma 3 12b 为 50.9%,Pixtral 12b 为 50.7%,MedGemma 4b 为 50.3%,几乎等于抛硬币。更严重的是,端到端 VLM 无法为其空间结论提供可验证的图像证据,弱视觉接地和幻觉是医学 VLM 临床部署的核心瓶颈:一个听起来合理的答案,如果不能追溯到图像证据,在临床上是不被接受的。
本文的目标是本文的目标是构建一个模块化的医学影像智能体,专门完成轴位 CT 切片上的二元空间关系验证,例如回答「肝脏是否位于脾脏左侧」。系统对外保持与普通 VLM 相同的对话接口和完全相同的提示词,但内部把任务分解为显式阶段:自然语言问题先被解析为结构化关系元组,随后由覆盖 61 个解剖类别的 YOLO 检测器定位目标器官,最终的空间判断由检测框质心坐标的确定性几何规则计算得出,而不由任何神经网络直接预测真值。作者在 MIRP RQ1 的 938 个 held-out 图像-问题对上,以统一提示协议对比该混合智能体与直接提示的 MedGemma 4b、Qwen2-VL 7b,希望证明显式模块化验证既大幅提升准确率,又能把每个错误归因到具体失败模块,从而把评测从黑盒准确率推进到模块级失败分析。
与已有工作不同的是,已有的 agentic 医学影像系统——如通用型 MMedAgent,以及面向胸部 CT 与 X 光判读、神经影像分析、报告生成的专用智能体——展示了用语言模型编排专业工具的潜力,但它们都没有把解剖空间关系当作「受控、图像接地、可审计的中间事实」来构建和评估:没有人专门验证空间判断能否成为可被显式检验的可靠中间步骤。本文的独特切入点是把空间关系验证隔离成一个受控子问题:它既是报告式影像理解的关键能力,又提供了严谨可复现的评测设定。通过把语言解析、解剖定位与几何验证拆成相互独立的阶段,系统从黑盒预测转向完全可审计的流程——任何错误都能定位到最早的失败模块(问题提取、路由、解析、本体匹配、漏检、定位不准、几何歧义或格式错误),这种阶段级失败归因能力是端到端 VLM 和此前医学智能体工作都不具备的。
核心方法
整体思路很直觉:既然 VLM 直接预测空间答案不可靠,那就只让它做擅长的事(理解语言、路由任务),把看图判断位置交给专门的检测器和几何规则。技术上,系统由 LangChain 编排,一个 VLM 控制器(如 MedGemma 4b 或 Qwen2-VL 7b)接收 CT 切片与用户提示,提取其中的核心空间问题并路由到空间验证通路。该通路包含四个串联阶段:元组提取、本体匹配、解剖定位与确定性验证。以「Is the liver left of the spleen?」为例,问题被解析为元组 $(\text{liver}, \text{left of}, \text{spleen})$,实体映射到检测器类别后由 YOLO 定位,最后对两个检测框质心的横坐标做比较,若 $x_{\text{liver}} < x_{\text{spleen}}$ 则判定为真。检测器覆盖 61 个解剖类别、训练于 421,023 个实例(含 AMOS 与 BTCV 数据),与测试集严格患者级隔离。系统同时实现了存在性验证工具,测量类推理留作未来扩展。最终返回的结构化结果附带解析元组、本体匹配、所选检测、几何比较与完整审计信息。
核心创新在于:没有任何神经网络直接预测最终的真值。端到端 VLM 的范式是「图像加问题进、答案出」,空间关系被隐式编码在一次多模态前向传播里,错了无从追责;本文把范式反转为「语言模型管语言、检测器管位置、确定性几何管结论」。关系真值完全由图像空间中的显式坐标计算得到,例如「左右」关系归结为质心横坐标 $x_{\text{left}} < x_{\text{right}}$ 的比较,几何验证器是确定性的,因此只要查询提取、本体映射和检测都正确,结论就可以一步步追溯到对应的坐标比较。另一个关键设计是对外接口保持不变:混合智能体与直接 VLM 接收完全相同的提示词(要求只输出 1 或 0),控制器从中提取核心问题再走模块化通路,这保证了对比实验的公平性。此外,当实体无法映射到检测器类别时,系统会立即返回带审计记录的无效结果,主动阻止不支持的查询而非硬猜。
方法步骤详情
完整流程分四步。第一步元组提取:输入是用户提示中的空间问题,轻量解析器(带 VLM 兜底)将其转换为结构化元组,如「Is the liver left of the spleen?」转为 $(\text{liver}, \text{left of}, \text{spleen})$,复杂自然语言由 VLM 回退兜底映射。第二步本体匹配:把提取出的实体映射到 YOLO 检测器的 61 个规范类别名,映射失败则立即返回无效结果并写入审计条目,防止系统对不支持的器官硬答。第三步解剖定位:调用 YOLO 检测器在轴位 CT 切片上定位目标结构,每个类别只保留置信度最高的边界框传给下一步,检测器训练于 421,023 个实例、含分割掩码导出的边界框及 AMOS/BTCV 增补数据。第四步确定性验证:从检测到的物体质心出发,按关系的方向性比较横坐标或纵坐标的排序,例如「left of」即验证 $x_{\text{A}} < x_{\text{B}}$,真值完全由工具提供的坐标显式导出。最后智能体汇总原始提示、提取查询、本体匹配、所选检测、二值结果与审计信息,返回结构化任务结果。
技术新颖性
技术新颖性体现在三点。第一,确定性几何验证取代神经预测:与 MMedAgent 等把推理交给语言模型的做法不同,本文的最终结论由坐标比较这一确定性规则产生,从机制上消除了 VLM 的空间幻觉,而不是靠提示工程缓解它。第二,阶段级失败归因:由于每个中间表示(提取的问题、解析元组、本体匹配、检测框、几何比较)都被显式记录,任何错误都能指派到最早的失败阶段,实验据此把 55 个错误精确拆解为定位不准 28 例、解析错误 15 例、漏检 12 例,而直接 VLM 的输出无法区分错误究竟来自语言理解、视觉接地还是空间推理。第三,模型无关的框架设计与严格对照:同一框架分别搭配 MedGemma 4b 与 Qwen2-VL 7b 均获大幅提升(91.6% 与 94.1%),且与直接提示使用完全相同的外部提示词与确定性解码(temperature 为 0),把增益干净地归因于内部推理架构而非提示差异。
实验结果
在 MIRP RQ1 的 938 个 held-out 图像-问题对上上,核心结论是模块化验证全面超越端到端提示。直接提示的 VLM 仍在随机水平:MedGemma 4b 准确率 51.8%(F1 67.2),Qwen2-VL 7b 准确率 51.6%(F1 56.8);作为参照,此前 MIRP 排行榜上 GPT-4o 仅 50.5%、Gemma 3 50.9%、Pixtral 50.7%。换成混合智能体后性能跃升:MedGemma 加混合达到 91.6% 准确率、91.3 F1;Qwen2-VL 加混合取得最佳成绩 94.1% 准确率、94.2 F1,相对直接 Qwen2-VL 提升 42.5 个百分点,且全程无无效二值输出。另外直接 MedGemma 的 F1(67.2)明显高于其准确率,说明输出分布有偏,而混合版本把精确率与召回率拉平。阶段级失败归因进一步解剖了最佳配置的 55 个错误:YOLO 定位不准占 28 例(50.9%),解析/查询提取错误 15 例(27.3%),漏检 12 例(21.8%),而问题提取、路由、本体匹配、几何歧义、格式错误均为 0 例,表明剩余瓶颈几乎全在感知和语言解析,几何验证器本身已无误差。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MIRP RQ1 空间问答(held-out 测试集,938 对) | Accuracy | 94.1%(Qwen2-VL + 混合智能体);91.6%(MedGemma + 混合) | 51.6%(直接 Qwen2-VL);51.8%(直接 MedGemma);排行榜 GPT-4o 50.5% | +42.5 个百分点(对直接 Qwen2-VL);+39.8 个百分点(对直接 MedGemma) |
| MIRP RQ1 空间问答(held-out 测试集) | F1 | 94.2(Qwen2-VL + 混合);91.3(MedGemma + 混合) | 56.8(直接 Qwen2-VL);67.2(直接 MedGemma);排行榜 MedGemma 60.7 | +37.4(对直接 Qwen2-VL);+24.1(对直接 MedGemma) |
| 阶段级失败归因(最佳配置的 55 个错误案例) | 各阶段错误占比 | 定位不准 28 例(50.9%)、解析错误 15 例(27.3%)、漏检 12 例(21.8%) | 问题提取/路由/本体匹配/几何歧义/格式错误均为 0 例 | 几何验证器零错误,瓶颈集中在感知与解析模块 |
局限与改进
作者明确承认的局限是:当前系统只处理轴位 CT 切片上的成对二维空间关系,不覆盖体积推理、距离敏感关系、包含、重叠或多结构一致性,空间验证只是一个受控的中间能力,为未来的报告导向智能体铺路。同时智能体的性能天然受底层工具质量约束——YOLO 定位不准贡献了 50.9% 的残余错误。我的补充观察有四点:其一,质心排序的几何规则过于粗糙,对尺寸悬殊的器官或斜向方位(如「前上方」)可能产生系统性误判,论文未讨论边界情况的处理;其二,本体匹配把查询限制在 61 个检测器类别内,无法开放词表地回答任意解剖结构关系;其三,held-out 测试集虽做了患者级隔离,但与排行榜结果并非严格配对比较,横向数字只能作参考;其四,二元关系验证离真实放射报告的自由文本空间描述还有相当距离,缺乏临床医生评估。
独立分析的弱点
独立分析有五个弱点。第一,感知瓶颈:50.9% 的错误来自 YOLO 定位不准,21.8% 来自漏检,说明当两个器官的质心因分割/检测误差偏移而改变左右排序时系统就失败,改进方向是引入不确定性估计——当两个框的质心距离小于检测误差量级时输出「无法确定」而非硬答,或换用更先进的 3D 检测/分割模型。第二,解析瓶颈:27.3% 的错误是实体或关系抽错,可改用约束解码或结构化语法强制输出合法元组,并对低置信度解析回退到更强 LLM。第三,几何规则表达能力弱:仅支持轴向的左右/上下质心排序,无法处理重叠、包含、距离敏感关系,应扩展几何验证器支持 IoU、方位角、距离阈值等规则。第四,仅限 2D 单切片:器官跨多切片延伸,单张轴位片上的「左右」可能因切片位置而异,需 3D 体积级路由。第五,闭集本体:只能验证 61 个预定义类别,遇到罕见解剖变异或病灶(肿瘤本身不在类别表中)即失效,可结合开放词表分割模型(如 Grounding DINO/SAM 类)缓解。
未来方向
作者提出的方向包括:把测量导向推理作为新的模块化工具接入同一框架;实现 3D 路由与体积测量,把空间验证从 2D 切片扩展到整个 CT 体积;以及把该架构集成到面向报告的医学影像智能体中,让空间验证成为结构化报告生成的可审计构件。框架本身已实现存在性验证工具,说明多工具扩展路径是现成的。基于本文成果还可延伸:一是用阶段归因信号做针对性数据增强,例如自动挖掘定位不准的案例去微调检测器,形成「归因驱动的自我改进」闭环;二是把确定性几何验证与 VLM 的软判断融合,对边界案例按检测不确定性输出置信度校准的答案;三是扩展到距离、重叠、包含等关系代数,并验证在 MIMIC-CXR 等报告数据上能否提升生成报告的空间事实准确率;四是开展放射科医生在环的评估,检验可审计的中间表示是否真的加速临床审阅。
复现评估
复现条件较好。代码已开源(https://github.com/DeveloperNomis/MICCAI-Medical-Agent),框架基于 LangChain 编排,主体是两个公开权重的模型(MedGemma 4b、Qwen2-VL 7b)加一个 YOLO 检测器,推理端普通单卡 GPU 即可运行。评测基准 MIRP RQ1 公开发布,检测器训练数据由 MIRP 训练队列的分割导出框加公开的 AMOS、BTCV 数据集构成(共 421,023 实例、61 类),训练检测器需要一定 GPU 资源但属于常规目标检测训练量级。提示词、评估协议(temperature 为 0、无效输出计错)和失败归因规则在论文中均有明确描述,唯一的不确定点是 MIRP 训练/测试划分与排行榜数据的对齐细节,以及解析器与 VLM 兜底的具体实现版本,复现者可能需要阅读代码确认。总体属于中等难度:几何验证部分零成本复现,检测器训练和基准划分对齐是主要工作量。
论文图表