← 返回 2026-09-11

CARDEA:基于空间证据可审计推理的冠脉造影端到端解读 CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation

Jia-Jen Lee, Shih-Yen Hou, Kee Koon Ng, Wei-Chun Wang, Shih-Sheng Chang 📅 2026-09-07 👍 13 2026-09-12 18:30
医学影像AI 可解释性 强化学习 视觉语言模型

仅训封闭任务即浮现开放报告能力,冠脉造影端到端可审计解读

前置知识

冠状动脉造影(CAG)

向冠脉注入造影剂并用X光透视成像的介入检查,是冠心病诊断金标准。三维血管投影到二维会产生血管重叠与缩短伪影,因此医生需要综合多个投照视角判断病变严重程度,主观性强、观察者间差异大。

本文的所有任务定义(优势分类、复杂度评估、关键帧选择、视角分类、报告生成)都建立在 CAG 的临床工作流之上,不了解检查流程就无法理解两遍管线的设计动机。

大型视觉语言模型(LVLM)

将视觉编码器与大型语言模型连接的多模态模型,能对图像/视频进行开放文本问答与推理。本文基座为 Qwen3-VL-30B-A3B-Thinking,属 MoE 架构,支持在推理时输出显式思考链(thinking 模式)。

CARDEA 的本质就是把一个通用 LVLM 对齐到 CAG 领域,并让其推理轨迹中嵌入空间证据;理解 LVLM 的 SFT 与 RL 训练范式是读懂三阶段训练的前提。

Chain-of-Box(CoB)

一种接地推理机制:在模型的推理文本中嵌入边界框作为空间锚点,使每个中间论断都对应原图的具体区域。人可以逐步审计模型『依据哪个区域的哪条血管得出结论』,区别于只输出最终框的检测模型。

CoB 是本文的核心贡献——可审计推理的载体,冷启动数据合成与 RLVR 奖励设计全都围绕『让模型稳定输出高质量 CoB 轨迹』展开。

可验证奖励强化学习(RLVR)

奖励由基于规则的验证器(如答案正确性)给出而非学习出来的奖励模型,避免 reward hacking。DeepSeek-R1 证明 RLVR 能让推理能力在纯策略优化中自发涌现,而非依赖模仿示范。

本文最有意思的结论——封闭任务上的 RLVR 反而提升了被 SFT 损害的零样本报告能力——正是 R1 式『策略优化浮现模仿得不到的能力』在医学影像上的印证。

自蒸馏(Self-Distillation)

用模型自身(或其基座未调优版本)作为教师生成训练数据。本文中未调优的 Qwen3-VL 教师模型根据 Stage 1 模型产生的检测框和文本化判定指南合成 CoB 推理轨迹,验证器只保留结论正确的轨迹作冷启动数据。

人工标注推理轨迹昂贵且 CoB 非基座原生能力,自蒸馏是绕开这一数据瓶颈的关键技巧,也是复现本文必备环节。

VS-F1(血管严重度宏F1)

针对自由文本报告的诊断性指标:先用 MedGemma-27B-IT 把报告解析成每支血管的严重度标签,再对 LM/LAD/LCX/RCA 等分支的标签算宏平均 F1。相比 ROUGE-L 等文本相似度指标,它不受措辞重叠和正常类占多数(74%)的影响。

报告生成是本文最核心的实验论据,VS-F1 的两阶段退化-反转曲线(0.452→0.373→0.686)直接支撑『RLVR 浮现开放能力』的主张。

研究动机

冠脉造影(CAG)是冠心病诊断的金标准,但把三维冠脉结构投影到二维平面会引入血管重叠与缩短伪影,容易低估病变严重程度;由于追加投照会增加造影剂和辐射暴露,临床医生只能在现有视角上靠脑力整合。更严峻的是解读主观性极强:近期研究显示三名资深心脏科医师阅读同一批造影的总体一致率仅 77.4%。深度学习虽被引入以降低变异,但现有方案各有缺陷:CathAI、DeepCoro 等级联管线串联多个单视角模块,误差会跨模块累积;DeepCORO-CLIP 等基础模型是判别式的,只能输出封闭标签或空间坐标;Nakamura 等与 Jiang 等的大型视觉语言模型(LVLM)虽能生成自由文本报告,但 Nakamura 的模型无法输出边界框,Jiang 的框只出现在与报告分离的子任务中——医生无法在报告内部审阅模型得出结论的空间依据,验证成本高、信任度低,临床落地受阻。

本文的目标是本文要构建一个统一的 LVLM——CARDEA,作为整条 CAG 解读管线的单一推理核心:从原始多视角造影视频出发,自动完成关键帧筛选与视角分类,再到研究级诊断(左右冠优势分类与 SYNTAX 复杂度评估),并首次把可审计的 Chain-of-Box 空间证据嵌入推理轨迹。训练上刻意只使用公开数据集上的封闭式任务(血管检测、狭窄检测、视角分类、关键帧选择、优势分类、复杂度评估),完全不训练开放式报告生成,然后在完全留出的外部队列 AngioCAD 上零样本评估全部能力。作者还想回答一个更根本的科学问题:仅靠带可验证奖励的强化学习(RLVR)在封闭任务上优化,能否浮现出监督模仿(SFT)无法获得的开放式报告能力?

与已有工作不同的是,独特切入角度有三层。第一,可审计性:不同于把检测框和报告分离的已有 LVLM,CARDEA 把边界框作为空间锚点直接写进推理轨迹内部,医生可逐步核查结论对应原图哪个区域的哪条血管——论文明确指出此前没有 CAG 系统做到报告内的可审计轨迹。第二,训练范式倒置:报告生成这类开放任务被完全排除在训练之外(因为缺乏基于规则的验证器,引入奖励模型会有 reward hacking 风险),作者假设封闭任务上的 RLVR 会迫使模型反复做多视角综合,从而内化出报告能力,这直接挑战『开放能力需要开放数据监督』的直觉。第三,数据策略:CoB 并非 Qwen3-VL 基座的原生能力,人工标注推理轨迹又昂贵,于是用未调优基座模型做教师、以 Stage 1 的检测框为条件自蒸馏合成冷启动数据,并用答案正确性过滤,绕开了人工标注瓶颈。

核心方法

CARDEA 基于 Qwen3-VL-30B-A3B-Thinking 构建,推理采用两遍管线:第一遍对每段造影视频做单视角推理,完成关键帧选择与三类视角分类(LCA/RCA/OTHER),再用规则过滤丢弃非诊断帧——因为用大模型直接处理全部原始帧计算上不可行,且许多帧心脏对位差、造影剂不足——最终保证每个研究保留最多 10 张关键帧且左右冠视角齐全;第二遍对精选关键帧做多图像 CoB 推理,输出优势分类、复杂度评估和零样本报告。训练分三阶段:Stage 1 用单视角任务(血管检测、狭窄检测、关键帧选择、视角分类)做 SFT,把模型从通用域对齐到 CAG 域并学会输出边界框;Stage 2 用自蒸馏合成的 CoB 轨迹对优势分类做冷启动 SFT,把感知能力延伸进推理;Stage 3 用 RLVR,对研究级任务在答案正确时额外奖励 CoB 行为,同时提升任务精度并巩固接地行为。全过程只用 ARCADE、CADICA、Coronary-Dominance、CardioSyntax、PubMedVision 等公开数据。

核心创新是『Chain-of-Box + 条件化 RLVR 奖励』的组合,以及由此实现的可审计端到端解读。与 Nakamura 等(不能输出框)和 Jiang 等(框在报告之外的子任务)的本质区别在于:框不再是独立输出的检测结果,而是推理文本内部的空间证据链,每个结论都能回溯到原图具体区域。奖励设计上,CoB 行为只有在最终答案正确时才获得额外奖励(条件化),且只施加于需要跨视角综合的研究级任务——单视角任务不涉及多视角整合逻辑,无需此类解释,故不奖励。开放任务(报告生成)被刻意排除在 RLVR 之外,因为它们没有规则验证器,用奖励模型会引入 reward hacking。消融实验揭示了两个组件的清晰分工:冷启动决定框的粒度——没有它,RLVR 奖励只要求『有个框』,模型退化到中位 0.76 帧面积的粗框(有冷启动约 0.01);CoB 奖励决定接地是否存续——去掉奖励后使用率先升后塌缩到约 5%,而任务精度几乎不变,说明 CoB 是可审计性而非精度的来源。

方法步骤详情

具体步骤如下。第一步,数据重构:ARCADE(3000 张关键帧、1500 名患者、设备多样)提供血管检测(SYNTAX 定义的 25 个冠脉节段)与狭窄检测(直径狭窄 ≥50%)两个单视角任务;CADICA(42 名患者的多视角视频)提供关键帧选择任务;视角分类为 LCA/RCA/OTHER 三类,前两类来自 ARCADE 血管标注,OTHER 由 CADICA 非诊断帧与 PubMedVision 非 CAG 医学图像构成;Coronary-Dominance(1574 例研究)提供优势分类(按 SYNTAX 定义分左/右优势);CardioSyntax(1844 例)提供复杂度评估,把连续 SYNTAX 评分离散化为 0–32 与 >32 两档。第二步,Stage 1 对齐:SFT 教模型用边界框定位血管与狭窄。第三步,Stage 2 自蒸馏冷启动:Stage 1 模型先产生血管和狭窄框,未调优的基座教师按文本化优势判定指南合成 CoB 轨迹,验证器只保留结论正确的轨迹用于 SFT。第四步,Stage 3 RLVR:可验证奖励(正确性 + 条件化 CoB 奖励)同时提升研究级任务精度并巩固 CoB 行为。第五步,部署时运行两遍推理管线:Pass 1 逐视频(可并行)选关键帧并分类视角、丢弃 OTHER,确保 LCA 与 RCA 存在;Pass 2 对最多 10 张关键帧做 CoB 多图推理,输出带空间轨迹的最终诊断。

技术新颖性

技术新颖性体现在三处。其一,CoB 机制在冠脉造影上的首次端到端落地:框嵌入推理轨迹且贯穿整条管线(从视频到研究级诊断),此前没有 CAG 系统在报告内部提供可审计轨迹,这是与 CathAI/DeepCoro(级联判别式)、Nakamura/Jiang(框与报告分离)最本质的差别。其二,自蒸馏式冷启动解决了推理轨迹数据稀缺:不需要人工撰写思维链,用基座模型当教师、以 Stage 1 检测框和文本判定指南为条件合成轨迹,再用答案正确性做质量过滤,成本低且可扩展;图 3B 证明冷启动还顺带继承了 Stage 1 的细粒度框尺度,是接地质量的决定因素。其三,最具启发性的发现是训练范式与能力的错位:两个 SFT 阶段使零样本报告 VS-F1 从基座的 0.513 一路退化到 0.452、0.373,而 RLVR 阶段反转为 0.686(关闭 thinking 也有 0.644,超过基座)——说明可验证奖励迫使模型内化跨视角综合能力,而非仅仅模仿输出形式,与 DeepSeek-R1 的结论在医学影像上互相印证。

End-to-end inference pipeline of CARDEA. A first pass filters non-diagnostic frames in parallel via keyframe selection and view classification; a second pass applies Chain-of-Box (CoB) reasoning over the curated multi-view keyframes to produce Dominance Classification, Complexity Assessment, and zero-shot Report Generation.
Figure 1: End-to-end inference pipeline of CARDEA. A first pass filters non-diagnostic frames in parallel via keyframe selection and view classification; a second pass applies Chain-of-Box (CoB) reasoning over the curated multi-view keyframes to produce Dominance Classification, Complexity Assessment, and zero-shot Report Generation.
Cold-start data preparation for Stage 2 training. The Stage 1 model generates vessel and stenosis bounding boxes for each keyframe; a teacher model synthesizes CoB reasoning traces conditioned on these detections; only traces reaching the correct diagnostic conclusion are retained for generative fine-tuning.
Figure 2: Cold-start data preparation for Stage 2 training. The Stage 1 model generates vessel and stenosis bounding boxes for each keyframe; a teacher model synthesizes CoB reasoning traces conditioned on these detections; only traces reaching the correct diagnostic conclusion are retained for generative fine-tuning.

实验结果

实验分四块。封闭任务(表1):狭窄检测 F1@IoU≥0.5 为 0.37(0.32–0.41),与专用模型 DCA-YOLOv8 的 0.36±0.08 持平;改用 Jiang 等的松弛准则 F1@(IoU≥0.5 或 IoP≥0.6) 升至 0.60,与其 LVLM 打平;血管检测 25 节段 F1 为 0.50(0.48–0.53),超过 DeepCoro 算法 4 的 0.47 和 Jiang 等 LVLM 的 0.46;三分类视角 Macro F1 达 0.99;关键帧选择平均帧距 $D_k$ 为 0.60,预测帧平均落在专家可用范围一帧内(但该集仅 5 名患者 48 段视频)。研究级任务:优势分类域内 Real 子集准确率 0.94,低于 2D ConvNeXt 的 0.97(Macro F1 0.88 对 0.94,全文唯一统计可区分短板),域移 Shift 子集反超(0.91 对 0.89);复杂度评估准确率 0.90(0.82–0.97),与 10 年经验专家 E1 的 0.90、3 年经验 E2 的 0.88 相当。零样本 AngioCAD(表2):RCA 狭窄二分类 Lesion F1 为 0.85(0.83–0.87),超过在该队列上开发的 Adaptive Feature Fusion 基线 0.81;视角分类 RCA F1 为 0.90(0.88–0.92),低于 VGG19+LSTM 的 0.95,用 CARDEA 自筛的有效视角子集(n=326)可升至 0.95。报告生成(表3):SFT 两阶段使两分类 VS-F1 从基座 0.513 退化至 0.452、0.373,仅 RLVR 扭转为 0.644(关 thinking)/0.686(开 thinking),超过基座且是 always-normal 下限 0.312 的两倍多;三分类同轨迹(0.361→0.508),有效视角子集达 0.716。消融(表4、图3):无冷启动时框面积中位 0.76 帧面积(有冷启动约 0.01);无 CoB 奖励时接地率塌缩至约 5% 而精度几乎不变。

Trained Closed-Ended Performance.
Table 1: Trained Closed-Ended Performance.
Zero-Shot Closed-Ended Performance on the External AngioCAD Dataset.
Table 2: Zero-Shot Closed-Ended Performance on the External AngioCAD Dataset.
Stage-Wise Evolution of Zero-Shot Report Generation Quality on AngioCAD.
Table 3: Stage-Wise Evolution of Zero-Shot Report Generation Quality on AngioCAD.
Ablation over the Cold Start and the CoB Reward.
Table 4: Ablation over the Cold Start and the CoB Reward.
Ablation of cold-start initialization and the CoB reward. A, Validation CoB usage across RLVR training. B, Distribution of in-trace box areas on the held-out test classification tasks.
Figure 3: Ablation of cold-start initialization and the CoB reward. A, Validation CoB usage across RLVR training. B, Distribution of in-trace box areas on the held-out test classification tasks.
查看结构化数据
任务指标本文基线提升
狭窄检测(单视角,ARCADE) F1@IoU≥0.5 0.37(0.32–0.41);松弛准则 F1@(IoU≥0.5 或 IoP≥0.6) 为 0.60 DCA-YOLOv8 0.36±0.08;Jiang 等 LVLM 松弛准则 0.60 持平(0.37 对 0.36)
血管检测(单视角,25 节段) F1@IoU≥0.5 0.50(0.48–0.53);11 节段口径 0.58 DeepCoro 算法 4 为 0.47(0.45–0.50);Jiang 等 LVLM 0.46 +0.03,超过两个基线
视角分类(3 类 LCA/RCA/OTHER) Macro F1 0.99(0.98–1.00) YOLOv8x-cls 二分类口径 1.00 基本持平(0.99 对 1.00)
优势分类(域移 Domain Shift 子集) 准确率 0.91(0.86–0.95),Macro F1 0.89 2D ConvNeXt 0.89,Macro F1 0.88 +0.02,域移下反超专用分类器
复杂度评估(CardioSyntax,n=60) 准确率 0.90(0.82–0.97),Macro F1 0.80 专家 E1(10 年)0.90 / E2(3 年)0.88 与两位介入心脏科医师相当
零样本 RCA 狭窄分类(外部 AngioCAD,n=412) Lesion F1 0.85(0.83–0.87),准确率 0.80 Adaptive Feature Fusion 0.81(准确率 0.72) +0.04(零样本胜过在该队列上训练的模型)
零样本报告生成(外部 AngioCAD) VS-F1(2 类) 0.686(0.664–0.707);有效视角子集 0.716 未调优基座 0.513;always-normal 下限 0.312 较基座 +0.173,为下限两倍多;SFT 阶段反而退化至 0.452/0.373

局限与改进

作者承认的局限:尚未做前瞻性临床验证,报告也未与医生撰写的报告做盲评对照;跨阶段比较每次训练只跑一次,无法估计运行间方差;训练数据偏重血管和狭窄,其他征象学习不足;研究级训练每例最多 10 张静态关键帧,缺少造影剂流动的时间动态;CoB 评估只看框的频率、面积和最终答案正确性,未验证框的忠实性(框是否真的因果支持结论);报告指标缺乏人级参照,只能相对比较;复杂度评估测试集仅 60 例、关键帧仅 5 名患者 48 段视频,可能检验效能不足;bootstrap CI 未做多重比较校正,所有差异只是探索性结论。我自己的补充观察:中位推理约 6 秒/研究(4×NVIDIA B200 张量并行),难以服务亚秒级场景;OOD 场景 CoB 使用率明显下降(Domain Shift 优势分类 65%、报告生成 75%,域内则 99.5–100%),可审计性恰恰在最需要审查的域移场景打折;VS-F1 依赖 MedGemma-27B-IT 抽取标签,抽取器偏差会传导进评估;与 DeepCoro 的检测对比因掩码转框可能低估对手;Ablation 表中冷启动+无条件奖励在 AngioCAD 报告上(0.665)反超所选配置(0.680 的 CI 重叠),说明设计选择的部分证据来自验证集点估计而非测试集显著差异。

独立分析的弱点

独立分析几点弱点。第一,延迟与算力:自回归架构加 30B 级模型导致中位 6 秒/研究、依赖 4 张 B200;改进方向是把 CoB 能力蒸馏到小模型、采用投机解码或对 Pass 1 用轻量模型分流。第二,可审计性的脆弱性:CoB 使用率从域内 99.5–100% 掉到域移 65%、零样本报告 75%,而恰恰 OOD 场景医生最需要审查依据;作者建议用拒绝采样轨迹补 SFT,更根本的做法是把『必须输出框』做成解码期硬约束或结构化引导。第三,框忠实性未验证:模型可能在正确答案旁贴一个无关大框骗过奖励(无冷启动时的 0.76 帧面积粗框就是这种倾向的极端形态),应引入遮挡扰动实验(遮住框区域看结论是否翻转)或注意力归因来度量忠实性。第四,评估链路双模型串联:MedGemma 抽取标签的系统性偏差(例如对措辞风格的偏好)无法与生成质量解耦,建议公开逐例抽取结果供人工抽查并做医师对照子集。第五,单次运行的方差问题:Stage 间差异(如 0.644 与 0.686)可能部分来自训练随机性,理想做法是每阶段多种子重复。第六,域内优势分类 Macro F1 0.88 对 0.94 的差距反映类别不平衡下的短板,值得引入重加权或代价敏感奖励。

未来方向

作者明确提出的方向:针对专家心脏科医师的前瞻性临床验证是部署前提;对 OOD 数据做拒绝采样 SFT 以关闭 CoB 使用率差距(重复采样已能把 Domain Shift 65%→92%、报告 75%→98.5%);探索把报告生成纳入训练但设计防 reward hacking 的验证机制。基于本文成果可延伸的研究:第一,建立 CoB 忠实性基准——用遮挡/反事实扰动系统评估框证据是否因果支持结论,这会惠及所有接地推理工作而不限于医学;第二,把静态关键帧扩展为造影剂流动的时序建模,时序信息可能显著改善狭窄分级与血流判断;第三,验证『对齐→自蒸馏接地冷启动→RLVR』三阶段范式在 CTA、超声、内镜等其他模态上的普适性,检验『封闭任务 RLVR 浮现开放能力』是否为一般规律;第四,为报告质量引入医生在环评估与多专家一致性度量,补上 VS-F1 缺失的人级参照;第五,扩展训练数据覆盖钙化、心肌桥、侧支循环等论文自认学习不足的征象;第六,研究 CoB 使用率与诊断正确性的条件关系——既然去掉奖励精度不变,可审计性在不同错误类型下是否同样可靠值得量化。

复现评估

复现基础较好:模型权重在 HuggingFace(benbayibaurba/cardea-v0)开源,推理代码在 GitHub(benbayibaurba/cardea)开源;所用六个数据集(ARCADE、CADICA、Coronary-Dominance、CardioSyntax、PubMedVision、AngioCAD)全部公开,附录 S1.1–S1.4 给出预处理、数据划分、超参数与奖励函数定义,MedGemma 抽取协议也写明(采样温度 0.5,五次独立运行 VS-F1 标准差 <0.003,评估链路稳定),论文还自曝了图 2 的自蒸馏提示格式。难点在算力:30B 级 MoE 模型的三阶段训练(尤其 RLVR 阶段 400 步×4 个消融变体)加上 4×B200 推理配置,普通实验室难以完整复现训练;只做推理与评估的门槛则低得多,单张高端 GPU 或量化后即可运行并对照论文表格。数据侧的小障碍是 AngioCAD 等数据集可能需要申请。总体评估:评估复现容易,训练复现困难,代码与权重齐备在医学 AI 论文中属于开放程度较高的一档。