Cura 1T:面向智能体化医疗的专用大模型 Cura 1T: Specialized Model for Agentic Healthcare
用人类把关的自我进化循环把医疗后训练变成数据配方搜索问题。
前置知识
参数高效微调 (LoRA, Low-Rank Adaptation)
LoRA 在冻结的预训练权重旁注入一对低秩矩阵 $A \in \mathbb{R}^{r \times k}$ 与 $B \in \mathbb{R}^{d \times r}$,使更新 $\Delta W = BA$ 的参数量仅为 $r \times (d+k)$ 而非 $d \times k$。本文用秩 $r=32$ 的 LoRA 适配器去训练一个一万亿参数的 Kimi-K2.6 基座,使后训练成本可控并允许每个能力回路独立更新。
Cura 1T 整套自我进化循环都建立在"训练一个候选适配器—评估—决定保留或回退"之上,不理解 LoRA 就无法理解为什么作者能在算力受限的机器上反复跑训练回路,也无法理解"consolidated mixture"最终是被训进适配器里的。
自蒸馏微调 (SDFT, Self-Distillation Fine-Tuning)
SDFT 让模型从自身在策略(on-policy)采样的样本 $y \sim \pi_\theta(\cdot | x)$ 出发,向一个"带特权上下文 $c$"的教师分布 $\pi(\cdot | x, c)$ 靠拢,目标为 $L(\theta) = D_{KL}(\pi_\theta(\cdot | x) \| \pi(\cdot | x, c)) = \mathbb{E}_{y \sim \pi_\theta(\cdot|x)} \log \frac{\pi_\theta(y | x)}{\pi(y | x, c)}$。特权上下文 $c$ 可以是被修正的轨迹、参考行为或已验证的知识,学生只看到原始提示。
SDFT 是 Cura 每个回路 SFT→RL→SDFT 三步训练栈的最后一步,也是"保住模型原生推理行为不被离策略(off-policy)思维链破坏"的关键机制。论文专门强调医疗长推理链中直接拷贝离策略 CoT 会损害模型,必须读懂这个 KL 目标才能理解保留锚(retention anchor)的动机。
医疗基准套件 (HealthBench / MedXpertQA / MedAgentBench / AgentClinic)
HealthBench 用医生撰写的评分细则(rubric)给开放式临床回答打分,分为 Professional(真实临床医生对话)与 Hard 两档;MedXpertQA 是文本+多模态专家级医学问答,按精确字母(exact-letter)pass@1 评分;MedAgentBench 测试模型能否通过 FHIR 协议调用完成 EHR(电子健康档案)工具任务;AgentClinic 在模拟诊所中评估多轮交互诊断。本文把六类面板分别对应患者沟通、临床推理、医疗智能体三类用例。
论文几乎所有数字(0.940、0.662、0.655、0.796 等)都在这套基准上得到,且自我进化回路的"评估失败"就是在这四个基准上收集带评分的轨迹。不熟悉这些基准的评分方式就无法判断 Cura 1T 提升的含义,也无法理解为什么不同失败模式需要不同的数据动作。
FHIR 与 EHR 工具调用
FHIR(Fast Healthcare Interoperability Resources)是 HL7 国际标准的资源交换协议,把患者、诊断、药物等表示为结构化资源(如 ServiceRequest、Patient)。MedAgentBench 让模型通过 fhir_get / fhir_post / finish 三个原生函数调用对运行中的 FHIR 服务器做读写,评分器检查每次调用是否满足资源 schema 与临床内容约束。
MedAgentBench 的主要失败模式是"脆性执行"——模型知道该做什么临床动作,但生成的资源因为缺字段、编码错误或负载不一致而被判错。理解 FHIR 才能看懂附录 A.3.1 中 SNOMED 306181000000106、stat 优先级、SBAR 笔记这些判分细节。
自动研究 / 自我进化闭环 (Auto-research & Self-evolution)
以 LLM 智能体为操作员,在固定预算内反复执行"假设—实验—度量—保留/丢弃"的闭环。早期工作如 Self-Refine、Reflexion 用自然语言批评改进提示,OPRO/DSPy/TextGrad 把提示、程序或 LM 流水线组件当成可优化对象,autoresearch 则让编码智能体直接编辑真实训练循环并按验证损失打分。Cura 借用了这种闭环测量纪律,但把搜索对象改成后训练数据混合。
Cura 的核心定位就是"自我进化",但它的独特之处是搜索对象是"数据配方"而非提示/代码/超参。必须理解这条技术脉络才能看出作者的切入点和以往工作的本质差别。
研究动机
医疗场景对大模型的能力要求横跨三个看似相关、却以截然不同方式失败的用例:患者沟通需要符合医生评分细则(rubric)的临床/患者侧回答,失败主要是"漏掉必答要点";临床推理需要在文本和影像上做专家级医学问答,失败是"事实知识缺失"与"推理链脆弱"并存;医疗智能体任务需要多轮诊断、EHR 工具调用、长程工作流,失败是"过早诊断"和"工具调用格式错"。作者观察到,已有社区工作(Med-PaLM、Baichuan-M4、MedQA/MedMCQA、MedXpertQA、AgentClinic、MedAgentBench、CHI-Bench、PhysicianBench 等)只在单一成分上做强,而一个能同时覆盖这三类用例的专用 LLM 仍严重欠探索。更麻烦的是,因为医疗训练信号稀缺且敏感、跨任务的失败分布不均,"为某一种行为补数据"往往会提升该行为却悄悄削弱其他原本正确的行为——例如 HealthBench 的 Behavior correction 一轮虽然总分从 0.503 升到 0.601,但在子集上 Professional 掉了 0.252、Hard 掉了 0.508,最终被迫回退。
本文的目标是本文的具体目标是构建一个能同时服务"患者沟通、临床推理、医疗智能体"三类用例的医疗专用万亿参数模型 Cura 1T,并以 Kimi-K2.6 为基座、用 LoRA 适配器进行后训练。作者不仅要在六类医疗基准面板(MedAgentBench、HealthBench Professional/Hard、MedXpertQA 文本/多模态、AgentClinic)上全面超越基座 Kimi-K2.6,还要与 Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro 等前沿模型竞争,并证明这种聚焦医疗的训练没有明显损害通用推理与智能体能力。更深层的目标是把"医疗专精"重新定义为一个可重复的、以数据混合为搜索对象的后训练流程,而非某条一次性提示或某份医学数据集。
与已有工作不同的是,现有自我进化与自动研究工作搜索的是提示、程序、技能、实验树或超参(OPRO、DSPy、TextGrad、autoresearch、AI Scientist、AlphaEvolve),而医疗后训练的真正瓶颈既不是现成的基准数据集,也不是训练算法或超参,而是"稀缺且分布不均的领域数据"。Cura 的独特切入角度是:保留这些闭环系统的测量纪律,但把搜索对象换成"后训练数据混合"——让智能体读带评分的失败轨迹、归类失败模式、按模式触发不同的数据合成技能(推理修正、知识注入、行为校准、保留锚),再用验证门(格式/安全/PII/去重)筛选候选行。这把"医疗专精"从模型训练问题转化为数据构造问题,并解释了为什么针对不同基准要换不同数据动作。
核心方法
Cura 1T 的整体思路可以用一句话概括:用一个人类把关的智能体闭环去反复"训练—评估—诊断失败—修数据",把数据混合当成主要的搜索对象。模型在 Kimi-K2.6 上用秩 $r=32$ 的 LoRA 适配器做后训练,支持 256K 上下文窗口与原生文本+视觉输入。每一轮的内部训练栈是 SFT→RL→SDFT:SFT 作为低成本前置筛查,验证数据混合与超参是否成形、训练是否稳定、指标是否朝预期方向走;RL 按任务级奖励信号改进策略;SDFT 以自蒸馏目标 $L(\theta) = D_{KL}(\pi_\theta(\cdot | x) \| \pi(\cdot | x, c))$ 收尾,把更新锚定在模型自身能产生的轨迹上,避免长医疗推理链被离策略 CoT 破坏。不同能力回路(MedAgentBench/HealthBench/MedXpertQA/AgentClinic)各自独立跑,最终 Cura 1T 从各回路饱和后累积的 consolidated mixture 训练得到。
核心创新在于"数据配方即搜索对象"。与以往自我进化系统搜索提示、代码或超参不同,Cura 的训练智能体只做一件事:读一段带评分的失败轨迹,判断缺的是哪类能力,再调用对应的合成技能产出针对性数据。这背后是一个对医疗后训练的关键观察——不同基准失败方式完全不同:HealthBench 多为漏评分要点(需行为校准)、MedXpertQA 是推理模式失败与知识缺失混杂(需知识注入+保留)、MedAgentBench 是脆性 FHIR 写入(需工具轨迹)、AgentClinic 是过早诊断(需任务特定的交互轨迹)。因此 refinement 步骤必须先归类失败再合成数据,而不是给一个泛化的"医学数据"更新。这种"分类后定向修复"加上"保留锚防遗忘"的设计,是 Cura 与一刀切式医学微调的本质区别。
方法步骤详情
自我进化循环分五步。Plan:智能体在人类引导下定义目标行为、选定基准与指标、设计数据配方、提出候选超参,产出训练规格并经人类 plan 审批。Train:在轻量栈上跑 LoRA 适配器,先用 SFT 筛查混合与超参,通过后跑 RL 用奖励信号改进策略,最后用 SDFT 以 KL 目标 $L(\theta)=D_{KL}(\pi_\theta(\cdot|x)\|\pi(\cdot|x,c))$ 巩固该轮。Evaluate:跑 harness 收集带评分轨迹与失败摘要。Refine:先做根因分析归类失败,再触发数据合成技能——Reasoning Correction 修正失败推理链并播种同类问题,Knowledge Injection 用检索文档补缺失临床知识并合成带显式推理的闭卷 QA,Behavior Calibration 合成表达期望差距的 rubric,Retention Anchor 加已掌握能力样本防遗忘,Other 处理工作流类失败;修正行与保留锚经 Data Mixture Curation 去重、设上限、重加权,再过 Validation Gates(格式/安全/PII/去重/覆盖)。Review:人类对 refinement 与候选模型把关,作 keep/revert/refine/deploy,保留轮成下一轮继续点。最终 Cura 1T 从所有保留轮累积的 consolidated mixture 训练得到,最终超参为 SFT→RL→SDFT、基座 Kimi-K2.6、LoRA rank 32、学习率 $3\times10^{-4}$ 线性衰减、batch 128、序列上限 256K、6 epoch 带 early stopping。
技术新颖性
技术新颖性有五点。其一,把搜索对象从提示/代码/超参转向数据混合,让"医疗专精"成为可重复的数据构造流程。其二,引入一组面向失败模式的可复用合成技能(推理修正/知识注入/行为校准/保留锚/Other/混合策划),既能定向修复又能保留旧能力,这解释了为什么 HealthBench 的 Behavior correction 被回退而 Clean behavior mix 被保留。其三,SFT→RL→SDFT 三步栈把 SDFT 当作"保住原生推理行为"的巩固器,避免长医疗推理链被离策略 CoT 损伤。其四,四个基准各自独立回路再 consolidated,使交叉基准巩固成为可能——Cura 1T 在 HealthBench Hard 达到 0.368 接近 HealthBench 专属轮,正是累积的体现。其五,对 harness 的工程化适配(AgentClinic 改为 order_test/submit_diagnosis 双工具、MedAgentBench 暴露 fhir_get/fhir_post/finish 三操作)既严谨又能让"脆性失败"的根因更可定位。
实验结果
核心发现分四层。总体(Table 1):相对 Kimi-K2.6,Cura 1T 在 MedAgentBench 0.847→0.940($+0.093$)、HealthBench Professional 0.503→0.662($+0.159$)、Hard 0.222→0.368($+0.146$)、MedXpertQA 0.569→0.655($+0.086$)、AgentClinic 0.754→0.796($+0.042$),六个面板五个第一、仅 MedXpertQA 多模态第二。MedAgentBench(Table 3):基座 0.883,经 Tool-use 0.943、Tool-use+retention 0.967、Harness bug fix 0.973 三轮保留后 consolidated 发布 0.940,强于 Claude Opus 4.8(0.937)、Gemini 3.1 Pro(0.913)、GPT-5.5(0.894)。HealthBench(Table 4):Behavior correction 因子集退化(Prof. $-0.252$、Hard $-0.508$)被回退,Clean behavior mix 提到 Prof. 0.634/Hard 0.372,consolidated 拿到最强 Prof. 0.662、Hard 0.368。MedXpertQA(Table 5):纯推理修正两轮被回退(0.541/0.545),Knowledge injection+retention 0.603、Mixture refinement 0.636,consolidated 0.655(文本 0.600、多模态 0.722),优于 Claude Opus 4.8 的 0.628、仅次于 GPT-5.5 的 0.675。AgentClinic(Table 6):经 Interactive trajectory+retention 升到 0.807,consolidated 0.796,NEJM 0.800 同 harness 下最佳,远超 GPT-5.5 的 0.684。域外(AIME、GPQA-Diamond、$\tau^2$-Bench)与前沿持平,$\tau^2$-retail/telecom 超过已公开报告的模型,证明医疗专精未明显削弱通用能力。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MedAgentBench EHR 工具任务 | 任务成功率 (task success, FHIR 合规) | Cura 1T consolidated 0.940(开发路径最高 0.973) | Kimi-K2.6 0.883;Claude Opus 4.8 0.937;Gemini 3.1 Pro 0.913;GPT-5.5 0.894 | 相对基座 +0.093(开发路径 +0.090 至 0.973),并超过最强前沿参考 Claude Opus 4.8 |
| HealthBench Professional 开放式临床回答 | 医生 rubric 评分 (T=1.0) | Cura 1T 0.662 | Kimi-K2.6 0.503 | +0.159,为该面板最强分 |
| HealthBench Hard 开放式临床回答 | 医生 rubric 评分 (T=1.0) | Cura 1T 0.368 | Kimi-K2.6 0.222 | +0.146 |
| MedXpertQA 专家医学问答(文本+多模态) | exact-letter pass@1 (T=1.0) | Cura 1T 总体 0.655(文本 0.600、多模态 0.722) | Kimi-K2.6 0.569;Claude Opus 4.8 0.628;GPT-5.5 0.675 | +0.086 优于基座与 Claude Opus 4.8,总体仅次于 GPT-5.5(多模态排第二) |
| AgentClinic 多轮交互诊断 | 诊断 pass@1(工具原生 harness, T=1.0) | Cura 1T 总体 0.796(NEJM 0.800) | Kimi-K2.6 0.754;Claude Opus 4.8 0.794;GPT-5.5 0.684 | +0.042,NEJM 子集同 harness 下最佳,远超 GPT-5.5 |
局限与改进
作者明确承认三类局限。其一,受算力、数据与资源约束,结果受限于当前训练机制(仅 LoRA rank 32、6 epoch、256K 序列上限),未来应拓宽临床行为覆盖、瞄准长程智能体任务、并在资源允许时探索全参数更新。其二,Cura 1T 是研究模型而非医疗服务,不能替代临床医生;基准上的强分只证明在固定 harness 下的窄能力,不构成无监督临床使用的安全保证。其三,作者也承认部分能力仍有提升空间——MedXpertQA 多模态仍排第二(0.722 低于 GPT-5.5 的 0.771)。从我的观察看还有更多隐藏局限:所有医疗基准的 harness 都被作者重新工程化(AgentClinic 改为双工具、MedAgentBench 暴露三操作),这些适配本身会影响与其他系统报告分数的可比性;自我进化循环中的人类把关(plan 审批与 keep/revert 决策)高度依赖专家时间,论文未量化需要多少人工;数据合成技能依赖前沿外部模型,存在被合成数据污染与对前沿模型依赖的双向耦合风险。
独立分析的弱点
独立分析看,Cura 至少存在四个可改进的弱点。第一是评测公平性:四个医疗基准都被作者重新 harness 化,这种"先改 harness 再报分"的做法会让跨论文比较失真,改进方向是同时报告原始协议与改造协议下的分数,或公开 harness 让第三方复测。第二是人工成本不透明:论文强调"human-gated",但没给出每个回路需要多少专家人时,plan 审批与 keep/revert 决策会成为规模化瓶颈,改进方向是引入更自动化的失败归类与离线回归测试集,把人类只留在高风险节点。第三是合成数据的闭环风险:推理修正、知识注入都依赖前沿外部模型生成教师轨迹,存在模型族同质化与合成错误被固化(如附录 A.3.3 健康码 ICD-10 退化为 M54.3 的细节),改进方向是对合成数据做对抗性交叉验证、加入来源溯源与不可验证条目剔除。第四是评测覆盖窄:六个面板集中于英语临床推理与 FHIR 工具,缺少非英语、儿科/罕见病、长程真实 EHR 工作流,改进方向是引入 CHI-Bench、PhysicianBench、HealthAgentBench 等长程基准与多语言评测。
未来方向
作者提出的未来方向有三:拓宽临床行为覆盖、瞄准长程智能体工作、在资源允许时探索全参数更新。基于本成果还可延伸出若干方向。其一,把"数据混合即搜索对象"的范式推广到法律、金融等其他"信号稀缺且失败分布不均"的领域,验证该闭环是否具有普适性。其二,将自我进化循环与更强的过程级奖励(process reward)结合,让 RL 阶段不再只依赖终态成功,而是奖励中间临床动作(如 order_test 的判别力)。其三,把保留锚形式化为一个显式的弹性权重巩固(EWC)式正则或课程调度,让"防遗忘"从启发式升级为可证明的约束。其四,研究 consolidated mixture 的可解释性——不同回路的保留数据之间是否存在冲突、合并时如何仲裁,是一个值得深挖的数据级问题。其五,结合连续照护系统(如 Baichuan-M4 的患者记忆、动作约束、证据检索)做长 horizon 真实部署评测,检验 Cura 在动态患者状态下的稳定性。
复现评估
复现评估中等偏难。有利面:模型权重以 actava.ai/cura 开放、GitHub(actava-ai/Cura)与文档可访问,最终训练超参完整公开(SFT→RL→SDFT、基座 Kimi-K2.6、LoRA rank 32、学习率 $3\times10^{-4}$ 线性衰减、batch 128、序列上限 256K、6 epoch 带 early stopping),训练栈基于 Tinker 的 LoRA 适配器训练,相对轻量。不利面明显:自我进化核心——数据合成技能依赖未公开的前沿外部模型作教师,合成数据、保留锚样本、各回路混合比例均未随文发布;四个基准的 harness 改造(AgentClinic 的 order_test/submit_diagnosis、MedAgentBench 的 fhir_get/fhir_post/finish)需运行真实 FHIR 服务器与病人模拟器,工程门槛高;"human-gated"环节需医学专家参与 plan 审批与 keep/revert 决策,非实验室难以复制。因此代码/权重层面可部分复现,但完整复现自我进化过程需重建数据合成流水线与人工把关流程,难度较大。
论文图表
图把域外基准分两组:Reasoning 含 AIME 2025/2026、GPQA-Diamond;Agentic 含 $\tau^2$-Bench 的 airline/retail/telecom。Cura 1T 在每个推理基准与 $\tau^2$-airline 上与前沿对比组持平,在 $\tau^2$-retail、$\tau^2$-telecom 上超过已公开报告分数的模型。
这张图回答了"医疗专精会不会损害通用能力"这一关键质疑,是证明数据混合搜索没有"塌掉"基座能力的重要证据,也是局限与安全性讨论的支撑。