EMBL AI 图书管理员:面向 AI 智能体的生命科学知识层 EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
为生命科学 AI 智能体提供自然语言文献检索的知识层。
前置知识
RAG(检索增强生成)
Retrieval-Augmented Generation:先从外部知识库检索相关文档片段,再拼入提示词让 LLM 生成答案。相比纯参数化生成,它把『记忆』外置到可更新的语料库,减少幻觉并支持引用溯源。
LIBRARIAN 本质是一个为生命科学文献优化的检索层,理解 RAG 范式才能看懂它在 agent 流水线里扮演的角色。
BM25
Best Matching 25 是经典的词频-逆文档频率类打分函数,给定查询 $q$ 和文档 $d$,按词项频率、文档长度归一化和 IDF 加权求和排序。它无需训练、可解释、可直接利用倒排索引。本文用它在段落级对全文做精排。
论文核心论点之一是『强 LLM 驱动的 BM25 关键词检索可逼近甚至超越稠密向量检索』,BM25 是理解整个流水线的基础。
Europe PMC
由 EMBL-EBI 维护的开放生命科学文献搜索引擎,索引约 11.9M 篇全文、40.7M 条 PubMed 摘要和 1.2M 条预印本,医学健康覆盖范围超过 PubMed。它提供结构化字段语法(如 GENE_PROTEIN、TITLE_ABS、PUB_YEAR、KW)和 JATS XML 全文接口。
LIBRARIAN 不自建索引,而是直接调用 Europe PMC 的实时检索服务,理解这个基础设施才能看懂它『无索引、纯编排』的设计。
稠密检索 vs 词法检索
稠密检索(dense retrieval)把段落和查询编码为向量,用近邻查找匹配;词法检索(lexical retrieval,如 BM25)基于词项精确匹配。前者语义强但昂贵、不可解释、丢失结构化字段;后者便宜可审计。
论文的关键差异化正是放弃稠密向量库、改用 LLM 编排词法检索,这是它与 OpenScholar、PaperQA2 等系统最本质的区别。
Citation F1
引用精确率和召回率的调和平均:召回衡量每个值得引用的论断是否都被恰当参考文献支持,精确率衡量每条引文是否相关且必要。是 ScholarQA-Bench 评估多文档综述质量的核心指标,用 AutoAIS 模型自动评分。
论文在 ScholarQA-Bench 上把 Citation F1 提升超过 16 个点,这是其最重要的定量结论,需要理解该指标才知道提升的意义。
研究动机
生命科学智能体(如 OpenScholar、AI co-scientist、Biomni、Kosmos)已深度嵌入科研工作流,但它们都依赖已发表文献作为推理依据,而文献正以指数级增长,信息过载严重。问题在于 Europe PMC 这类被广泛使用的检索接口是为人类读者而非智能体设计的:输入侧要求关键词和复杂布尔语法,而生物实体存在大量别名(如基因符号 TP53、蛋白名 p53、疾病缩写 ALS),单一查询极易漏检,需多次互补检索才能保证召回;输出侧返回的是按词频排序的整篇文章,仅有少量内容与问题相关。对于固定上下文窗口的 LLM,整篇论文会耗尽大量 token 预算,迫使每个 agent 各自学会查询语法、发起多次搜索并通读全文才能定位所需证据。
本文的目标是本文要给生命科学智能体提供一个即插即用的『知识层』:agent 用自然语言提问,直接拿到一段紧凑、可引用的证据片段——包含原文 span、论文元数据,以及生成该证据的 Europe PMC 查询,使检索过程透明可审计。可量化的目标是:在四类互补基准上让各类 agent(文献综述、声明核验、开放问答、生物学工作流任务)都能稳定提升,例如 ScholarQA-Bench 的 Citation F1 提升 16 个点以上、ProClaim 与专家共识的 Agreement 提升 5 个点、LitQA2 准确率提升约 8 个点。同时坚持不训练专用模型、不维护稠密向量索引,让任何 LLM 都能即插即用。
与已有工作不同的是,已有工作要么用稠密向量库(OpenScholar 数据存储约 744 GB、PaperQA2、SciRAG),要么为检索训练专门模型,但稠密索引昂贵、可解释性差、且把结构化元数据压平后无法直接按 gene/protein/organism 字段过滤。本文抓住两个被忽视的点:一是 Europe PMC 自带的高质量、可审计的字段化词法检索能力本身已足够强,关键在于让 LLM 学会编排它而非另起炉灶;二是随着 LLM 推理能力增强,稠密检索相对 BM25 的优势正在收窄(PI-SERINI、SAGE 等已证实)。于是它走『无自建索引 + 单一 LLM 编排实时检索』的路线,把语义理解能力完全外置到通用大模型,从而同时获得稠密检索的自然语言接口和词法检索的可审计、低成本优势。
核心方法
直觉上,LIBRARIAN 像一个『数字生命科学馆员』:你用大白话提问,它替你把问题拆成几条互补的关键词/字段化检索式,去 Europe PMC 实时检索,再像审稿人一样把检索回来的论文切成段落、按相关性排序,最终挑出能直接回答你问题的句子并附上出处。技术路线是一条三阶段流水线:召回导向的子查询生成 → 论文级检索与段落精排 → 过滤、重排与证据抽取。整个过程由单个 LLM(实验用 GLM-5,约 700B 参数)编排,不训练任何模型、不构建任何向量库,纯靠 prompt 驱动现成 LLM 和 Europe PMC 的实时检索服务。系统是模型无关的:换更强的 LLM 即可继承收益。流水线从『召回优先』渐进到『精度优先』,先靠多子查询避免漏检,再靠交叉编码挑出真正相关的证据。
核心创新是『用单一 LLM 编排现成结构化检索,而非构建稠密向量索引』。与 OpenScholar、PaperQA2、SciRAG 的本质区别在于:那些系统都各自维护一份庞大的稠密向量库(数百 GB 嵌入),而 LIBRARIAN 不持有任何索引——它把 Europe PMC 当作知识来源,自己只做编排。第二个关键点是『召回优先 → 精度优先』的两段式:Stage 1 用 LLM 生成多条互补子查询(默认 $N=7$ 条)以覆盖生物实体的多别名;Stage 3 用一次 LLM 调用对候选句子做『过滤+重排+证据抽取』三合一的交叉编码,且模型只输出句子 ID 而非重写文本,大幅降低解码 token 数、压缩延迟与成本。每条证据还保留生成它的查询语句,使整个检索过程透明、可被 agent 或用户审计,这是稠密近邻检索做不到的。
方法步骤详情
Stage 1(子查询生成):单个 LLM 把自然语言问题 $q$ 转成 JSON 形式的子查询集合 $Q=f_{\text{plan}}(q)=\{q_1,\dots,q_N\}$,默认 $N=7$,每条是面向 Europe PMC 字段(如 TITLE_ABS、GENE_PROTEIN、KW、PUB_YEAR)的关键词或字段化查询;每条先经确定性语法校验,非法者被丢弃,仅合法子查询被执行,planner 解析失败会降温重试再回退到原始问题。Stage 2(论文检索与段落排序):合法子查询并行提交给 Europe PMC 实时检索,每条最多返回 $P=50$ 条记录,按 PMID→DOI→title 三级去重后至多 $M=N\times P$ 条候选;拉取 JATS XML 全文,剔除参考文献等元数据,把正文段落(含 section 标题)用 BM25 按原问题排序,每篇选 $k=16$ 段(必含摘要)进入下一步。Stage 3(过滤/重排/抽取):候选段落用 pySBD 切句并加唯一 ID,单次 LLM 调用(abstract 批 50 篇、full-text 批 3 篇)对每句与原问题做交叉编码评估,输出排序后的句子 ID 列表,同时完成过滤、重排和证据抽取;最后把选中句子按来源论文聚簇并配元数据,返回约 250 词、来自至多 30 篇全文加 30 篇摘要论文的可引用证据集合 $E$。
技术新颖性
新颖性有三层:一是架构上放弃稠密向量库、复用 Europe PMC 实时字段化检索,省去数百 GB 索引与持续重索引成本,也保留了结构化字段查询能力;二是编排策略上把『多别名召回』显式建模为 LLM 生成的互补子查询(强制 30-40% 为纯文本查询、禁止单条 3 个以上 AND),这比单纯布尔检索或稠密检索更贴合生命科学实体多别名的特性;三是 Stage 3 的『过滤+重排+证据抽取三合一 + 只输出 ID』设计,让单次 LLM 调用同时承担三种功能且解码极少 token,区别于传统多阶段 reranker。与 SIRA、SAGE、PI-SERINI 等近期『LLM 控制词法检索』工作相比,本文首次把它扩展到生物医学文献,并暴露 Europe PMC 的结构化字段语法而非通用网页。
实验结果
四个基准上一致提升。ScholarQA-Bench(表 1):Synthesis Agent(GLM-5)+ LIBRARIAN 的 Citation F1 在 Bio 达 73.8、Neu 达 79.4、Multi 达 76.2,分别比同 agent 配 BM25-OSDS 提升 +6.8、+10.9,比 OpenScholar-70B 提升 +17.9(55.9→73.8)和 +16.3;Multi 的 LLM 评分从 4.10 升到 4.90(约 +20%),而单纯换更大模型在该指标上无效,说明提升来自更好的证据。ProClaim-Eval(表 2):单 prompt 的 Verifier Agent 把平均 Agreement 从 0.51 提到 0.66(+15 个点),完整 ProClaim 从 0.75 提到 0.80(+5 个点),SIGNOR 0.78、ConnectomeDB 0.81,远超 OpenScholar 基线 0.43,说明 LIBRARIAN 已完成大部分重活。开放形式 LitQA2(表 3):同一 GPT-5.4 主干下,LIBRARIAN 把 Coverage 92.3→95.6、Precision 76.2→82.6、Accuracy 70.3→78.9(+8.6),对比纯参数化的 17.6 准确率可见检索 grounding 的关键作用。LAB-Bench(表 4):对 GPT-5.4,macro 准确率从 50.5 提到 54.6(+4.2),SeqQA 涨幅最大 52.5→63.8(+11.3,覆盖率 85.0→98.8),Cloning +3.1、ProtocolQA +3.7;但 DbQA 微降 -1.3,说明对类数据库查表任务帮助有限。对较弱的 GPT-4o,LIBRARIAN 以覆盖率换精确率(macro 准确率持平 35.2→35.3),起校准作用。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ScholarQA-Bench 多文档综述(Bio 拆分) | Citation F1 | 73.8(Synthesis Agent GLM-5 + LIBRARIAN) | 55.9(OpenScholar-70B)/ 67.0(同 agent + BM25-OSDS) | +17.9 / +6.8 |
| ScholarQA-Bench(Neu 拆分) | Citation F1 | 79.4 | 63.1(OpenScholar-70B)/ 68.5(+BM25-OSDS) | +16.3 / +10.9 |
| ProClaim-Eval 声明核验 | 专家共识 Agreement(平均) | 0.80(ProClaim + LIBRARIAN) | 0.75(ProClaim + PubMed/S2)/ 0.43(OpenScholar) | +5 个点 / +37 个点 |
| 开放形式 LitQA2 事实问答 | Accuracy(GPT-5.4 主干) | 78.9(+ LIBRARIAN) | 70.3(Web-Search)/ 17.6(Parametric) | +8.6 / +61.3 |
| LAB-Bench 序列操作(SeqQA) | Accuracy(GPT-5.4) | 63.8(+ LIBRARIAN) | 52.5(Base) | +11.3 |
局限与改进
作者承认三点:(1) 知识覆盖受限于 Europe PMC,部分付费墙论文全文不可用;(2) 不支持多跳推理——只做单轮检索(虽有 $N=7$ 互补子查询提升召回),多跳串联留给下游 agent;(3) 忽略图表、补充材料、非文本内容,表格仅按文本处理,对应 FigQA/TableQA/SuppQA 任务被排除在外。我的额外观察:ScholarQA-Bench 上 OSDS 行是固定语料的纯 BM25(无子查询规划、无 relevance filter),Europe PMC 行同时换了语料和检索策略,所以 +6.8/+10.9 的提升混入了语料差异,不能完全归因于 LIBRARIAN 流水线本身;LAB-Bench 上 LIBRARIAN 行混入了参数化回退(检索为空时退回裸 prompt),并非纯 grounding 结果;所有实验仅用 GLM-5 作编排模型,未做编排模型规模的消融,无法判断编排模型本身的能力对 LIBRARIAN 性能的边际贡献。
独立分析的弱点
第一,单轮检索限制多跳能力:对于『A 调控 B、B 影响 C,所以 A 与 C 的关系』这类需链式推理的问题,单轮互补子查询可能无法串联,改进方向是让 LIBRARIAN 自主判断证据是否充分、决定是否多轮迭代检索(作者已列为 future work)。第二,强依赖 Europe PMC 索引质量与实时状态:检索结果随查询时刻索引状态变化,逐位复现困难,可考虑缓存+版本化语料快照。第三,编排 LLM 成本未量化:GLM-5(约 700B)虽自托管,但 Stage 1 与 Stage 3 多次调用对中小团队不友好,可探索用小模型做子查询生成、保留大模型做精细过滤的混合编排以降本。第四,仅文本模态:图表与补充材料是生命科学论文的重要证据来源,对 FigQA/SuppQA 类任务无法覆盖,需多模态扩展。第五,DbQA 类任务几乎无收益甚至微降,说明对结构化数据库查询场景应另接 UniProt/ChEMBL/OpenTargets 等结构化知识库而非文献层。
未来方向
作者明确计划:扩展知识源到 OpenTargets、UniProt、ChEMBL 等 EMBL 资源;支持多轮迭代检索(当检索证据不完整时自主决定继续搜索);引入多模态处理图表与补充材料。基于成果可延伸的方向:(1) 把 LIBRARIAN 接入更多生命科学 agent(Biomni、TxAgent、AI co-scientist)验证通用增益的边界与上限;(2) 探索编排模型规模与系统性能的标度律,寻找最小可用编排模型,使方案对算力受限团队也可用;(3) 把『检索可审计性』(每条证据保留生成查询)做成 agent 可自我纠错的反馈回路;(4) 与 MCP(Model Context Protocol)集成,作为标准化知识服务器供任意 agent 调用,呼应 BioContextAI/MCPmed 生态。
复现评估
可复现性较高。代码、prompt、运行配置与评估流水线全部开源(github.com/petroni-lab/librarian),关键参数($N=7$、$P=50$、$k=16$、batch size、各阶段温度、synthesis top-k=60、证据 span 约 250 词)在表 5 完整列出,Stage 1/3 与各基准的 prompt 在附录 C/D 逐字给出,ScholarQA Multi 子集、LitQA2 的 91 题子集 ID 也已发布以便精确重建。挑战在于:编排模型 GLM-5(约 700B)需 NVIDIA DGX B200 自托管,中小团队需租用大显存 GPU 或换用 API 模型;Europe PMC 是实时服务,结果随索引状态变化,难做到逐位复现;LitQA2 仅用 91 题(全文可用子集)、LAB-Bench 仅用公开子集(约 80%),需注意与原 benchmark 数字的口径差异。综合看复现难度中等,主要门槛在编排模型算力。
论文图表