← 返回 2026-07-20

RAGU:配备紧凑领域适配大模型的多步 GraphRAG 引擎 RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin 📅 2026-07-13 👍 143 2026-07-25 18:30
GraphRAG 图社区检测 检索增强生成 知识图谱 紧凑语言模型

多步 GraphRAG 引擎配 7B 提取模型,分离抽取与整合,证据召回率达 84%

前置知识

GraphRAG(图检索增强生成)

GraphRAG 是检索增强生成(RAG)的一个分支。传统 RAG 把文档切成平坦的文本块,用向量相似度检索,无法捕捉跨文档的实体关联。GraphRAG 则先用大模型从文档中抽取实体和关系,构建一张知识图谱,检索时通过图遍历(如个性化 PageRank、社区汇总)来组织上下文,从而回答需要多跳推理、全局综合的问题。代表系统有微软 GraphRAG、LightRAG、HippoRAG 2。其核心权衡是:图谱质量决定回答质量,但建图开销大、工程实现脆弱。

RAGU 是一个 GraphRAG 引擎,其全部创新(多步建图、社区检测、紧凑提取模型)都围绕知识图谱的构建与检索展开,不理解 GraphRAG 的范式就无法理解它要解决的问题。

NEREL 实体关系模式与信息抽取

NEREL 是俄语嵌套命名实体、关系与事件标注语料,定义了 29 种实体类型(如 PERSON、ORGANIZATION、PRODUCT、DATE)和 49 种关系类型(如 WORKS_AS、PARENT_OF、DATE_OF_DEATH)。信息抽取(IE)任务分两步:命名实体识别(NER,识别实体的边界与类型)和关系抽取(RE,判断实体对之间的关系及类型)。本文用 NEREL 作为受控模式,要求两阶段抽取:先抽实体并验证类型,再把实体名作为约束喂给关系抽取器,确保每条关系的源/目标实体都匹配已验证实体。

RAGU 的核心卖点是类型化的两阶段抽取(实体先于关系),这是它与 LightRAG 等单遍自由抽取系统的本质区别,也是 Meno-Lite-0.1 微调的目标技能。

Leiden 社区检测算法

Leiden 算法是一种图社区检测方法,通过优化模块度(modularity)将图中紧密相连的节点划分为社区。相比简单的聚类,它能保证每个社区内部连接良好、社区间连接稀疏,且具有理论上的连通性保证。层次化 Leiden 进一步构建多分辨率社区树。在 GraphRAG 中,社区用来做全局检索:先为每个社区生成结构化摘要(标题、概述、发现),回答宽泛问题时直接汇总相关社区摘要,而不必遍历所有节点。

Leiden 社区检测是 RAGU 六步流水线的关键一步,决定了 GlobalSearch 引擎和社区摘要的质量,也是论文反复强调整合(consolidation)发生在社区检测之前的依据。

语言技能 vs 世界知识的缩放律

本文提出一个核心假设:世界知识(事实记忆)随参数量近乎线性增长,而语言技能(理解、抽取、基于上下文推理)随模型增大增长缓慢。证据来自 Qwen2.5-Instruct 家族:在世界知识问答 CheGeKa 上 F1 从 0.5B 到 72B 增长 21.1 倍(对数线性斜率 0.65),而在上下文已含全部事实的 MultiQ 上仅增长 4 倍(斜率 0.26)。由此推论:RAG 流水线内部的 LLM 做的是抽取/总结/推理等语言任务,因此一个面向技能优化的紧凑模型即可胜任,不必用 GPT-4 级别的大模型。

这个假设是整篇论文的理论基石,直接支撑了用一个 7B 模型替代 32B 模型做抽取的设计决策,也解释了为什么模型尺寸对端到端 QA 质量影响极小。

vLLM 高效推理与 DBSCAN 去重

vLLM 是面向大模型推理的高吞吐服务框架,核心是 PagedAttention 显存管理,让 7B 模型能在单张消费级 GPU 上高效部署。DBSCAN 是基于密度的聚类算法,能把空间相近的点聚成簇、同时识别噪声点。RAGU 在整合阶段用 DBSCAN 对重复提及的实体做聚类,再用 LLM 把多个描述合并成规范化摘要,从而在建图前降低实体噪声。两者结合实现了成本与质量的平衡:紧凑模型靠 vLLM 降本,靠 DBSCAN+LLM 摘要去噪。

vLLM 是单卡部署的前提,DBSCAN 去重是整合阶段的具体技术,两者共同支撑了 RAGU 实测约 $0.001/文档、远低于商业 API 的成本优势。

研究动机

现有 GraphRAG 系统在落地时面临三重障碍。障碍一是单遍抽取:微软 GraphRAG、LightRAG 等把知识图谱构建当作一次 LLM 抽取完成,产生大量噪声、重复的实体,没有任何跨文档块的整合机制,导致图结构稀疏、检索脆弱。障碍二是对昂贵 LLM 的依赖:因为抽取质量直接决定图质量,从业者默认调用 GPT-4 级别的大模型,单文档建图成本高达约 $0.10,10 万文档约需 $10,000,把高质量 GraphRAG 锁死在大厂实验室。障碍三是工程成熟度不足:很多开源框架安装失败、依赖硬绑定特定 CUDA/PyTorch 版本,甚至对原始 LLM 输出直接调用 eval()(如 HippoRAG 2 在 openie_openai.py:36,88),构成代码注入面;还用 assert False(HippoRAG.py:216)做控制流,在 python -O 下静默失效。三重障碍叠加,使得学术上更强的检索算法反而难以在生产中稳定运行。

本文的目标是本文要同时解决这三重障碍,交付两个开源工件。第一是 Meno-Lite-0.1,一个 7B 的紧凑提取模型,从 RuadaptQwen2.5-7B-Lite-Beta 出发,经 1.3B token 继续预训练加 50M token 监督微调,在知识图谱构建任务上以 12.5% 的相对优势超越 Qwen2.5-32B,并能在单张消费级 GPU 上经 vLLM 部署。第二是 RAGU,一个模块化、多步的 GraphRAG 引擎,通过把抽取与整合解耦——两阶段类型化抽取、DBSCAN 支撑的去重、LLM 摘要、Leiden 社区检测——得到更干净、更连通的知识图谱,并能 pip install graph_ragu 一键安装、单卡运行。整体目标是让高质量 GraphRAG 以低两个数量级的成本走出实验室。

与已有工作不同的是,本文的独特切入角度是把两类工程问题统一到同一个理论洞察下。论文先提出语言/世界知识假设,用 CheGeKa(世界知识)F1 增长 21.1 倍 vs MultiQ(语言技能)仅 4 倍的实证证据,论证 RAG 流水线内的 LLM 需要的是可随小模型获得的语言技能而非需要大模型的世界知识;据此训练一个技能取向的 7B 提取器,再用一个显式整合阶段弥补小模型单遍抽取的噪声。这与既有工作形成本质区别:微软 GraphRAG 依赖单遍大模型抽取、无整合;LightRAG 单遍自由抽取;HippoRAG 2 个性化 PageRank 擅长链式但工程上不安全;Wikontic 侧重本体对齐。RAGU 同时在语义(多步整合)和工程(Pydantic 校验、可插拔存储、约 374 个测试)上发力。

核心方法

RAGU 的整体思路是先承认事实——大模型在 RAG 内部做的不是事实回忆,而是理解、抽取、基于上下文推理这类语言技能,而这些技能随模型增大增长缓慢(实证斜率仅 0.26)。因此一个紧凑、技能取向的 7B 模型就够了,关键是把语言技能练强、再用一个显式整合阶段消除单遍抽取的噪声。技术路线分两条:模型侧训练 Meno-Lite-0.1,引擎侧构建六步可配置流水线。整条流水线把实体抽取与关系抽取分到两个阶段,中间用 DBSCAN+LLM 摘要做整合,最后做层次化 Leiden 社区检测并生成结构化社区报告。所有 LLM 输出经 Pydantic v2 校验,所有工件持久化到三层可插拔存储(图/键值/向量),约 374 个自动化测试加确定性 mock LLM 服务器保证无需 API 密钥即可跑 CI。

核心创新点是把抽取与整合显式解耦,并用一个面向语言技能的紧凑模型做提取器。与已有方法的本质区别有三层。其一,单遍系统(LightRAG、微软 GraphRAG)一次性让 LLM 自由吐出实体和关系,重复噪声直接进入社区检测;RAGU 在两阶段类型化抽取(先实体、后关系,约束在 NEREL 的 29 类实体/49 类关系上)之后再做 DBSCAN 聚类与 LLM 摘要整合,让进社区检测的图更干净。其二,论文用 CheGeKa vs MultiQ 的缩放差距(21.1× vs 4×)论证 RAG 内 LLM 只需语言技能,据此训练 7B 的 Meno-Lite-0.1 替代 32B 模型,端到端 QA 质量仅波动 1–2 个百分点却把成本降两个数量级。其三,工程上用 Pydantic 校验替代 eval()、用可插拔三层存储替代硬编码 Parquet/SQLite,把学术系统改造成可测、可部署、可迁移的工程品。

方法步骤详情

流水线分六步。Step1 分块:提供固定重叠、嵌入切点、交叉编码器重排三种 chunker。Step2 两阶段抽取:Stage1 抽实体并在 NEREL 模式(29 实体类型、49 关系类型)下验证;Stage2 抽关系,强制每条关系的源/目标实体必须命中已验证实体名,消除实体-关系错配;两阶段可选注入 ICL 示例(语义/BM25/混合/随机)。Step3 整合:EntitySummarizer 按(名称,类型)分组,对重复提及用 DBSCAN 聚类再 LLM 摘要,RelationSummarizer 同理。Step4 层次化 Leiden 社区检测划分去重图。Step5 LLM 为每个社区生成结构化报告(标题、概述、发现)。Step6 可插拔模块(如 RemoveIsolatedNodes)可选精修。检索侧五个引擎:LocalSearch(实体扩展到关系与块)、GlobalSearch(社区摘要评级)、NaiveSearch、MixSearch(并行)、QueryPlanEngine(DAG 分解),均支持交叉编码器重排和 Qdrant 混合稠密+稀疏检索。模型侧 Meno-Lite-0.1 经 1.3B token 继续预训练加 50M token SFT,128K 上下文(passkey 0.98)、俄语分词效率比原生 Qwen2.5 高 47%(3.77 vs 2.57 字符/token)。

技术新颖性

技术新颖性体现在四个维度。模型维度,Meno-Lite-0.1 把训练算力投向语言技能而非事实记忆,在 IE 基准上以 7B 之身超越 32B 模型(调和均值 0.468 vs 0.416,相对优势 12.5%),主要由关系抽取 F1(0.347 vs 0.239)驱动,并用单卡 vLLM 部署,成本约 $0.001/文档,比商业 API 低约两个数量级。流水线维度,显式引入整合阶段(DBSCAN 去重+LLM 摘要),并证明整合位于社区检测之前才能产出更干净的图——这是 LightRAG 等单遍系统缺失的一环。工程维度,三层可插拔存储抽象(NetworkX→Neo4j、NanoVDB→Qdrant)让单机原型到生产栈的迁移只改两个构造参数;约 374 个测试加确定性 mock LLM 服务器让 CI 从美元级 API 调用降到秒级 CPU;Pydantic v2 校验彻底消除 eval() 代码注入面。评测维度,论文引入 verbose vs terse 两套答案生成协议,揭示 HippoRAG 2 在多跳 QA 上的优势很大程度上是答案格式伪影,这一方法论本身具有借鉴价值。

End-to-end indexing pipeline.
Figure 2: End-to-end indexing pipeline.
Knowledge graph built from the Ritchie passage.
Figure 4: Knowledge graph built from the Ritchie passage.

实验结果

核心发现分四组。第一,GraphRAG-Bench(医学)存在交叉点:事实级 HippoRAG 2 凭个性化 PageRank 领先(事实检索 AC 72.4 vs RAGU 54.2,Δ=−18.2pp);随复杂度上升差距收窄(复杂推理 −14.7pp、上下文摘要 −0.9pp 近持平);创意生成 RAGU 反超,AC 59.0 vs 56.9、忠实度 34.2 vs 26.6、覆盖度 57.4 vs 34.7。证据召回率 RAGU 全事实级最高达 84% vs 竞品 ≤76%,直接支撑整合假设。第二,多跳 QA(表2):verbose 下 HippoRAG 2 全面领先(BioASQ AC 74.1 vs 56.0);切 terse 后 BioASQ 上 RAGU 反超(72.9 vs 72.4),2Wiki 差距从 −19.3pp 收窄到 −5.5pp(58.0 vs 63.5),仅最难的 MuSiQue HippoRAG 2 仍以 54.4 vs 40.1 领先——说明其多跳优势很大程度是答案格式伪影。第三,IE 基准(表3):Meno-Lite-0.1(7B)调和均值 0.468 超 Qwen2.5-32B(0.416),由关系抽取 F1 0.347 vs 0.239 驱动。第四,成本(表8):MS-GraphRAG ~40k token/$0.10 每文档;RAGU ~8k token/$0.001,10 万文档约 $100 vs $10,000。消融(表7)显示模型尺寸 3B–14B 仅使 AC 波动 ≤1.5pp,证明整合阶段才是质量主因。

Multi-hop QA under two answer-generation protocols.
Table 2: Multi-hop QA under two answer-generation protocols.
IE benchmark (knowledge-graph construction).
Table 3: IE benchmark (knowledge-graph construction).
Engineering comparison between RAGU and HippoRAG 2.
Table 6: Engineering comparison between RAGU and HippoRAG 2.
GraphRAG-Bench Ablation Summary.
Table 7: GraphRAG-Bench Ablation Summary.
Approximate graph-construction (indexing) token volume and cost per document.
Table 8: Approximate graph-construction (indexing) token volume and cost per document.
Entities extracted from the Ritchie passage.
Table 4: Entities extracted from the Ritchie passage.
Relations extracted from the Ritchie passage (5 of 8 shown).
Table 5: Relations extracted from the Ritchie passage (5 of 8 shown).
Cross-over by task complexity on GraphRAG-Bench (Medical).
Figure 3: Cross-over by task complexity on GraphRAG-Bench (Medical).
查看结构化数据
任务指标本文基线提升
GraphRAG-Bench(医学)创意生成 Answer Correctness / Coverage AC 59.0,Coverage 57.4(Meno-Lite-0.1) HippoRAG 2:AC 56.9,Coverage 34.7 AC +2.1pp,Coverage +22.7pp
GraphRAG-Bench(医学)证据召回率 Evidence Recall(%) 84(四个事实级最高) 竞品 ≤76 召回率 +8pp 以上
知识图谱构建(IE 基准) 调和均值 HM 0.468(Meno-Lite-0.1,7B) Qwen2.5-32B:0.416 +12.5% 相对优势
多跳 QA(terse 协议,BioASQ) Answer Correctness 72.9 HippoRAG 2:72.4 +0.5pp 反超
建图成本(10 万文档) 美元/文档 约 $0.001(RAGU+Meno-Lite-0.1,~8k token) 约 $0.10(MS-GraphRAG,~40k token) 成本降约 100 倍

局限与改进

作者承认的局限有四。其一,缩放证据只来自单一模型家族(Qwen2.5)和少量任务,虽覆盖六个尺寸仍是有力假设而非普适定理。其二,Meno-Lite-0.1 用参数化事实回忆换取上下文接地,多跳推理在 32K token 后退化,不应作为独立知识库使用。其三,IE 基准存在分布重叠警告:Meno-Lite-0.1 的 SFT 用了 NEREL 的训练/验证集,而基准只用其测试集且指令措辞不同,重叠仅限标注模式与文本域,但残余优势无法完全排除。其四,默认 NetworkX 图后端(虽可插拔)无法扩展到百万节点级语料,大规模部署需专用图数据库适配器;最终图质量仍对提取 LLM 敏感,弱基座模型引入的结构噪声整合也无法完全修正。我自己的观察是:论文的 NEREL 模式根植于俄语新闻域,迁移到中文、英文或医疗/法律域时实体与关系类型需重新适配;Creative Generation 上虽然反超但绝对 AC 仍仅约 59,忠实度仅 34,离生产可用还有距离;消融只覆盖了 11 种配置,对 chunking 策略、社区检测分辨率等超参的敏感性未充分刻画。

独立分析的弱点

第一个弱点是评测域偏窄。主评测集中在 GraphRAG-Bench 医学子集、BioASQ、MuSiQue、2Wiki,且 NEREL 模式根植于俄语新闻域;中英文通用企业域、多语言混合场景下实体/关系类型需重新设计,社区检测质量也可能因图密度不同而波动。改进方向是构建跨域(法律、金融、客服)评测集并支持可插拔模式适配器。第二个弱点是 Creative Generation 虽反超但绝对质量偏低(AC 约 59、忠实度 34),广上下文检索虽召回更全,合成阶段仍依赖外部答案 LLM。改进方向是把摘要质量、引用回溯、事实一致性纳入检索-生成联合优化。第三个弱点是默认 NetworkX 后端不抗规模,社区检测在百万节点上成瓶颈。改进方向是把可插拔存储落到 Neo4j、Kùzu 等原生图库并研究分布式 Leiden。第四个弱点是提取 LLM 质量是天花板,整合只能降噪不能修结构缺陷;而 Meno-Lite-0.1 的 SFT 与 IE 测试集存在模式级重叠,残留优势难彻底排除。改进方向是用完全独立的标注集做 SFT,并发布隔离的训练/评测协议。

未来方向

作者明确提到的方向包括:扩展缩放假设到更多模型家族和任务以验证普适性;把默认 NetworkX 替换为可扩展的专用图数据库适配器以支持百万级语料;针对非俄语、非新闻域做模式适配,降低迁移成本。基于本文成果可延伸的方向包括:第一,把语言/世界知识假设推广到更多技能(如代码生成、工具调用、SQL 抽取),训练一系列技能取向的紧凑模型替代昂贵通用模型;第二,研究整合阶段的形式化——DBSCAN 聚类与 LLM 摘要的权衡、社区检测分辨率与检索精度的关系,建立可调质量-成本曲线;第三,把 verbose/terse 双协议评测方法论推广为 GraphRAG 评测的标配,避免答案格式伪影掩盖真实的检索质量;第四,探索检索引擎与生成器的联合训练,让 LocalSearch/GlobalSearch/MixSearch 的选择由查询类型自动决定;第五,把可插拔三层存储与确定性哈希 ID 治理范式迁移到其他知识图谱/RAG 框架,提升整个生态的工程成熟度。

复现评估

复现性是本文强项,工程投入明显。代码与模型均开源:RAGU 引擎 MIT 协议在 github.com/RaguTeam/RAGU,可 pip install graph_ragu 一键安装;Meno-Lite-0.1 权重 Apache 2.0 在 huggingface.co/bond005/meno-lite-0.1。仓库自带约 374 个自动化测试和确定性 mock LLM 服务器,CI 无需 API 密钥或 GPU 即可跑完整回归,这在开源 GraphRAG 框架中较罕见。每个域对象(实体、关系、块)携带确定性 MD5 标识可追溯到源文本。IE 基准已集成进公开 LM Evaluation Harness(nerel-bench 任务组)。附录给出 RAGU vs HippoRAG 2 逐行对照(eval() 在 openie_openai.py:36,88、assert False 在 HippoRAG.py:216),并钉死 HippoRAG 2 提交哈希 d437bfb1。难点在于:完整复现端到端实验需单张能跑 7B vLLM 的 GPU(约 $1/h),建图约 8k token/文档、约 2k tok/s;评测还需 gpt-4o-mini 做答案生成、gemini-3-flash-preview 做 LLM-as-judge,存在 API 成本与评测者-生成者重叠规避要求(论文已说明二者不同模型)。