检索增强生成范式的规模化研究:BM25 的大规模优势 BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
RAG 范式规模化研究:BM25 在大语料上反超 Agent 与图检索
前置知识
BM25 / 词法检索
BM25 是经典的基于词频和文档频率的倒排索引打分算法(Robertson & Zaragoza, 2009),通过精确词项匹配对文档排序,不需要任何 LLM 或神经网络参与构建。它把查询与文档的词项重叠度按饱和词频和逆文档频率加权求和,查询时只需一次索引查找,代价极低且几乎不随语料规模增长。
本文的核心结论正是 BM25 在大规模企业语料上反超更花哨的方法,理解它的低开销、精确匹配特性是读懂结论的关键。
稠密检索(Dense Retrieval)
稠密检索用编码器模型把查询和文档块映射成向量,通过近邻搜索召回语义相关内容(如 Karpukhin et al. 2020 的 DPR)。它只需要对语料做一次 embedding 通道即可建索引,构建成本远低于图方法,但依赖语义相似度而非精确匹配,在面对语义相近但事实错误的干扰文档时容易失手。
论文将稠密检索作为低开销但语义化的参照,其在大规模上的持续低于 BM25 揭示了精确匹配对抗干扰陷阱的价值。
图检索增强生成(Graph-based RAG)
图检索在索引阶段用 LLM 对每个文本块抽取实体和关系,构建可查询的图结构。代表方法包括构建层级社区报告的 MS-GraphRAG、双层级实体关系索引的 LightRAG、用 Personalized PageRank 在三元组图上检索的 HippoRAG 2,以及用轻量 NER + embedding 构建共现图、无需生成式构建的 LinearRAG。它们的共同特点是构建阶段开销巨大。
本文的核心发现之一是图方法在大规模上撞上构建墙(LightRAG 推断需约 102B token / 4 年),理解图方法的构建代价才能理解规模化局限。
智能体检索 / 文件系统 Agent
智能体检索(如 ReAct、File-System Agent)用 LLM 通过迭代的工具调用(列目录、搜索、读文件)探索语料,每次调用依赖前一次结果,形成顺序检索策略。本文借鉴编码 Agent(SWE-bench、Claude Code、Codex)的文件命令接口,在语料的原始文件树上操作,每个问题预算 80 次 LLM 调用,无需任何检索索引。
File-System Agent 是论文在小规模上的赢家,理解其顺序探索机制与高查询 token 成本是理解大规模下被 BM25 反超的原因。
规模化 / 语料阶梯(Scaling Ladder)
规模化研究关注当工作负载(问题、证据、干扰项)固定而语料增长时,方法行为如何变化。本文构建了 28 层严格嵌套的语料阶梯 $T_1 \subset T_2 \subset \cdots \subset T_{27}$,每层按 $n_{t+1} \approx 1.25 n_t$ 增长,从 1,144 篇文档扩展到 511,959 篇(约 1.7M 到 601M token),实现约 450 倍的跨度。
整个论文的方法学核心就是这套受控嵌套阶梯;交叉点(约 10M token)正是规模化效应最关键的结论。
研究动机
检索增强生成(RAG)的方法已经分化为词法检索、稠密检索、图索引和智能体搜索四大范式,但它们的代价出现在不同阶段、以不同形式产生:词法和稠密检索几乎不需要预处理,图检索在建索引时对每个块跑 LLM 抽取实体关系开销巨大,而智能体搜索把代价压到查询时通过迭代工具调用探索语料。问题在于,现有评测几乎都各自在单一语料规模、各自独立的基准上评测这些方法,而真实部署的企业知识库动辄几十万文档且持续增长,因此这些范式随语料增长时的准确率-代价变化(scaling)始终不明确。不同研究自由变动读者模型、判官、问题集和语料难度,使得准确率差异很容易被这些混淆因素掩盖,规模化问题一直悬而未决。
本文的目标是本文的目标是在严格控制混淆变量的前提下,系统刻画四大 RAG 范式随语料规模增长时的准确率与代价权衡。具体而言,作者构建一条从 1,144 篇到 511,959 篇文档(约 1.7M 到 601M token)、28 层严格嵌套、约 450 倍跨度的语料阶梯,同时固定问题集(500 题)、金标证据和对抗干扰文档,统一读者模型(Qwen3.6-27B,零温度)与判官协议,并对所有范式做 token 级的构建/查询代价计量。在此框架下回答:哪类范式在小规模领先、哪类在大规模占优,以及在精度-代价 Pareto 前沿上各自的定位。
与已有工作不同的是,本文的独特切入点在于“受控嵌套规模化 + 统一计量”:不同于以往在单一语料规模、独立基准上各自调优系统的方法,它把问题与对抗证据从最小层起就钉死,仅让背景文档按固定来源-噪声分层顺序增长,从而把“语料变大”这一单一变量隔离出来。配合统一的读者模型、统一判官、跨范式 token 计量,以及匹配的访问层实验(把智能体策略架在不同检索底座上)和检索原语替换实验(Agent+BM25),作者能够把“候选发现、框架、底座”三类效应区分开来,从而把交叉点定位为可测量的规模化效应,而非不同系统在孤立规模上的比较。
核心方法
整体思路是“固定一切、只动语料规模”。直觉上:要公平比较范式,必须让读者模型、判官、问题、证据和干扰项完全相同,只改变语料背景量。技术路线上,作者基于 EnterpriseRAG-Bench(511,959 篇文档、600.8M token、500 题、九种来源)构建嵌套阶梯,最小层(bedrock)由 722 篇金标文档、326 个经方法无关过滤挖出的陷阱、99 个诱饵和 2 张组织页去重后共 1,144 篇构成;第 $t$ 层 = bedrock 加上某个固定分层顺序 $\pi$ 的前 $n_t - 1144$ 篇非 bedrock 文档,相邻层 $n_{t+1} \approx 1.25 n_t$,共 28 层且 $T_1 \subset T_2 \subset \cdots$ 严格成立。七条流水线在该阶梯上统一作答,每条用 top-5 chunk,统一计量构建 token、查询 token、延迟和官方精度。
核心创新是“规模依赖的交叉点(scale-dependent crossover)”这一可观测现象及其机制分离。与以往寻找“某个范式无条件最优”的思路本质不同,作者发现没有单一赢家:File-System Agent 在最小共享层领先,但约 10M token 处被 BM25 反超,此后 BM25 在每个更大的共享层都领先,全规模差距接近 20 分。更关键的是,作者通过两组匹配控制实验揭示机制:其一,把 Agent 的原始文件树工具替换为 BM25 排序检索(Agent+BM25),在全规模把分数从 36.9 拉到 69.4,证明“全局候选排序”才是决定因素,迭代式局部搜索无法替代;其二,通过范式中立的访问层把同一智能体策略架在不同图索引上,分离“智能体策略”与“图底座”的效应。
方法步骤详情
方法步骤为:(1) 构建 bedrock——汇总 500 题的 722 篇金标、326 个陷阱(BM25 top-10 加稠密重排 top-200 池,LLM 过滤保留同主题但事实错误者)、99 个诱饵与 2 张组织页,去重得 1,144 篇;(2) 生成嵌套层——按种子化分层顺序 $\pi$ 逐层加非 bedrock 文档,$n_{t+1} \approx 1.25 n_t$,清单校验保证严格嵌套 $T_1 \subset T_2 \subset \cdots$;(3) 七条流水线作答——BM25、DenseRAG、HippoRAG 2(图+PPR)、MS-GraphRAG、LightRAG、LinearRAG(无生成式)、File-System Agent(原始文件树 80 次调用),统一用 Qwen3.6-27B 读者与 Qwen3-Embedding-0.6B 嵌入;(4) 计量判分——共享计量层拦截每次调用、区分构建/查询 token,按官方协议评分并交叉校验;(5) 机制控制——在 150 题样本上做 Agent+BM25 检索替换与图底座访问层实验。
技术新颖性
技术新颖性体现在三点。第一,可复用的 28 层、450 倍嵌套语料阶梯,把问题、证据和干扰项从最小层钉死,使规模化效应可被干净测量,这是此前 RAG 评测所缺失的。第二,统一框架下对七大流水线做 token 级构建/查询计量,并匹配读者、判官与召回控制,首次把“代价何时付出”(离线建图 vs 在线探索)这一维度量化。第三,用匹配的控制实验把效应归因:检索原语替换(Agent+BM25)证明全规模崩塌是候选发现失败而非证据合成薄弱,访问层实验证明同一图索引在 Agent 与原生 one-shot 排序下可差 22–30 分,从而把交叉点定性为可测量的规模化效应。这种“控制变量 + 机制分离”的实验设计是相对其他规模研究的新颖之处。
实验结果
核心发现是规模依赖的交叉点。bedrock(N=1,144)上 File-System Agent 与 BM25 并列领先(77.4 vs 74.7,区间重叠),DenseRAG 仅 58.1,图方法落在 45.9–66.2 区间。约 10M token 处曲线交叉,BM25 此后每个更大共享层都领先:全规模(N=511,959)BM25 仍 50.5,而 File-System Agent 跌至 30.7、DenseRAG 29.9,差距近 20 分。构建墙方面,LightRAG(超线性 $b=1.36$)连 2,826 篇都未跑完,全规模外推约 102B token/4 年;MS-GraphRAG 停在 8,750 篇;HippoRAG 2 近线性但 155M token 处花 724M 构建 token 仍比 BM25 低约 15 分。查询代价上 BM25 几乎与规模无关(5.8K token/题),File-System Agent 从 226K 涨到 343K、全规模预算耗尽达 31%。机制控制最关键:全规模 Agent+BM25 得 69.4,比原始文件 Agent 高 32.52 分、比原生 BM25 高 14.56 分,命中率从 39.0% 升至 78.0%,仅用约 1/9 查询 token,证明“先全局排序再智能体推理”才是正解。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 官方综合分(bedrock, N=1,144) | Official combined score (%) | BM25 = 74.7 | File-System Agent = 77.4;DenseRAG = 58.1 | BM25 与领先者基本持平(差距 2.7 分,置信区间重叠),显著优于稠密与图方法 |
| 官方综合分(全规模, N=511,959) | Official combined score (%) | BM25 = 50.5 | File-System Agent = 30.7;DenseRAG = 29.9 | BM25 领先 File-System Agent 近 20 分,规模化优势显现 |
| 检索原语替换控制(全规模 150 题) | Combined score / 任意金标命中率 | Agent+BM25 = 69.4,命中率 78.0% | 原始 File-System Agent = 36.9,命中率 39.0%;原生 BM25 = 54.8 | 比原始文件 Agent +32.52 分、比原生 BM25 +14.56 分,查询 token 仅约 1/9 |
| 构建成本外推(全规模 600.8M token) | 拟合生成式构建 token / 单实例时长 | LinearRAG = 0 生成式 token(仅 embedding);BM25 = 0 | HippoRAG 2 ≈ 2.9B / 3 天;MS-GraphRAG ≈ 7.9B / 50 天;LightRAG ≈ 102B / 4 年 | 无 LLM 构建的方法在大规模可部署,图方法撞墙 |
局限与改进
作者明确承认若干局限:图方法的大规模结果实际是“构建可行性”而非外推精度——HippoRAG 2 停在 131,876 篇、MS-GraphRAG 停在 8,750、LightRAG 停在 2,254,未完成层在主曲线中保持缺失,仅在覆盖调整汇总里计为零;每个系统每题只跑一次,不确定性来自问题重采样而非随机重复运行;LinearRAG 的 token 统计含约 3% 估计(实体名流不可得)。我自己还观察到:结论高度依赖单一企业语料 EnterpriseRAG-Bench,其问题带有强词法锚点且陷阱是“语义相似但事实错误”,这天然偏袒 BM25 的精确匹配,作者在 6.1 节用改写与深度控制部分缓解,但能否推广到开放式长尾或语义主导的问答仍存疑;读者固定为单一模型(Qwen3.6-27B),未覆盖更大/更小或不同家族的读者对结论稳健性的影响。
独立分析的弱点
第一,单一语料与语料特异性:BM25 的优势很大程度来自该基准“精确词法锚点 + 语义陷阱”的结构,作者自己在改写控制(N=2,254 时 BM25 仍 60.1 领先 Dense 49.9)中部分验证,但在更开放、语义主导或跨语言的长尾问题上结论未必成立——改进方向是引入多样化语料(多语言、多领域、开放式 QA)重做阶梯。第二,图方法受限于构建实现而非范式本身:LightRAG 的超线性增长源于重复实体合并重写,改进其合并算法或用近似/批处理抽取可能改变构建墙,值得针对性优化后再比较。第三,单一读者模型与单次运行:未检验读者规模/家族对交叉点位置的影响,也未做随机重复——改进方向是用多档读者并增加重复以收紧不确定性。第四,File-System Agent 的预算固定为 80 次调用,全规模预算耗尽达 31%,未探索自适应预算或更高效工具(如先 BM25 预筛再局部探索,即 Agent+BM25 思路)作为默认流水线的系统化设计。
未来方向
作者提出的方向包括:跨范式评测应报告嵌套规模精度、构建/查询代价与索引覆盖率三者,并把“条件于完成的质量”与“覆盖调整的可部署性”分开报告;在实际部署中为企业语料默认用 BM25,对聚合类问题用 Agent+BM25(词法排序发现 + 窄候选上的智能体调用),图索引仅在构建近线性且关系型问题占主导时才考虑。基于成果可延伸的方向有:把嵌套阶梯方法学迁移到多语言、多领域和开放式问答语料,验证交叉点是否迁移;研究图方法构建算法优化(如轻量抽取、增量构建、近似合并)后规模化曲线的变化;探索自适应预算与混合检索(BM25 发现 + 智能体精读 + 图扩展)的统一流水线设计;以及检验交叉点位置对读者模型规模与判官协议的敏感性。Agent+BM25 在全规模 69.4 的强劲表现提示“全局排序 + 局部智能体推理”可能是一个值得系统化设计的新默认范式。
复现评估
复现性总体较好但仍需大量资源。作者提供了较完整的实验协议细节:语料阶梯构造方法、bedrock 的 1,144 篇构成、来源-噪声分层顺序、统一的读者(Qwen3.6-27B,vLLM 零温度)与嵌入(Qwen3-Embedding-0.6B)、官方判分协议加独立判官与二元协议交叉校验,并提到提供包含命令行接口的 artifact。数据基于公开的 EnterpriseRAG-Bench(511,959 篇文档)。但算力门槛极高:全规模跑通需对最大语料做 600.8M token 的稠密嵌入(DenseRAG 约 659.4M embedding token)、HippoRAG 2 全规模外推约 2.9B 生成式 token / 单实例 3 天、File-System Agent 单问题 80 次调用、500 题全规模查询代价巨大。图方法多条流水线在中等规模就跑不完,意味着完整复现七条流水线 × 28 层的矩阵对大多数团队不现实,复现核心交叉结论(BM25 vs Agent)则相对可行。
论文图表
该示意图以简明方式呈现核心发现:各范式的点估计在约 10M 语料 token 处交叉,交叉后 BM25 在每个更大的共享层都领先。File-System Agent 在最小层领先,但其代价随规模上升而精度下降;图方法曲线提前终止于各自的最大可行层。
这张图是全文的“一图胜千言”,直接给出了最重要的结论——规模依赖的交叉点,是理解后续所有实验数据的纲领性可视化。
画出七条流水线在所有测得层级上的官方综合分曲线与置信带,曲线约 10M token 处交叉,图方法曲线在各自最大可行层终止。BM25 全规模保持 50.5 领先,File-System Agent 跌至 30.7。
这是支撑主结论的核心数据图,逐层展示了交叉与图方法提前终止,是 Table 1 的可视化版本,最具说服力。