← 返回 2026-08-18

ENTLORE:面向企业问答中潜在组织推理的图基础基准 ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering

Akrin Zheng, Alexander Wu, Alaia Liu 📅 2026-08-11 👍 6 2026-08-23 18:30
RAG 企业问答 多跳推理 知识图谱 评测基准

用私有审计真值图构建企业QA基准,专考语料中从未明说的组织关系推理

前置知识

RAG(检索增强生成)

先从外部语料中检索与问题相关的文档片段,再把它们放进提示词让大语言模型基于证据生成答案,而不是靠参数记忆作答。Flat RAG 把全部语料嵌入一个稠密向量索引,一次检索后单轮生成;Agentic RAG 则允许模型在多轮工具调用中反复搜索、抓取、推理。

本文的评测矩阵正是围绕不同 RAG 访问范式展开的:BM25、Flat RAG、Agentic、LLM-Wiki、GraphRAG 都是从同一发布语料构建的访问条件,理解它们的差异才能读懂实验设计。

GraphRAG

一种结构化知识访问范式:离线用语言模型从语料中抽取实体、类型化关系和社区报告,构建实体图;查询时利用图结构(而不是平铺向量检索)定位和聚合证据。它诱导出的结构来自语料本身,不代表真实世界的正确组织知识。

GraphRAG 是 ENTLORE 上最强的可部署条件(L3 平均 36.2%),但论文反复强调:它自己无法证明哪些未在语料中言明的组织关系是正确的,这正是需要基准侧私有真值图的原因。

BM25 稀疏词法检索

基于词频和逆文档频率的经典排序算法,匹配查询与文档的词面重叠。它不依赖语义向量,但对项目别名、模块名、工单术语、角色标签这类稀疏组织锚点词特别敏感,在企业语料上往往意外地强。

本文最大的反直觉发现之一是 BM25 全面击败 Flat RAG 和 Agentic 检索(L3 上 34.0% 对 18.9%/13.5%),其优势被归因于词法匹配恰好命中文档中稀疏的组织锚点。

多跳问答与查询式基准构建

HotpotQA、MuSiQue 等多跳基准要求模型组合分布在不同文档中的多条显式事实。此类受控基准常沿一条预定义推理路径物化文档:答案链条的每一步都被写成明确的文档内容,考察的是检索并拼接这些已陈述事实。

本文的核心批评正指向这一范式:真实企业问题所需的目标关系往往不在任何文档中出现,沿着预定义路径出题只能测组合、测不出'恢复语料中缺席的关系',这是 L1/L2 与 L3 的分界线。

真值图与证明证书

基准构建者私有的经过审计的知识图,记录每个答案的推导依赖链。'证明证书'指每道题附带的结构化依据:用了哪些前提边、经过哪条认证规则推出、金答案集合在相关闭包下是否完备、程序指称是否唯一。

这是本文方法论的基石:只有基准侧持有真值图,才能对'语料中从未出现的目标关系'计算完整金答案、验证其可由发布语料推出且确实缺席,从而保证 L3 题可作答、可验证、不泄露。

研究动机

现有企业问答基准把任务框定为'检索内部文档并生成有据答案',但真实企业记录是日常工作的副产品:某项活动属于哪个项目、内部代号对应哪个更大的计划、某条工作流的负责人是谁,这类关键组织关系散落在会议纪要、工单、报表等异构来源中,从未在任何单一文档里被明说。EnterpriseRAG-Bench、WixQA、QO-Bench 等近期基准虽然提供了真实的多源证据、项目连贯语料和可执行事件表示,但证据往往围绕预定义答案路径组织——每一步推理都被物化为显式文档内容,系统只需检索并拼接'已陈述的事实'。这测的是组合能力,而不是从语料中恢复缺失目标关系的能力。作者把后者称为潜在组织推理(latent organizational reasoning)。此外,直接从选定文档生成问题虽然规避了证据不确定性,却无法保证真实的企业问题有完整且唯一确定的答案。闭卷实验也印证了知识确实来自语料而非参数记忆:八个模型在 L1/L2/L3 上的闭卷准确率仅为 0.6%/0.0%/7.9%。

本文的目标是作者要构建一个能真正考核潜在组织推理的企业问答基准。具体目标有三层:其一,从真实企业的常规文档、权威组织表和运营记录中重建一个'经过审计的企业世界',作为私有真值图,把原生事实、元数据事实、启发式关联和经认证的派生关系明确分开;其二,把组织惯例编码为版本化约定库,认证出语料中从未出现的目标关系,使每道题都能计算完整的金标准答案和证明证书,并通过全库扫描验证目标关系确实不在发布语料中;其三,把这个世界投影为对齐的匿名化发布语料,只暴露文档、扣留私有结构与目标关系,被测系统拿不到任何实例级金关系。最终产出的 ENTLORE 包含 2,341 篇文档、907 道题(469 道 L1 显式查找、204 道 L2 跨源组合、234 道 L3 潜在组织推理),并在 8 个模型 × 7 种访问条件共 56 个配置上评测。

与已有工作不同的是,本文的独特切入是把'图'放在问题与碎片化语料之间作为中间语义层:问题由类型化图算子生成、语义由图决定,语言模型只负责措辞,题目与文档互不迁就。与 HotpotQA 等多跳基准把推理步骤以支持句形式分布到文档中不同,与 KQA Pro、QO-Bench 等在已物化的知识库或类型化事件记录上执行可执行程序也不同——ENTLORE 先从常规记录中认证组织关系,再把目标关系从发布证据中整体扣留。评测侧的 GraphRAG、HippoRAG 等方法虽然能从语料诱导结构,但无法自证哪些未言明的组织关系是有效的、完备的、有发布前提支撑的;只有基准侧的私有审计真值图能同时给出可答性判定、完整金答案、证明依赖与'目标关系在每个实体别名下都不出现'的全库缺席验证。这个'真相私有、前提可审计'的设计在基准构建中是新颖的。

核心方法

直觉是:要考'语料里没写的关系',出题人必须自己先知道答案,且能证明答案唯一、完备、可由语料推出——所以先私下重建一个可审计的企业世界,对外只发布文档。技术路线分四步(Figure 2):第一步,从常规文档、权威组织记录、运营轨迹重建带溯源的原始图 $G_{\text{raw}}$,覆盖人员、项目、模块、活动、系统、客户共 1,153 个实体、3,784 条类型化关系;边分三类——原生关系(文档或轨迹支撑)、元数据关系(来自权威记录)、启发式关联(仅用于候选发现和干扰项构造,永不能独立确立金答案)。第二步,用版本化约定库生成候选组织推理边,每条保留边记录生成规则、依赖链和人工授权裁决,形成真值图 $G_{\text{truth}} = \text{audit}(G_{\text{raw}}) \cup C^*(G_{\text{raw}})$,其中 $C^*$ 表示只应用经认证的规则而非无限制闭包。第三步,用共享匿名化映射 $\phi$ 把语料投影为发布文档集 $D_{\text{release}}$,实体与别名一致重命名、日期平移但保持相对组织结构。第四步,把每道题编译为可执行图程序,在真值图上计算金答案并验证推导、完备性、唯一性与目标关系缺席。

核心创新是'认证派生关系 + 扣留目标关系'的组合。约定库中形如 $\text{works\_on}(p, m) \circ \text{contains}(\text{proj}, m) \Rightarrow \text{attributed\_to}(p, \text{proj})$ 的包含转移约定,把模块级工作活动归属到父项目——这类边在任何发布文档中都不存在,但由组织惯例合法推出,且每条都带规则版本和依赖链可回溯。真值图不是自由推理的产物:$C^*$ 只并入人工授权过的规则应用,启发式关联只能造干扰项。由此产生的 L3 题,答案在发布语料中'缺席却在图上成立',验证器还能做全库扫描,确认目标关系在每个实体别名下都不出现,排除答案意外泄露。于是形成'真相私有、前提可审计'的格局:被测系统只能访问 $D_{\text{release}}$,私有组织记录、认证规则、真值图和实例级证明证书全部扣留;而基准侧保有每道题的完整金答案与证明,可同时判定可答性与答案完备性。这是与'沿预定义答案路径物化文档'的查询式构建(Figure 1 左)的本质区别。

方法步骤详情

第一阶段(重建):输入是企业内部文档、权威组织表、运营轨迹;输出是带溯源的 $G_{\text{raw}}$(1,153 实体、3,784 条类型化关系),每条边记录来源。第二阶段(认证):版本化约定库产出候选推理边(约定族与前置条件见附录 E),人工审计后并入得到真值图;被否决或无支撑的候选被过滤,需要私有前提才能成立的题目候选送入'可验证弃答库'。第三阶段(匿名化投影):每篇发布文档恰好对应一篇原文档的匿名化转写,保留体裁、局部组织、信息密度与自然省略——缩写名、省略项目范围、依赖上文这些难点是语料的固有属性而非生成伪影;投影不引入组织表、其他文档或认证推理边的任何事实,跨源身份一致与时间结构由共享匿名化映射保持。第四阶段(出题与验证):类型化图算子在 $G_{\text{truth}}$ 的合格区域采样并执行查询,记录类型化答案、证明依赖与关联的发布证据单元;语言模型以员工口吻措辞但不接触金答案;验证器检查推导有效、集合答案在相关闭包下完备、程序指称唯一;L3 题额外要求含认证推导的证明,并做全库缺席扫描。最终 907 题 = 469 L1 + 204 L2 + 234 L3,覆盖 56 个模型与访问配置。

技术新颖性

技术新颖性体现在四个层面。构建范式上,先建世界后出题:问题不迁就文档、文档不围绕问题生成,与 Figure 1 左的查询式构建形成对照;匿名化发布是源世界的对齐投影而非问题导向的合成语料。认证机制上,'约定库 + 人工授权 + 规则版本 + 依赖链'使派生关系可审计,配合验证器的闭包完备性检查、唯一指称检查和全库缺席扫描,保证 L3 答案既不在语料中又可严格推导。评测设计上,对比矩阵刻意控制变量:Flat RAG 与 Agentic 共享同一稠密索引和检索后端(隔离迭代交互的作用),Agentic 与 LLM-Wiki 共享同一 agent 框架(隔离离线编译的作用),GraphRAG 作为系统级结构化访问备选,$\Omega$ 金文档参考通过同一工具循环暴露金文档路径但永不提供目标关系,并把总误差分解为 $\Delta_\Omega$(访问差距)与 $\rho_\Omega = 1 - \Omega$(金证据残差)。最后,发布保真度本身被当作实验对象(RQ4)检验,而非默认假设,这种自我审视在基准论文中少见。

The ENTLORE pipeline(ENTLORE 流水线)
Figure 2: The ENTLORE pipeline(ENTLORE 流水线)

实验结果

RQ1(显式证据):L1 上 GraphRAG、BM25、LLM Wiki 平均 63.2%/62.4%/61.7%,L2 上 LLM Wiki 与 BM25 领先(52.5%/51.4%);三题级合计 BM25、GraphRAG、LLM Wiki 构成 52.6%/52.2%/50.9% 的第一梯队,Agentic 仅 36.5%、Flat RAG 36.0%;闭卷 0.6%/0.0%/7.9% 证明无任何条件靠参数记忆得分。RQ2(潜在关系):L3 上 GraphRAG 最佳(36.2%),其后 BM25 34.0%、LLM Wiki 27.7%、Flat RAG 18.9%、Agentic 13.5%;但 GraphRAG 对 BM25 的优势温和且依赖模型(5:3 领先),分离集中在特定关系族——部门归属上 GraphRAG 53% 对 BM25 仅 2%(42 题,oracle 84%),而包含归属、层级汇总族所有方法不超过 34%(oracle 66%/59%)。按平铺检索器是否拼齐金文档集分组:拼齐的 560 对(30%)中 BM25 54.9% 反超 GraphRAG 48.5%;未拼齐的 1,312 对(70%)中 GraphRAG 31.0% 领先、BM25 25.1%,oracle 从 82% 降至 64%——结构化访问的价值恰恰出现在检索拼装失败处。BM25 全面碾压 Flat RAG(L1/L2/L3 各 +16.2/+18.9/+15.1)和 Agentic(+13.9/+15.9/+20.5),且差距的 71% 来自'只有 BM25 拼齐的证据子集'而非答后表现。校准差异显著:零分 L3 答案中 BM25 有 53% 明说'事实不在语料中',GraphRAG 仅 6%。RQ3(金文档残差):供给金文档路径后 L1/L2 仍有 12.6%/6.2% 未答,L3 高达 30.4%,是 L2 的 4.9 倍,占最佳条件剩余误差的 47.7%——去掉检索错误并没有消除潜在关系挑战。RQ4(发布保真度):176 个对齐条目上组级结构保持(oracle 配置仍占前三,平均 |Δ|=0.125),但可部署条件的细粒度排序未达显著($\rho=0.71$,置换检验 p=0.06),偏移集中在 BM25(-0.28)与 GraphRAG(-0.19)。

Overall answer accuracy (%) by level (L1/L2/L3) across 8 models and seven access conditions(8 个模型与七种访问条件在各难度级上的总体答案准确率)
Table 1: Overall answer accuracy (%) by level (L1/L2/L3) across 8 models and seven access conditions(8 个模型与七种访问条件在各难度级上的总体答案准确率)
Performance across L3 relation families, flat-retriever evidence assembly, and gold-document residuals(L3 关系族性能、平铺检索证据拼装与金文档残差)
Figure 3: Performance across L3 relation families, flat-retriever evidence assembly, and gold-document residuals(L3 关系族性能、平铺检索证据拼装与金文档残差)
查看结构化数据
任务指标本文基线提升
L1 显式查找(答案在单篇发布文档中明确陈述) 答案准确率(8 模型平均,%) GraphRAG 63.2%(最佳可部署条件) 闭卷 0.6%;Flat RAG 46.1% 较闭卷 +62.6 个百分点,较 Flat RAG +17.1 个百分点
L2 跨源组合(答案由多篇文档中显式陈述的事实组合而成) 答案准确率(8 模型平均,%) LLM Wiki 52.5%(最佳可部署条件) 闭卷 0.0%;Flat RAG 32.5% 较 Flat RAG +20.0 个百分点
L3 潜在组织推理(目标关系不在任何发布文档中) 答案准确率(8 模型平均,%) GraphRAG 36.2%(最佳可部署条件) Agentic 13.5%;金文档 oracle Ω 为 69.6% 较 Agentic +22.7 个百分点,但仍比 oracle 低 33.4 个百分点
金文档残差(给定金文档路径后仍未答出的比例) 未答率(最佳可部署条件) L3 残差 30.4% L1 残差 12.6%;L2 残差 6.2% L3 残差是 L2 的 4.9 倍,占最佳条件剩余误差的 47.7%,证明残差源于关系恢复而非文档获取

局限与改进

作者明确承认的局限有三点:其一,$\Omega$ 残差 $\rho_\Omega$ 包含导航、交互、答案抽取与提示效应,不是纯粹的推导失败度量,只是组织关系恢复失败的上界,附录 F 的锚点实体事后检验也仅是'一致但有限'的补充;其二,发布保真度分析(RQ4)只支持组级比较,可部署条件的细粒度排序在 176 个条目上未达统计显著($\rho=0.71$,p=0.06),且偏移集中在 BM25(-0.28)与 GraphRAG(-0.19),作者归因于语料经过匿名化和翻译后词法敏感性变化;其三,GraphRAG 与 BM25 的比较是完整访问系统层面的,不是对 GraphRAG 组件的受控消融。我自己的观察:L3 仅 234 题,细分到关系族后样本很小(Figure 3a 中 n=12 到 n=66),'部门归属 53% 对 2%'这样戏剧性的分离建立在小样本上,置信区间会很宽;判定 L3 的约定库是单个企业的私有领域知识,换一个组织需重新审计,框架的跨组织可迁移性未验证;自由文本答案由单一固定 judge 评分,虽做了 judge 复现检验,单一裁判的系统性偏置风险仍在;Agentic 条件的预算上限(30 轮迭代、40 万 token、900 秒)可能低估了该方法的上限。

独立分析的弱点

第一,小样本关系族:L3 的 234 题摊到五个认证关系族加一个未分类桶,最少仅 12 题,Figure 3a 中'GraphRAG 53% 对 BM25 2%'的部门归属结论建立在 42 题上,换一组企业数据可能完全不同——改进方向是为每个关系族设定最低样本量并报告置信区间,或扩充题库。第二,约定库私有且领域特定:认证规则不发布,其他组织无法直接复用,L3 边界的判定完全依赖该企业的审计流程——改进方向是开源若干脱敏的约定模板族,或提供从组织元数据半自动学习约定的工具链。第三,单一 judge 评分:自由文本被还原为原子声明后由单个固定裁判打分,尽管做了复现检验,对'弃答式回答'和'部分正确'的打分粒度仍粗糙——改进方向是引入多裁判交叉与人工抽检的双通道校准。第四,访问系统实现的耦合:GraphRAG 是系统级对照,其领先可能来自实现质量而非范式本身;Agentic 的 30 轮/40 万 token 预算也可能偏紧——改进方向是每个范式给多个开源/闭源实现取最优,并做预算敏感性分析。第五,RQ4 只覆盖 176 个可干净反向渲染的条目,发布保真度对全部 907 题的外推有限——改进方向是扩大对齐验证集并把翻译/匿名化偏移纳入分数校正。

未来方向

作者在结论中指出的方向:企业问答系统应把'文档背后的组织'当作一等推理对象,跨源恢复类型化关系,在多步推理中保留溯源,并在组织推断缺乏依据时主动弃答——BM25 零分答案中 53% 明说事实不在而 GraphRAG 仅 6% 的弃答率差异,说明校准与弃答机制本身就是值得单独研究的维度。在此基础上的自然延伸包括:其一,约定自动挖掘——用过程挖掘和组织学习技术从运营日志中半自动发现并认证组织惯例,降低人工审计成本并支持跨组织迁移;其二,把真值图中的认证边作为弱监督信号微调模型,让'包含转移'这类组织推理模式成为可训练的归纳偏置;其三,把 $\rho_\Omega$ 残差进一步分解为关系恢复、答案组织、抽取失败等成分,得到比上界更精细的诊断;其四,扩展到多语言企业语料和跨行业组织结构,检验 L3 难度的普适性;其五,研究发布保真度与匿名化强度之间的定量权衡,为未来的基准发布提供数据效用-隐私的操作系统。

复现评估

复现条件较好。基准、数据和代码已在 https://github.com/scitix/entlore 公开,发布物包括匿名化对齐语料(2,341 篇文档)与 907 道题(含 L1/L2/L3 划分),可完整复现 56 配置(8 模型 × 7 访问条件)的评测矩阵。算力需求主要是推理成本而非训练:GraphRAG 与 LLM-Wiki 需要一次性离线索引/编译;最贵的部分是 Agentic 与 $\Omega$ 运行——每题上限 40 万累计 token 和 900 秒,234 道 L3 题 × 8 模型 × 2 条件的调用量可观,但都可按需缩减。需要特别注意两点边界:其一,私有组织记录、认证规则、真值图与实例级证明证书不发布,因此'从原始企业数据重建世界、认证关系'的前半段流程无法复现,能复现的是评测侧;其二,出题管线含人工语义审计与授权环节,构建过程本身无法全自动重放。总体而言,评测复现难度中等偏低(主要成本是 API 调用),构建复现则依赖私有数据,不可行。