← 返回 2026-08-31

盲人摸象:探测大语言模型在长尾分歧知识下的认知近视 Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun 📅 2026-08-28 👍 15 2026-09-01 18:30
参数化记忆 基准评测 知识冲突 长尾知识 闭卷问答

ElephantBench闭卷探针揭示:最强模型对长尾分歧事实也仅能完整回忆52.4%

前置知识

参数化记忆(Parametric Memory)

指模型把训练语料中的事实压缩进权重参数后形成的内部知识,区别于上下文中临时提供的信息。测试它通常采用闭卷方式:不给模型任何检索工具或参考文档,只给问题让其直接作答,答案完全来自权重中固化的知识。

本文的全部问题都建立在参数化记忆上:不测上下文推理能力,只测权重里是否同时固化了同一事实的多个版本。

长尾知识与低暴露语料

长尾知识指预训练中出现频次极低的罕见事实。DCLM fastText 等质量分类器会按分数把网页语料分成保留集和丢弃集,被丢弃的低分文档 $D_{low}$ 往往恰好承载长尾事实,且很少被预训练流程针对性上采样。

本文反用质量过滤器:专门到被丢弃的 $D_{low}$ 中挖掘分歧事实,使记忆失败更容易暴露、探针更灵敏。

LLM-as-a-Judge

用一个强 LLM 按评分标准对被测模型的自由文本回答打分的方法,能容忍同一事实的多种表述。本文的 judge 把回答判为三档:包含全部参考答案为完整召回,包含部分为部分召回,无参考答案或含错误为失败召回。

ElephantBench 的核心指标 C/P/F 全部依赖这一语义判分机制,理解其三分类逻辑才能读懂实验结果。

知识冲突与源分歧

同一事实在不同独立来源中说法不一致的现象,例如两个网站对同一位名人的出生日期记载不同。研究它通常区分开卷设定(推理时提供冲突段落)与闭卷设定(不给证据,考记忆)。

本文与既有冲突基准的本质区别在于闭卷:它考的是多个互斥说法是否共存于参数中,而非对给定证据的推理。

研究动机

事实问答领域长期默认每个问题只有一个标准答案,这一假设掩盖了关键盲区:LLM 的参数化记忆里是否同时保留了长尾事实的多个不同版本?现有评测只能覆盖问题局部。一方面,长尾 QA 基准(如 LPFQA、MINTQA)用实体流行度或语料频率定义长尾,测试模型能否回忆罕见事实,但打分时仍假设单一标准答案,记忆的完整性完全未被检验;另一方面,知识冲突基准(WikiContradict、ConfRAG、WhoQA、DynamicQA)虽然研究分歧,但采用开卷设定,在推理时直接提供冲突段落,测的是阅读理解与多跳推理,而非记忆本身。于是出现一个无人覆盖的地带:没有任何基准能在闭卷条件下检验模型是否完整记住了同一事实的多个经过验证的说法。这正是标题所说的认知近视——像盲人摸象,模型可能只摸到并只记得主导版本而遗漏少数版本,传统单答案 QA 对此毫无察觉。

本文的目标是本文的目标是构建一个可复现、可审计的闭卷知识探针 ElephantBench,系统回答两个层层递进的问题:LLM 能否回忆起长尾事实?如果能,它能否从参数化记忆中恢复该事实的全部已验证版本?具体做法是从被质量过滤器淘汰的低暴露网络语料中挖掘自然发生的跨源分歧,经可审计的图构建流水线生成 1,094 道闭卷 QA 题,每题至少包含两个可溯源的验证答案。评测指标刻意设计为分解式:完整召回率 $C$、部分召回率 $P$、失败召回率 $F$ 与条件完整度 $K = C/(C+P)$,把“能否想起”与“想起得全不全”分开诊断。作者还希望把语料层面的暴露不平衡(多数派支撑文档数 $N_{maj}$ 与少数派文档数 $N_{min}$)与模型的记忆失败模式定量关联,使基准不仅给模型排名,还能反哺预训练数据配比研究。

与已有工作不同的是,本文的独特切入角度有三点。第一,反其道而行之的数据选择:主流预训练流程用 DCLM fastText 等分类器把语料切成保留集 $D_{high}$ 与丢弃集 $D_{low}$,作者偏到被丢弃的 $D_{low}$ 里找金子——低暴露事实很少被预训练时的针对性上采样补票,记忆失败更容易暴露。第二,考察单位从“事实”变为“分歧”:不问模型知不知道某事实,而是问它是否同时保留了同一“主体–属性”对上的多个独立验证版本,例如 Mother Teresa 生日在 IMDb 记为 1910 年 8 月 26 日、另一网站记为 8 月 27 日这类真实冲突被直接变成测试样本。第三,闭卷加可溯源:评测时不给任何证据、检索或工具,逼模型动用参数化记忆,但每个答案都追溯到源文档并经三重验证,兼顾难度与可信度。这一组合在既有工作中是空白。

核心方法

整体思路是先建一张“分歧地图”,再从图上采题目。形式化地,给定全量语料 $D_{all}$、质量分类器 $Q$ 与阈值 $\tau$,取 $D_{low} = \{z \in D_{all} : Q(z) < \tau\}$;把其中每篇文档作为节点构成文档图 $G_D = (V_D, E_{sup}, E_{conf})$,support 边连接谈论同一事实且说法一致的文档,conflict 边标记同一“主体–属性”对上的互斥说法。两阶段流程把图构建成本从朴素的两两比较 $O(n^2)$ 降下来:先用知识点聚类与实体抽取筛出候选对 $C = C_K \cup C_N$,再用 LLM 边分类器只对候选对判定 none/support/conflict。每条冲突边向其 support 邻居扩展成局部子图,交给 LLM 合成命名实体型与线索型两种匹配问法、共享同一答案集 $A = \{v_i\}_{i=1}^k\ (k \ge 2)$ 的 QA 记录。4,127 条冲突边产出 8,254 道候选题,经 LLM 核查、WebAgent 独立检索与人工审核三道关卡后留下 1,094 题。

核心创新是把“记忆的完整性”变成可测量对象,与已有工作的本质区别在三个层面。相对长尾 QA 基准(LPFQA、MINTQA),本文拒绝单标准答案假设,参考答案是经验证的集合 $A$,评价区分完整、部分、失败三档召回,从而把“只记得主导版本”的认知近视与“完全遗忘”分开。相对知识冲突基准(WikiContradict、ConfRAG、WhoQA),本文是闭卷设定:源文档、图结构、外部工具全部隐藏,直接探测参数化记忆而非上下文推理。相对 WRAP、ReWire、RePro、WRAP++ 等过滤语料回收工作,它们的目标是合成训练数据,本文则把 $D_{low}$ 中的自然跨源分歧转化为评估探针。此外,语料统计揭示的暴露不对称规律——多数派曝光只提升“能否想起”、少数派曝光才提升“想起得全不全”——把可测的语料分布属性与记忆失败机制挂钩,让基准能直接指导数据配比,而不只是排行榜。

方法步骤详情

流水线五步。第一步语料划分:用 DCLM fastText 分类器对 RePro organic 语料打分,取 $Q(z) < \tau$ 的低分文档组成 $D_{low}$。第二步候选对生成:Qwen3.6-27B 按 SuperGPQA 分类法打知识点标签 $K(d)$,同簇配对得 $C_K$($\sum_k \binom{|B_k|}{2}$ 次比较);再用 T-NER 抽取归一化实体,倒排索引召回跨簇共享实体的对得 $C_N$。第三步边分类:LLM 读入候选对双方全文,$r_{ij} = f_\zeta(T(d_i), T(d_j), P)$,输出 none/support/conflict,构成 $E_{sup}$ 与 $E_{conf}$。第四步 QA 合成:对每条冲突边 $e$ 抽取含端点及 support 邻居的子图 $H_e$,GPT-5.6-Sol 生成问句 $q_e$ 与答案集 $A_e$,含命名实体与线索两种匹配问法。第五步三重验证:LLM 通读子图确认答案有据;GLM-5.2 驱动的 WebAgent 用 WebSearch/WebFetch 独立检索权威来源;人工终审剔除实体错配、无支撑答案与答案泄露。4,127 条冲突边产出 8,254 道候选,去重后余 1,094 题。

技术新颖性

技术新颖性可从效率、设计与评测三点看。效率上,朴素做法要用 LLM 逐一审查 $\binom{|V_D|}{2}$ 个文档对,本文用知识点聚类加 NER 倒排索引把候选空间压到 $|C_K \cup C_N|$,每对只需一次分类调用,使大规模网页语料的图构建可行,且流水线可复用于任意低暴露语料。设计上,“冲突边为种子、support 邻居作证”的子图采样保证每题天然自带双面证据链:答案集中每个 $v_i$ 都能在子图文档中找到证据片段,再由独立网络检索交叉确认,分歧是自然 occurring 而非凭空构造。评测上,论文证明条件答案困惑度 PPL 与生成式分级评估高度对齐:Qwen3.6-27B 上 PPL 分箱升高时,完整召回从 78.9% 单调降到极低、失败率升至 7.53% 段,提供了免去自回归生成与 LLM 评审的低成本代理。命名实体与线索两种问法均值差仅 0.65 个百分点(95% CI $[-1.05, 2.31]$,p=0.470),说明测的是知识本身而非题目形式。

Overview of ElephantBench as a systematic probe of parametric memory in LLMs.
Figure 2: Overview of ElephantBench as a systematic probe of parametric memory in LLMs.
Distribution of the 1,094 benchmark questions across knowledge fields.
Figure 3: Distribution of the 1,094 benchmark questions across knowledge fields.

实验结果

实验覆盖 32 个模型(26 开源加 6 闭源,默认开启推理)。其一,前沿模型失败模式是“记住了但不全”:Kimi-K3 以 C=52.38%、P=45.25%、F=2.38%、K=53.65% 居首,Gemini-3.1-Pro(C=50.37%)、GPT-5.5(C=50.18%)次之,前三名 F 仅 2.19–2.65%,但 C 无一超 53%。其二,规模提升召回但不提升完整性:Qwen3.5 从 2B 到 397B,C 从 1.65% 升至 32.27%,F 从 81.35% 降到 8.50%,P 却从 17.00% 涨到 59.23%;开源小于 10B 的模型平均 C 仅 5.48%。其三,推理收益呈规模依赖:GPT-5.6-Sol +13.99、GPT-OSS-120B +12.89、Hy3 +10.60 个百分点,但 Qwen3.5 在 2B/4B 反而下降 0.64/0.37。其四,暴露不对称显著:$N_{maj}$ 每增一个标准差使 P 升 14.18、F 降 10.17;$N_{min}$ 每增一个标准差使 C 升 15.13、P 降 15.41 个百分点。其五,领域梯度明显:人物组织事件 C=38.7%,消费产品服务仅 6.2%。其六,贪心 oracle 用 23 个配置把 C 推到 81.2%,仍有 206 题(18.8%)无模型完整回忆。

Evaluation results on all 1,094 questions (%).
Table 1: Evaluation results on all 1,094 questions (%).
Within-family scaling trends for open-weight models.
Figure 4: Within-family scaling trends for open-weight models.
Effect of reasoning on complete recall.
Figure 5: Effect of reasoning on complete recall.
Effect of reasoning on complete recall across Qwen3.5 model sizes.
Figure 6: Effect of reasoning on complete recall across Qwen3.5 model sizes.
Recall outcomes by source exposure, binned by $N_{maj}-N_{min}$ (top) and $N_{min}$ (bottom).
Figure 7: Recall outcomes by source exposure, binned by $N_{maj}-N_{min}$ (top) and $N_{min}$ (bottom).
Outcome shares averaged over models for representative knowledge fields.
Figure 8: Outcome shares averaged over models for representative knowledge fields.
Outcome shares when models are greedily added to the oracle pool.
Figure 9: Outcome shares when models are greedily added to the oracle pool.
Recall outcomes across five perplexity bins for Qwen3.6-27B.
Figure 10: Recall outcomes across five perplexity bins for Qwen3.6-27B.
查看结构化数据
任务指标本文基线提升
长尾分歧知识闭卷问答(1,094 题) 完整召回率 C / 条件完整度 K (%) 最强 Kimi-K3:C=52.38,K=53.65;Gemini-3.1-Pro C=50.37;GPT-5.5 C=50.18 同组次强与开源阵营:Claude-Opus-4.8 C=44.15;DeepSeek-V4-Pro C=31.99;GPT-OSS-120B C=22.49 无任何模型 C 超过 53%;最强模型在近半数问题上只召回部分版本,暴露跨厂商共享的认知近视
模型规模消融(Qwen3.5 家族 2B→397B) C / P / F (%) 397B:C=32.27,P=59.23,F=8.50 2B:C=1.65,P=17.00,F=81.35 召回大幅改善但 P 同步膨胀 42.23 个百分点,规模只解决“想起”不解决“记全”
跨模型 Oracle 覆盖(贪心组池) C (%) 23 个配置贪心池 C=81.2,F=0 单模型(Kimi-K3)C=52.4 +28.8 个百分点,显示模型间强互补性;但 206 题(18.8%)仍无模型完整回忆
条件答案 PPL 代理评估(Qwen3.6-27B) 各 PPL 分箱的 C/F (%) 最低分箱 C=78.9、F=1.13;最高分箱 F=7.53 生成式 LLM-judge 全量评估(成本高) PPL 分箱与分级结果单调对齐,可作免生成、免评审的低成本评估代理

局限与改进

作者坦承三点局限:其一,各模型预训练语料不公开,只能用公开语料的相对频率作暴露的观察性代理,结论只能算关联而非对具体模型训练数据的直接测量;其二,1,094 题、22 个领域无法穷尽长尾知识的广度与分歧形态的多样性;其三,32 个被评测模型不覆盖论文完成后的新模型与全部推理配置。我的补充观察:评审 judge 与题目生成器同为 GPT-5.6-Sol,虽附录 D 做了人机一致性检验,但同族偏好仍可能系统性影响 C/P 边界这一最关键的量;验证环节依赖 Wikipedia 等权威源,可能使官方叙事天然占优,从而低估模型对少数派合理记忆的得分;语义判分对表述的容忍度也会移动 C 与 P 的分界。此外语料以英文网页为主,结论向其他语种的迁移性未知;$N_{maj}/N_{min}$ 基于单一第三方语料,与各厂商内部数据配比的偏差可能不小。

独立分析的弱点

独立分析几点弱点。第一,judge 偏差风险:生成与判分都重度依赖 GPT-5.6-Sol,而“部分 vs 完整”的判分边界恰是论文最关心的量,任何系统性宽松都会直接污染 C 的绝对数值;改进方向是多 judge 集成加人工校准子集。第二,暴露代理的外部效度:用 RePro 语料的文档计数替代各模型真实训练分布,对闭源模型几乎必然有偏,可结合 membership inference 或模型内部探针做三角验证。第三,206 道(18.8%)无模型完整回忆的题缺乏定性分析,其中可能混有答案集不完整或问题歧义的坏样本,应做人工根因分析并报告坏样本率。第四,PPL 代理只在 Qwen3.6-27B 一个模型上验证,跨 tokenizer 与跨家族的稳健性未知。第五,闭卷设定无法区分“记住了但不愿说”与“根本没记住”,知识抑制与知识缺失混在一起,可配合 logit lens 或诱发式探测把二者拆开。

未来方向

未来方向分作者提出与个人延伸两部分。作者方向:扩大基准规模与分歧类型覆盖(时间性冲突、数值精度冲突等),纳入更多语言与地区来源,覆盖更多新模型。延伸方向:其一,把暴露不对称的发现变成干预实验——对长尾事实的少数派说法做定向过采样并观察完整召回是否因果提升,把观察性关联升级为干预性证据,直接服务数据配比;其二,用 PPL 代理做持续评测,在训练 checkpoints 间追踪多版本事实记忆的动态,刻画遗忘曲线与上采样效应;其三,从机制可解释性角度研究多版本事实在参数中的共存形态,例如不同说法是否存于不同层或被上下文头抑制;其四,把图构建流水线产品化为“任意语料到知识探针”的通用工具,用于医疗、法律等领域模型的记忆审计;其五,研究闭卷记忆与 RAG 外部证据冲突时模型的行为策略与置信度校准。

复现评估

复现友好度较高。项目主页、代码库(github.com/Tencent/ElephantBench)与数据集(huggingface.co/datasets/Tencent/ElephantBench)全部公开,1,094 题可直接下载评测。复现完整构建流水线门槛中等偏高:需要 Qwen3.6-27B(知识点标注与边分类)、GPT-5.6-Sol(QA 生成与判分)、GLM-5.2(WebAgent 验证)三个模型的大量推理调用,对 4,127 条冲突边、8,254 道候选题的规模,API 或 GPU 成本不低,还依赖 RePro organic 语料的获取权限与人工审核预算。相比之下,只复现评测部分(闭卷问答加 LLM-as-judge,或 PPL 代理)非常轻量,单卡即可测开源模型。附录提供了评测 prompt、judge rubric、人机一致性分析与数据发布筛查流程,透明度好。建议先跑通官方数据集上的评测,再按需复现构建流水线的局部。