← 返回 2026-09-11

三思而后链:多语言实体链接中的稀有性、推理与检索 Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

Parinthapat Pengpun, Simran Khanuja, Graham Neubig 📅 2026-09-09 👍 12 2026-09-12 18:30
Wikidata 多模态 多语言实体链接 推理模型 检索增强生成 长尾实体

多维刻画实体稀有性,推理+迭代检索的免训练框架超SOTA 6.9%,稀有实体最高提升23.3%

前置知识

实体链接(Entity Linking)

把文本中的实体提及映射到知识库条目的任务,例如把句子里的「钻石公主号」链接到英文 Wikipedia 的 Diamond Princess 词条。本文采用 MERLIN 的设定:给定源语言文本 $T$、配图 $I$ 和被标注的提及 $m$,模型需预测该实体的英文 Wikipedia 标题,并以与金标的精确匹配(exact match)作为评估指标。

这是全文的任务定义,所有准确率数字、稀有切片退化分析都建立在这个设定上。

Wikipedia/Wikidata 结构指标

Wikipedia 系指标反映编辑关注度:90 天页面浏览量、反链数、条目长度、修订次数、独立编辑者数、分类数、外部链接数、参考文献数、图片数;Wikidata 系指标反映知识图谱结构:入链、出链、语言版本数(拥有该实体条目的 Wikipedia 语言数量)、语句数(statement)、限定符数(qualifier)、实体年龄。它们度量实体被文档化的深度与跨语言连通程度。

本文用这 15 个指标重新定义稀有性,是与以往仅用流行度指标的核心区别。

Bottom-5% 稀有切片

对每个稀有性指标,将测试集实体按指标值排序,落在最稀有的 $q=5\%$ 分位以下的实体构成一个切片,即实体 $e$ 在指标 $m$ 上稀有当且仅当 $m(e)$ 位于测试集分布的底部 5%。不同指标切出的稀有集合平均只有约 37% 的 Jaccard 重叠,说明它们捕捉的是不同的稀有性维度。

这是定位失败模式的分析工具,作者发布的 MERLIN-Rare 数据集就是这些切片的集合。

BM25 与稠密检索

BM25 是词法检索,按查询词与文档词的重叠打分,速度快但当非拉丁文字(印地语、泰米尔语、日语)的提及需要音译成英文标题时容易失配;稠密检索用多语言嵌入模型(multilingual-e5-large-instruct)把英文 Wikipedia 的「标题-描述」对编入 FAISS 索引,按语义相似度返回 top-$k$,能跨文字匹配语义。

检索方式直接决定正确实体会不会被送进模型上下文,是消融实验的关键变量之一。

推理原生模型(Thinking vs Instruct)

指经过强化学习训练、能生成长思维链的模型,如 Qwen3-VL 的 Thinking 版本;与之对照的是同底座、同参数规模的 Instruct(指令微调)版本。推理模型在两次工具调用之间会生成大量分析文本,用于评估检索结果并规划下一步查询,本质是用推理时计算(test-time compute)换取能力。

本文依靠同架构的 Think/Instruct 成对对比,才得以干净地隔离「推理」这一个因素的贡献。

迭代检索增强生成(Agentic RAG)

模型配备 search_wikipedia 工具,循环执行「分析上下文→发出查询→阅读结果→决定是否再搜」。本文每例最多允许 20 次检索,并强制第一次检索以免模型直接凭参数知识作答。与 ReAct/IRCoT 用于问答不同,这是该范式首次被用于多语言多模态实体链接。

这是方法框架的主体,论文最核心的「推理×检索互补」效应就发生在这个循环里。

研究动机

多语言多模态实体链接系统在常见实体上表现良好,但在长尾上急剧退化。以 MERLIN 基准(覆盖印地语、印尼语、日语、泰米尔语、越南语五种语言)为例,当时的 SOTA 模型 CulturalPangea 尽管专门用文化接地数据微调过,五语平均准确率也只有 81.1%。更关键的问题在于以往工作衡量「稀有」只用流行度代理指标(如 90 天页面浏览量、入链数),这类指标度量的是访问频率,无法区分「不受欢迎」与「文化小众」:一个实体可能流量很高但知识图谱结构稀疏(如 2016 年印度废钞事件有 3.6 万浏览量、980 位编辑者,却只有 11 条 Wikidata 语句),也可能在特定语言社区内广为人知但跨语言覆盖极差(如 Muttahida Qaumi Movement 只有极短的英文条目却有 287 条 Wikidata 入链)。实验显示 CulturalPangea 在各 bottom-5% 稀有切片上的准确率相对全集下降 15.4%–39.9%:分类数切片 −39.9%、页面浏览量切片 −37.7%、Wikidata 语句数切片 −37.0%,而结构指标与流行度指标圈出的稀有实体集合平均只有 37% 的重叠——意味着只看流行度会漏掉大量模型同样会失败的实体。

本文的目标是本文有两个相互支撑的目标。其一是诊断:把实体稀有性从单一的流行度视角扩展为多维刻画,用 Wikipedia 编辑指标(浏览量、条目长度、修订数、独立编辑者数等)度量文档深度,用 Wikidata 结构指标(语言版本数、语句数、限定符数、出入链)度量知识图谱连通性与跨语言覆盖,逐一考察 SOTA 在每类稀有切片上的退化幅度,验证不同稀有性定义是否暴露不同失败模式,并把这些切片作为 MERLIN-Rare 数据集发布供社区做定向评估。其二是治疗:提出一个简单、免训练的框架,让具备推理能力的视觉语言模型在推理时迭代地检索英文 Wikipedia、动态收集证据,弥补稀有实体在参数知识中的缺失。在此之上作者定量回答三个研究问题:相对已有方法的优势如何随稀有程度扩大?收益来自推理、检索还是二者组合?小模型加检索能否替代大模型?

与已有工作不同的是,本文的独特切入有三点。第一,稀有性定义:以往工作(如 Mallen et al. 2023、Kandpal et al. 2023)把稀有等同于低流行度,而本文首次把 Wikidata 的结构稀疏性——尤其是语言版本数和语句数——作为与文化代表性挂钩的独立稀有性维度,抓住「编辑关注」与「结构连通」的解耦:两者对应的 bottom-5% 集合 Jaccard 重叠最低仅 10%。第二,任务范式:推理增强检索(ReAct、IRCoT)此前只用于知识密集型问答,LLM 实体链接工作(LELA、ELA)都是单次检索加推理且几乎只做英文文本;本文首次把「推理原生 VLM + 迭代式证据收集」引入多语言多模态实体链接,且瞄准文化小众实体。第三,实验方法:用 3 个规模(2B/4B/8B)× 2 种变体(Think/Instruct)× 3 种检索条件(无检索/BM25/嵌入)共 18 个配置的受控因子设计,干净地隔离推理、检索、模型规模各自的贡献及其交互效应,这种归因严格度在实体链接文献中是首次。

核心方法

直觉上,稀有实体最不可能被编码在模型参数里(训练数据向文档充分的头部实体倾斜),但它们仍可能在英文 Wikipedia 中留有文档;同时,把一个多语言提及正确消歧到知识库条目往往需要多步上下文推理,例如文本只说「游轮」时,要靠图片识别出船身上写的 Diamond Princess 才能发起针对性搜索。据此,作者提出一个两模块、免训练的流水线:模块 1 是具备推理能力的 VLM(Qwen3-VL Thinking 系列,2B/4B/8B 三种规模),配有 Wikipedia 搜索工具,允许最多 20 次检索迭代,循环执行「分析图文语境→发出查询→把检索到的标题与描述纳入推理→决定是否继续」;模块 2 把模块 1 产出的完整推理轨迹重新喂回模型,要求其只输出最终的英文 Wikipedia 标题。检索层提供两种实现:基于 BM25S 的词法检索,以及用 multilingual-e5-large-instruct 嵌入加 FAISS 的语义检索,后者专门缓解非拉丁文字提及与英文标题之间的音译鸿沟。

核心创新是「推理与检索互补」这一被受控实验证实的主张,以及支撑它的多维稀有性刻画。与以往把稀有等同于低浏览量不同,本文证明不同稀有性指标圈出的实体集合平均只有 37% 的 Jaccard 重叠,结构性稀疏(语言版本少、语句少、出链少)暴露的失败模式是流行度指标看不到的。方法层面,与 CulturalPangea 依靠在文化数据上微调来注入知识不同,本文完全不动模型权重,而是在推理时让模型自主搜索;与 LELA/ELA 那种「检索一次再推理」不同,这里的检索嵌在推理循环内部、可随推理逐步细化。关键的实证发现是:单独给推理(Think 对 Instruct、均无检索)在任何稀有切片上都不显著($p>0.5$);单独给检索能救稀有实体,却让无推理模型在全集上受伤(8B-Instr+BM25 全集 $-4.9\%$,原因是它平均搜 3.2–5.2 次且不分析结果,检索噪声淹没了参数知识中的正确答案);只有二者结合才既拿全集收益又拿稀有切片收益——推理模型搜索更少(1.0–2.2 次对 3.2–5.2 次)但更精准,两次搜索之间生成 1,400–3,100 个 token 用于分析,而 Instruct 模型只生成 26–30 个 token。

方法步骤详情

流水线步骤如下。输入是文本段落 $T$、配图 $I$ 和被标注的实体提及 $m$。第一步,系统强制模型发起第一次搜索(初步实验发现 2B 模型即便有工具也常不调用、直接报答案,因此必须强制),查询由模型生成,系统提示要求把实体名翻译或音译成英文以匹配英文 Wikipedia 标题。第二步,检索系统返回 top-$k$ 条「标题, 描述」对:BM25 版本在 HuggingFace 的 wikimedia/structured-wikipedia 英文转储上建 BM25S 索引;嵌入版本把每个英文标题-描述对用 multilingual-e5-large-instruct 编码进 FAISS 索引,以查询文本做最近邻检索。第三步,模型把检索结果纳入推理轨迹,分析候选实体并决定是否、如何继续搜索,每例上限 20 次工具调用。第四步,模块 1 输出自由格式的推理过程,包括考虑过哪些候选实体、为何选定最终答案。第五步,模块 2 用完整推理轨迹重新提示模型,要求只输出最终英文 Wikipedia 标题,与金标做精确匹配评估;附录 A.4 另做重定向感知评分作为稳健性检查。

技术新颖性

技术新颖性体现在四个层面。其一,数据/评测层面:MERLIN-Rare 是首个按知识图谱结构指标(而非仅流行度)划定的多语言多模态稀有实体切片集,且阈值稳健性经过验证(1%、5%、10% 结论一致,增益 +8.0% 到 +41.1% 全为正)。其二,范式层面:把 RL 训练出的推理原生模型与工具调用结合用于实体链接,作者明确指出这是推理-检索范式首次进入该任务,填补了实体链接长期停留在「候选集分类或直接生成」的空白。其三,方法层面:完全免训练——不微调任何权重,只靠系统提示、强制首搜、两阶段答案提取这类推理时工程,就超越了一个在文化数据上专门微调过的 SOTA(+6.9%)。其四,科学层面:18 配置的因子设计加上 McNemar/bootstrap 显著性检验(表 8),把「推理×检索」的交互效应从混杂因素中剥离出来,并给出机制性证据——查询细化转换占比 56–58% 对 35–40%、Instruct 查询逐字重复率升到 34%、2B 模型根本不会用工具——这种严格的归因分析在应用型 NLP 论文中少见。

Two-module pipeline. Module 1 performs iterative reasoning with retrieval access over Wikipedia. Module 2 re-prompts the model to extract the final title from the reasoning.
Figure 4: Two-module pipeline. Module 1 performs iterative reasoning with retrieval access over Wikipedia. Module 2 re-prompts the model to extract the final title from the reasoning.

实验结果

主结果(表 2):8B-Think+Embed 在 MERLIN 五语平均达 87.9%,比 SOTA CulturalPangea 的 81.1% 高 6.9%(印地语 +10.0、印尼语 +10.0、泰米尔语 +9.3、越南语 +2.9、日语 +2.1)。RQ1(表 3):15 个 bottom-5% 稀有切片上优势+5.5% 到 +23.3%,限定符 +23.3%(68.4% 对 45.1%)、语句数 +22.1%、出链 +21.7%、语言版本 +16.3%(63.9% 对 47.6%),14/15 个切片增益超全集的 +6.9%。RQ2(表 4):检索增益从全集 +3.8% 放大到语言版本切片 +18.8%,达 5.0 倍;Instruct 出现反转——8B-Instr+BM25 全集 $-4.9\%$ 但结构稀有切片 +8.1%–+12.6%;单独推理在所有稀有切片上不显著($p>0.5$)。RQ3:4B-Think+Embed(83.7%)追平 8B-Instr(83.5%),稀有实体上反超 +5%–+7%;2B 无法有效用工具。错误分析:841 个错误中检索失败占 72%,23.5% 属提取失败;稀有实体错误率 31.1% 对头部 8.4%($\chi^2=40.84$,$p=1.0\times10^{-7}$);非拉丁文字检索失败占错误 76.8% 高于拉丁的 62.5%。稳健性:重定向感知评分下优势保持 +4.9%;14/15 个切片上退化幅度小于 Pangea,实体年龄是唯一例外。

Cultural Pangea accuracy (%) on the full MERLIN test set and bottom-5% slices for each rarity metric.
Table 1: Cultural Pangea accuracy (%) on the full MERLIN test set and bottom-5% slices for each rarity metric.
Accuracy (%) on the full MERLIN test set. Bold = best per column, underline = second best.
Table 2: Accuracy (%) on the full MERLIN test set. Bold = best per column, underline = second best.
8B-Think+Embed accuracy (%) and advantage over Pangea on rare entity slices.
Table 3: 8B-Think+Embed accuracy (%) and advantage over Pangea on rare entity slices.
RAG delta (%) vs. no-RAG baseline computed as per-language macro-average.
Table 4: RAG delta (%) vs. no-RAG baseline computed as per-language macro-average.
Error taxonomy for 8B-Think+Embed on the full MERLIN test set across all languages.
Table 5: Error taxonomy for 8B-Think+Embed on the full MERLIN test set across all languages.
Share of errors (%) by category, for 8B-Think+Embed, on head entities versus rare entities.
Table 6: Share of errors (%) by category, for 8B-Think+Embed, on head entities versus rare entities.
Embedding retrieval statistics for Latin-script (Id, Vi) versus non-Latin-script (Hi, Ta, Ja) inputs, 8B-Think+Embed.
Table 7: Embedding retrieval statistics for Latin-script (Id, Vi) versus non-Latin-script (Hi, Ta, Ja) inputs, 8B-Think+Embed.
Statistical significance (McNemar’s and bootstrap tests) computed on examples pooled across languages.
Table 8: Statistical significance (McNemar’s and bootstrap tests) computed on examples pooled across languages.
Baseline accuracy (%) on the full test set and bottom-5% rare entity slices. All three baselines degrade on rare entities.
Table 9: Baseline accuracy (%) on the full test set and bottom-5% rare entity slices. All three baselines degrade on rare entities.
Accuracy (%) under exact-match and redirect-aware scoring.
Table 10: Accuracy (%) under exact-match and redirect-aware scoring.
Think − Instruct gap (%, average across languages) by model size and retrieval method.
Table 11: Think − Instruct gap (%, average across languages) by model size and retrieval method.
Accuracy drop (%) from full dataset to bottom-5% slices. “Gap” = Pangea drop − our drop.
Table 12: Accuracy drop (%) from full dataset to bottom-5% slices. “Gap” = Pangea drop − our drop.
Accuracy (%) at 1%, 5%, and 10% rarity thresholds for five metrics, using per-language macro-averages.
Table 13: Accuracy (%) at 1%, 5%, and 10% rarity thresholds for five metrics, using per-language macro-averages.
Full error taxonomy across 8B configurations.
Table 14: Full error taxonomy across 8B configurations.
Pipeline decomposition of errors for RAG-based 8B configurations.
Table 15: Pipeline decomposition of errors for RAG-based 8B configurations.
Search behavior summary across all 12 RAG configurations.
Table 16: Search behavior summary across all 12 RAG configurations.
Computational cost per example across all 18 configurations.
Table 17: Computational cost per example across all 18 configurations.
Accuracy (%) with and without embedding retrieval, for Qwen3-VL and GLM-4.6V-Flash.
Table 21: Accuracy (%) with and without embedding retrieval, for Qwen3-VL and GLM-4.6V-Flash.
Our best system (8B-Think+Embed) vs. baselines. (a) Full test set accuracy across five languages: +6.9% average over SOTA. (b) Advantage over Pangea on bottom-5% rare entity slices reaches +23.3%. (c) On rare entities in the bottom 5% by language editions, Pangea reaches 47.6% while our system reaches 63.9%.
Figure 2: Our best system (8B-Think+Embed) vs. baselines. (a) Full test set accuracy across five languages: +6.9% average over SOTA. (b) Advantage over Pangea on bottom-5% rare entity slices reaches +23.3%. (c) On rare entities in the bottom 5% by language editions, Pangea reaches 47.6% while our system reaches 63.9%.
Advantage (%) of 8B-Think+Embed over Cultural Pangea across all 15 bottom-5% rare entity slices, sorted by magnitude.
Figure 6: Advantage (%) of 8B-Think+Embed over Cultural Pangea across all 15 bottom-5% rare entity slices, sorted by magnitude.
Accuracy (%) by rarity decile (1 = rarest, 10 = most common) for two representative Wikidata-structural metrics. Our system (8B-Think+Embed) degrades roughly half as steeply as CulturalPangea toward the sparse end.
Figure 7: Accuracy (%) by rarity decile (1 = rarest, 10 = most common) for two representative Wikidata-structural metrics. Our system (8B-Think+Embed) degrades roughly half as steeply as CulturalPangea toward the sparse end.
4B-Think+Embed vs. 8B-Inst on the full dataset and rare entity slices. The two systems are nearly identical on the full dataset but diverge on rare entities, with the smaller reasoning model winning by +5–7%.
Figure 8: 4B-Think+Embed vs. 8B-Inst on the full dataset and rare entity slices. The two systems are nearly identical on the full dataset but diverge on rare entities, with the smaller reasoning model winning by +5–7%.
Accuracy vs. model size (2B/4B/8B) across all 6 configurations.
Figure 9: Accuracy vs. model size (2B/4B/8B) across all 6 configurations.
Per-search hit rate (fraction of examples where search k returns the target) and cumulative retrieval success for 8B models.
Figure 10: Per-search hit rate (fraction of examples where search k returns the target) and cumulative retrieval success for 8B models.
Query diversity (left) and verbatim repetition rate (right) across successive search transitions for 8B models.
Figure 11: Query diversity (left) and verbatim repetition rate (right) across successive search transitions for 8B models.
Search count distributions across all 12 RAG configurations. Think (blue) concentrates at 1–2 searches; Instruct (orange) spreads across 3–5+.
Figure 12: Search count distributions across all 12 RAG configurations. Think (blue) concentrates at 1–2 searches; Instruct (orange) spreads across 3–5+.
Accuracy vs. average token cost for all 18 configurations. Bold labels mark the Pareto frontier.
Figure 13: Accuracy vs. average token cost for all 18 configurations. Bold labels mark the Pareto frontier.
查看结构化数据
任务指标本文基线提升
MERLIN 全测试集(5 语种平均)多语言多模态实体链接 精确匹配准确率 (%) 87.9(8B-Think+Embed) CulturalPangea 81.1(此前 SOTA);mGENRE 72.9;GEMEL 58.7 +6.9
bottom-5% 限定符数(Wikidata)稀有切片 精确匹配准确率 (%) 68.4 CulturalPangea 45.1 +23.3
bottom-5% 语句数(Wikidata)稀有切片 精确匹配准确率 (%) 66.1 44.0 +22.1
bottom-5% Wikidata 出链稀有切片 精确匹配准确率 (%) 66.3 44.6 +21.7
bottom-5% 分类数切片 精确匹配准确率 (%) 59.5 41.2 +18.3
bottom-5% 语言版本数稀有切片 精确匹配准确率 (%) 63.9 47.6 +16.3
bottom-5% 页面浏览量(90 天)切片 精确匹配准确率 (%) 57.5 43.3 +14.1
印地语全测试集 精确匹配准确率 (%) 87.0 77.0 +10.0
印尼语全测试集 精确匹配准确率 (%) 90.6 80.6 +10.0

局限与改进

作者在 Limitations 一节承认:受控因子实验只在 Qwen3-VL 上做,GLM-4.6V-Flash 的非思考模式无法维持检索循环,因此「推理×检索」的完整交互效应是否跨模型家族成立尚无证据,只验证了稀有切片的检索收益跨家族成立;评测限于 MERLIN 的五种语言,且知识库锚定英文 Wikipedia——所有 MERLIN 实体按构造都有英文条目,对完全没有英文覆盖的实体(如 Wikipedia 更稀疏的非洲语言)方法是否有效未知;检索是最大瓶颈,占 72% 的错误,即便嵌入检索也不能保证源语言与英文标题音译差异大时的召回;评测沿用 MERLIN 的精确匹配协议,会把合法的非规范标题(重定向、缩写)误判为错。我的补充观察:成本不可忽视,最佳配置每例约 11,052 个 token、176.9 秒,是最便宜配置的 3.9 倍(表 17),而无检索的 8B-Think 已用 45% 成本拿到 96% 的准确率;在分布最常见端(decile 10)系统反而落后基线 2–3 个点;23.5% 的提取失败说明两阶段答案抽取会丢掉推理中已经出现的正确候选;整套系统继承英文 Wikipedia 的西方中心覆盖偏差,稀有性刻画只能暴露偏差而不能修正它。

独立分析的弱点

独立分析的弱点:第一,检索召回是硬瓶颈(72% 的错误中正确实体从未被搜到),非拉丁文字尤甚(占错误 76.8%),典型案例包括日语「米」被误读为姓氏而从未搜「美国」、印尼语 Kinabalu 时城市 Kota Kinabalu 压在联邦选区前。改进方向:先在源语言 Wikipedia 检索再跨库链接,或对查询做音译候选扩展,结合 Wikidata 别名/标签做候选召回。第二,成本与收益不成比例的场景:8B-Think+Embed 每例 11.1k token、约 177 秒,改进方向是按提及的预测稀有度或置信度自适应分配检索预算,只在结构稀疏时启动多跳循环。第三,小模型工具使用失败:2B-Think 在 97% 的样本上只做强制单次搜索,说明有效工具使用是规模涌现能力,改进方向是用示教轨迹或强化学习专门训练小模型的搜索策略。第四,消歧/粒度错误在稀有实体上上升(concept granularity 从 3.0% 升到 8.7%),模型会主动拒绝正确实体(23.5% 提取失败),改进方向是在推理中显式枚举候选并强制逐个验证,或对选择阶段做校准。第五,「推理×检索」交互可能绑定 Qwen 式推理实现:GLM 思考模式因锚定检索候选在全集上损失 2.7%,结论外推需谨慎。

未来方向

作者明确提出的方向:改进跨语言检索是未来最有影响力的工作方向(检索失败占 72% 的错误);把评测推广到 Wikipedia 更稀疏的语言(如非洲语言)以检验方法在文化长尾上的极限;用 MERLIN-Rare 做定向评估。基于本文成果可延伸的方向:其一,用强化学习训练「何时搜、搜什么、何时停」的工具使用策略(作者引用了 Search-R1、ReTool 一线工作),把推理式搜索从提示工程变成可学习的技能,同时优化 token 预算;其二,把 Wikidata 图结构直接纳入检索——沿出入链做图遍历、用结构特征重排候选——这正对应收益最大的切片恰恰是 Wikidata 结构切片的事实;其三,多模态检索扩展,用图像内容(船身文字、地标、人脸)直接生成查询或做图像到实体的检索;其四,把重定向感知评分推广为社区标准,作者显示它会把双方分数抬到 89.5/84.6 但优势收窄到 +4.9%,说明协议选择影响结论表述;其五,用结构稀有度指标做课程学习或数据增强,在训练阶段就照顾结构稀疏实体;其六,探索非英文知识库与本地语言知识源,缓解英文中心的覆盖偏差。

复现评估

复现条件相当友好。开源情况:项目页 neulab.github.io/think-before-you-link/ 提供代码(MIT)与 MERLIN-Rare 切片(CC BY-SA 4.0);模型与工具全开放——Qwen3-VL(Apache 2.0)、multilingual-e5-large-instruct(MIT)、FAISS/BM25S(MIT)、SGLang(Apache 2.0);数据侧 MERLIN 基准、英文 Wikipedia(CC BY-SA 4.0)、Wikidata 元数据(CC0)均公开。算力:每配置仅需一块 NVIDIA L40S(48GB)、10 CPU 核、25GB 内存,无需多卡集群;论文给出全部 18 配置的逐例成本(表 17),如最佳配置11,052 token、176.9 秒/例,最贵的 2B-Instr+BM25 反而要 23,527 token,可据此估算开销。需自行完成的工作:用 Wikipedia/Wikidata API 抓取 15 个稀有性指标、构建 BM25 与 e5 嵌入索引、复现强制首搜与两阶段提取的提示(完整模板见附录 A.12)。综合评估难度中低:单卡 48GB 即可复现主表,主要不确定性在 Wikipedia 索引版本差异与提示敏感性,但作者公开的搜索行为统计(表 16、图 10–12)可用于对齐验证。