← 返回 2026-08-24

大语言模型时代的圣训计算科学:批判性叙述综述 Hadith computational science in the age of large language models: a critical narrative review

Md. Ashraful Haque, Riasat Islam 📅 2026-06-18 👍 2 2026-08-29 18:30
AI伦理 圣训NLP 大语言模型 知识图谱 综述 阿拉伯语NLP

批判性评估圣训计算在LLM时代的真实进展、结构性缺口与五大研究议程

前置知识

Isnad 与 Matn(传述链与正文)

圣训由两部分构成:isnad/sanad 是传述链,记录该言辞经过哪些传述人一代代传递下来;matn 是言辞内容本身。将二者自动分割(isnad-matn separation)是圣训计算的基础任务,因为传述链的真伪与正文含义需要分开评估,很多下游任务(传述人分析、来源验证)都以干净的分割为前提。

论文的三层任务框架和大量被评估研究都围绕这一文本结构展开,不理解 isnad/matn 就无法理解各任务的定义、基准与评估判词。

批判性叙述综述

与 PRISMA 式系统综述或文献计量不同,批判性叙述综述不追求穷举检索和统计汇总,而是由作者依据明确声明的评估维度,对代表性研究逐篇做质量评价与解释性综合。它适合任务、数据、评测实践高度异质的领域,因为简单计数会抹平最关键的差异。

本文正是用这种综述逻辑区分'持久进展'与'基准局部收益',并在第3节详细交代了其检索、纳入与评估设计及自身局限。

检索接地与 RAG

检索接地指系统在生成答案前先从权威来源检索证据并引用出处,典型实现是检索增强生成(RAG)。在宗教文本这类高风险领域,接地让输出的忠实性可检验、可溯源,是抑制幻觉、把'流畅生成'变成'可靠引用'的关键机制。

论文把接地评测(如 Mubarak 等 2025 把忠实性与幻觉做成显式任务)视为 LLM 时代最重要的范式转变之一,也是其'证据基础设施'论断的核心。

知识图谱与实体链接

知识图谱以节点(人物、书籍、事件)和边(师承、引用、归属)组织结构化知识;实体链接则把文本中出现的名字消歧到图谱中的正确实体。在圣训领域,这依赖 rijal(传述人传记)文献提供的生平、师承与时代信息,是溯源感知检索和跨源证据网络的地基。

Level 2/3 的核心难题——传述人身份消解、跨集合链接、可检验证据图——本质都是知识图谱与实体链接问题。

专家在环评估

在自动指标之外,引入领域专家对系统输出进行验证、纠错与评分的评估协议,包括标注规范、评分量表和错误复盘流程。在自动指标无法覆盖正确性、可接受性等维度的场景(法律、医疗、宗教文本),它是判断系统是否真正可用的必要环节。

论文主张在宗教文本域,专家判断是系统质量本身的一部分:Asgari-Bidhendi 等(2025)用 6 位领域专家给 120 万条叙述的富集结果打分就是范例。

研究动机

圣训计算自 Azmi 等 2019 年的奠基性综述之后进入 transformer 与 LLM 时代,但现有综述没有跟上形势。Hakak 等(2022)只聚焦认证问题,不重估更广的计算图景;Sulistio 等(2024)更像机器学习应用的'技术清单',对基准可比性、任务成熟度、哪些原创研究真正改变了领域几乎不置一词;Azwar 等(2025)靠文献计量把发文量增长当作领域成熟的证据,而发文数量并不证明核心问题正在被解决;Azwar 与 Usman(2025)的 PRISMA 综述仍停留在高层描述。结果是一个解释真空:读者无法判断哪些研究提供了方法学上持久的证据,哪些收益只在特定基准内成立,哪些弱点仍在阻碍学术应用。更严重的是,这些综述几乎不纳入伊斯兰学者与领域专家视角——而在真实性、权威性、伦理治理高度敏感的宗教文本领域,这恰恰是核心问题。同时领域内大量论文依赖六部正典圣训集等结构规整的语料,报告的漂亮分数掩盖了真实文本世界的复杂与混乱。

本文的目标是本文的目标是完成一次批判性叙述综述,回答五个环环相扣的问题:(1) transformer 与 LLM 时代最重要的方法学变化是什么;(2) 哪些当代研究构成实质性进步而非基准局部收益;(3) 为什么现有综述留下解释空白;(4) 哪些结构性限制持续约束领域,特别是六部正典书与裸正文之外的部分;(5) 伊斯兰学者与领域专家的视角应如何塑造下一阶段研究。作者进一步主张把圣训计算重新定义为'证据基础设施问题'——评价标准不应是孤立的模型性能,而应是知识整合、溯源与专家监督——并据此给出一份由五个相互关联的研究计划构成的议程,覆盖基准改革、长尾语料、学术感知建模、跨源整合与专家治理。

与已有工作不同的是,本文的独特切入在综述逻辑本身。作者不做穷举计数,理由是该领域在数据、方法、发表场所、评测实践上高度异质,计数会抹平最关键的差异。他们改用三层分析框架(Level 1:isnad-matn 分割等分割任务;Level 2:传述人分析、来源验证、问答、认证建模;Level 3:知识图谱与语料级富集基础设施)解释'进步为何不均衡';设计六个评估维度(语料真实性、评测设定、迁移、可复现性、专家参与、学术用途)对代表性论文逐篇编码,而不是把不同任务的分数堆进一个排行榜;并把学者/专家文献从'附录式讨论'提升为证据链的中心。文中还明确区分三类声明——实证观察、解释性综合、规范性建议——使读者能分辨证据强度。据作者所述,这是首篇对圣训计算文献做论文级批判性评估并系统纳入专家视角的综述。

核心方法

综述设计分四步。第一步检索:2025 年末至 2026 年初,在 Google Scholar、Scopus、ACL Anthology、SpringerLink、ScienceDirect、arXiv 及人工整理的领域库中迭代检索,查询词把圣训术语(hadith、sanad/isnad、matn、sharh、takhrij)与 AI 术语(NLP、transformer、large language model、knowledge graph、question answering、retrieval、authentication 等)组合,再做前向/后向引用追踪收敛清单。第二步汇编:文献库初始入围 42 条,按范围精炼后剩 32 条,涵盖技术研究、数据集/语料论文、综述及少量治理语境文献,重点放在 transformer 与 LLM 时代的工作,同时保留奠定技术基线的早期研究。第三步筛选:满足三条纳入标准之一即可入选。第四步评估与综合:对核心论文按六维度编码,区分三类声明强度,最终形成研究议程。

核心创新是把综述本身变成'证据评估'而非'活动地图'。与既有综述罗列应用和趋势不同,本文对每篇关键论文追问:依赖的语料是否真实多样?评测设定能否与别的研究比较?迁移是否被测试?数据与代码是否可审计?专家是否参与?任务是通向真实学术工作流还是只解决技术代理?由此得出两条反直觉判断。其一,方法变迁不是'旧 AI 被 LLM 干净替换':符号/混合方法在稳定的分割任务上仍有竞争力(Table 3),LLM 真正改变的是规模(Rezwan 流水线处理约 120 万条叙述)、工作流编排(OCR 修复、分割、检索、来源核查、简化、语义标注、人工验证的组合)和'什么算有说服力的证据'。其二,圣训计算应被评估为证据基础设施问题——成功标准是溯源、接地、不确定性呈现与专家监督,而不是在孤立基准上刷 SOTA。

方法步骤详情

具体执行如下:先按上述检索式与时间窗汇编文献库(初始 42 条,精炼后 32 条)。纳入标准有三条,满足其一即可:(1) 直接在圣训或相近古典阿拉伯语宗教文本任务上提出或评估计算方法;(2) 创建、记录或基准化实质影响圣训计算的资源(语料、分割数据集、传述人数据集、知识接地评测资产);(3) 提供改变领域解读方式的综述级或学者反思,尤其是关于真实性、权威性、负责任使用的讨论。排除纯神学讨论和与圣训无关的泛阿拉伯语 NLP。对进入逐篇评估的原始研究另设四条精选标准:任务中心性、方法独特性、对后续工作或基准实践的影响力、技术细节是否足以支撑批判性评估。评估框架为六维度(Table 2):语料真实性、评测设定、迁移、可复现性、专家输入、学术用途,用 Y/P/N 三级编码而非单分数打分,并且不把不同任务的头条指标合并成总排名——因为任务定义、语料与指标跨文献差异过大。Table 4 对 8 组代表性研究逐项给出评估与总评。预印本只在引入重大基础设施时保留并明确标注;概念/伦理论文只作解释性背景。

技术新颖性

新颖性不在算法而在综述方法学。第一,论文级批判评估:Table 4 是圣训计算领域第一个结构化的逐篇评估表,暴露了描述性综述必然错过的证据缺口,例如 Mahmoud 等(2022)在人工 sanad 验证集上表现强、真实测试数据上明显更弱——这正是'合成-真实迁移鸿沟'的直观证据。第二,领域定制评估维度:六维度为宗教文本域量身设计,'专家输入'与'学术用途'是一般 NLP 综述没有的维度;作者还公开声明自己的解读优先级(溯源、接地、基准现实性、学术用途),让偏好本身可被批评。第三,把'LLM 带来了什么/没带来什么'说清楚:LLM 改变了规模、工作流与证据标准,但没有解决传述人身份消解、预处理脆弱性、传记-书目接地问题,因此当前是'混合阶段'而非 LLM 中心阶段。这套模板对其他低资源、高风险、扎根于传统知识体系的领域(法律、古典学、宗教研究)具有可迁移性。

实验结果

综述的核心发现是'进步不均衡'。Level 1(isnad-matn 分割)最快成熟:Altammami 等(2019)在六部正典圣训集上建立端到端跨书基准,多种方法在稳定环境中均表现强劲,但都受限于正典语料;Muther 与 Smith(2020)证明长文本中精确边界常无客观答案,使评测更贴近现实。Level 2 '在压力下多样化':传述人消歧、来源验证、问答、知识表示相继出现,但无一攻克跨集合鲁棒性与传记实体链接。数据层面,Mghari 等(2022)的 Sanadset 含 650,000 条叙述、覆盖 926 本书,暴露早期基准的结构假设只适用于异常规整的材料;Mahmoud 等(2022)显示人工 sanad 验证与真实测试间的性能落差。Level 3 跃升至流水线基础设施:Asgari-Bidhendi 等(2025)的 Rezwan 处理约 120 万条叙述、含 6 位专家评分;Mubarak 等(2025)把忠实性与幻觉做成显式评测目标。据此归纳四大缺口:过度集中于六正典书、注释层缺失、与古兰经-seerah-rijal 网络连接薄弱、面向当代 fiqh 的桥接不足。

How our review differs from recent review literature on hadith computation and digital hadith studies
Table 1: How our review differs from recent review literature on hadith computation and digital hadith studies
Appraisal dimensions used to evaluate primary studies in this review
Table 2: Appraisal dimensions used to evaluate primary studies in this review
Main AI paradigms in contemporary hadith computation
Table 3: Main AI paradigms in contemporary hadith computation
Structured appraisal of representative primary studies
Table 4: Structured appraisal of representative primary studies
Conceptual foundation for the next phase of hadith computational science
Fig. 1: Conceptual foundation for the next phase of hadith computational science
查看结构化数据
任务指标本文基线提升
圣训叙述语料规模 叙述条数 / 覆盖书籍数 Sanadset:650,000 条叙述、926 本书(Mghari 等 2022,被本文评估为基础设施级贡献) 六部正典书内部基准(如 Altammami 等 2019 的分割基准) 规模与结构多样性数量级提升,暴露正典-only 基准的盲区,但本身不解决跨集合迁移问题
LLM 辅助语料富集流水线 处理规模与专家验证 Rezwan:约 $1.2 \times 10^6$ 条叙述、多任务、多语言、6 位领域专家评分(Asgari-Bidhendi 等 2025) 旧式小语料、单任务本地管线($10^3$ 量级) 处理规模从 $10^3$ 级跃升至 $10^6$ 级,但成本高、提示敏感、可复现性有限
传述人消歧 人工 sanad 验证集 vs 真实测试集表现 Mahmoud 等 2022:首个大规模可训练的传述人消歧基准资源 此前无该任务的系统形式化 任务形式化与资源贡献显著;人工数据到真实数据的迁移仍是公认弱点
接地评测(忠实性/幻觉) 以权威来源为基准的 QA 与幻觉/纠错任务化 Mubarak 等 2025:古兰经/圣训接地的评测框架,开放度 Y、专家参与 P 无接地的自由生成评测 使 faithfulness 首次可测量,但仍属代理任务,不等于真实学术工作流验证
综述文献库 精炼后收录条数与评估深度 初始 42 条入围、精炼后 32 条;8 组代表性研究逐篇六维度编码(Table 4) Azwar 等 2025、Sulistio 等 2024 等既有描述性/文献计量综述 从'活动地图'升级为带评估维度的论文级批判评估

局限与改进

作者承认的局限:叙述综述固有搜索与选择偏倚,偏向被主流数据库索引、数字可及的研究;灰色文献、索引薄弱的阿拉伯语期刊、实践中使用的未发表工具代表性不足——而长尾圣训语料的'不可发现'本身就是领域问题的一部分;作者还明确声明其解读优先级(溯源、接地、基准现实性、学术用途)会塑造对文献的判断。我补充的观察:32 条的文献池相对单薄,任何关键论文的入选/落选都可能改变结论;六维度 Y/P/N 编码没有公开评分锚点或多人编码信度检验,部分判词(如 QA 研究'受控环境')依赖主观权衡;'学者视角'一章自己也承认证据多为概念性、基于小专家池,却仍用它支撑治理议程的规范性部分;全文几乎没有定量元分析(如按年份、任务、语料统计文献分布),'进步不均衡'的论断主要靠选例论证;对非英语(印尼语、乌尔都语、中文等)伊斯兰 AI 社区的工作覆盖不明,可能低估已有实践。

独立分析的弱点

弱点一:证据基座小且不完全可审计。42 到 32 条的筛选、8 组逐篇评估,选例稍有不同结论就可能变化;改进方向是公开完整编码表、检索日志与落选清单,允许社区复核与扩展。弱点二:六维度编码缺乏信度检验。Y/P/N 判断没有评分指南、没有第二编码者一致性(如 Cohen's kappa);改进方向是发布标注规范并做双人独立编码。弱点三:专家视角章节与技术批评的严谨度不对称——引用的多是概念性论文与小样本专家讨论,作者也承认不能代表'伊斯兰学者观点'整体,却据此推进治理议程;改进方向是开展跨 madhhab、跨机构、跨技术素养层级的正式专家调查。弱点四:议程规范性有余、操作性不足,'长尾语料建设''可检验证据图'没有给出原型系统、数据许可方案或组织机制;改进方向是先在某个具体长尾文集(如一部 musnad)上做端到端试点再谈推广。弱点五:对负面结果的讨论多为二手转述,本文未直接复现任何被批评的基准来验证'基准局部收益'的判断。

未来方向

作者提出五个相互关联的研究计划:(1) 基准改革与评测现实主义——从正典书内测试转向跨集合迁移、结构不规则叙述、手稿/OCR 污染材料,并建立报告标准(语料边界、预处理假设、开放度、失败模式);(2) 知识基础设施与长尾语料——覆盖六正典书之外的 musnad、musannaf、mu'jam、ajza'、rijal 著作与注释文献,配套收集感知元数据、版本追踪、阿拉伯语宗教文本 OCR 基准(引 Heakl 等 2025);(3) 学术感知建模——传述人身份消解需要良好链接的 rijal 资源与时空约束;注释感知计算要把正文与 sharh、takhrij、法律推断对齐并区分学派限制;(4) 整合伊斯兰知识系统——把古兰经、seerah、tafsir、fiqh 章节、传述人传记连成可检验证据网络,定位是面向 fiqh 的证据支持而非自动 fatwa 签发;(5) 专家中心治理——scholar-in-the-loop 评估协议、可审计提示、不确定性呈现。可延伸方向:把 Table 4 框架工具化为评审评分卡;基于 Sanadset 量化合成-真实迁移差;设计跨源多跳证据检索共享任务。

复现评估

作为文献综述,本文不发布代码或数据集(作者在声明中明确:Data availability 为文献型叙述综述、无新数据集;Code availability 不适用)。'复现'意味着按其公开的检索式、数据库清单、时间窗(2025 年末至 2026 年初)与三条纳入标准重新汇编文献库——这些信息写得足够清楚,中等投入即可复现出一个近似文献池,但逐篇精选与 Y/P/N 编码含主观判断,难以逐项复现。Table 2 的六维度与 Table 4 的呈现格式本身是可复用资产,适合直接改造成系统综述方案或论文评审评分卡。无需算力。被综述工作中值得关注的开放资源:Sanadset(650K 条叙述、926 本书)、OpenITI 开放文本基础设施(Miller 等 2022)、Rezwan 流水线(作者明确指出其可复现性有限);多数被评估研究(如 Altammami 2019、Mahmoud 2022)的开放性在 Table 4 中仅获 P(部分),暗示领域整体的数据开放仍是短板。