← 返回 2026-08-05

LegalPincite:多层次法律信息检索数据集 LegalPincite: Multi-level Legal Information Retrieval Dataset

Theresia Veronika Rampisela, Henrik Palmer Olsen, Giovanni Colavizza 📅 2026-08-04 👍 4 2026-08-10 18:30
信息检索 引用检索 数据泄漏 数据集 法律AI

欧盟法院多层次法律检索数据集,缓解查询泄漏并纳入全段落语料

前置知识

精准引用(pincite/pinpoint citation)

精准引用指在法律文书中对另一个案件某一段落的精确引用,而非仅引用整个案件。例如判决第40段中写明引用了案件 C-35/19 的第29段。法律实践非常依赖精准引用,因为法律文档冗长乏味,而真正相关的往往只是被引案件中的某一段。它对应案件-案件、段落-案件、段落-段落三种引用层级。

理解精准引用及其三个层级是读懂本文数据集设计动机的基础,因为LegalPincite的全部创新都围绕如何在段落级提供检索标注与查询脱敏。

查询数据泄漏(query data leakage)

在检索评测中,查询文本本身若包含答案线索(如被引案件标题、案件编号 C-35/19、段落号29、涉案当事人),模型可以通过简单匹配这些线索获得虚高的性能,而非真正理解语义相关性。研究表明段落开头的标识符尤其会膨胀检索分数。LegalPincite通过法律NER模型与正则表达式系统移除这类信息来缓解泄漏。

数据泄漏是本文要解决的核心痛点之一,论文专门用Tab. 8做了泄漏消融分析,理解它才能明白为什么仅移除段落ID还不够、为什么必须用脱敏后的查询。

稀疏检索模型与IR评测指标

稀疏检索模型基于词频统计,包括TF-IDF、BM25、基于Dirichlet平滑的语言模型LMIR,以及无参的DPH(基于超几何模型)。评测指标有Hit Rate@$k$(前k个是否命中相关文档)、NDCG@$k$(归一化折损累积增益,考虑排名位置)、MAP(平均精度)、MRR(倒数排名)。BM25对超长文档会过度惩罚。

本文的所有基线实验都用这四个稀疏模型和上述指标,看懂Tab. 6/Tab. 8需要熟悉NDCG@10等指标的含义及其在不同检索层级上的可比性。

时间泄漏与防泄漏划分

检索评测集若不控制时间,可能出现2020年案件引用2023年先例这种违反因果的不合理情况。LegalPincite按年份划分train(查询<2018)/dev(2018-2021)/test(2022-2025),并限制dev/test的真实引用与候选文档年份均严格早于该划分的所有查询年份,从而模拟真实法律检索场景。

这是数据集构建方法论的关键,决定了LegalPincite评测的严谨性与现实性,也是它优于既有数据集的工程细节。

研究动机

现有公开法律信息检索数据集存在两个严重缺陷。首先是查询泄漏:段落级引用检索数据集(如Mori et al.、Olsen et al.的工作)在查询段落中保留了被引案件标题、段落编号、案件相关实体等信息,这些信息本不应出现在测试查询中,会导致模型通过匹配查询里已暴露的引用线索获得虚高的检索性能。其次是语料不完整:这些数据集的候选文档集合仅包含引用和被引用段落,排除了大量既不引用也不被引用的普通段落,而这类段落构成案件内容主体。把候选池大幅缩小后,检索任务被过度简化,无法反映真实场景。Tab. 1系统对比了COLIEE、AusLaw、IRLeD、ECtHR-PCR、Caselaw、CLERC等十个数据集,显示同时具备泄漏缓解、全段落语料和人工验证三重特性的只有LegalPincite。作者进一步检查[26,27]还发现语言歧义、文本缺失、分段错误、人工标注不可复用等问题,严重影响可用性。

本文的目标是本文目标是构建一个大规模、多层次、可复用的法律IR评测集LegalPincite,支撑案件-案件、段落-案件、段落-段落三种查询-文档层级的检索方法开发与严格评测。具体而言,数据集需满足三点:一是提供经过脱敏的查询,移除与引用相关的案件标题、案件号、段落号和涉案当事人以消除泄漏;二是提供包含全部段落的真实候选语料,而非仅引用/被引用段落,以模拟真实检索难度;三是提供案件级和段落级真实引用标注,并辅以部分法学专家的人工验证。作者还希望数据集遵循FAIR原则(可发现、可访问、可互操作、可复用),赋予DOI、发布到HuggingFace Hub、采用CC-BY许可,并提供兼容pyterrier的CSV格式与基准复现代码。

与已有工作不同的是,本文独特切入角度是同时解决泄漏和语料完整性这两个此前被割裂处理的难题。已有段落-段落引用数据集要么做了泄漏缓解但语料残缺,要么语料完整却存在严重泄漏,而LegalPincite是首个在三个检索层级上同时实现泄漏缓解、全段落语料纳入和人工验证三重特性的数据集。作者还针对[26,27]中的语言歧义(缺失语言标签,约5%为法语)、268个段落文本缺失、影响1400+案件的解析错误、以及无法回链到原始数据的人工标注等可用性问题逐一修复,并用2021-2025年最新数据扩充,最终得到2,170个新案件和41,547条新引用。这种修复加更新加脱敏的组合策略是相比单纯发布新数据集的本质区别。

核心方法

整体思路是先合并与清洗两份已有CJEU数据集,再用最新数据扩充,然后通过命名实体识别与正则表达式对查询脱敏,最后按IR评测惯例格式化输出。技术路线分四阶段:数据获取阶段合并[26]的全段落数据集(截至2024-07-29)与[27]的引用数据集(110,601对引用加890条专家标注),二者均源自EUR-Lex;数据更新阶段在2026年5月用selenium爬取2021-2025年的2,170个案件,提取41,547条段落-段落引用;预处理阶段解决语言歧义、缺失文本、分段错误、标注不可用四类问题,并按年份划分train/dev/test;脱敏阶段用预训练法律NER模型[14]与正则识别并移除查询中的引用信息。整个过程以层次化的查询-文档对齐(CELEX案件ID与段落号)为骨干,最终输出兼容pyterrier的query/doc/qrel CSV文件,仅含二值相关性。

核心创新点是全段落语料与查询脱敏的组合,这是区分LegalPincite与所有现有数据集的本质特征。已有方法要么只提供引用/被引用段落(语料残缺导致检索难度被低估),要么不脱敏(查询泄漏导致性能虚高),而LegalPincite同时做到了两点。作者特别发现,简单移除段落编号ID并不足以消除泄漏——仍可能因为查询中残留的案件标题等线索而虚高性能。因此他们结合法律NER模型与正则表达式系统移除所有引用相关信息,并用Tab. 8定量证明仅移除段落ID仍会膨胀NDCG@$10$。另一个关键创新是修复[26,27]中1400+案件的解析错误与段落拼接问题,通过重新下载EUR-Lex的HTML/XHTML版本并用Cellar API提取被自定义标签包裹的段落号与文本,保证分段与源文档一致。

方法步骤详情

方法步骤如下。第一步数据获取:合并[26]全段落数据集与[27]引用数据集,均源自EUR-Lex,用CELEX案件ID与段落号作标识。第二步数据更新:用selenium爬取2021-2025年的CJEU判决,得2,170个新案件,提取41,547条段落-段落引用,用Cellar API从HTML/XHTML提取段落文本,排除155个无法在线获取的案件。第三步清洗与修复:用langdetect移除约5%非英文段落;从[26]与EUR-Lex在线版本恢复268个缺失段落文本,无法恢复的引用对删除;用Cellar API重下载修正影响1400+案件的解析错误;手动修复[27]不可用的人工标注三元组。第四步聚合与划分:去重后按年份划分train(<2018)/dev(2018-2021)/test(2022-2025),限制dev/test真实引用与候选均早于查询年份以防时间泄漏。第五步查询脱敏:用法律NER模型[14]与正则识别并移除案件标题、案件号、段落号等引用信息。第六步格式化:输出query/doc/qrel及metadata CSV,兼容pyterrier。

技术新颖性

技术新颖性体现在多个维度。首先是多层次检索支持:这是首个同时覆盖案件-案件、段落-案件、段落-段落三层级的CJEU数据集,三层级train查询数分别约6,738/43,847/43,847。其次是系统化的数据修复管线,识别并解决前人数据集未被重视的四类问题,特别是影响1400+案件的解析错误与段落拼接,显著提升可复用性。第三是严谨的时间防泄漏划分策略:候选与真实引用年份均严格早于查询年份,避免2020年案件引用2023年先例这种不合理情况。第四是双源标注融合:将EUR-Lex自动提取的引用与两位法学专家的二值相关性标注(基于逐字复述与扩展复述两问)聚合,并验证二者在检索效果上差异较小。第五是数据泄漏的实证分析,定量证明仅移除段落ID不足以消除泄漏,建议使用LegalPincite已脱敏查询。

实验结果

核心发现分三部分。第一,多层级基线效果(Tab. 6):案件-案件层级LMIR最优,dev/test的NDCG@$10$为0.462和0.442;段落-案件层级TF-IDF最优,NDCG@$10$均为0.604;段落-段落层级BM25与TF-IDF持平,dev约0.573-0.574。BM25在案件-案件和段落-案件上明显较差(case-case test N@$10$仅0.101),因它对超长法律文档过度惩罚;DPH在各层级稳定。第二,数据泄漏分析(Tab. 8):对比ori(未脱敏)、w/o par ID(仅移除段落号)、w/o citation(移除全部引用信息)三设置,案件-案件和段落-案件层级泄漏使NDCG升高,段落-案件升幅最大达0.111(55.0%);例外是BM25案件-案件ori下反而下降30.7%。段落-段落层级w/o citation反而最优,比其他设置高最多0.186 NDCG@$10$(34.7%),说明移除引用信息也减噪。第三,标注来源对比(Tab. 7):仅EUR-Lex与附加人工验证两子集NDCG@$10$差异较小,可在更小人工子集评测以省算力。

Datasets for legal case retrieval or paragraph citation retrieval in English, based on query-document level, citation leakage mitigation on queries, all paragraphs, and human validation.
Table 1: Datasets for legal case retrieval or paragraph citation retrieval in English, based on query-document level, citation leakage mitigation on queries, all paragraphs, and human validation.
Range of years used for chronologically splitting query (citing), cited, and candidate cases/paragraphs.
Table 2: Range of years used for chronologically splitting query (citing), cited, and candidate cases/paragraphs.
Statistics of query and ground truth for each query-doc level and split.
Table 3: Statistics of query and ground truth for each query-doc level and split.
Statistics of corpus (candidate cases or paragraphs).
Table 4: Statistics of corpus (candidate cases or paragraphs).
The number of unique query-doc pairs that are relevant (qrels) based on the source for various query-doc levels on the dev split.
Table 5: The number of unique query-doc pairs that are relevant (qrels) based on the source for various query-doc levels on the dev split.
Baseline retriever effectiveness on various query-document levels and splits of our dataset.
Table 6: Baseline retriever effectiveness on various query-document levels and splits of our dataset.
NDCG@10 for two disjoint subsets of the dev split: queries with ground truth sourced from EUR-Lex only and queries with additional human expert validation.
Table 7: NDCG@10 for two disjoint subsets of the dev split: queries with ground truth sourced from EUR-Lex only and queries with additional human expert validation.
Comparison of test N@10 under various leakage mitigation settings.
Table 8: Comparison of test N@10 under various leakage mitigation settings.
Distribution of query length, as well as lexical overlap and semantic similarity of query and relevant documents.
Fig. 2: Distribution of query length, as well as lexical overlap and semantic similarity of query and relevant documents.
查看结构化数据
任务指标本文基线提升
案件-案件检索(test) NDCG@10 LMIR 0.442(DPH 0.403,TF-IDF 0.427) BM25 0.101 LMIR 相对 BM25 大幅领先
段落-案件检索(test) NDCG@10 TF-IDF 0.604 BM25 0.202 TF-IDF 相对 BM25 显著领先
段落-段落检索(dev) NDCG@10 BM25 0.574 / TF-IDF 0.573(持平) BM25 在段落-段落层级追平 TF-IDF
数据泄漏影响(段落-案件,test) NDCG@10 相对变化 w/o par ID 相对 w/o citation +55.0% w/o citation 0.202 证明仅移除段落ID仍残留泄漏

局限与改进

作者承认的局限包括:真实引用主要源自EUR-Lex,存在反馈循环问题——法官可能已用EUR-Lex等检索系统找到引用并引用了靠前结果,文本中可能有被引段落的逐字复述,但这在Fig. 2中表现为查询与相关文档的词汇/语义重叠中位数均低于0.5,并非主导模式;专家标注仅基于单一稠密检索器的top-10结果,可能限制标注穷尽性,故应聚焦短截断点的精度指标而非召回;自动脱敏与非英文移除管线存在漏检,作者手动检查发现若干遗漏但认为影响有限,系统审计留作未来工作。我自己的观察还有:受算力和数据规模限制,作者完全未评测稠密检索器/神经检索器,而法律检索当前正快速向神经方法迁移,这是对数据集价值的显著未验证部分;BM25的异常表现提示基准方法选择敏感;语料仅限CJEU英文判决,对其他法系和跨语言场景覆盖有限。

独立分析的弱点

独立分析的弱点如下。第一,缺少神经/稠密检索器基准:作者明确因算力受限未跑稠密检索器,而现代法律IR已广泛采用交叉编码器与稠密向量检索,数据集在该方向的实际区分度未被检验。改进方向是提供预计算的稠密索引与标准化评测脚本,降低复现门槛。第二,脱敏不完全:作者承认自动管线(法律NER加正则)仍有漏检,这会削弱无泄漏这一核心卖点。改进方向是引入更强的法律LLM做引用实体抽取并结合人工抽样审计,发布脱敏差异报告。第三,人工标注穷尽性受top-10限制:标注仅来自单一检索器top-10,可能漏掉更靠后的相关段。改进方向是用多检索器并集做候选池,或引入主动学习扩标。第四,时间划分可能造成分布偏移:按年份硬切分使test查询集中于2022-2025新案,可能与train主题分布不同,影响模型迁移。改进方向是结合主题分层的混合划分。第五,反馈循环未量化:法官引用的先例可能本就是检索系统返回的top结果,建议量化这种偏差并提供去偏评测协议。

未来方向

作者提出的延伸方向包括引用链接预测、跨语言检索(数据集本身源于多语言CJEU)、法律文本蕴含(抽取被引段落的相关片段)、法律检索增强生成RAG(将初步裁决问题与其答案配对)、以及大语言模型法律推理评测;他们还把网页爬取与提取管线一并开源以支持未来扩展。基于成果可延伸的方向还有:构建稠密/神经检索基线并建立排行榜,将脱敏管线升级为基于法律LLM的实体抽取,引入多检索器并集候选池以提升人工标注穷尽性,研究主题分层的时间划分以缓解分布偏移,量化并去偏反馈循环,将数据集扩展到CJEU多语言全量版本并构建跨语言检索基准,以及结合案件元数据(日期、主题、法庭)做细粒度的分桶评测与公平性分析。

复现评估

复现评估较高。数据方面,LegalPincite发布在HuggingFace Hub(theresiavr/legalpincite),赋予DOI(doi.org/10.57967/hf/9072),采用CC-BY许可,CSV格式且兼容pyterrier的TREC qrel惯例,文件命名清晰(query/doc/qrel加split加level)。代码方面,作者在github.com/theresiavr/legalpincite提供加载脚本、基线检索代码、超参网格搜索空间与最优配置。算力方面,基线检索(TF-IDF/BM25/LMIR/DPH)用pyterrier即可在普通服务器运行,但稠密检索器因法律文本超长与数据规模(如test有593,877个段落)作者明确表示算力不足无法运行,这是复现的主要障碍。难度方面,整体可复现性好:数据公开、格式标准、代码开源、FAIR原则到位。主要不确定点在于selenium爬取EUR-Lex与Cellar API提取段落这两步依赖外部网站稳定性,若网站变更则需维护爬虫;此外部分缺失段落文本是手动在线查找的,难以完全自动化复现。