这处引用对题吗?法律引用命题级支持验证的受控评测 Is this Citation on Point?
用三级难度引用扰动揭示:LLM 能抓住假案例,却难以验证真实引用的页级命题支持。
前置知识
Bluebook 引用与 pinpoint 页码
Bluebook 是美国法律写作的标准引用格式,形如 Case Name, 卷号 判例集 首页, pinpoint页 (法院 年份),例如 Zubulake v. UBS Warburg, 217 F.R.D. 309, 322 (S.D.N.Y. 2003)。pinpoint 页码指向判例中具体支持当前主张的那一页或页区间,是引用支持关系的最小载体;引用前还可加 see、cf.、but see 等信号词表明支持强度。
本文最难的 Hard 档扰动正是利用 pinpoint 结构只改页码而不换案例,理解引用的解剖结构才能理解三级难度的构造逻辑,以及为何页级验证是任务瓶颈。
捏造 vs 歪曲(fabrication vs misrepresentation)
Dahl et al. (2024) 把法律引用幻觉分两类:捏造指被引权威根本不存在(如 Mata v. Avianca 案中 ChatGPT 编造的案例),数据库查询即可识别;歪曲指案例、判例集、pinpoint 页码全部真实且格式正确,但该权威并不支持文中引用它所要支持的主张。
本文研究对象正是后者。理解这一二分才能明白为什么'引用存在'级别的检查不够,以及为什么随着捏造越来越容易被查库抓住,歪曲型错误反而成为更主要的残余风险。
Recall 与 FPR
召回率 $R = \frac{TP}{TP + FN}$ 衡量错误引用中被正确标记的比例;假阳性率 $FPR = \frac{FP}{FP + TN}$ 衡量有效引用被误杀的比例。好的引用护栏系统需要同时做到高召回、低误报,二者在本任务中此消彼长。
论文的核心结论是一组权衡:页锚定提示提高召回却推高 FPR,即模型'变得更怀疑但没变得更挑剔',没有这对指标就无法理解全文的实验结果与实践含义。
规则化受控扰动与难度分级评测
从真实样本出发、用规则化改写构造负样本是 NLP 评估的标准做法(如摘要事实一致性评估中的合成错误)。本文把真实引用按 Bluebook 结构做三级扰动:换成无关案例(Easy)、换成同文档相邻段落引用过的案例(Medium)、同一案例内只改 pinpoint 页码(Hard),难度随替换内容与原命题的主题相似度上升而上升。
整个评测集与'Easy 接近饱和、Hard 大幅崩塌'的主结论都建立在这套分级扰动上;它也是作者论证不用 LLM 生成扰动的对照背景。
标注一致性:Fleiss' κ 与 Gwet's AC1
多标注者一致性衡量人工标签的可靠性。Fleiss' κ 在类别严重不平衡时会失真——本文 BriefMe 上三人一致率 80% 而 κ 仅为 -0.07(患病率悖论);Gwet's AC1 在高一致、不平衡场景下更稳健,本文两数据集 AC1 分别为 0.88 和 0.85。
人工校验是论证'扰动样本确实不对题'的关键证据;理解为何选 AC1 而非 κ,才能正确评估这个评测集标签的可信度。
研究动机
2023 年 Mata v. Avianca 案中,纽约联邦法官制裁了两名提交 ChatGPT 生成虚构引用的律师,成为法律 AI 幻觉的标志性事件。但这类捏造错误(被引案例根本不存在)如今已被案例数据库查询基本解决;真正棘手的是歪曲型错误:案例、判例集、pinpoint 页码全部真实且格式正确,被引页面却不支持文中主张——Figure 1 展示的真实法庭文件里,Zubulake v. UBS Warburg 案被正确引用,但引文所援引的 holding 根本不在该判决意见中,且按 Model Rules 3.3 与 1.1,律师在提交前有核实义务。当 LLM 进入起草流程,几秒钟就能产出含几十条引用、表面流畅的简报,流畅性诱发过度依赖(Mik, 2023),待核查的支持主张数量激增。而现有 LLM 法律评测大多只考察捏造检测,普遍忽略命题级支持验证;通用事实核查(如 FEVER 类基准)中'主题相关即支持'的直觉在法律领域失效,因为法律论证依赖类比推理与先例,两段文字可以讨论同一教义却支持不同命题。
本文的目标是本文要回答一个刻意收窄的问题:当前 LLM 能否检测出'法律引用不支持其被引用来支持的命题'这类歪曲型错误?具体目标分四层。其一,把引用支持验证形式化为区别于捏造检测的二元判定任务:给定用 标记了目标引用的源段落与被引文档内容(含 pinpoint 时只给该页内容),判断引用是否'对题'(YES/NO 加理由)。其二,在真实法律语料上构造难度可控的评测集,用三级扰动量化'主题相似度上升、支持关系被破坏'对检测难度的影响。其三,围绕三个研究问题系统评测 14 个前沿模型配置(OpenAI、Anthropic、Google 三家 13 个基础模型):检测能力随难度如何变化?更大更新的模型(如 GPT-5 对 GPT-4o)是否更好?法院意见书与诉讼简报两类文档之间表现是否有差异?其四,诊断失败模式,并测试针对性的页锚定提示干预,确认瓶颈是否在于模型把主题匹配当成了命题级验证。
与已有工作不同的是,本文的独特切入角度有三。第一,任务切分:不同于把'法律幻觉'当单一问题,作者沿 Dahl et al. (2024) 的捏造/歪曲二分专攻后者,并提出'捏造越容易被查库抓住、歪曲越成为主要残余风险'的论点,界定了评测靶心。第二,扰动构造不靠 LLM 而靠引用格式本身:作者先试过让模型生成微妙修改的段落,人工评估发现生成文本常常改动与目标引用无关的内容、产生无效测试样本;于是改用规则化扰动,利用 Bluebook 引用结构(案例名-卷号-判例集-首页-pinpoint 页)天然提供的三级编辑难度——最难的 Hard 档保持案例不变、只改页码(如 500 U.S. at 105 改为 112),把验证需求精确压缩到页级命题支持。第三,引入与三位有诉讼经验的法律分析师共同建立的三分类引用角色体系(实质性/程序性/次要),只评直接支持主张的实质性引用,使任务定义与法律实践中'对题'(on point)概念对齐,而不是混入程序史或背景性引用稀释任务。
核心方法
先说直觉:把一条真实引用逐步改成'更难识破'的错误,检测难度应随替换内容与原命题主题重叠程度上升——换一个毫不相干的案例一眼即假;换成同一文档相邻段落里引用过的案例就有迷惑性;保持案例不变、只把 pinpoint 页码从 1464 改成 1467,表面完全合法,只有真正去读那一页才能识破。技术路线据此展开:从两个公开法律语料 CLERC(法院意见书,论文正文记约 2000 条引用,附录统计为保留 2965 条案例法引用)和 BriefMe(最高法院简报,641 条)抽取引用及被引文档全文;用 GPT-4.1-mini 提示分类器(在约 80 例专家标注留出集上 F1=0.83)过滤出实质性引用(占 69–70%);按三级策略做规则化扰动生成负样本,原始引用保留为正样本;三位法律分析师人工校验(与启发式标签一致率 84–88%,Gwet's AC1 0.85–0.88);最后以 Recall 与 FPR 评测 14 个模型配置,对比 baseline 与页锚定两种 prompt,并逐条分析假负例理由文本归纳失败模式。
核心创新是把'歪曲型引用错误'变成可精确控制的自变量。与已有工作的本质区别在于扰动的最小性:Hard 档只改动 pinpoint 页码,案例、判例集、卷号、首页、年份全部保留真实,唯一被破坏的是'该页内容支持该命题'这一支持关系。此前工作要么测捏造(引用不存在,查库即知)、要么测引用检索(找到正确权威,如 LePaRD 上最佳模型召回仅 59%)、要么测引用格式是否正确(Dahl, 2025),而本文测的是'格式完全正确的真实引用是否真的支持当前主张'。另一个关键设计是用引用角色分类学把评测限制在实质性引用上——只有这类引用构成支持主张,程序性引用(记录案件历程)和次要引用(背景/对比/相反权威)不构成支持主张,混入会稀释任务定义。作者还刻意保持原文法律散文一字不动、只替换引用本身,保证检测失败只能归因于支持验证能力,而非文本生成噪声。
方法步骤详情
第一步,数据构建:CLERC 提供 2965 条保留的案例法引用(36% 含 pinpoint),BriefMe 641 条(23% 含 pinpoint;因无前文段落无法构造 Medium)。第二步,引用过滤:与三位法律分析师建立实质性/程序性/次要三分类,GPT-4.1-mini 分类器在约 80 例专家留出集上 F1=0.83,仅保留实质性案例法引用。第三步,扰动生成:Easy 换成无关文档的引用,Medium 换成同源文档前文段落中的引用,Hard 仅改同案例的 pinpoint 页码。第四步,人工校验:每数据集 23 条(10 条三人重叠),与启发式标签一致率 88.2%/84.2%,Medium 与 Hard 上三人一致率仍达 86%。第五步,模型评测:14 个配置覆盖 OpenAI、Anthropic、Google 三家 13 个基础模型,输入为标记引用的段落加被引页内容,输出 YES/NO 加理由。第六步,干预与诊断:页锚定 prompt 增加逐字引文核对、页级验证、区分主题与支持三条指令并附同案例错页反例;错误分析逐条审查 GPT-5 假负例理由,归纳失败模式。
技术新颖性
技术新颖性体现在四点。其一,把困难的评测对象转化为结构可控的自变量:Bluebook 的 pinpoint 字段天然提供了'最小编辑、最大迷惑'的扰动算子,难度梯度不靠人工设计而来自引用格式本身,这在法律 NLP 评测中是新的。其二,规则化扰动相对 LLM 生成扰动的对照本身是负结果贡献——模型生成改写时会波及与目标引用无关的文本,说明 LLM 在生成时无法隔离引用相关主张,与其在验证时无法隔离同一主张互为印证,作者明确把这一点写进讨论。其三,干预设计是诊断性的而非纠正性的:页锚定 prompt 不是为了'解决'问题,而是证明 baseline prompt 根本没有激发页级验证——Easy 召回几乎不动(CLERC 上平均仅 +0.7pp)而 Hard 大涨,说明增益来自行为改变而非字符串匹配;同时 FPR 全线上扬揭示'更怀疑但不更挑剔'这一质变。其四,用 Recall/FPR 双指标加逐条理由文本分析,把'说谎式验证'(声称被引页'明确指出'实际不存在的文字)从一般漏检中分离出来,给出可操作的失败模式分类。
实验结果
难度梯度成立:Easy 召回 93–100% 近饱和,Hard 跌至 CLERC 36.5–60.6%、BriefMe 51.5–82.7%,降幅 16–63pp。规模与推理有帮助但不可预测:GPT-5 在 Hard 上超 GPT-4.1,但 GPT-5.4 无推理反低于 GPT-5,Opus 低于 Sonnet;GPT-5.4 高推理将 Hard 召回提至 CLERC 59.8%、BriefMe 82.0%,仍漏 40% 错配。召回与误报难两全:GPT-4o 的 CLERC Hard 召回最高 60.6%,FPR 却达 34.9%,误杀约1/3好引用;Opus 4.6 反之,FPR 最低 4.1%、Hard 召回垫底 36.5%;BriefMe 最高 82.7%(Gemini 2.5/3.1 Pro)。简报 Hard 召回高 12–26pp。页锚定提示使 Hard 召回提升 9.7–35.5pp,但 FPR 上升 1.0–24.7pp。失败模式:约三分之二漏检声称被引页'明确指出'不存在的文字;含逐字引文的 GPT-5 漏检中 92% 引文不在被引页上;附录显示关系型替换更难。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 错误引用召回(Easy:替换为无关文档的案例) | Recall | 全部 14 个配置达 93.0–100%(CLERC 94.8–99.8%,BriefMe 93.0–100.0%) | 难度下界参照,各模型近乎饱和 | —(问题已基本解决) |
| 错误引用召回(Hard:仅改 pinpoint 页码,法院意见书 CLERC) | Recall | 最佳 GPT-4o 60.6%,GPT-5.4 高推理 59.8% | 同模型 Easy 召回 94.8–99.8% | Easy→Hard 下降 16–63pp,最强模型仍漏 40% |
| 错误引用召回(Hard,诉讼简报 BriefMe) | Recall | 最佳 Gemini 2.5 Pro / 3.1 Pro 均为 82.7% | 同数据集最低 Claude Opus 4.6 仅 54.0% | 比 CLERC 同配置高 12–26pp |
| 推理增强(GPT-5.4 高推理 vs 无推理,Hard) | Recall | CLERC 59.8% vs 48.5%;BriefMe 82.0% vs 64.0% | GPT-5.4 无推理 48.5% / 64.0% | +11.3pp / +18.0pp,但 FPR 仅微降(15.6%→13.1% / 14.6%→14.4%) |
| 页锚定提示干预(Hard 召回) | Recall 增益 | CLERC +9.7 至 +27.8pp;BriefMe +6.5 至 +35.5pp | baseline prompt | 代价:FPR 全线上升 1.0–24.7pp(GPT-4o-mini +20.5、Gemini 2.5 Flash 最高 +24.7) |
| 有效引用误报(CLERC) | FPR | 最低 Claude Opus 4.6 4.1% | 最高 GPT-4o 34.9%(误杀约 1/3 好引用) | 低 FPR 与高 Hard 召回在所有配置中不可兼得 |
局限与改进
作者明确承认的局限:任务被二元化为对题/不对题,而律师实践中引用价值是频谱(约束性与说服性权威、事实类比程度、后续判例是否推翻该案);人工校验与启发式标签一致率 84–88%,少数扰动可能碰巧仍对题,模型接受这类样本会被误记为漏检,召回可能被低估;只覆盖美国联邦法院意见书与简报中的实质性案例法引用,不含制定法、法规与次要来源;扰动未覆盖 distinguish/criticize 等关系型替换,附录初步实验提示那类错误可能更难;未与人类律师审查流程对比,也未度量端到端审计成本,单条召回/FPR 无法完全代表监督工作流中的实际效用。我的观察:Hard 档只适用于含 pinpoint 的引用,而 CLERC 仅 36%、BriefMe 仅 23% 的引用带 pinpoint,评测对整体引用分布代表性受限;'页码错即不支持'是启发式,页码区间重叠、同页多议题等边界情形未讨论;人工验证样本极小(每数据集 23 条、三人重叠仅 10 条),诊断集仅 24–37 条,置信区间未知;14 个配置全为闭源商业模型,结论时效性短。
独立分析的弱点
独立分析的弱点与改进方向。其一,任务输入过于慷慨:模型直接收到被引页内容,跳过了'在整份判决中定位正确页'这一现实难点(LePaRD 最佳检索召回仅 59%),真实系统的风险是检索错位与验证失败复合,应做检索+验证的级联评测。其二,召回-FPR 权衡未解决:页锚定提示让模型'更怀疑但不更挑剔',缺乏校准,改进方向包括逐引用置信度校准、conformal prediction 提供可证明的误报上界,以及把逐字引文核对前置为确定性字符串匹配预处理,只把无法匹配的案例交给 LLM 复核。其三,扰动分布与真实 LLM 引用错误的自然分布未必一致,应从律师修正记录与法院 citechecking 判例中挖掘自然错误做外部效度检验。其四,二元标签丢弃了 Bluebook 信号(see、cf.、but see)携带的支持强度信息,可把信号类型纳入标签空间。其五,样本量小导致模型间排序(如 GPT-5 与 GPT-5.4 反转、Opus 低于 Sonnet)可能落在噪声内,需 bootstrap 置信区间支撑。其六,仅评美国法,对大陆法系无外推证据。
未来方向
作者提出的方向:系统评估 distinguish/criticize 等案例间处理关系替换(附录 H 只是 24–37 条规模的诊断,且显示可能比错页更难);直接测量命题特异性以检验'简报命题更窄、错页失配更尖锐'的文档类型假说;把制定法、法规与次要权威纳入评测;度量真实监督工作流中的端到端审计成本而非单条指标;并指出弥合差距'可能需要超越 prompt 调整、更大模型或更长推理的机制',暗示需要架构级方案——先在权威内定位相关内容、再判断是否支持的两步法(与 CiteAudit 思路呼应)。基于本文成果可延伸的方向:构建'确定性引文匹配 + LLM 兜底'的混合护栏,把可字符串核对的逐字引文从 LLM 判断中剥离;把校准与选择性预测作为核心评价维度,给出可部署的置信阈值;对法院与律师协会的 AI 使用指南做政策影响评估——本文直接提出'低于命题级验证的 AI 引用检查是否提供充分保障'这一待答问题;在开源模型上复制以判断差距来自规模还是训练数据;以及扩展到多语言与大陆法系判例引用传统。
复现评估
复现条件相当好。作者提供正式的 Reproducibility Statement:评测方法在正文第 3 节与附录 F 完整描述,两个 prompt(baseline 与页锚定)全文收录于附录 B,评测数据以 JSONL 定义了完整 schema(附录 F 含字段定义与正/错预测的完整示例)。两个源语料 CLERC 与 BriefMe 均公开可得,三级扰动规则明确、可程序化重放;引用分类 prompt 及其在约 80 例专家留出集上的 F1=0.83 也有报告。算力门槛低:全部为 API 调用,数据规模为数千条引用量级,单人即可完成。难点有二:一是闭源模型迭代快,14 个配置中的具体版本(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro)复现时可能已不可调用,精确数字难以逐位复现;二是人工校验环节依赖三位有诉讼经验的法律分析师(标注一致性与分类器验证),普通团队难以等价重现,但流程、标注指南与一致率指标披露完整。构造出的评测数据集本身未见明确开源声明,可能需按论文描述自行重建。总体复现难度评估:中低。
论文图表
展示一份真实法庭文件中的引用错误:Zubulake v. UBS Warburg 案真实存在、案例名与判例集信息引用均正确,但引文所援引的 holding 并不出现在判决意见的对应位置。这是比'引用不存在的案例'更隐蔽的失败模式。
它是全文问题定义的具象锚点:一图说明所有表层检查都通过、唯有支持关系断裂的歪曲型错误长什么样,正是本文要自动化检测的对象。
Table 5 的完整版:补齐 Easy 档(+0.2 至 +4.4pp,GPT-5 甚至 -0.2pp),Hard 增益 6.5–35.5pp,FPR 上升 5.8–24.7pp。
与 Table 14 对称地确认干预的难度特异性,并显示简报上提示敏感性更高、代价也更大。
区分/批评类案例间处理关系的小规模诊断(样本 24–37 条):部分模型在有效集上 FPR 很高(GPT-4o 区分集 74.1%、批评集 76.5%),页锚定提示提升漏检召回但常推高有效集误报,与主实验权衡一致。
展示了比错页替换更难的下一层错误类型(关系型替换),为未来工作提供方向,也说明本文 Hard 档并非难度上界。