← 返回 2026-08-20

时间多信号融合的 Token 级幻觉检测 Temporal Multi-Signal Fusion for Token-Level Hallucination Detection

Igor Itkin 📅 2026-06-30 👍 3 2026-08-25 18:30
BiGRU RAG 信息论分析 多信号融合 幻觉检测 序列标注 黑盒检测

用33维黑盒特征流加BiGRU序列标注检测token级幻觉,AUC较逐token独立分类提升11点

前置知识

RAG 与幻觉

检索增强生成先检索外部文档进上下文再让 LLM 作答;幻觉指输出与源文档矛盾或无所本依据。RAGTruth 是该领域标准基准,对 GPT-4、LLaMA-2 等六个模型在 QA、摘要、数据到文本任务上的输出做了 span 级人工标注,token 级正例率约 5.6%。

本文的任务定义、主基准(RAGTruth)与迁移目标(PsiloQA)全部建立在 RAG 幻觉之上;不熟悉这个场景就无法理解标注转换方式以及 5.6% 正率为何把 token F1 压得很低。

Token 级检测与序列标注

响应级检测只回答「整段回复里有没有幻觉」,token 级检测要给每个词打二值标签、定位具体出错位置。序列标注是 NLP 经典任务形式(如命名实体识别、词性标注):模型读取整条输入序列,为每个位置输出标签概率,允许相邻位置的标签相互提供证据。

把幻觉检测重述为序列标注正是本文的核心贡献。理解这个框架,才能明白 BiGRU 与逐 token 独立分类器(LogReg/MLP)的本质差别,以及 11 点 AUC 差距从何而来。

自然语言推理(NLI)

NLI 判断前提与假设的关系,输出蕴含、矛盾、中立三类概率。把检索源文档当前提、生成句子当假设:矛盾概率高说明该句与源冲突,蕴含概率下降(entailment drop)提示内容脱离源文档。本文用 MultiNLI 微调的 DeBERTa-v3-large 计算,上下文截 400 词。

NLI 是 33 维特征中 7 维的来源,也是最强单信号(entailment drop 单独使用 0.641 AUC)。附录 H 的反事实实验证明 NLI 特征抓的是「真幻觉」而非生成器风格,是支撑多信号融合结论的关键证据。

Surprisal、熵与 token rank

用另一个 LM 作「外部观察者」打统计分:log-probability(surprisal)衡量 token 有多意外,熵衡量预测分布不确定性,子词 rank 是真实 token 的预测排名。幻觉常表现为低概率、高熵、高 rank 的统计异常。本文用 TinyLlama-1.1B 作代理观察者。

LM 特征族是三族信号之一,但它单独只有 0.551 AUC(接近随机),因为代理模型与真实生成器存在风格错配。论文用它说明「任何单一信号都不够」这一核心论点。

BiGRU 与循环序列建模

GRU 是带门控的循环网络,逐位置更新隐藏状态;双向 GRU 同时从左到右和从右到左读序列,每个位置的表示拼接前后文信息,既能传播「幻觉已开始」的证据,也能利用幻觉区之后的上下文。本文 BiGRU 仅 2 层、隐藏维 64、121K 参数,适配 33 维低维输入。

BiGRU 是主模型,多个核心结论都围绕它展开:双向比单向好(0.840 vs 0.802/0.817)、时序顺序贡献 44% 的增益、以及「架构不是瓶颈」的天花板实验。

AUC-ROC 与 F1 的分工

AUC-ROC 衡量排序质量——随机一个正例排在随机一个负例前面的概率——与阈值无关,适合正例稀少(5.6%)的场景。F1 在固定阈值(本文 0.5)下调和查准与查全,对类别不平衡极其敏感,因此 RAGTruth 上 token F1 普遍只有 0.2 上下。两者衡量的是模型不同侧面的能力。

论文所有主结论用 token AUC(10 seeds + Wilcoxon 符号秩检验)表达;而 span F1 0.394 对 LettuceDetect 0.589 的劣势需要理解「排序质量 vs 边界精度」的优化目标差异才能公允评价。

CRF 与 forward-backward 边缘化

条件随机场在神经网络的发射分数上加标签转移矩阵,建模整条标签序列 $P(y_1,\dots,y_T \mid x)$ 的全局结构。推理时若直接对发射势做 softmax 会忽略转移结构而失准,应改用 forward-backward 算法计算边缘概率 $P(y_t \mid x)$ 再评分。

论文发现 CRF + softmax 把 BiGRU-CRF 的 AUC 拉到 0.666,换成 forward-backward 边缘后恢复到 0.845(+17.9 点)。这是任何用排序指标评估 CRF 模型的人都会踩的坑,有独立的方法论价值。

研究动机

LLM 的幻觉是静默失败:生成文本流畅、上下文恰当,没有任何内在信号提示出错了,而在医疗、法律、金融等 RAG 场景中,一条幻觉声明就会沿下游决策链传播。现有检测方法分四族,各有特征性失败:内部探针(hidden-state 线性探针、稀疏自编码器)需要生成模型白盒访问,闭源 API 上完全不可用,且 Cheang 等(2025)证明当模型对主题只有部分知识时内部表征变得不可分辨;不确定性方法(语义熵、熵产率)在高置信幻觉上恰好失效——Simhi 等(2025)指出这正是最要命的失败模式;NLI 分类器(LettuceDetect span F1 0.589、HaluGate token F1 0.590)和 token 分类器逐位置独立打分。Snel 与 Oh(2025)在 RAGTruth 上给出了最有说服力的证据:幻觉 span 的第一个 token 可以靠熵检测(AUC 约 0.8),而同一 span 中的后续 token 接近随机水平——因为独立打分丢掉了「幻觉已经开始」这一最强线索。所有方法共享的结构性缺陷是:在每个位置孤立地计算分数,从不参考邻域信号如何随时间演化。

本文的目标是本文要构建一个纯黑盒的 token 级幻觉检测器:只读生成的文本和两个小型外部模型(DeBERTa-v3-large 与 TinyLlama-1.1B),完全不触碰生成模型的内部(激活、注意力、logits 都不用),因此能直接部署在闭源 API 上。围绕三个研究问题组织验证:RQ1——建模 token 位置间的时间依赖是否优于独立逐 token 分类;RQ2——融合文本统计、NLI、语言模型三类信号是否优于任何单一信号族;RQ3——学到的时序模式能否跨源模型(六个 LLM 留一法)和跨数据集(RAGTruth 与 PsiloQA 双向零样本迁移)泛化。量化目标是:在 RAGTruth 上以序列标注方式显著超过逐 token 基线,同时跨模型退化控制在几个百分点内。

与已有工作不同的是,本文的独特切入是把「幻觉不是点事件而是时间延展的片段」这一经验规律量化并转化为归纳偏置。作者在 RAGTruth 上统计:幻觉 span 中位长度 5 个 token(均值 9.4),标签转移概率 $P(H_t \mid H_{t-1}) = 0.902$ 而起始概率 $P(H_t \mid F_{t-1}) = 0.006$,持久与起始之比高达 150:1;信息论分析进一步显示 76% 的标签熵可由前一步上下文消解,91% 可由双向邻居消解。已有的时序视角工作只有 HALT(把 log-prob 当时间序列读,但仅单一信号族且输出响应级结论),而所有 token 级系统(LettuceDetect、HaluGate、ReDEEP、RagtStacking)都独立打分。据作者所知,这是首个在 token 级同时建模时间依赖并学习式融合多信号的工作;此外它不满足于「有效」,还用控制变量分解和信息论解释增益来源,这类自省在检测文献中少见。

核心方法

直觉是:自回归模型一旦偏离事实根基,错误 token 就成为后续生成的上下文,把模型拖入延续幻觉叙事的轨道,因此幻觉 token 成串出现,其统计签名——与源文档的词汇重叠下降、NLI 矛盾概率上升、代理 LM 的 surprisal 升高——随时间共同演化。技术路线是把检测变成序列标注:对每个 token 提取 33 维特征,来自三个互补信号族(文本统计 20 维、NLI 7 维、LM 6 维,见表 2),再叠加时间增强(运行均值、一阶差分、5/10/20 token 滑窗极值)使序列动态在特征层面显式化;然后用一个 2 层、隐藏维 64 的 BiGRU(121K 参数)读取整条特征矩阵 $X \in \mathbb{R}^{T \times 33}$,输出每个 token 的幻觉概率 $\hat{y}_t = f_\theta(X)_t$。所有特征只依赖生成文本加两个小外部模型,生成模型全程黑盒,因此对 GPT-4 这类闭源 API 同样适用。

核心创新是把「幻觉的时间连续性」变成模型可利用的结构先验。与所有已有方法的本质区别有二。第一是时间依赖建模:独立分类器在看到第 $t$ 个 token 的特征前就丢掉了「前一个 token 是否幻觉」的信息,而马尔可夫分析表明这恰恰携带 76%(单向)到 91%(双向)的标签熵;BiGRU 能观察到信号的演化方向(重叠率正在下降、矛盾概率正在爬升),从而在 span 中后段单 token 特征模糊时仍维持高置信。第二是学习式多信号融合:最强单信号(NLI entailment drop)只有 0.641 AUC,三族信号互补——文本特征抓对源文档的偏离、NLI 抓语义矛盾、LM 抓统计异常,时序融合后达到 0.840。这与 HALT(单信号、响应级)和 Lookback Lens(单一注意力信号)形成鲜明对照:融合不是可选项而是必要条件。

方法步骤详情

第一步,预处理:把 RAGTruth 的 span 标注转为词级二值标签(字符重叠 >50% 记为幻觉),训练集按幻觉标志分层切分 85/15。第二步,提取 33 维特征:文本 20 维——表面指标、与源文档的重叠 $\mathbb{1}[w_t \in C]$、累积重叠率、新颖率及其窗口均值和差分;NLI 7 维——DeBERTa-v3-large 对「源文档→句子」的蕴含/矛盾/中立概率(截 400 词),加矛盾的运行均值、句间差分与 entailment drop;LM 6 维——TinyLlama 的 log-probability、next-token 熵、子词 rank 及 tokenizer 失配 fallback 值,缺失值用训练集中位数填充防泄漏。第三步,训练 BiGRU(2 层,$h{=}64$):类加权 BCE $\mathcal{L} = -\tfrac{1}{T}\sum_{t}[\alpha\, y_t \log \hat{y}_t + (1{-}y_t)\log(1{-}\hat{y}_t)]$,$\alpha = n_{neg}/n_{pos}$ 补偿 5.6% 正例率;AdamW 学习率 $10^{-3}$、梯度裁剪 1.0、batch 32、最多 15 epoch、验证 F1 早停。第四步,评估 token AUC 与 F1@0.5,关键比较用 10 seeds 加 Wilcoxon 检验。

技术新颖性

新颖性有四点。其一,token 级时间依赖建模属首次:HALT 在响应级用单一 log-prob 序列,Snel 与 Oh 只观察到「首 token 可检、后续随机」现象而未建模,本文第一个在 token 级用序列标注利用该结构。其二,学习式多信号融合:先前系统要么单一信号族,要么手工组合,本文让 121K 参数的序列模型端到端学习三族信号的联合时序动态,并证明无时序建模时融合停滞于 0.730 AUC、加时序才到 0.840。其三,发现并修复 CRF 评分失准:softmax 让 BiGRU-CRF 掉到 0.666 且跨种子波动 ±0.05,forward-backward 边缘恢复 0.845(+17.9 点),对用排序指标评 CRF 的场景有普适方法论价值。其四,自省深度罕见:shuffled BiGRU 控制变量分解(44/24/32)与马尔可夫链信息论分析(熵率 $h{=}0.077$、混合时间约 10 token)成功预测 1D-CNN 恢复 75% 差距;附录 X 用生成器自身隐状态探针(线性仅 0.543–0.574)反驳「内部状态已含时间信号」的质疑。

Method overview. Three external signal families are extracted per token (no access to the generating LLM is required), enriched with temporal statistics, and labeled jointly by a bidirectional sequence model.
Figure 1: Method overview. Three external signal families are extracted per token (no access to the generating LLM is required), enriched with temporal statistics, and labeled jointly by a bidirectional sequence model.
Feature dynamics aligned to hallucination span onset (1,136 spans). LM entropy spikes at onset; context overlap drops; NLI contradiction rises gradually; BiGRU probability accumulates monotonically.
Figure 3: Feature dynamics aligned to hallucination span onset (1,136 spans). LM entropy spikes at onset; context overlap drops; NLI contradiction rises gradually; BiGRU probability accumulates monotonically.

实验结果

RQ1:BiGRU 全信号达 0.840 ± 0.007 token AUC(10 seeds),比参数相近的 LogReg 0.730 高 11.0 点($p{=}0.002$);分解:时间顺序 +4.9(44%)、序列聚合 +2.6(shuffled 0.791)、非线性容量 +3.5(MLP 0.765)。方向消融:ForwardGRU 0.802、BackwardGRU 0.817、BiGRU 0.840。信息论解释:一步上下文消解 76% 标签熵、双向达 91%,混合时间约 10 token,成功预测 1D-CNN 恢复 75% 差距;优势随序列变长从 +8.1 扩到 +12.2。RQ2:最强单特征 entailment drop 仅 0.641,LM 熵 0.551 近随机;BiGRU 纯文本 0.832 → 全信号 0.845;与 Lookback 特征融合达 0.866;反事实显示 NLI 抓真幻觉,LM 熵跨模型差异大半是生成器风格。RQ3:六模型留一平均 0.808(退化 3.8%,GPT-4 最难 0.781);PsiloQA→RAGTruth 0.744 反超反向 0.634,标注密度重于数据量。各架构收敛 0.843–0.845,瓶颈在 33 维特征;CRF 修复 0.666→0.845。分任务 QA 0.887 / Data2txt 0.828 / Summary 0.760;span F1 仅 0.394(LettuceDetect 0.589)。全程不到 8 GPU 小时。

Positioning on RAGTruth. †Span F1. ‡10 seeds. §0.73 = the published Lookback Lens (LogReg) classifier; 0.838 = the same attention features under our BiGRU sequence model.
Table 1: Positioning on RAGTruth. †Span F1. ‡10 seeds. §0.73 = the published Lookback Lens (LogReg) classifier; 0.838 = the same attention features under our BiGRU sequence model.
Per-token feature groups.
Table 2: Per-token feature groups.
Sequence labeling architectures. All models use h=64. CRF variants use forward-backward marginals for ranking.
Table 3: Sequence labeling architectures. All models use h=64. CRF variants use forward-backward marginals for ranking.
Research questions and corresponding experiments.
Table 4: Research questions and corresponding experiments.
Token-level AUC and F1 on RAGTruth test set. CRF models use softmax scoring.
Table 5: Token-level AUC and F1 on RAGTruth test set. CRF models use softmax scoring.
Mean ± std across 10 seeds (all signals). MLP is a capacity-matched token-independent baseline (112K parameters ≈ BiGRU's 121K).
Table 6: Mean ± std across 10 seeds (all signals). MLP is a capacity-matched token-independent baseline (112K parameters ≈ BiGRU's 121K).
Controlled decomposition of BiGRU's advantage over LogReg (10 seeds, all signals).
Table 7: Controlled decomposition of BiGRU's advantage over LogReg (10 seeds, all signals).
Directional ablation (10 seeds, all signals).
Table 8: Directional ablation (10 seeds, all signals).
Individual features as standalone detectors.
Table 9: Individual features as standalone detectors.
Cross-dataset transfer (mean ± std, 10 seeds, all signals).
Table 10: Cross-dataset transfer (mean ± std, 10 seeds, all signals).
Fair comparison on the open-LLM subset of RAGTruth (5 seeds). Combined = our 33-dim + Lookback features.
Table 11: Fair comparison on the open-LLM subset of RAGTruth (5 seeds). Combined = our 33-dim + Lookback features.
CRF scoring: softmax vs. forward-backward (FB) marginals.
Table 12: CRF scoring: softmax vs. forward-backward (FB) marginals.
Complete list of 33 per-token features. The 'Context' column indicates whether the feature encodes temporal information: point = depends only on the current token; cumul = cumulative statistic up to position t; window = sliding window average/max; delta = finite difference between adjacent positions; sent = sentence-level.
Table 13: Complete list of 33 per-token features. The 'Context' column indicates whether the feature encodes temporal information: point = depends only on the current token; cumul = cumulative statistic up to position t; window = sliding window average/max; delta = finite difference between adjacent positions; sent = sentence-level.
Same architectures with ReduceLROnPlateau + early stopping (max 50 epochs, patience 10, 5 seeds). Plateau scheduling raises the ceiling from 0.840 to 0.845 and eliminates most architecture differences.
Table 21: Same architectures with ReduceLROnPlateau + early stopping (max 50 epochs, patience 10, 5 seeds). Plateau scheduling raises the ceiling from 0.840 to 0.845 and eliminates most architecture differences.
Probing comparison: hidden states from the generating model vs. our 33-dim black-box features. Each generator is evaluated only on its own outputs.
Table 22: Probing comparison: hidden states from the generating model vs. our 33-dim black-box features. Each generator is evaluated only on its own outputs.
Decomposition of BiGRU's 11-point advantage over LogReg. Temporal order is the largest contributor (44%).
Figure 2: Decomposition of BiGRU's 11-point advantage over LogReg. Temporal order is the largest contributor (44%).
AUC distribution across 10 seeds for key architectures. Temporal models (BiGRU, BiLSTM) consistently outperform non-temporal baselines (LogReg, MLP).
Figure 4: AUC distribution across 10 seeds for key architectures. Temporal models (BiGRU, BiLSTM) consistently outperform non-temporal baselines (LogReg, MLP).
Token AUC across all architecture–signal combinations (single seed). Non-CRF temporal models (BiGRU, BiLSTM) consistently outperform baselines across all signal configurations.
Figure 5: Token AUC across all architecture–signal combinations (single seed). Non-CRF temporal models (BiGRU, BiLSTM) consistently outperform baselines across all signal configurations.
Leave-one-out cross-model generalization (all signals, 10 seeds). GPT-4 is the hardest transfer target; LLaMA-2-70B is the easiest.
Figure 6: Leave-one-out cross-model generalization (all signals, 10 seeds). GPT-4 is the hardest transfer target; LLaMA-2-70B is the easiest.
Waterfall decomposition of signal contributions to BiGRU's AUC. NLI and LM features provide complementary gains beyond text features alone.
Figure 7: Waterfall decomposition of signal contributions to BiGRU's AUC. NLI and LM features provide complementary gains beyond text features alone.
Precision-recall curves for all non-CRF architectures (all signals, seed 42). The low overall precision reflects RAGTruth's 5.6% hallucination rate.
Figure 8: Precision-recall curves for all non-CRF architectures (all signals, seed 42). The low overall precision reflects RAGTruth's 5.6% hallucination rate.
Per-task AUC comparison (all signals). The temporal advantage of BiGRU over LogReg is largest for Data2txt.
Figure 9: Per-task AUC comparison (all signals). The temporal advantage of BiGRU over LogReg is largest for Data2txt.
Token AUC by sequence length quartile. The BiGRU–LogReg gap grows from +8.1 (Q1) to +12.2 (Q4).
Figure 10: Token AUC by sequence length quartile. The BiGRU–LogReg gap grows from +8.1 (Q1) to +12.2 (Q4).
CRF scoring methods compared. Forward-backward marginals recover up to +17.9 AUC points over softmax scoring.
Figure 11: CRF scoring methods compared. Forward-backward marginals recover up to +17.9 AUC points over softmax scoring.
Natural counterfactual: same query, different LLMs, one hallucinating. NLI contradiction separates the two; LM entropy does not; BiGRU integrates both.
Figure 12: Natural counterfactual: same query, different LLMs, one hallucinating. NLI contradiction separates the two; LM entropy does not; BiGRU integrates both.
Bidirectional dataset transfer. Reverse transfer (PsiloQA to RAGTruth) outperforms forward despite fewer training examples.
Figure 13: Bidirectional dataset transfer. Reverse transfer (PsiloQA to RAGTruth) outperforms forward despite fewer training examples.
Architecture comparison (cosine schedule). All temporal architectures with full-sequence scope converge to ~0.84 AUC.
Figure 14: Architecture comparison (cosine schedule). All temporal architectures with full-sequence scope converge to ~0.84 AUC.
查看结构化数据
任务指标本文基线提升
RAGTruth token 级幻觉检测(主结果,10 seeds) Token AUC-ROC BiGRU 0.840 ± 0.007(单 seed 最高 0.845),token F1 0.257,AP 0.282 逐 token LogReg(同 33 维特征)0.730 ± 0.001;MLP(参数匹配 112K)0.765 ± 0.002 +11.0 AUC 点(Wilcoxon p = 0.002),MLP 只追回 32% 的差距
单信号 vs 多信号融合(BiGRU) Token AUC 三族融合 + 时序建模 0.840–0.845 最强单特征 NLI entailment drop 0.641;LM 熵 0.551;BiGRU 纯文本 0.832 融合较最强单信号 +20 点;时序建模贡献 +4.9 点(44% 的总增益)
与白盒 SOTA 对比(RAGTruth) Token AUC 0.840 ± 0.007,纯黑盒,适用于闭源 API RagtStacking(需激活访问)0.836;ReDEEP 0.733;Lookback Lens 0.73(发表版) 黑盒方法反超需要模型内部的白盒方法,且跨 18 倍模型规模仅波动 2.3 点(RagtStacking 数据)
与注意力信号互补融合(RAGTruth open-LLM 子集,Qwen3-14B 代理) Token AUC(5 seeds) 33 维特征 + Lookback 特征融合 0.866 ± 0.007 Lookback Lens 单独 0.838 ± 0.015;本文特征单独 0.819 ± 0.013 +2.8 点,证明黑盒外部信号与注意力信号捕获正交信息
跨源模型泛化(六模型留一法) Token AUC 平均 0.808(LLaMA-2-70B 0.829,GPT-4 0.781) 同分布 0.840 相对退化仅 3.8%,时序优势在全部六个留一模型上保持
跨数据集零样本迁移(PsiloQA ↔ RAGTruth) Token AUC(10 seeds) PsiloQA→RAGTruth 0.744(F1 0.185);RAGTruth→PsiloQA 0.634 LogReg 同设置 0.692 / 0.618 少三倍训练样例但标注密度高(53% vs 5.6%)的方向反超 +11 点,证明标注密度比数据量重要
CRF 评分方式对比(BiGRU-CRF) Token AUC Forward-backward 边缘概率 0.845 Softmax 对发射势直接评分 0.666 +17.9 点,softmax 忽略转移结构导致系统性失准
Span 级定位(与微调 encoder 对比) Span F1 0.394(121K 参数,预提取特征,优化排序质量) LettuceDetect 0.589(395M 参数 ModernBERT 微调) 落后 0.195:边界精度与黑盒可用性/3000 倍参数差之间的权衡

局限与改进

作者承认:测试时需对 DeBERTa(350M)和 TinyLlama(1.1B)推理,延迟敏感场景开销大;实验全为英语;黑盒设计放弃内部信号;二值标签不区分幻觉严重性与类型;token 独立性假设使 AUC 有效样本量膨胀,example 级 AUC 仅 0.795;5.6% 正率压制 token F1;NLI 截 400 词可能漏掉与后文的矛盾;span F1 0.394 显著低于 LettuceDetect 0.589。我的补充:其一,LM 特征依赖代理与生成器的风格匹配,反事实显示跨模型熵差 +0.295 大半是风格,对风格迥异的闭源新模型该信号可能进一步退化;其二,token F1 0.257、AP 0.282 说明排序好但校准差,以 0.5 阈值直接产品化会误报严重;其三,方法依赖源文档 $C$ 存在,对无参考的开放生成幻觉(闲聊、推理、创作)不适用;其四,作者自己的架构实验证明天花板由 33 维手工特征决定,继续提升需学习表征,但会侵蚀黑盒性这一核心卖点;其五,150:1 持久性统计来自 RAGTruth 标注方式,迁移到代码、表格等结构化输出时未必成立。

独立分析的弱点

弱点一:双向架构不可流式。BiGRU 需完整序列才能打分,无法在生成中实时报警,而干预越早越便宜——改进方向是训练单向变体或滑动窗口因果版本(ForwardGRU 0.802 可作下界)。弱点二:LM 信号近乎失效。TinyLlama 熵单独仅 0.551,跨模型变化大半是风格——改进方向是对目标 API 做无标注风格适应,或用多代理 LM 分歧度替代单一代理。弱点三:阈值与边界。F1@0.5 仅 0.257,CRF softmax 跨种子波动 ±0.05,说明校准差、span 切分靠阈值化粗糙——改进方向是引入 ECE 评估、用 forward-backward 边缘做 Viterbi span 分割或训练边界检测头。弱点四:特征天花板固化。所有架构卡在 0.843–0.845,手工 33 维特征信息量已榨干——改进方向是用轻量可学习特征提取器替换手工特征,在保持近黑盒的同时突破上限。弱点五:评估假设脆弱。token 独立性使显著性检验有效自由度膨胀,跨数据集 F1 不可比——改进方向是按 example 聚类的 bootstrap 置信区间与 example 级配对检验。

未来方向

作者提出的方向:流式检测——生成过程中用单向变体持续监控,在幻觉 span 完成前触发干预(拒绝采样、上下文回注或提示修正),把检测器从「事后审计」升级为「在线护栏」。可延伸方向:其一,检测到干预闭环——Akarlar(2026)的激活修补显示幻觉状态向前传播(87.5%)远比逆向修复(33.3%)容易,与本文前向证据积累一致,可在 $\hat{y}_t$ 超阈值时触发重采样或回退;其二,可学习特征蒸馏——把三族信号蒸进小 encoder,逼近 0.85+ 天花板同时保持部署廉价;其三,多语言扩展——在 PsiloQA 的多语言部分验证时序先验(持久概率 150:1)是否跨语言成立;其四,无参考幻觉检测——用多信号分歧(多个 NLI 模型、多个代理 LM 的一致性)替代源文档 $C$,覆盖开放生成场景;其五,标注效率工程——研究 LLM-as-judge 噪声密集标注加小量人工精标的两阶段方案;其六,用 CRF forward-backward 边缘做 span 级输出以缩小与 LettuceDetect 的边界差距,形成「黑盒默认 + 白盒增强」的产品线(融合已达 0.866)。

复现评估

复现条件相当友好。代码承诺发布于 https://github.com/YehudaItkin/temporal-hallucination-detection(预印本阶段,发表前可能尚未实际公开);RAGTruth 与 PsiloQA 均公开。特征提取完全确定性、无学习参数,种子只影响分类器初始化与训练顺序,10 seeds 方差很小(五个架构 std < 0.01)。总计算量不到 8 GPU 小时(2 块 RTX 4090),主模型仅 121K 参数,单卡可训练;主要成本是离线预提取特征(两个外部模型对约 230 万 token 推理)。训练配方具体:AdamW、学习率 $10^{-3}$、梯度裁剪 1.0、batch 32、512 token 截断、早停 patience 5;附录 A 列出 33 维特征完整清单,附录 J/W/K 给出超参扫描与种子分布。潜在坑:CRF 变体必须用 forward-backward 边缘而非 softmax 评分,否则复现出 0.6–0.7 的假象;标注转换与 NLI 400 词截断需严格照做。综合评估:开源落地后复现难度低,结果可信度高。