← 返回 2026-07-28

推理去噪器:通过去噪推理轨迹实现大推理模型的幻觉检测 Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du 📅 2026-07-24 👍 8 2026-08-02 18:30
大推理模型 幻觉检测 推理轨迹去噪 注意力机制 表示学习

用最终答案注意力学习投影,滤除推理轨迹噪声步骤以提升大模型幻觉检测

前置知识

大推理模型(Large Reasoning Models, LRM)

大推理模型指 OpenAI o 系列、DeepSeek-R1、Qwen3 等在给出最终答案前先生成一段长推理轨迹的模型。与普通 LLM 直接作答不同,LRM 会先把思考过程(如分步推导、验算、自我修正)逐 token 写出来,再产出答案 $a$。这段推理轨迹 $C=(c_1,\dots,c_K)$ 通常包含几十到上百个步骤,长度远超普通生成,因此既是提升推理能力的来源,也引入了大量噪声。

本文研究的对象就是 LRM 的推理轨迹,理解推理轨迹的存在与结构(步骤可分解、长度可变、含噪声)是理解为什么需要去噪的前提。

幻觉检测(Hallucination Detection)

幻觉检测是指判断模型最终答案是否真实/正确的任务。给定 $(p, C, a)$(提示、推理轨迹、答案),目标是学一个二元检测器 $G(p,C,a)\in\{0,1\}$,预测答案是否幻觉($y=1$ 表示幻觉)。常见范式包括:基于探针的 embedding 方法(如 Supervised Probing、CCS)、基于不确定性的方法(如 Perplexity)、基于一致性的方法(多次采样比较)、以及让模型自我报告置信度的 verbalized 方法。评价指标通常用 AUROC。

本文的最终目标就是提升幻觉检测性能,REDE 只是一个可插拔的去噪前置模块,下游检测器仍是这些经典方法。需要知道这些范式才能理解 REDE 的通用性贡献。

最终答案注意力(Final-Answer Attention)

在因果 Transformer 中,每个 token 通过注意力机制决定关注前面哪些 token。本文利用答案 $a$ 的最后一个 token $a_T$ 对每个推理步骤 $c_i$ 所含 token 的注意力质量,作为该步骤对最终答案贡献大小的衡量。形式化为 $s_i=\sum_{t\in I_i}\frac{\exp(q(a_T)^\top k(x_t)/\sqrt{\omega})}{\sum_u\exp(q(a_T)^\top k(x_u)/\sqrt{\omega})}$,其中 $q,k$ 是查询/键投影。$s_i$ 越大说明最终答案越依赖该步骤。

最终答案注意力是 REDE 的核心监督信号来源,论文的关键发现就是它能区分有用步骤与噪声步骤,必须理解它才能理解整个方法。

kNN 距离与表示空间塑形(Representation Shaping)

在嵌入空间中,$k$ 近邻(kNN)距离衡量一个点与其最近邻的相似程度:距离小说明该点处在密集区域,距离大说明它是离群点。本文通过训练一个轻量投影网络 $f_\varphi$,把原始步骤嵌入映射到一个新空间,让有用步骤聚成紧凑簇、噪声步骤散开成为离群点,从而可以用 kNN 距离简单地把噪声步骤滤掉。这本质是一种对比学习式的表示空间塑形。

REDE 的核心技术就是表示空间塑形加 kNN 过滤,理解这一点才能理解为什么需要三项损失(紧凑/散开/分离)以及推理时的滤除机制。

AUROC 指标

AUROC(Area Under ROC Curve)是二分类器在不 同阈值下整体性能的度量,取值 0~1,越大越好。它对正负样本比例不敏感,是幻觉检测领域最常用的指标。例如论文报告 Qwen3-8B 在 TruthfulQA 上从 68.63 提升到 87.32,就是 AUROC 值。

论文所有主结果和消融都以 AUROC 报告,理解该指标才能判断提升幅度是否显著。

研究动机

大推理模型虽然靠长推理轨迹提升了解题能力,但这些轨迹对幻觉检测反而是负担。作者通过人工标注 AIME 2024 上 Qwen3-8B 的推理步骤,发现轨迹中大量存在两类噪声:一是无关步骤(irrelevant),不提供与问题相关的有效信息;二是重复步骤(repetitive),其内容已被后续步骤覆盖。实验显示这些噪声步骤会显著拉低检测性能,而把它们去掉反而带来清晰提升(Figure 1a 标注 +13.73% 的增益)。更棘手的是,现成信号都无法识别它们:基于置信度的打分在有用与噪声步骤上分布严重重叠(Figure 1b),而朴素的 kNN 基于原始嵌入只能识别部分无关步骤,却无法把重复步骤与有用步骤区分开(Figure 1c)。这意味着直接用整条原始轨迹喂给检测器,信号会被噪声稀释,检测效果受限。

本文的目标是作者的目标是设计一个通用、免人工标注、轻量的去噪前置模块,能在大推理模型的推理轨迹中可靠地识别并滤除噪声步骤,再把清洗后的轨迹交给任意下游幻觉检测器(探针类、不确定性类、verbalized 类均可)。具体地,希望在不依赖人工步骤标注的前提下,把每条轨迹里无关与重复两类噪声步骤精准剔除,使下游检测 AUROC 显著提升,并在多个推理基准(TruthfulQA、MATH、CodeElo、MultiHopQA)与多个 LRM 家族(Qwen3、DeepSeek-R1-Distill)上一致有效。

与已有工作不同的是,现有路线都无法解决这个噪声问题:置信度反映的是模型对自己生成内容的确定程度,而非步骤对下游幻觉检测的有用程度;原始嵌入空间的相似度又无法区分语义相近的重复步骤。已有 LRM 专用检测器(如 RACE、RHD、ARS)要么把整条轨迹当作整体上下文处理(ARS 只在轨迹边界做答案层表示塑形),要么用一致性等其他信号,都没触及轨迹内部的步骤级噪声。本文的独特切入点是:利用 LRM 自身的最终答案注意力作为免标注监督信号,把它从'直接滤除规则'升级为'训练信号',用来重塑步骤级表示空间,使简单距离规则就能可靠过滤——这与以往所有直接基于注意力或基于生成质量的步骤选择方法有本质区别。

核心方法

整体思路是:与其直接拿注意力分数当过滤阈值(实验证明这样不稳定且推理要重算注意力),不如把注意力当作免标注监督,学一个轻量投影把步骤嵌入映射到一个'去噪空间',让有用步骤聚拢、噪声步骤散开,推理时用 kNN 距离把最像离群点的步骤删掉即可。技术路线分三步:先用最终答案注意力给每个步骤打分;再据此选出一批'有用代理'(高注意力 top-$\rho$%)和'噪声代理'(低注意力 bottom-$\rho$%),训练一个投影网络 $f_\varphi$(LRM 全程冻结,只优化投影);最后推理时对每个测试轨迹算 kNN 距离,丢掉距离最大的 top-$\zeta$% 步骤,得到清洗轨迹交给任意下游检测器。整个框架对检测器无关,且训练阶段只需模型自身注意力、无需人工标注。

核心创新是用'最终答案注意力'作为免标注监督信号来重塑步骤表示空间,而不是直接用它过滤。直觉上:无关步骤与答案关联弱,注意力低;重复步骤的内容已被后续步骤覆盖,注意力也会落到后出现的那一份上而偏低。作者用 Qwen3-8B 验证,平均注意力有用步骤为 $6.5\times10^{-3}$,无关步骤仅 $2.1\times10^{-3}$,重复步骤 $3.3\times10^{-3}$(Figure 2)。但直接按注意力阈值过滤只能得到 80.51(CCS),不如学习法 87.32,因为单例注意力受轨迹长度结构影响不稳定。因此 REDE 把它转化为投影目标:三项损失分别让有用步骤紧凑 ($\mathcal{L}_{\text{compact}}$)、让噪声步骤彼此散开 ($\mathcal{L}_{\text{disperse}}$)、把两类推开 ($\mathcal{L}_{\text{separate}}$),从而把易变的单例注意力变成稳定的嵌入结构。这与生成导向的步骤选择(SPIRIT、ASAP、Step Entropy 等)本质不同,它们优化生成质量而非检测所需的有用步骤。

方法步骤详情

方法分四步。步骤1(打分,Eq.1):取答案最后 token $a_T$,步骤 $c_i$ 分数定义为其 token 收到的注意力总质量 $s_i=\sum_{t\in I_i}\frac{\exp(q(a_T)^\top k(x_t)/\sqrt{\omega})}{\sum_{u}\exp(q(a_T)^\top k(x_u)/\sqrt{\omega})}$。步骤2(嵌入抽取,Eq.2):用困惑度加权聚合 token 隐表示得步骤嵌入 $e_i$,权重 $\text{PPL}(x_t)=1/p_\theta(x_t|x_{<t})$,越不可预测 token 权重越大。步骤3(投影学习,Eq.3):按 $s_i$ 取 top-$\rho$% 为有用代理集、bottom-$\rho$% 为噪声代理集,训练投影 $z_i=f_\varphi(e_i)$,目标含三项:紧凑有用步骤、散开噪声步骤、分离两类。步骤4(推理过滤):算每步 kNN 余弦距离,丢掉距离最大的 top-$\zeta$%(最优 $\zeta=70$%),清洗轨迹交检测器。推理无需注意力与标签。

技术新颖性

技术新颖性体现在四点。第一,问题新:首次系统指出 LRM 推理轨迹中的步骤级噪声(无关+重复两类)是幻觉检测被忽视的障碍,并用人工标注定量证明去除噪声能带来增益(Figure 1a 的 +13.73%)。第二,监督信号新:把最终答案注意力从'直接过滤规则'重新定位为'免标注训练监督',避开单例注意力不稳定的问题(直接过滤仅 80.51 vs 学习法 87.32)。第三,损失设计新:三项损失各司其职——紧凑有用步骤、散开噪声步骤、分离两类,消融显示去掉 $\mathcal{L}_{\text{disperse}}$ 损失最大(86.44→80.06),因为否则噪声步骤会聚成一团与有用步骤混淆。第四,框架轻量且通用:只训一个轻量投影,LRM 冻结;与检测器无关,能插到 CCS、Supervised Probing、Perplexity、Verbalized Certainty 等多种检测器上;作者还给出了基于滤后轨迹检测误差有界的形式化分析(附录 E),界直接取决于噪声步骤过滤质量。

最终答案注意力在推理步骤上的分布
Figure 2: 最终答案注意力在推理步骤上的分布
语义相似步骤中早/晚步骤的保留对比
Figure 3: 语义相似步骤中早/晚步骤的保留对比
REDE 框架训练与推理总览
Figure 4: REDE 框架训练与推理总览

实验结果

核心发现分五点。一、过滤普遍有效(Table 2):滤后轨迹在四种检测器全面提升,如 Qwen3-8B TruthfulQA 上 CCS 68.63→87.32、Probing 80.42→86.44,Distill-Llama-8B 趋势一致。二、全面超越基线(Table 1):MATH 探针 87.06、CodeElo 87.19、MultiHopQA 82.94,超过最强相关基线 ARS(MATH CCS 77.03 vs REDE 81.33)。三、跨数据集迁移好(Figure 5a):MultiHopQA 训练、CodeElo 测试达 88.04,略超域内 87.19。四、规模可扩展(Figure 5b):Qwen3-32B TruthfulQA 达 90.87%(比 RACE 高 5.73 点),Distill-Qwen-32B 达 78.95%(高 13.11 点)。五、消融:丢步比 $\zeta$ 在 70% 达峰、输出维 $d'$ 在 1024 达峰;六种步骤选择策略对比仅 REDE 一致提升;学习法优于直接注意力过滤(80.51 vs 87.32)。

与竞争性幻觉检测方法的对比
Table 1: 与竞争性幻觉检测方法的对比
原始推理轨迹 vs 滤后轨迹的检测对比
Table 2: 原始推理轨迹 vs 滤后轨迹的检测对比
步骤选择策略对比(TruthfulQA,Qwen3-8B)
Table 3: 步骤选择策略对比(TruthfulQA,Qwen3-8B)
直接注意力过滤 vs REDE(TruthfulQA)
Table 4: 直接注意力过滤 vs REDE(TruthfulQA)
跨数据集迁移与大规模 LRM 扩展性
Figure 5: 跨数据集迁移与大规模 LRM 扩展性
消融研究
Figure 6: 消融研究
查看结构化数据
任务指标本文基线提升
TruthfulQA 幻觉检测(Qwen3-8B,CCS) AUROC 87.32 68.63(原始轨迹 CCS)/ 81.92(ARS) 相对原始轨迹 +18.69 个点,SOTA
MATH 幻觉检测(Qwen3-8B,Supervised Probing) AUROC 87.06 81.05(原始轨迹)/ 77.03(ARS CCS) 相对原始轨迹 +6.01 个点
CodeElo 幻觉检测(Qwen3-8B,Supervised Probing) AUROC 87.19 82.82(原始轨迹) +4.37 个点
MultiHopQA 幻觉检测(Qwen3-8B,Supervised Probing) AUROC 82.94 77.84(原始轨迹) +5.10 个点
大规模 LRM 扩展性(TruthfulQA,Qwen3-32B) AUROC 90.87 85.14(RACE) +5.73 个点

局限与改进

局限性有几方面。第一,方法仍依赖标签:投影训练虽不需要人工步骤标注,但需要用正确性标签(由外部判官 Qwen3-32B 生成)来选数据,下游若用 Supervised Probing 还需监督标签;CCS 路线虽免监督但整体仍非完全无标签。第二,过滤对超参敏感:丢步比 $\zeta$ 在 70% 达峰、过大(>90%)会误删有用步骤而下降,输出维 $d'$、代理比例 $\rho$、损失权重等也需调,实际部署要小心调参。第三,分析主要建立在 Qwen3-8B 与 AIME/TruthfulQA 等少数模型与数据上,人工步骤标注成本高、样本有限(附录 A.3),结论的普适性(尤其非数学/代码任务)仍待验证。第四,只报告 AUROC,未给出准确率、F1、校准等指标(虽附录 C.10 有补充),且 greedy 解码为主,多样性采样下的鲁棒性验证有限。第五,理论与实证之间存在差距:附录 E 的检测误差上界依赖过滤质量假设,但实际轨迹结构异质,理论保证难以直接兑现。

独立分析的弱点

弱点一:直接注意力过滤已能拿 80.51,说明注意力本身信号不弱,学习法相对它的提升(87.32)主要来自把单例信号稳定化;如果模型更大或轨迹更规整,学习法的边际收益可能缩小,改进方向是探索自适应阈值或在线蒸馏注意力。弱点二:固定丢 top-$\zeta$% 太粗,不同轨迹噪声比例不同,固定 70% 在干净轨迹上会误删有用步骤;改进方向是学一个动态的步数自适应门控。弱点三:三类噪声(无关、重复、以及潜在的错误/误导步骤)只覆盖两类,且重复步骤被笼统归为低注意力,可能漏掉'看似有用实则误导'的步骤;改进方向是引入内容正确性或逻辑连贯性信号做更细分类。弱点四:依赖最终答案注意力,黑盒 LRM(无注意力输出)难以直接用,论文仅在附录 C 提及黑盒适用性;改进方向是用 logit 探针或代理模型近似注意力。弱点五:评估维度单一(AUROC 为主),未充分讨论过滤是否会误伤任务准确率(虽有附录 C.9);改进方向是把检测提升与下游任务表现联合优化。

未来方向

作者提出与可延伸的方向包括:一是把推理轨迹去噪推广到更多检测范式与更多 LRM 家族(如更强的 o 系列闭源模型),并研究黑盒场景下用代理注意力近似;二是探索更细粒度的噪声类型(不止无关与重复,还有误导/错误步骤)与自适应的过滤强度;三是把 REDE 思想迁移到推理增强、推理压缩、KV cache 优化等下游任务。基于成果可延伸:用学到的去噪嵌入做推理过程的可解释性分析或推理质量评分;与基于一致性的多次采样检测结合;研究去噪后的轨迹是否能反过来提升生成质量或减少推理长度;把注意力监督扩展为多 token 答案或多跳推理的层级监督,处理更长、更复杂的多轮推理轨迹。

复现评估

复现性中等偏上。论文给出了较完整的方法描述与公式(Eq.1-3、Algorithm 2/3 在附录)、四个基准(TruthfulQA、MATH=MATH500+AIME2024+AIME2025、CodeElo、MultiHopQA 由四个多跳数据集构建)、两个 LRM 家族的实验设置、以及详细附录(数据集构建 A.1/A.2、标注协议 A.3、基线实现 A.4、计算开销 A.7)。关键超参如 $\rho$、$\zeta$、$d'$、训练层都有消融。但摘要未明确提及是否开源代码与权重,正确性标签依赖外部判官 Qwen3-32B(需重新生成),数据集划分(25% 测试、100 验证)与三次随机种子平均也给出。整体计算量可控(投影轻量、LRM 冻结),主要成本在推理轨迹生成与注意力抽取。复现主要难点在于人工步骤标注(附录 A.3)与各基线的精确复现。