GradCuit:基于信用分配梯度流的鲁棒可解释测试时潜在推理 GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
在Transformer中间层插入可优化潜在态,借自注意力直接回传奖励梯度优化测试时推理。
前置知识
测试时潜在推理 (Test-Time Latent Reasoning)
在模型参数完全冻结的前提下,针对每个具体样本,在推理阶段优化一组实例相关的连续潜在变量 $z=(z_1,\dots,z_N)$,从而在不重新采样、不重排输出的情况下改善大语言模型生成质量。代表方法 LatentSeek 把潜在变量定义在输出侧,先将其解码为前缀 token,再以标准自回归方式续写,并用奖励加权梯度更新这些潜在态。其理想目标为 $z^* = \arg\max_z \mathbb{E}_{x\sim\pi(x|z,c)} R(x,c)$。
GradCuit 的全部动机都建立在 LatentSeek 这类输出侧方法的缺陷之上:如果不理解 LatentSeek 把潜在变量经解码 token 与推理轨迹相连的工作方式,就无法理解 GradCuit 为什么要改在中间隐藏层定义潜在空间、为什么能绕开解码瓶颈。
信用分配问题 (Credit Assignment)
在强化学习与序列决策中,信用分配指把序列级的奖励 $R(x,c)$ 合理地分摊到序列中每一个决策变量上。在潜在推理里,问题变成:一条由 $T$ 个 token 组成的生成轨迹,到底哪些潜在变量、哪些 token 位置对最终正确与否贡献最大。经典策略梯度用 $\nabla_{z_i}\log\pi(x_i|z_i)$ 形式的分数函数估计,但 LatentSeek 只能把信用经解码 token 间接传回,每个潜在变量只对接自己解码出的那一个前缀 token。
本文标题即以“Credit-Assigned”命名,其核心贡献正是让整段续写(continuation)所有 token 的奖励加权梯度,沿着自注意力路径直接、逐位地分配到每个潜在变量上。理解信用分配才能看懂 $\nabla_{z_i^{(l)}} J = \sum_t \mathbb{E}[R(x,c)\,\nabla_{z_i^{(l)}}\log\pi(x_t|x_{<t},z^{(l)},c)]$ 这一关键更新公式。
Transformer 自注意力电路 (Self-Attention Circuit)
受 Elhage 等人 Transformer Circuits 工作启发,把多头自注意力视为一张有向图:每个 query 位置与每个 key 位置之间的注意力权重构成边,信息沿这些边复合传播,形成一个可计算的“电路”。在因果掩码下,每个位置只能“看到”它之前的全部位置。GradCuit 正是把潜在变量插入这条电路中间,使其既能作为可被后续 token 注意到的前向通路,又能作为反向求导的梯度传播通路。
方法名 GradCuit = “gradient through circuit”,整个设计哲学都依赖这一电路视角。要理解为什么插入中间层后每个续写 token 都对每个潜在态可微,必须先掌握自注意力图如何定义可微的信息通路。
策略梯度 / REINFORCE 更新
策略梯度通过最大化期望奖励 $J(z)=\mathbb{E}_{x\sim\pi(x|z,c)}[R(x,c)]$ 来优化策略参数,其梯度可写成奖励加权的对数似然梯度 $\nabla_z J = \mathbb{E}[R(x,c)\nabla_z\log\pi(x|z,c)]$。GradCuit 沿用 LatentSeek 的策略梯度式更新 $z^{(l)}\leftarrow z^{(l)}+\eta\,\nabla_{z^{(l)}}J(z^{(l)})$,但关键区别在于分数函数是对所有续写 token 求和的 $\sum_{t=1}^{T}\nabla_{z_i^{(l)}}\log\pi(x_t|x_{<t},z^{(l)},c)$,而非仅解码前缀。
论文中所有优化更新、消融里的“w/o Gradient(高斯随机方向)”、以及学习率鲁棒性实验,都建立在策略梯度这一基础之上。理解 $\eta$、$\nabla_z J$、随机方向变体的含义,是读懂鲁棒性与消融结果的前提。
因果自回归分解 (Causal Autoregressive Factorization)
自回归语言模型把序列概率分解为 $\pi(x|c)=\prod_{t=1}^{T}\pi(x_t|x_{<t},c)$,即在给定历史前缀条件下逐 token 预测下一个。GradCuit 引入潜在态后给出新的分解 $\pi(x|z^{(l)},c)=\prod_{t=1}^{T}\pi(x_t|x_{<t},z^{(l)},c)$,其中下一 token 分布由 $\pi(x_t|x_{<t},z^{(l)},c)=\text{LM\_Head}(\text{Transformer}_{l+1:M}[h_c^{(l)},z^{(l)},h_{x<t}^{(l)}])$ 给出,即把拼接序列送入剩余 $l+1$ 到 $M$ 层。
这一分解是推导梯度流 $\nabla_{z_i^{(l)}}\pi(x_t|x_{<t},z^{(l)},c)$ 的数学基础,也解释了为什么每个续写 token 都能通过剩余 Transformer 层的注意力直接对潜在态求导,是方法章节的核心公式。
研究动机
现有的测试时潜在推理方法(如 LatentSeek、LTPO、MILR)都把潜在变量与推理轨迹之间的接口放在“解码出的离散 token”上:先把连续潜在态 $z$ 解码为前 $N$ 个 token,再以标准自回归方式续写,最后用奖励 $R(x,c)$ 反传更新潜在态。这种设计带来两个具体痛点。其一,间接优化:解码过程在连续潜在态与其下游效果之间塞入了一个信息瓶颈,优化信号变得间接,并与中间 token 表示纠缠在一起,每个潜在变量只能收到它自己解码出的那一个前缀 token 的对数似然梯度 $\mathbb{E}[R(x,c)\nabla_{z_i}\log\pi(x_i|z_i)]$,整段续写后半部分的奖励几乎无法直接回流。其二,潜在动力学不透明:离散生成通路遮蔽了单个潜在变量如何影响后续预测,研究者既说不清某次潜在更新为什么有效,也难以做可解释性分析。在 GPQA-Diamond、GSM8K、MATH-500 等推理基准上,这种间接信用分配直接限制了方法的天花板。
本文的目标是本文的目标是设计一种既能在测试时直接优化实例相关潜在态、又能让信用分配沿着完整续写轨迹精确回流的方法,从而在提升推理精度的同时获得更低的超参敏感性与更强的可解释性。具体而言,作者希望做到三件事:第一,让每一个续写 token 的对数似然 $\log\pi(x_t|x_{<t},z,c)$ 都对每一个潜在变量可微,使奖励加权梯度 $\sum_t R(x,c)\nabla_{z_i}\log\pi(x_t)$ 能逐位、直接地分配到潜在态;第二,在不更新任何模型参数、仅更新一小段插入隐藏层的潜在向量的前提下,稳定地超过 CoT 与 LatentSeek 等基线;第三,借由这条电路式的梯度通路,把潜在动力学“打开”给研究者看,定位出潜在态主要影响哪类 token、最该插在哪一层。
与已有工作不同的是,GradCuit 的独特切入角度在于:它不再像 LatentSeek 那样把潜在空间定义在 Transformer 的“输出侧”(先解码再续写),而是把潜在空间搬进 Transformer 的“中间隐藏态空间”——在第 $l$ 层输出与续写隐藏态之间插入可优化向量 $z^{(l)}$。这样一来,预训练好的自注意力机制本身就被征用为潜在优化的前向计算通路与反向梯度通路,无需任何额外解码接口。这一视角直接对应 Elhage 等人的 Transformer Circuits 思想:注意力图定义了一个可微的复合电路,GradCuit 因此得名(gradient through circuit)。与 prompt tuning / prefix tuning 这类需要监督数据、要在训练时反传整网的方法不同,GradCuit 完全在测试时、以奖励信号驱动,且梯度只需穿过 $l+1$ 到 $M$ 层。这种“在电路内部插入并直接求导”的设计,是它在信用分配与可解释性上区别于所有同行的本质所在。
核心方法
方法的直觉非常直接:既然信用分配的瓶颈来自“解码 token”这一离散接口,那就干脆不解码,把潜在向量直接插进 Transformer 的中间隐藏层,让自注意力自己把续写 token 与潜在态连起来。技术路线上,作者取一个 $M$ 层 Transformer 解码器,选定第 $l$ 层的输出空间作为潜在优化空间。预测第 $t$ 个 token 时,先把 prompt $c$ 与已生成 token $x_{<t}$ 过前 $l$ 层,得到隐藏表示 $h_c^{(l)}$ 与 $h_{x<t}^{(l)}$,再在二者之间插入可优化的潜在变量 $z^{(l)}$,拼接成 $[h_c^{(l)},\,z^{(l)},\,h_{x<t}^{(l)}]$,送入剩余的 $l{+1}\!:\!M$ 层与 LM head 得到下一 token 分布。优化时用奖励模型 $R(x,c)$ 对整段续写打分,按策略梯度把奖励加权梯度沿自注意力回传到 $z^{(l)}$,反复迭代直至收敛,全程冻结基础模型参数。整条通路天然可微,因而既能精确分配信用,又能用 token 级梯度做可解释性归因。
核心创新点是把Transformer的自注意力机制当作一条“梯度路由电路”。因为插入的潜在变量 $z^{(l)}$ 与token隐藏表示一起参与自注意力,每个生成续写token都能注意到其前所有潜在位置,于是每个续写token的对数似然 $\log\pi(x_t|x_{<t},z^{(l)},c)$ 都对每个潜在态 $z_i^{(l)}$ 直接可微,梯度 $\nabla_{z_i^{(l)}}\pi(x_t|x_{<t},z^{(l)},c)$ 可沿剩余 $l{+1}\!:\!M$ 层的注意力通路无障碍回流。这与LatentSeek的本质区别在于:LatentSeek每个潜在变量只能对接“自己解码出的那一个前缀token”,信用被解码瓶颈截断;而GradCuit让整段 $T$ 个续写token的奖励加权梯度 $\sum_{t=1}^{T}R(x,c)\nabla_{z_i^{(l)}}\log\pi(x_t|x_{<t},z^{(l)},c)$ 全部逐位落到潜在态上。这条电路式通路还顺带提供了可解释性透镜——对 $z^{(l)}$ 求Jacobian即可看清潜在态如何影响后续预测。
方法步骤详情
完整流程分五步。(1)选层初始化:在 $M$ 层Transformer选定第 $l$ 层初始化可优化潜在向量 $z^{(l)}$。(2)前向构造:预测每个 $x_t$ 时把 $c$ 与 $x_{<t}$ 过前 $l$ 层得 $h_c^{(l)}$、$h_{x<t}^{(l)}$,与 $z^{(l)}$ 拼成 $[h_c^{(l)},z^{(l)},h_{x<t}^{(l)}]$,过 $l{+1}\!:\!M$ 层与LM head得 $\pi(x_t|x_{<t},z^{(l)},c)$。(3)奖励评估:用奖励模型对续写打分 $R(x,c)$。(4)更新:按 $z^{(l)}\leftarrow z^{(l)}+\eta\,\nabla_{z^{(l)}}J$ 更新,梯度 $\nabla_{z_i^{(l)}}J=\sum_{t=1}^{T}\mathbb{E}[R(x,c)\nabla_{z_i^{(l)}}\log\pi(x_t|x_{<t},z^{(l)},c)]$ 聚合所有续写token,$\eta\approx0.001$。(5)迭代至收敛,仅 $z^{(l)}$ 被更新。
技术新颖性
技术新颖性体现在四个层面。其一,潜在空间位置:首次把测试时潜在优化的空间从输出侧搬到中间隐藏层,直接征用预训练自注意力作为优化通路,而非外挂一个解码接口。其二,信用分配方式:通过对所有续写 token 的对数似然求 $\nabla_{z^{(l)}}\log\pi(x_t)$,实现“全序列奖励 → 每个潜在态”的直接信用分配,从根本上绕开离散解码瓶颈。其三,可解释性副产品:这条可微通路使得 token 级梯度归因成为可能,作者据此发现潜在态影响高度集中在 because、therefore、then 等“推理连接词”上,并定位出早-中段(25%–50% 深度)为最佳优化空间。其四,鲁棒性来源被拆解清楚:消融显示“插入位置/直接交互”与“奖励引导”是互补的两条增益来源,即便用高斯随机方向替代奖励梯度,GradCuit 仍能与有奖励引导的 LatentSeek 持平,这说明收益很大一部分来自潜在空间本身的可达性,而非单纯依赖奖励信号。与 prompt tuning 需要监督、与 TTT 需要更新参数不同,GradCuit 是纯测试时、纯潜在态优化。
实验结果
在5骨干(LLaMA-3.2-3B、3.1-8B、Qwen2.5-7B/14B、Qwen3-4B)、3基准(GPQA-Diamond、GSM8K、MATH-500)、2格式(\boxed/JSON)共30设置上评测。表1显示GradCuit平均64.5%,比CoT高6.6、比最强竞争方法高2.4,23项最佳;相对LatentSeek的\boxed/JSON增益为GPQA +2.2/+2.0、GSM8K +2.5/+3.8、MATH-500 +2.8/+8.9。鲁棒性(图2):LLaMA-3.2-3B上MATH-500扫7个学习率,GradCuit仅51.4%–53.8%浮动,LatentSeek为47.6%–51.8%,均值52.6% vs 49.3%、标准差0.82 vs 1.53。图3显示用高斯随机方向替代奖励梯度,GradCuit(random)平均60.6%略超有奖励引导的LatentSeek 60.3%。可解释性(图4)显示推理连接词梯度强度三基准均最高(0.308/0.303/0.256);消融(表3)完整66.6%、固定前缀仅62.0%,随机方向加奖励梯度再+2.4。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| GPQA-Diamond(钻石级科学问答) | Boxed / JSON 答题准确率(%),跨5骨干平均 | Boxed 39.0% / JSON 37.2% | LatentSeek Boxed 36.8% / JSON 35.2%;CoT Boxed 30.2% / JSON 31.1% | 相对LatentSeek +2.2/+2.0点;相对CoT +8.8/+6.1点 |
| GSM8K(小学数学应用题) | Boxed / JSON 答题准确率(%),跨5骨干平均 | Boxed 88.8% / JSON 84.8% | LatentSeek Boxed 86.3% / JSON 81.0%;CoT Boxed 85.4% / JSON 80.3% | 相对LatentSeek +2.5/+3.8点;相对CoT +3.4/+4.5点 |
| MATH-500(竞赛级数学) | Boxed / JSON 答题准确率(%),跨5骨干平均 | Boxed 72.0% / JSON 65.0% | LatentSeek Boxed 69.2% / JSON 56.1%;CoT Boxed 66.1% / JSON 54.0% | 相对LatentSeek +2.8/+8.9点(JSON提升最显著);相对CoT +5.9/+11.0点 |
| 学习率鲁棒性(LLaMA-3.2-3B, MATH-500, Boxed) | 7个学习率档位下的准确率均值与标准差 | 均值52.6%,标准差0.82,范围51.4%–53.8% | LatentSeek 均值49.3%,标准差1.53,范围47.6%–51.8% | 标准差降至约一半,均值+3.3点,对学习率选择显著更鲁棒 |
| 整体平均(30个骨干×基准×格式设置) | 平均准确率(%) | 64.5%(30项中23项单项最佳) | 最强竞争方法 62.1%;CoT 约57.9% | 比最强竞争方法+2.4点;比CoT+6.6点 |
局限与改进
作者承认的局限主要有三点:第一,收益依赖一个好的奖励模型 $R(x,c)$,奖励信号的质量直接决定潜在优化方向,对开放式生成任务(难以设计可靠奖励)的适用性未被验证;第二,潜在插入的层数位置 $l$ 与潜在数量 $N$ 都是任务相关的超参,图5显示最优层在 25%–50% 之间漂移,移到 75% 反而可能有害(GPQA 上尤为明显),意味着换骨干或换任务需重新调参;第三,实验全部集中在可判定的短答推理(数学/科学 QA),未覆盖代码生成、长文本写作、多轮对话等场景。从我的观察补充:方法需要对剩余 $l{+1}\!:\!M$ 层做反向传播,单样本的显存与计算开销显著高于纯前向的采样类方法(如 Self-Consistency),虽迭代次数更少但每步更贵;此外消融里“随机方向都接近 LatentSeek”这一结论虽然漂亮,但也暗示奖励引导的边际增益相对温和(仅 +2.4),如何在更难任务上让奖励信号发挥决定性作用仍是开放问题;归因分析目前仅做了 5 类 token 的粗粒度分类,缺乏对单个潜在维度的语义对应研究。
独立分析的弱点
独立来看有几处可改进。其一,显存与吞吐:反向传播剩余层使单样本优化偏贵,可引入梯度检查点、低秩潜在表示或仅对前若干续写token回传梯度降本。其二,超参自动化:最优插入层随任务漂移,可设计自适应层选择(按各层梯度范数/不确定性在线挑选)或同时在多层插入潜在态联合优化,降低人工调参。其三,奖励依赖:当前用外部奖励模型打分,难判定开放式任务上受限,可用模型自身置信度(如LTPO的confidence reward)或过程级奖励替代,扩展到代码、长文生成。其四,归因粒度:现在只分5类token,未来可做单潜在维度→token的细粒度对应,并把“连接词敏感”用于主动定向干预。其五,多模态:同行MILR/DMLR已做图文潜在推理,GradCuit的电路式梯度流可自然迁移到视觉token与跨模态注意力。其六,效率对比尚不充分,论文只比迭代次数未给wall-clock/FLOPs/显存,建议补齐以佐证“迭代更少即更省”。
未来方向
作者明确点出的方向包括:把电路式梯度通路与更深层的可解释性工具结合,研究潜在态如何塑造推理连接词;以及探索早-中段层的更细粒度规律。基于成果可延伸的方向有:第一,多模态潜在推理——把中间层插入思路与 MILR/DMLR 的图文潜在优化结合,处理 VQA、图文数学等任务;第二,自适应/多层插入——动态选择或同时优化多个层的潜在态,避免单一层位置的任务依赖性;第三,过程级与自奖励——用模型自身置信度或逐步过程奖励替代外部奖励模型,摆脱对 R 的依赖并扩展到开放式生成;第四,潜在干预与可控推理——利用“连接词敏感”这一归因发现,定向增强/抑制某些潜在维度以主动操控推理风格;第五,效率工程——梯度检查点、低秩潜在、部分 token 回传等使方法在更大模型上可行;第六,与训练时方法(如 GRPO、DPO)结合,探索测试时潜在优化能否反哺训练阶段的潜在表示学习。Anthropic 同期的 J-lens 工作(专注可解释性)也提示可在“潜在推理可解释性”这一轴上与更大规模 mechinterp 工具交叉。
复现评估
复现门槛总体中等偏上。利好方面:作者公开了代码(github.com/Yuzhaoxin946/GradCuit)与项目主页,所用 5 个骨干(LLaMA-3.2-3B、LLaMA-3.1-8B、Qwen2.5-7B/14B、Qwen3-4B-Instruct-2507)与 3 个基准(GPQA-Diamond、GSM8K、MATH-500)均为公开可用,\boxed/JSON 提示与基线协议在附录给出,关键超参(学习率 0.001、层数 25%–50%)也已报告。挑战方面:方法需要对剩余 Transformer 层做反向传播,复现需具备带足够显存的 GPU(最大骨干 14B,反传显存压力不小),并需自备/选定一个奖励模型 $R(x,c)$(论文未完全明确所用奖励模型的获取细节,这点会增加复现不确定性);此外层数位置、潜在数量等任务相关超参在不同骨干/任务上需重新调整,单次复现未必能直接复刻全部 64.5% 的平均值。建议复现者先从 LLaMA-3.2-3B + MATH-500(Boxed) 这一最经济的配置入手,验证 +6 点量级的相对提升后再放大规模。
论文图表