← 返回 2026-07-29

挖掘语言模型中的潜在推理策略 Uncovering Latent Reasoning Strategies in Language Models

Awni Altabaa, John Lafferty 📅 2026-07-20 👍 4 2026-08-03 18:30
变分推断 推理策略 模型可解释性 潜在变量模型 策略发现

用模型定向重建目标把预训练LM混合的策略解耦成策略对齐的潜在变量

前置知识

变分自编码器与条件 ELBO(VAE / cELBO)

变分自编码器用一个编码器 q(z|x,y) 近似难以求解的后验,并通过最大化证据下界(ELBO)来训练潜在变量生成模型。对本文的条件版,负目标为 $J_{\mathrm{cELBO}} = \mathbb{E}_{z\sim q}[ -\log g_\phi(y|x,z)] + \mathrm{KL}(q_\xi(\cdot|x,y) \| r_\phi(\cdot|x))$。它等价于 $-\log p_\phi(y|x) + \mathrm{KL}(q \| p_\phi(\cdot|x,y))$,因此它只要求边际 $p_\phi(y|x)$ 匹配观测分布、并让 q 匹配'哪个分解产生了该边际'的后验,却不要求 z 解释 y 超出 x 的部分。

本文的核心论证正是标准条件 ELBO 在'分解已预训练模型'时会失效——惰性 z 分解是它的全局最优——理解 ELBO 的语义才能看懂作者为何要替换重建项。

后验塌缩(Posterior Collapse)

后验塌缩指潜在变量在训练后变得惰性、几乎不携带信息的现象:编码器让 q(z|x,y) 退化到与先验/路由器 r(z|x) 几乎相同,于是 KL 项为零而重建仍由不含 z 的部分完成。本文给出一种被既有变分文献较少讨论的'病态'塌缩:当生成器在初始化时已能实现 $p_\theta(y|x)$ 时,对所有 z 令 $g_\phi(y|x,z) = p_\theta(y|x)$ 即可同时保真与让 q=r,使 z 完全无用却仍是最优解。

这是论文要解决的头号障碍;方法的所有设计都围绕'如何打破这种保真却惰性的塌缩'展开。

路由器-生成器策略分解(Router-Generator Factorization)

本文把目标刻画为对基模型响应分布的潜在变量分解 $p_\theta(y|x) \leadsto (r_\phi(z|x), g_\phi(y|x,z))$:路由器 $r_\phi(z|x)$ 把输入映射到潜在策略分布,策略条件化生成器 $g_\phi(y|x,z)$ 在 x 与采样 z 下生成响应,要求 $\int r_\phi g_\phi \, d\mu \approx p_\theta$。'策略对齐'进一步要求变化 z 改变所用的高层解题策略,且同一 z 在不同输入间保持相同策略含义(跨输入语义一致性)。

这是论文的问题定义、目标对象与评估口径;读懂它才能区分'信息量''策略对齐''跨输入一致性'三个层次的要求。

基模型惊讶度与分数信息增益(Surprisal & Fractional Information Gain)

基模型惊讶度定义为 $b_{\theta,t}(x,y) = -\log p_\theta(y_t | x, y_{<t})$,度量在已知 x 和自回归前缀后基模型对下一 token 剩余的不确定性。本文用它构造 token 权重 $w^{(\gamma)}_{\theta,t}$,并把重建损失用全局尺度 $c_\theta = (1/\tau_y)\mathbb{E}[b_\theta(x,y)]$ 归一化,使重建项 $R_\theta$ 在 $g_\phi = p_\theta$ 时期望为 1。于是 R_θ 的下降被解读为'被 z 解释掉的、以基模型为单位的响应损失比例',即分数信息增益。

这是方法的核心机制——'让重建压力集中在策略分支点、并以基模型单位度量'——的全部技术依据。

LoRA 轻量适配

LoRA 通过在原权重旁注入低秩更新 $W \leftarrow W + BA$(B、A 为低秩矩阵)来轻量微调大模型,保留预训练权重并大幅减少可训练参数。本文把预训练 Transformer 适配成路由器/生成器/后验三个角色时,全部采用 LoRA 风格低秩更新,再加少量高斯头和潜在嵌入投影,使生成器从基参数 θ 初始化、从而直接继承 $p_\theta(y|x)$。

理解 LoRA 才能理解'惰性分解就在初始化附近'这一塌缩成因,以及作者为何强调轻量适配的双面性。

研究动机

语言模型在推理任务中能用多种截然不同的策略求解同一问题——例如证明一个定理可采用反证法、归纳法或构造法,解一道编程题可能选用动态规划、图搜索或贪心算法。这些策略在许多问题间可复用,却只被隐式、纠缠地编码在响应分布 $p_\theta(y|x)$ 中,模型没有任何显式变量来标识或控制当下所用策略。本文进一步揭示一个被既有工作忽视的根本困难:当对一个已预训练好的基模型做潜在变量分解时,因为生成器在初始化时就已经能实现 $p_\theta(y|x)$,'忽略潜在变量 z'的分解(对所有 z 都令 $g_\phi(y|x,z) = p_\theta(y|x)$、$q_\xi(z|x,y)=r_\phi(z|x)$)不仅紧邻初始化、而且对于只拟合可观测边际分布的目标而言是全局最优的。这使得标准变分目标(含条件 ELBO)陷入一种病态塌缩:可保分布保真,却让 z 完全惰性、无法暴露策略层面的结构。

本文的目标是本文的目标是把给定预训练语言模型的响应分布 $p_\theta(y|x)$ 分解成一个结构化、策略条件化的表示——一个路由器-生成器分解 $(r_\phi(z|x), g_\phi(y|x,z))$:路由器把每个输入映射到潜在策略变量 z 的分布,策略条件化生成器在 x 与采样 z 下生成响应。该分解需同时满足两条:保持可观测响应分布($\int r_\phi(z|x) g_\phi(y|x,z)\,d\mu(z) \approx p_\theta(y|x)$),并让 z 既'有信息量'又'策略对齐'——变化 z 应改变生成器使用的策略,且同一 z 值在相关输入间承载相同策略含义(跨输入语义一致性)。作者用可控的算法任务基准配合在训练时被隐藏、仅用于评估的 ground-truth 策略标签来检验这种对齐是否真正达成。

与已有工作不同的是,本文的独特切入角度有三层。第一,把'分解已预训练模型'与'从数据训练潜在变量模型'严格区分:前者中目标分布在初始化时就已被表示,这是 VAE 式方法所没有的塌缩根源,因此标准变分推断在此必然失效。第二,把基模型本身当作参照系——用 $p_\theta$ 把重建损失归一化到'基模型参考单位',并在 token 级用基模型惊讶度 $b_{\theta,t}(x,y)$ 引导重建压力,使其集中在策略选择最可能发生的'分支点'。第三,把评估标准从'边际匹配'升级为更严格的'类比一致性'(Analogical Consistency):把在某输入上采样的 z 复用到另一相关输入,检验是否仍生成同一策略,从而直接衡量 z 是可复用的策略变量、还是输入局部的响应索引。

核心方法

整体思路是:先用一个可控的多策略算法基准(list 求和、排序、网格寻路、线性方程求解、进制转换、多位加法六个任务族)拟合一个会混合多种策略的基模型 $p_\theta(y|x)$;然后在其上训练路由器-生成器分解。训练样本完全从基模型采样 $x\sim D_X,\, y\sim p_\theta(\cdot|x),\, z\sim q_\xi(\cdot|x,y)$,全程不提供策略标注。核心机制是'模型定向重建压力':重建项在 token 级按基模型惊讶度加权、在全局用基模型响应损失归一化,使 $\mathbb{E}[R_\theta]=1$ 恰好对应'生成器等同基模型'。最终目标 $J_\theta = R_\theta + \beta\,\mathrm{KL}(q_\xi \| r_\phi)$ 把 KL 惩罚与'被 z 解释掉的基模型响应损失比例'平衡,从而把重建改进解读为分数信息增益,而非绝对 log-loss 单位。

核心创新点是用基模型 $p_\theta$ 自己定向重建压力,而非像标准 ELBO 只拟合边际。本质区别:标准条件 ELBO 中分解 $g_\phi(y|x,z)=p_\theta(y|x)(\forall z)$、$q_\xi=r_\phi$ 是全局最优,模型没有动机把信息路由到 z。本文重建项 $R_\theta=c_\theta\,\mathbb{E}_{z\sim q}[\sum_t a_{\theta,t}(-\log g_\phi(y_t|x,z,y_{<t}))]$ 用全局尺度 $c_\theta$ 归一化到基模型参考单位,并按 token 权重 $a_{\theta,t}=\alpha\,\bar w^{(\gamma)}_{\theta,t}+(1-\alpha)\,w^{(\gamma)}_{\theta,t}$ 加权(权重随基模型惊讶度 $b_{\theta,t}^{\gamma}$ 归一化,$\gamma\ge0$ 控制集中度)。这迫使 z 解释基模型在'前缀确定后仍留多种续接可能'的 token——即策略分支点,从而打破惰性塌缩。

方法步骤详情

步骤1(架构):把预训练 Transformer 适配成三角色。路由器 $r_\phi(z|x)$ 为对角高斯(两个投影头输出 $\mu,\log\sigma^2$);生成时把潜在样本 z 投影为嵌入 $E_\phi(z)$ 作为伪 token 插入嵌入层;训练后验 $q_\xi(z|x,y)$ 是独立同构模型。三者用 LoRA 低秩更新加少量高斯头与潜在投影,从基参数 θ 初始化。步骤2(采样):$x\sim D_X,\, y\sim p_\theta(\cdot|x),\, z\sim q_\xi(\cdot|x,y)$,无策略标注。步骤3(惊讶度):$b_{\theta,t}(x,y)=-\log p_\theta(y_t|x,y_{<t})$。步骤4(目标):$J_\theta=R_\theta+\beta\,\mathrm{KL}(q_\xi\|r_\phi)$,设计为当 $g_\phi=p_\theta$ 时 $\mathbb{E}[R_\theta]=1$。步骤5(评估):用保留策略标签测保真度与对齐。

技术新颖性

新颖性体现在三方面。问题层面:首次把'分解已预训练模型以暴露策略'形式化为与标准潜在变量建模本质不同的问题,并精确刻画'惰性 z 分解既紧邻初始化又全局最优'这一塌缩机制。方法层面:提出模型定向重建目标,把基模型同时用作归一化基准(基模型参考单位)和 token 级压力引导器(惊讶度加权),使损失带'分数信息增益'语义;并通过'全局尺度+token 加权'与'纯全局尺度'、'token 逆加权'对照,验证 token 级惊讶度加权的关键作用。理论层面:对复杂度惩罚的变分目标给出分解 $L_{\beta,\lambda}=H(Y|X)-(1-\beta)I_q(Y;Z|X)+\mathrm{DecGap}+\beta\,\mathrm{PriorGap}+\lambda C$,证明当 profiled 分数恢复差距 $\Delta^{\mathrm{prof}}_{\beta,\lambda}(\delta)>0$ 时极小化子满足 $d(\hat q,S^\star)<\delta$,并给出相应样本复杂度。

Autoregressive router-generator Transformer architecture
Figure 2: Autoregressive router-generator Transformer architecture
Token-level $p_\theta$ surprisal weighting
Figure 4: Token-level $p_\theta$ surprisal weighting

实验结果

第一,目标结构确实存在:图5 的线性探针显示六个任务族的策略标签都能从基模型隐藏态解码,尤其在表达策略特定计算的位置准确率很高。第二,标准 ELBO 失败:图3 显示训练中分布保真度升至约 1.0、后验-路由器 KL 相对初始坍塌到接近 0、而策略对齐一直很低;图6 在 Qwen2.5 0.5B/1.5B 上显示 ELBO 与 β-ELBO 基线能保分布却得不到策略对齐。第三,模型定向重建成功:'全局尺度+token 加权'变体在两种规模上同时达到高分布保真与高策略对齐(图6)。第四,潜在几何演化(图7):后验潜在从初始重叠云在 2%→6%→10%→20%→50%→100% 逐步分离成任务与策略结构化区域,且为任务条件化的多路复用而非单一全局策略码本。第五,机理消融:token 逆加权削弱对齐(图6 阴影条);图8 显示 token 加权重建损失与策略对齐跨方法高度相关,支持'对齐来自 z 捕获高惊讶度响应变异'的解释。

Method comparison on pretrained Qwen2.5 runs
Figure 6: Method comparison on pretrained Qwen2.5 runs
Posterior latent geometry over training
Figure 7: Posterior latent geometry over training
Fidelity-alignment phase space and token-weighted reconstruction vs Strategy Alignment
Figure 8: Fidelity-alignment phase space and token-weighted reconstruction vs Strategy Alignment
查看结构化数据
任务指标本文基线提升
Qwen2.5 0.5B / 1.5B 上的分布保真度与策略对齐(图6) Distributional Fidelity(保持有效解轨迹)+ Strategy Alignment(跨输入 Analogical Consistency) global+token weighting 变体在两种规模上同时取得高保真与高策略对齐 ELBO、β-ELBO 仅保分布保真、策略对齐接近基线低位 在策略对齐轴上从接近随机水平提升到高位,同时不损失分布保真
潜在几何的策略结构化(图7) 后验均值潜在的 PCA 投影是否按任务与策略聚集 训练 2%→100% 逐步从重叠云分离为任务+策略结构化区域,且为任务条件化多路复用 训练初期重叠、无结构 潜在变量从惰性演化为可识别的策略变量
机制验证:token 加权重建 vs 策略对齐(图8) 训练终点 token 加权重建损失与 Strategy Alignment 的相关性 所有方法(含消融)的终点在散点上呈强相关:重建越低、对齐越高 ELBO/β-ELBO 落在高重建、低对齐区域 为'对齐来自捕获高惊讶度响应变异'提供机理级证据
策略信息可解码性(图5) 从基模型隐藏态线性探针预测 ground-truth 策略的准确率 六个任务族在表达策略特定计算的位置准确率普遍较高 随机猜测水平 证明目标策略结构已隐式存在于基模型,为'暴露而非创造'提供前提

局限与改进

作者承认三点:基准局限于六类有 ground-truth 策略标注的合成算法任务,方法能否迁移到开放式推理仍是开放问题;理论分析是初步的,oracle 选择判据(profiled 分数的恢复差距 $\Delta^{\mathrm{prof}}_{\beta,\lambda}$)与实际训练动力学之间的联系尚未形式化刻画;论文未展示在大规模真实推理任务上的可扩展性。我额外观察到:实验规模限于 0.5B/1.5B 小模型,且任务高度结构化、可解析,策略恢复的成功相当依赖任务的可解析性与策略枚举的清晰性;评估高度依赖保留的 ground-truth 策略标签,而在真实场景中这类标签恰恰难以获得,使得'如何判断已恢复正确策略'在更复杂任务上仍无解;缺少与更广潜在变量方法(Information Bottleneck、解耦 VAE、可控生成)的系统对比,难以判断本文目标相对其他压力重分配方案的增量。

独立分析的弱点

第一个弱点是任务结构化程度过高。六个算法任务都有可解析的解轨迹和枚举清晰的策略,策略恢复的成功难以直接外推到自然语言推理;改进方向是在数学证明、代码生成等半结构化任务上构造弱监督策略信号(如答案子类型、工具调用序列、求解树结构)。第二个弱点是评估依赖隐藏的 ground-truth 策略标签。真实开放任务缺乏这类标签,'恢复是否正确'无法验证;改进方向是发展无监督的跨输入一致性代理指标或人类评估协议。第三个弱点是规模与计算。仅在 0.5B/1.5B 与 LoRA 适配上验证,且需对潜在维度、β、γ 做扫描;改进方向是研究可扩展的潜在参数化(如离散策略码本)与自适应 β/γ 调度以降低扫描成本。第四个弱点是理论实用性。oracle 判据 $\Delta^{\mathrm{prof}}>0$ 难以在训练前验证,复杂度代理 $C(r,g)$ 偏抽象、未与具体参数化绑定;改进方向是把它与 LoRA 秩、潜在维数等归纳偏置更具体地对应。

未来方向

作者明确把下游应用留作未来工作:把策略级干预用于强化学习后训练中的定向探索,超越基模型响应分布的被动 on-policy 采样,从而发现并改进欠采样的推理策略、支持策略跨输入的迁移或重组;并指向模型可解释性、可控性与探索三个方向。基于本成果可延伸的方向包括:把 router-generator 分解迁移到数学定理证明与代码生成等结构化推理;研究离散策略码本以获得更可读、可组合的策略变量;用恢复的潜在 z 做 RL 中的分层策略搜索或自我博弈;把'模型定向重建'思想推广到多模态生成与工具调用轨迹的策略分解;以及在更大模型与真实任务上检验分数信息增益目标的扩展性,并发展无监督的对齐评估方法。

复现评估

复现性总体良好。作者公开了代码库 github.com/Awni00/latent-strategies-in-lms,并在附录 C 给出六类算法基准的设计细节、附录 E 给出 β 的扫描范围与超参。模型基于开源 Qwen2.5 0.5B/1.5B,仅用 LoRA 适配加少量高斯头与潜在投影,硬件门槛相对可控。训练样本完全从基模型采样且无需策略标注,协议清晰。主要风险在于:正文以柱状/散点呈现图6-8 而未给出每条曲线的精确数值,β 扫描细节在附录,精确复现需自行跑通扫描并匹配 β 选择规则;理论部分的 $C(r,g)$ 与离散集合 $Q,R,G$ 是理想化设定,难以直接对应实际实现。综合看,主结论可复现,但定量对比需一定工程投入。