← 返回 2026-07-23

SLPO:通过代理策略扩展潜在推理 SLPO: Scaling Latent Reasoning via a Surrogate Policy

Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li 📅 2026-07-22 👍 5 2026-07-28 18:30
强化学习 思维链 测试时扩展 潜在推理 策略优化

用代理似然把结果奖励RL引入潜在推理,实现潜在测试时扩展

前置知识

显式思维链与潜在推理

显式 CoT 把每个推理步骤解码为离散语言 token,从词表分布 $\pi_\theta(y_t|x_i,y_{<t})$ 中采样,因此天然带有逐 token 的动作概率可供 RL 分配信用。潜在推理则在隐藏空间中自回归地传播连续向量 $h_{i,t}\in\mathbb{R}^d$,转移写成 $h_{i,t}=f_\theta(x_i,h_{i,<t})$,中间计算绕过词表分布,省去了每步语言解码的开销,能在短得多的计算长度上匹配甚至超越显式 CoT。

本文的全部动机建立在这两类推理的差异上:潜在推理更高效却缺乏可处理的动作似然,这是阻碍其进入结果奖励 RL 阶段的根本障碍。

结果奖励强化学习(RLVR)

RLVR 指用可验证奖励 $R(\hat{a}_i,a_i^\star)$ 训练推理模型,奖励只看最终答案是否正确。主流目标包括组相对的 GRPO 和留一基线 RLOO,它们对采样 rollout 用优势 $A_i=R_i-b_i$ 加权序列对数似然来更新参数。这套范式之所以对显式 CoT 成熟,是因为离散 token 轨迹有明确的 $\log\pi_\theta(y_{1:T},\hat{a}_i|x_i)$ 可供求导。

SLPO 的目标正是把 RLVR 迁移到潜在推理,理解 RLVR 的信用分配机制才能明白为何连续潜在转移需要一个代理似然接口。

MC-dropout 随机 rollout

在推理时保留 dropout(概率 $p$)会让同一前缀产生不同的隐状态,从而给原本确定性的潜在推理注入随机性。文献表明这种随机性可作为 RL 探索的底物,记一次采样的轨迹为 $\tilde{h}_{i,1:T_{\max}}$。SLPO 进一步用同一前缀上 $K$ 次独立 dropout 前向评估的样本 $z^{(k)}_{i,t}$ 估计经验均值与方差,构造代理分布。

MC-dropout 既是 SLPO 探索随机性的来源,又是构造代理似然所需的矩估计器,是整个方法成立的物理基础。

停止门与自适应停止

停止门是一个附加在潜在状态上的头 $g_\theta$,输出停止概率 $s_\theta(h)=\sigma(g_\theta(h))$。在长度 $t$ 停止的概率为 $P_\theta(\tau=t)=\rho_t\prod_{k<t}(1-\rho_k)$,其中 $\rho_t=s_\theta(h_t)$。推理时顺序推进,首次超过阈值即停并解码答案,从而把固定预算 $T_{\max}$ 变成按样本决定的实际计算长度。

SLPO 的第二支柱就是让停止时刻可学习,理解停止门才能看懂难度自适应计算(图7)是怎么从固定预算中释放出来的。

代理似然(Surrogate Likelihood)

代理似然是 SLPO 为连续潜在转移构造的可微打分函数。它用 $K$ 次 MC-dropout 样本估计各向同性高斯 $\mathcal{N}(\mu_{i,t},\sigma^2_{i,t}I)$,再在该高斯下评估真实采到的隐状态 $h_{i,t}$:$\log\tilde{\pi}_\theta(h_{i,t}|\cdot)=-d\log\sqrt{2\pi\sigma^2_{i,t}}-\|h_{i,t}-\mu_{i,t}\|^2/(2\sigma^2_{i,t})$。采样状态作为 stop-gradient 目标,梯度只流过重新计算的矩。

这是把奖励优势转换为向量空间信用的关键桥梁,命题1证明正优势会把均值拉向状态、负优势推开,是理解方法核心机制的基础。

研究动机

显式思维链(CoT)推理把每个中间步骤都解码为离散语言 token,但其中许多 token 服务于语言连贯、叙述或冗余,而非底层解题状态,每个 token 仍要承担完整的自回归生成开销,这从根本上限制了显式推理的可扩展性。潜在推理把中间计算承载为隐藏空间中的连续向量,已能以短得多的计算长度匹配甚至超越显式 CoT。然而现有潜在推理器仍被“模仿”束缚:它们主要通过 SFT 对齐到人工选择、压缩或渲染的显式 CoT 表示。更关键的是存在两个结构性缺陷阻碍结果奖励 RL 的引入:其一,中间步骤作为绕过词表分布的连续向量传播,缺乏一个可处理的逐步动作似然 $\log\pi_\theta(h_{i,t}|x_i,h_{i,<t})$ 来分配转移级信用;其二,现有方法在训练和推理中固定思维预算 $T_{\max}$,冻结了 RL 本该优化的计算地平线。两者共同缺失使结果奖励无法诱发潜在测试时扩展。

本文的目标是本文的目标是把结果奖励强化学习引入自回归潜在推理器,从而在连续隐空间中实现真正的潜在测试时扩展。具体而言,作者希望构造一个可在任意向量化潜在推理器上使用的优化接口,使 RLOO 或 GRPO 这类标准算法能把可验证奖励 $R(\hat{a}_i,a_i^\star)$ 的信号传递回连续的潜在转移;同时让推理器自身学会“何时停止思考”,把固定预算转化为按难度自适应的计算分配。最终目标是同时提升并行采样的通过率 Pass@$k$ 与确定性准确率,并在更难的样本上分配更长的潜在轨迹,使潜在推理像显式 CoT 那样跨过“模仿阶段”进入“结果优化阶段”。

与已有工作不同的是,本文的独特切入角度是识别并补齐结果奖励与潜在推理之间缺失的优化接口。已有潜在策略方法要么依赖词表中介接口(LEPO 用 Gumbel 噪声作用于软 token rollout、Latent-GRPO 在词表空间的潜在 token 上稳定 GRPO),要么依赖架构特定的潜在头(CoLaR 学一个高斯头),都不能直接迁移到传播纯隐藏状态的任意向量潜在推理器。SLPO 的本质区别是:它不依赖任何词表概率,而是基于 MC-dropout 诱导的随机性,用 $K$ 次随机前向评估的经验均值 $\mu_{i,t}$ 与加底各向同性方差 $\sigma^2_{i,t}$ 构造一个可微的高斯代理似然,把 rollout 优势直接转换为对向量推理的信用分配,并辅以正确性监督冷启动的停止门来优化可变计算地平线。作者明确指出,非约束隐藏状态递归上的结果奖励策略优化此前无人探索。

核心方法

SLPO 的整体思路是“先用正确性监督冷启动一个可学习的停止门,再用一个可微的代理似然把结果奖励接到连续潜在转移上”。直觉上:显式 CoT 之所以能被 RL 优化,是因为采样轨迹天然带有逐 token 的动作概率;潜在推理没有这种概率,那就用 MC-dropout 在同一前缀上重复采样 $K$ 次,估计出一个高斯分布当作代理策略,把真实采到的隐状态在该高斯下打分,于是奖励优势能通过这个分数回流到参数。技术路线分两阶段:先用停止门冷启动给每个候选停止长度解码答案、用正确性集合 $V_i^{(n)}$ 监督门的停止时刻分布;再进入 SLPO 主优化,采样 rollout、用代理似然加上答案 token 似然和停止时刻似然组成复合得分 $\tilde{\ell}_\theta(\xi_i|x_i)$,以 $L_{RL}=-A_i\tilde{\ell}_\theta(\xi_i|x_i)$ 为损失,用 RLOO 或 GRPO 估计优势 $A_i=R_i-b_i$,默认超参 $(K,G)=(4,8)$。

核心创新点是为连续潜在转移构造一个“不经过词表”的可处理代理策略接口,并用一个可学习的停止门释放被冻结的计算预算。与已有方法的本质区别有三:第一,代理似然完全定义在隐藏空间,采样轨迹的隐状态被当作 stop-gradient 目标,梯度只流过重新计算的矩 $(\mu_{i,t},\sigma^2_{i,t})$;命题1证明在固定方差下,正优势会把 $\mu_{i,t}$ 拉向 $h_{i,t}$、负优势则推开。第二,停止门冷启动用每个候选长度上解码答案的正确性 $V_i^{(n)}$ 监督停止时刻分布 $P_\theta(\tau_i^{(n)}=t)=\rho_{i,n,t}\prod_{k<t}(1-\rho_{i,n,k})$,给 RL 阶段提供一个合理的初始停止策略。第三,复合得分把潜在转移、答案 token 和停止时刻三类似然统一进一个奖励加权目标,使单一可验证奖励同时塑造推理内容与计算分配。

方法步骤详情

方法分三步。第一步停止门冷启动(Sec 4.1):加停止头 $g_\theta$,输出停止概率 $s_\theta(h)=\sigma(g_\theta(h))$;对输入 $x_i$ 用骨干采样 $N$ 条随机潜在轨迹,枚举候选停止长度,在各长度处停住并解码答案,定出正确停止集 $V_i^{(n)}$,以交叉熵类损失把门的停止时刻概率质量压到 $V_i^{(n)}$ 内。第二步 SLPO 主优化(Sec 4.2):对前缀跑 $K$ 次 MC-dropout 得 $z^{(k)}_{i,t}$,估出均值 $\mu_{i,t}$ 与加底方差 $\sigma^2_{i,t}$,构造高斯代理给真实隐状态打分;采样 rollout $\xi_i=(h_{i,1:\tau_i},a_i)$,复合得分 $\tilde{\ell}_\theta$ 把潜在转移、答案 token、停止时刻三类似然相加,损失 $L_{RL}=-A_i\tilde{\ell}_\theta$,默认 $(K,G)=(4,8)$。第三步推理(Sec 4.3):潜推理顺序推进,停止头每步给停止概率,首次超阈值即停并解码答案。

技术新颖性

技术新颖性体现在四点。其一,代理似然是首个不依赖词表概率、不依赖架构特定潜在头的结果奖励接口,适用于任何传播纯隐藏状态的自回归潜在推理器;命题1和2给出了它在固定方差下与期望奖励梯度一致、以及 $J(\theta)$ 局部改进的充分条件(App A.5)。其二,停止门冷启动把“难度自适应计算”从概念变成可优化量:它用解码答案的正确性而非人工标注来监督停止时刻,使 RL 阶段能直接优化停止决策(图7显示难度与长度正相关,Pearson $r=0.30$)。其三,MC-dropout 同时承担两种角色——既提供探索随机性产生行为轨迹,又通过 $K$ 次重评估提供代理矩估计,无需额外的随机化网络。其四,复合目标把三类异质似然(连续转移、离散答案、停止时刻)统一进同一个奖励加权框架,使标准 RLOO/GRPO 可直接套用,方法层面复用性强。

Overview of SLPO. Verifiable outcomes induce rollout advantages that weight the latent-surrogate, answer, and gate terms.
Figure 2: Overview of SLPO. Verifiable outcomes induce rollout advantages that weight the latent-surrogate, answer, and gate terms.

实验结果

核心发现可逐一分析。表1显示一致的潜在测试时扩展:在全部 12 个骨干–数据集组合上 SLPO 同时提升 Pass@8 与 Pass@16,覆盖 COCONUT/CODI、GPT-2 与 Llama-3.2-1B、三个留出基准,增益最大达 12.07 个百分点(相对 26.8%)。表2扩到显式 CoT-SFT/iCoT 与更多潜在基线:CODI+SLPO 在 Llama-3.2-1B 上以平均 5.79 步取得潜在方法最高平均准确率 54.95,比 Latent-SFT 高 1.05 个百分点且少用 50.3% 潜在步。表3、4证明迁移到软 token 推理:1B 上 GSM8K 与 MATH500 最佳确定性准确率(46.70、27.20),3B 上 AIME 2025 Pass@1 从 0.96 升到 3.33(3.47×)、AMC23 从 27.03 升到 32.50(+5.47 个百分点)。图4显示 RLOO 与 GRPO 曲线高度对齐,图3显示组大小 $G$ 是主要扩展轴而对 $K$ 不敏感,图6显示步间余弦距离增大、前缀有效秩下降,图7证实难度越大潜在轨迹越长。

Comparison between latent-reasoning baselines and our variants.
Table 1: Comparison between latent-reasoning baselines and our variants.
Broader model results on grade-school mathematical reasoning benchmarks.
Table 2: Broader model results on grade-school mathematical reasoning benchmarks.
Soft latent inference results with Llama3.2–1B.
Table 3: Soft latent inference results with Llama3.2–1B.
Soft latent inference Pass@k results with Llama3.2–3B.
Table 4: Soft latent inference Pass@k results with Llama3.2–3B.
Controlled hyperparameter sweeps for SLPO.
Figure 3: Controlled hyperparameter sweeps for SLPO.
Pass@k under SLPO with RLOO versus GRPO on COCONUT and CODI.
Figure 4: Pass@k under SLPO with RLOO versus GRPO on COCONUT and CODI.
Mean generated sequence length during soft-token training on the 1B setup.
Figure 5: Mean generated sequence length during soft-token training on the 1B setup.
Latent geometry pre- and post-SLPO.
Figure 6: Latent geometry pre- and post-SLPO.
Relationship between problem difficulty and latent length under the learned stopping gate.
Figure 7: Relationship between problem difficulty and latent length under the learned stopping gate.
查看结构化数据
任务指标本文基线提升
潜在测试时扩展(MultiArith, Llama-3.2-1B COCONUT) Pass@8 57.07(COCONUT+SLPO) 45.00(COCONUT) +12.07个百分点,相对26.8%
平均准确率与效率(Llama-3.2-1B) 平均Acc / 平均潜在步数 54.95 / 5.79(CODI+SLPO) 53.9 / 11.66(Latent-SFT) +1.05个百分点,少用50.3%潜在步
GSM8K 准确率与步数(Llama-3.2-1B) Acc / 推理步数 55.27 / 6.30(CODI+SLPO) 54.1 / 25.4(CoT-SFT) +1.17个百分点,少用75.2%推理步
软 token 潜在推理(AIME 2025, Llama-3.2-3B) Pass@1 3.33(SLPO) 0.96(LEPO) 3.47×提升
软 token 潜在推理(AMC23, Llama-3.2-3B) Pass@1 32.50(SLPO) 27.03(LEPO) +5.47个百分点,相对20.2%
软 token 潜在推理(GSM8K, Llama-3.2-1B) 确定性Acc 46.70(SLPO) 45.56(GRPO) +1.14个百分点,最佳确定性准确率

局限与改进

作者承认的局限主要有:实验只覆盖小学数学(GSM8K-Aug 训练,GSM8K/GSM-Hard/MultiArith 评估,软 token 迁移加了 MATH500/AIME/AMC23),未触及开放推理;骨干规模较小(GPT-2 124M、Llama-3.2-1B/3B),更大骨干下的扩展性未验证;MC-dropout 提供的随机性是否足以覆盖真实策略分布、各向同性高斯代理对真实转移的逼近误差,都只在附录给出经验证据。我观察到三点额外隐忧:第一,估计代理矩需 $K$ 次额外前向,训练开销随 $K$ 线性增长,虽然图3表明对 $K$ 不敏感可缓解,但大骨干上仍可能成为瓶颈。第二,停止门冷启动依赖在每个候选长度解码答案并判正确性,对奖励稀疏或验证困难(如开放式生成)的任务不适用。第三,MC-dropout 假设推理时的随机性来源,与推理时关闭 dropout 做确定性解码存在张力,确定性 Acc 与 Pass@$k$ 之间的差距(如 GPT-2 COCONUT 在 GSM8K 上 Acc 仅 35.63 但 Pass@16 达 51.55)提示策略质量仍有提升空间。

独立分析的弱点

独立分析的弱点及改进方向。弱点一:代理高斯是各向同性且加底的,对真实转移这种高维、各向异性、可能多模态的分布逼近粗糙,当真实转移多峰时单一高斯会把均值拉到峰间无意义位置;改进方向是用对角或低秩协方差、甚至归一化流做更灵活的代理密度,或用能量模型直接对转移打分。弱点二:MC-dropout 注入的随机性受限于 dropout 率和位置,探索能力有限,当骨干本身方差小时代理几乎退化;改进方向是引入显式的潜空间噪声(加性高斯或随机化层)作为更强探索源,或结合进化策略扩大搜索。弱点三:停止门冷启动成本随候选长度枚举线性增长,长预算下代价高;改进方向是借鉴课程式或基于价值的停止估计,用少量采样近似停止价值。弱点四:评估集中在小学数学,对长链推理、代码、多模态等场景泛化未经验证;改进方向是扩展到需要长推理链与多步验证的任务。弱点五:软 token 迁移实验中 SLPO 在部分 Pass@32 指标上不如 CoT(表4 GSM8K P@32 95.30 vs 96.89),说明并行采样覆盖上并非全面占优,需进一步调优。

未来方向

作者明确提出的方向是:扩展到更大骨干、开放推理任务、多模态潜在架构。基于成果可延伸的方向包括:把代理策略接口与基于价值的停止(学一个潜在价值函数估计停止回报)结合,实现更细粒度的计算控制;探索代理似然与显式潜变量模型(VAE/扩散)的统一,让转移分布更可处理、更逼近多模态;把 SLPO 的难度自适应思想用于推理时预算调度,配合并行采样做混合扩展;研究软 token 与隐藏状态两类潜在接口联合训练的可能性;以及在更大、更难的基准(如 MATH 全集、竞赛级数学、代码生成)上验证扩展规律,确认 12.07 个百分点这类增益是否随规模持续放大。

复现评估

复现性总体中等偏上。作者公开了项目页(https://github.com/ModalityDance/SLPO),骨干用公开的 COCONUT/CODI checkpoint,数据用公开的 GSM8K-Aug 与三个标准基准,超参 $(K,G)=(4,8)$、最大预算 $T_{\max}=12$、dropout $p=0.1$、三种 dropout seed 等在正文和附录 A 给出,停止阈值的验证扫描、软 token 设置(App A.9)也有交代。挑战在于:MC-dropout 采样、$K$ 次重评估和 group size $G$ 的 rollout 显著增加训练算力,且停止门冷启动需为每个候选长度解码并判答案正确性;正文未给出完整学习率、batch、训练步数等细节(多在附录),骨干规模虽小但完整复现全套实验(含 3B 软 token 与 AIME/AMC)仍需可观 GPU 资源。潜空间几何、有效秩等探针(App C/D)指标定义较细,忠实复现需仔细对照附录。