← 返回 2026-08-24

ParaTempo:基于时序置信度的高效异步并行推理 ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin, Yuling Shi, Min Wang, Beijun Shen 📅 2026-08-17 👍 38 2026-08-29 18:30
LLM推理控制 并行推理 推理优化 测试时扩展 高效推理

用时序置信度做异步分支控制,并行推理延迟降低21.8–32.2%

前置知识

自洽性

对同一问题独立采样多条推理链,等全部生成完毕后对最终答案做多数投票的解码策略(Wang et al. 2022)。它用并行宽度换取准确率,但固定预算下每条分支获得相同的 token 配额,各分支收敛快慢的巨大差异被完全忽略,产生大量冗余计算。

本文的效率参照系就是 SC@16(16 分支自洽性),其在 AIME26 上延迟 250.6s、总 token 229.7k,正是 ParaTempo 要压缩的基线;理解它的固定预算聚合机制,才能看懂算力浪费从何而来。

中间答案探测

在推理前缀后追加答案强制后缀(如 Final answer:),读取 top-L 候选 token 的 log 概率,归一化为答案分布 $p_{i,t}(v)=\exp(\ell_{i,t}(v))/\sum_u \exp(\ell_{i,t}(u))$,不打断生成地窥探答案倾向。

ParaTempo 每隔 $\tau=500$ 个生成 token 探测一次,时序置信度、剪枝、退休、fork 和置信加权投票全部建立在这些探测分布之上,它是理解全文方法的最小单元。

答案分布熵与时序置信度

对候选答案概率分布计算香农熵 $H(g)=-\sum_v g(v)\log g(v)$,熵越低分布越集中于单一答案。ParaTempo 取指数变换 $C=\exp(-H(g))\in(0,1]$;由于 $\exp(H(g))$ 恰为该分布的困惑度,$C$ 可解读为有效竞争答案数的倒数,越接近 1 表示越收敛。

$C_{i,t}$ 就是全文的核心控制信号,分支剪枝、提前退休、donor 选择与置信加权投票都由它(及其最大分量 $c_{i,t}$)驱动,不懂这个量的语义就看不懂任何一步决策。

分支局部性与异步控制

指控制决策只依赖分支自身的探测历史,无需等待其他分支推进到同一推理深度。同步方法(如 Parallel-Probe 的跨分支 2D 探测共识)必须设置全局屏障,已经收敛的短分支要陪着长分支继续等待甚至生成冗余 token。

异步性是 ParaTempo 在保持精度的同时把延迟降低 21.8–32.2% 的结构性原因,也是它与最强并行基线 Parallel-Probe 的根本差异所在。

测试时扩展

不增大模型参数,而在推理阶段投入更多计算(更长的思维链、更多采样分支、搜索验证)来换取更高准确率的范式。并行推理是其"宽度"方向的代表,成本随分支数与推理深度二者相乘增长。

本文属于"更聪明的测试时扩展"这一支:目标是在保留并行推理精度收益的前提下,通过在线控制把计算开销压缩 20–30%,理解这个大背景才能定位论文的贡献层次。

研究动机

并行推理通过同时采样 K 条独立推理链再做多数投票来提升大推理模型的准确率与稳健性,但计算成本随分支数和推理深度成倍增长。传统固定预算方案(如 SC@16)给每条分支相同的 token 预算、全部生成结束后才聚合,完全忽视分支间异质的收敛进度:早已收敛的分支继续产出冗余 token,无望的分支却持续吞噬算力。现有在线控制信号各有硬伤:最终答案共识(如 ESC)可靠但出现太晚,须等大量计算完成后才可用;token 级置信度(DeepConf 所用的熵、困惑度)与答案演化脱节,模型可能词汇层很确定却在探索不同答案假设,反之亦然;孤立的中途探测(Parallel-Probe)对瞬态波动过敏。作者用超过 9000 万推理 token 的初步研究量化了这些问题:平均 token 熵的时序波动高达 0.54,对未来答案稳定性的预测力 |ρ|≤0.13、AUC≤0.58;瞬时答案置信度波动 0.26 同样不可忽略,中间推理步骤暂时偏向错误假设时会剧烈震荡。

本文的目标是本文把并行推理改写为在线资源分配问题:在保持固定预算方案准确率的约束 $A(\pi) \ge A(\pi_{fixed})$ 下最小化推理成本 $\min_\pi C(\pi)$。具体目标是构造一个同时满足三种性质的分支级控制信号——答案空间对齐(度量候选答案分布而非表层生成统计)、时序一致性(跨多次观测聚合证据而非依赖单次探测)、分支局部性(无需跨分支同步即可独立更新)——并用它驱动每个探测点上的四类决策:继续解码、提前退休已收敛分支、剪枝发散分支、把释放的算力 fork 给有希望的分支继续探索,最后在置信加权投票足够集中时全局早停。工程上作者追求免训练、无同步屏障,在标准 vLLM 推理栈上把平均延迟和总 token 同时压低约 20–30%,而精度损失控制在 1 个百分点左右。

与已有工作不同的是,已有信号要么全局且滞后(答案共识需等大量分支完成),要么细粒度但答不对题(token 熵反映词汇不确定性而非答案演化),要么中途但噪声大(单次探测被瞬态推理状态主导)。ParaTempo 的独特切入是把"答案演化历史"本身变成信号:对同一分支最近 W 次探测分布做滑动窗口平均,用聚合分布的熵定义时序置信度,使答案对齐与时序平滑两种性质同时成立,初步研究显示其稳定性和预测力显著优于三类旧信号。更进一步,它把这单一信号扩展成完整的异步生命周期控制器(剪枝、退休、fork、全局早停),彻底移除 Parallel-Probe 等方法必需的跨分支同步屏障,让每条分支按自身进度独立决策,从而同时节省总计算量和关键路径延迟。

核心方法

直觉:一条分支若反复探测都把概率质量压在同一答案上,多半已收敛,后续 token 可省;反之答案分布长期发散的分支,继续解码也难有可靠收敛。技术上,ParaTempo 每隔 τ=500 个生成 token 对每条活跃分支做中间答案探测:在前缀后拼接 " Final answer:" 式强制后缀,取 top-L=20 候选 token 的 logit 归一化成答案分布 $p_{i,t}(v)$;用大小 W=7 的滑动窗口平均得 $g_{i,t}(v)$;定义时序置信度 $C_{i,t}=\exp(-H(g_{i,t}))\in(0,1]$。该信号驱动四类异步操作:低置信分支剪枝、最近 X=15 次探测置信度均不低于 θ_retire=0.90 的分支提前退休(停止生成但保留投票证据)、剪枝释放的槽位从最高置信 donor 前缀 fork 新分支、置信加权票满足 $\max_a V_t(a)\ge\gamma_{ES}|B_t|$ 时全局早停。分支任意时刻处于 Active/Retired/Pruned/Forked 四状态之一;全程免训练,单卡 A100 即可复现。

核心创新是时序置信度 $C_{i,t}=\exp(-H(g_{i,t}))$ 这一分支局部收敛信号,与三类已有信号本质不同:相比 token 熵和困惑度,它直接度量答案空间集中度,初步研究中未来稳定性预测 AUC 从 ≤0.58 升至 0.71 以上且波动率远低于 0.54;相比单次探测的瞬时答案置信度(波动 0.26),滑动窗口聚合进一步压制瞬态波动;相比 ESC、Parallel-Probe 的跨分支共识,它是分支局部的,无需同步屏障。第二个关键设计是分位数化剪枝阈值 $\theta_{prune}=\mathrm{Quantile}_{1-q_{prune}}(S_{warm})$:用 warmup 阶段 N_warm=9 次探测收集的置信度按当前题目自适应校准,避免全局手工阈值跨难度失效。第三,退休机制(连续窗口判据 $\min_\tau c_{i,\tau}\ge\theta_{retire}$ 防单点噪声误触发)把局部收敛转化为计算节省同时保留证据,fork 机制把释放预算再投资到最有希望的 donor 前缀,形成"省下来、再花出去"的算力闭环。

方法步骤详情

分五步。(1) warmup:采样 K=16 条分支,前 N_warm=9 次探测内不干预,收集时序置信度样本,按 q_prune=0.50 分位数校准出该题专属剪枝阈值 $\theta_{prune}$。(2) 探测:此后每 τ=500 token 探测一次得 $p_{i,t}$,与最近 W=7 次探测平均成 $g_{i,t}$,算出置信度 $C_{i,t}=\exp(-H(g_{i,t}))$、主导答案 $\hat{y}_{i,t}$ 及其质量 $c_{i,t}$。(3) 分支控制:若 $C_{i,t}<\theta_{prune}$ 则剪枝并释放槽位;若最近 X=15 次探测的最小置信度不低于 θ_retire 则退休,停止生成但保留投票证据;释放的槽位从置信最高的合格 donor 处 fork 前缀并换采样种子。(4) 全局共识:对有投票权的分支计算置信加权票 $V_t(a)$,当 $\max_a V_t(a)\ge\gamma_{ES}|B_t|$ 时早停。(5) 输出 $\hat{y}=\arg\max_a V_t(a)$;否则跑到无活跃分支或预算耗尽。

技术新颖性

技术新颖性体现在三个层面。信号层面:以往"时序"信号多为 token 级(如 TRACE 聚合 token 一致性做早退),本文首次把时间聚合施加在"答案分布"这一语义层对象上,$C_{i,t}=\exp(-H(g_{i,t}))$ 可解释为逆有效候选答案数,兼具答案对齐与时序平滑两种性质,初步研究(Table 1:token 信号波动 0.54–0.56、|ρ|≤0.13、AUC≤0.58)与 Figure 4 系统验证了这一点。控制结构层面:与 DeepConf 的顺序置信过滤、ESC 的答案共识早停和 Parallel-Probe 的同步 2D 探测不同,四状态生命周期(Active/Retired/Pruned/Forked)允许每条分支按自身进度独立走完"剪枝—fork—退休"循环,是少数真正无同步屏障的全并行控制器,因此能同时压总 token 和关键路径延迟。校准层面:warmup 分位数校准让剪枝阈值按题自适应,避免了跨难度题目共享全局阈值的失效问题;整套机制免训练、即插即用,只依赖模型自身的探测概率,不需要任何额外模型或验证器。

Overall framework of ParaTempo
Figure 2: Overall framework of ParaTempo

实验结果

主实验(Table 2,4 次平均):Qwen3.5-35B-A3B 上 ParaTempo@16 四基准平均准确率 71.1%,仅比 SC@16 的 72.2% 低 1.1 点,但延迟降 21.8%、总 token 降 30.3%;比 Parallel-Probe@16 高 3.9 精度点且延迟再降 10.6%。分基准:AIME26 83.3%(SC 87.5%,延迟 198.4s 对 250.6s);HMMT25 73.3%,超 SC 4.1 点;HMMT26 42.4%(SC 45.5%);GPQA 85.4%(SC 86.4%)。GPT-OSS-20B 上 AIME26 86.7%(Parallel-Probe 81.7%),顺序 token 8.0k 最低;GPQA 70.4%,延迟为 SC 的 45%。汇总:较 SC 减延迟 21.8–32.2%、减 token 18.1–30.3%。消融(Table 3):去退休跌 6.6 点、去 fork 跌 3.3 点、去剪枝延迟升至 233.0s。

Evaluation of existing signals by temporal volatility and future answer stability prediction (h = 5)
Table 1: Evaluation of existing signals by temporal volatility and future answer stability prediction (h = 5)
Main results across four benchmarks
Table 2: Main results across four benchmarks
Ablation results of ParaTempo on HMMT25 with Qwen3.5-35B-A3B
Table 3: Ablation results of ParaTempo on HMMT25 with Qwen3.5-35B-A3B
Latency–accuracy scaling curves of ParaTempo and Parallel-Probe with Qwen3.5-35B-A3B
Figure 3: Latency–accuracy scaling curves of ParaTempo and Parallel-Probe with Qwen3.5-35B-A3B
Analysis of temporal confidence under the preliminary study protocol
Figure 4: Analysis of temporal confidence under the preliminary study protocol
查看结构化数据
任务指标本文基线提升
AIME 2026(Qwen3.5-35B-A3B) 准确率% / 延迟s / 总token 83.3 / 198.4s / 161.9k(顺序 10.2k) SC@16:87.5 / 250.6s / 229.7k;Parallel-Probe@16:76.7 / 223.1s / 164.0k 比 Parallel-Probe 高 6.6 精度点;比 SC 省延迟 20.8%、省 token 29.5%
HMMT November 2025(Qwen3.5-35B-A3B) 准确率% / 延迟s 73.3 / 205.7s / 166.6k SC@16:69.2 / 257.8s;Parallel-Probe@16:65.0 / 218.1s 超 SC 4.1 点、超 Parallel-Probe 8.3 点,延迟省 20.2%
GPQA Diamond(Qwen3.5-35B-A3B) 准确率% / 延迟s / 总token 85.4 / 161.1s / 130.4k SC@16:86.4 / 225.0s / 196.7k;DeepConf-low:82.8 精度仅低 SC 1.0 点,延迟省 28.4%、token 省 33.7%,为全表最低延迟
AIME 2026(GPT-OSS-20B) 准确率% / 顺序token 86.7 / 8.0k(延迟 79.3s) Parallel-Probe@16:81.7 / 8.5k;SC@16:90.0 / 11.2k 超最强并行基线 5.0 点且顺序 token 更少;延迟仅为 SC 的 71.7%
四基准平均(Qwen3.5-35B-A3B) 平均准确率 / 平均延迟 / 总token 71.1% / 降低 21.8% / 降低 30.3% SC@16:72.2%(参照基准) 精度仅 -1.1 点,换取延迟与总 token 的大幅节省
HMMT25 消融(Qwen3.5-35B-A3B) 准确率% 完整版 73.3% / 205.7s / 166.6k w/o Retire 66.7%;w/o Fork 70.0%(145.5k);w/o Prune 71.7%(233.0s) 退休、fork、剪枝分别贡献 6.6、3.3、1.6 个精度点或对应效率收益

局限与改进

首先是数学竞赛最难基准上的精度回退:Qwen 上 HMMT26 为 42.4% 对 SC 的 45.5%,GPT-OSS-20B 上 HMMT25 63.3% 对 68.3%、HMMT26 51.5% 对 56.8%,说明当题目本身需要充分探索答案多样性时,剪枝与早停可能错杀尚有潜力的分支。其次,剪枝阈值按当前问题 warmup 置信度的 1-q_prune 分位数校准,是纯相对判据:若全部分支都很差,"相对较好"的分支也会被保留,校准无法识别绝对水平;反之难题上可能把一半探索判死。第三,探测本身有开销(每 500 token 强制一次答案生成、缓冲前缀拼接),论文未单独报告探测开销占比及其对延迟的贡献。第四,实验限于数学与多选科学推理两个任务、两个模型,答案桶的构造依赖任务格式(数值、选项),向开放式生成(代码、自由文本)扩展时答案归一化与等价类判定并不平凡。第五,fork 继承单一最高置信 donor 的前缀,可能引入探索同质化,论文未分析 fork 后分支与 donor 的答案多样性关系。

独立分析的弱点

(1) 剪枝的相对阈值缺陷:按分位数 1-q_prune=0.50 剪掉置信度低于中位水平的一半分支,在所有分支都发散的极难题上会错杀一半探索容量,HMMT26 上对 SC 的精度落后(42.4% 对 45.5%)可能源于此;改进方向是叠加绝对置信度下界,或与题目难度估计(如 DSC 的难度自适应预算)联合校准。(2) 退休判据只看置信度幅度、不看正确性:若模型系统性偏向错误答案("幻觉式收敛"),早退休会把错误证据以高权重锁定进最终投票;可引入跨分支答案一致性或轻量验证器二次确认。(3) 全局早停用置信加权而非票数加权,少数高置信分支可主导 $\max_a V_t(a)\ge\gamma_{ES}|B_t|$ 的判定,存在"自信但错"的多数派风险;可加不确定性惩罚或贝叶斯证据聚合。(4) 每 500 token 注入强制后缀可能干扰原生推理状态,τ 与 W 的敏感性分析缺失;可做自适应探测间隔。(5) 评估限于单卡 A100、vLLM 与 K=16,异步控制与 continuous batching、多卡服务结合的大规模部署收益仍待验证。

未来方向

作者层面,Technical Supplement 提供了完整伪代码与更多消融基准,说明框架仍在扩展中。基于本文成果可延伸的方向:(1) 把时序置信度从"控制信号"升级为"加权证据",与过程奖励模型或外部验证器融合,缓解幻觉收敛导致的错误锁定;(2) 探测-控制循环天然适配推测式分支场景,可与 ATTS 的共形预测结合,为早停决策提供统计覆盖率保证;(3) "答案空间对齐"的信号设计有望迁移到代码生成(以测试通过情况的分布为答案空间)与智能体多路径规划,只需重新定义答案桶的等价关系;(4) warmup 校准目前只利用当前题目内部信息,可引入跨题目的难度先验做贝叶斯阈值估计,改进极难题上的相对阈值缺陷;(5) fork 端可研究多样性正则(不同采样温度、前缀扰动、多 donor 混合),避免释放算力被反复投到同一条有希望的思路上;(6) 在线学习化:用历史决策的最终对错反馈微调剪枝、退休与早停阈值,形成随分布漂移自适应的控制器。

复现评估

复现条件较好。代码与数据集开源在 GitHub(ScottZhang812/ParaTempo),Technical Supplement 含完整伪代码与扩展消融。实验全部在单张 NVIDIA A100 80GB 上用 vLLM 完成,模型为开源的 Qwen3.5-35B-A3B 与 GPT-OSS-20B,采样配置完全明确(温度 0.6、nucleus p=0.95、每轨迹上限 16384 token、K=16),超参完整:τ=500、L=20、W=7、X=15、N_warm=9、q_prune=0.50、θ_retire=0.90、γ_ES=0.50,结果为 4 次独立运行平均。基准 AIME 2026、HMMT、GPQA Diamond 均公开。主要门槛在算力:每题 16 分支乘 16k token 上限,仅初步研究就收集了超 9000 万推理 token,全量复现 Table 2 需数百 GPU 时;但单基准小规模验证单卡可行,且方法免训练、无额外模型依赖,复现难度中等偏低。注意论文引用的版本号(Qwen3.5、AIME 2026)为其写作时最新版本,复现时应对齐。