A*-Thought-V2:基于大语言模型几何动力学的高效潜在推理 A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM
按隐藏状态轨迹方向角把冗余思维链压成潜在token,精度升2.6%、长度近半。
前置知识
Chain-of-Thought(CoT)与高效推理
思维链让模型在给出最终答案前先生成一串中间推理步骤,能显著提升数学、逻辑类任务的准确率,但长推理序列带来巨大的计算、显存和上下文开销。高效推理研究如何在尽量不掉点的前提下缩短推理痕迹,代表思路包括token级剪枝(TokenSkip)、步级搜索剪枝(A*-Thought)与早退机制等。
本文的问题起点正是CoT冗长:Qwen3.6-27B在AIME 2025上平均每题生成约3.8万token。理解硬剪枝范式及其信息丢失缺陷,才能理解本文'软压缩成潜在token'的动机。
潜在推理(Latent Reasoning)
让模型不用离散词表token、而用连续向量(潜在空间表示)进行思考的范式,代表工作有Coconut、SwiReasoning、CODI等。一个连续向量可承载多个token的语义,相当于提高信息密度、缩短序列;代价是难以解释与监督。
本文属于'显式-隐式交织'的潜在推理:被判冗余的步骤被压成latent token。理解该范式才能明白Embedding Forcing与Label Forcing要解决的核心问题——如何训练模型生成并利用连续思考向量。
PCA 主成分分析
经典线性降维方法:寻找方差最大的正交投影方向,把高维数据映射到低维空间(如把数千维的LLM隐藏状态投到3维),在尽量保留主要变化结构的同时便于可视化与分析。
本文的'几何动力学'分析完全建立在PCA之上:把问题、各步骤、解答的隐藏状态投到3D空间后计算轨迹方向角$\theta_n$。不懂PCA就无法理解方向角这一核心筛选信号的来源。
软标签与交叉熵损失
标准SFT用one-hot硬标签做下一词预测,交叉熵 $\mathcal{L}=-\sum_v y_v \log \hat{p}_v$ 惩罚真实词的低概率。软标签把目标从单个词换成概率分布(多个词按权重共享概率质量),适合监督'一个位置需同时编码多个token语义'的场景。
Label Forcing的本质就是把整步所有token的one-hot取平均,得到多峰软分布来监督latent位置。没有软标签概念,就无法理解latent token为何能学到整步语义。
ACU(单位计算精度)
Accuracy per Computation Unit,定义为 $\text{ACU}=100\times\text{Accuracy}/\text{Length}$,其中准确率以百分点计、长度为平均生成token数。它同时衡量正确性与推理开销,是高效推理常用的综合指标,越大越好。
论文的主要效率结论都以ACU表述(如27B上从基座0.35升至0.80、约2.29倍),理解它才能读懂实验表格中'又快又准'的权衡。
KV缓存与自回归推理
自回归LLM逐token生成,每个位置的Key/Value被缓存,供后续位置通过因果注意力复用历史信息,避免重复计算;修改某个新位置的输入向量不会影响已缓存的历史。
推理时latent位置不查词表embedding,而是把边界标签的末层隐藏状态 $u_{i+j}=h^{(L)}_{i+j-1}$ 直接作为输入继续前传,这依赖KV缓存机制保证因果一致性,是理解训练-推理一致设计的关键。
研究动机
推理模型靠长思维链换准确率,代价极其高昂:论文实测Qwen3.5-9B在AIME 2025上平均每题生成40545个token,Qwen3.6-27B在AIME 2024上也需约29521个token,其中大量是检查、修正、分支试探等'冗余思考'。现有压缩方法几乎都是硬剪枝:TokenSkip按重要度删token,A*-Thought用A*搜索挑出保留步骤、其余直接丢弃。硬剪枝有两个问题:其一,被删掉的检查与修正信息可能正是模型自我纠错的关键——A*-Thought在Qwen3.6-27B上平均准确率反而从基座的81.1%降到80.4%,AIME 2025更是从71.7%跌到65.8%;其二,搜索式预处理昂贵,A*-Thought压缩3k条训练数据需要5小时16分22秒。另一类潜在推理方法(Coconut、SwiReasoning、CopT等)虽能把思考编码进连续空间,但'哪些步骤该显式保留、哪些该压缩、被压信息去哪了'缺乏一个有原则的判据。
本文的目标是本文目标是构建'信息保真的CoT压缩'框架:不是删除冗余步骤,而是把它们压缩成高密度的连续潜在token,与保留的文本步骤交织成显式-隐式混合推理序列。具体包括三件事:(1)找到有原则、可解释、计算便宜的判据来决定每个推理步骤的去留,作者希望判据来自模型内部几何而非外部打分模型;(2)设计配套训练目标,让模型学会在latent位置'一次性表达'被压缩步骤的语义,并在推理时与文本生成无缝衔接;(3)在精度不掉甚至提升的前提下大幅缩短生成长度,同时把数据预处理与训练开销降到远低于前作A*-Thought——目标是压缩预处理从5小时级降到分钟级、响应长度近乎减半。
与已有工作不同的是,本文的独特切入是把'推理压缩'从文本重要度排序问题转化为'隐藏状态轨迹的几何动力学'问题。作者将问题→各步骤→解答的表示投影到3D PCA空间,定义全局方向 $z_0=h_s-h_q$ 与局部转移 $z_n=h_{t^{(n)}}-h_{t^{(n-1)}}$,用夹角 $\theta_n=\arccos\frac{z_n^\top z_0}{\|z_n\|\|z_0\|}$ 刻画每步偏离'通往答案主方向'的程度。经验发现极为规整:六个30°角度区间分别对应'直接推导/常规演算/混合执行/条件检查/重解释修正/分支重考虑'六类语义(如[0°,30°)高频词是hence、simplify,[120°,150°)是mistake、however),角度随时间的波动还呈现探索→收敛→精化三阶段。这给出了以往文献没有的、纯几何的显式/潜在分配准则:沿主方向前进的步骤留作文本,绕路的检查与试探压进潜在空间;再辅以'池化embedding+步级软标签'让被压步骤的信息真正进入训练信号,而非像A*-Thought那样硬删除。
核心方法
方法分'数据构造'与'训练/推理改造'两半。直觉上:推理轨迹在隐藏状态空间里是一条从问题走向答案的路径,沿主路推进的步骤是'执行',偏离主路的步骤是'检查、犹豫、试错'——前者读者需要看清,后者可以'折叠'。技术上,先用小模型(默认Qwen3.5-0.8B)提取问题、每步、解答的隐藏状态并做3D PCA投影,计算每步方向角 $\theta_n$;给定阈值 $\tau$(60°或90°),$\theta_n\le\tau$ 的步骤保留为显式文本,$\theta_n>\tau$ 的连续冗余段被替换为潜在token序列。训练时用Embedding Forcing把每个被压缩步骤的词embedding均值池化为一个latent输入向量,用Label Forcing把该步所有token的one-hot平均成软分布作为latent位置的监督目标,再与标准交叉熵按权重 $\lambda$ 混合。推理时模型按训练格式自行生成latent边界标签,在latent位置直接把上一位的末层隐藏状态当作输入前传,实现文本与连续思考的交替生成。
核心创新有三点且相互咬合。第一,几何动力学筛选:不同于A*-Thought的双向重要度打分+A*树搜索(计算重、耗时长),本文用PCA投影轨迹上的夹角作筛选信号——无参数、无训练,把压缩3k条数据的预处理从5:16:22降到0:16:57(-94.6%),且角度区间与步骤语义高度对应,可解释,并可通过 $\tau$ 连续调节压缩强度(60°保留约31.67%的token,90°保留48.09%)。第二,显式-隐式交织而非硬删:被压步骤不消失,而是变成信息密度更高的latent token夹在文本之间,保留推理的时序进程。第三,步级软标签监督:标准下一词预测的one-hot目标无法监督'一个向量代表一整步'的位置,本文把整步token的one-hot平均成多峰软分布 $y^{(n)}_{\text{soft}}$,配合latent损失缩放权重 $\lambda$(0.1~0.3);消融证明这是最关键的组件——去掉Label Forcing后AIME三集平均准确率从94.5%暴跌到72.5%。
方法步骤详情
完整流程见Algorithm 1。(1)轨迹构建:用Qwen3.5-0.8B提取问题、各步骤与解答的隐藏状态 $\{h_q, h_{t^{(n)}}, h_s\}$,PCA投影到3维并中心化。(2)方向决策:计算全局方向 $z_0=h_s-h_q$ 与局部转移 $z_n$,夹角 $\theta_n=\arccos\frac{z_n^\top z_0}{\|z_n\|\|z_0\|}$(向量近零时默认保留),$f_n=\mathbb{I}[\theta_n\le\tau]$ 决定去留。(3)序列构造:保留步原样写入文本;连续冗余段两侧插入边界标签,段内每个冗余步($l^{(n)}$个token)生成latent输入 $c^{(n)}=\frac{1}{l^{(n)}}\sum_{j} e^{(n)}_j$ 与软目标 $y^{(n)}_{\text{soft}}=\frac{1}{l^{(n)}}\sum_j y^{(n)}_j$。(4)训练:教师强制输入 $(e_q; e_{t'}; e_s)$,总损失 $\mathcal{L}=\frac{1}{N_{valid}}(\sum_{I_{text}}\mathcal{L}_{CE}+\lambda\sum_{I_{latent}}\mathcal{L}_{latent})$,$\lambda$ 取0.1~0.3,latent token上限256。(5)推理:latent位置用上一位末层隐藏状态 $u_{i+j}=h^{(L)}_{i+j-1}$ 作输入前传,KV缓存保留全部上文,随后恢复文本生成;最多4个latent段、每段最长32。
技术新颖性
与三条已有技术路线相比,新颖性明确。对比硬剪枝(TokenSkip、A*-Thought):它们输出是变短的纯文本,本文输出是文本+连续token的混合序列,冗余信息以潜变量形式保留——消融显示这套latent机制贡献了主要增益(EF与LF全去掉仅61.7%,完整方法94.5%)。对比训练无关/外挂式的潜在推理(SwiReasoning在文本与潜在模式间动态切换、CopT用连续空间验证器做on-policy修正):它们不改变'哪些内容值得压缩'的判断依据,本文则由模型自身隐藏状态的几何性质给出数据级判据,压缩离线一次性完成,可解释、可调。对比自蒸馏式潜在推理(CODI等):那些方法用固定策略整体压缩CoT,本文做到步级、变长、位置自适应的压缩,并用多峰软标签而非单一目标向量监督——图5测得latent位置平均预测熵高达5.69/5.09(两个模型),而文本位置仅0.26/0.37,说明latent位置拟合的是宽分布软目标而非某个具体词。此外,'六角度区间—语义词汇'的对应关系(Table 4)本身也是对LLM推理动力学的可复用观察。
实验结果
主实验(Table 1)在9B与27B上、六个基准(Math500、AIME 2024/2025/2026、ARC-Challenge、GPQA-Diamond,各重复4次)结论一致。27B上τ=90°变体平均准确率93.9%(基座81.1%、SFT 92.9%、SwiReasoning 92.6%、CopT 91.8%、A*-Thought 80.4%),平均长度11785 token(SFT为14024,缩短16.0%),ACU 0.80,较基座0.35提升2.29倍;AIME 2024达96.7%,Math500达96.7%/2496 token(较SFT缩短64%)。9B上τ=90°平均91.5%、13462 token、ACU 0.68(SFT为89.0%/16157/0.55)。消融(Table 2,AIME三集平均):几何筛选94.5%/ACU 0.51,优于随机角度92.8%与反向选择91.4%(三者压缩率均约48%),说明增益来自选对步骤;去Embedding Forcing降至92.8%,去Label Forcing暴跌至72.5%,两者皆去仅61.7%。分析实验:图4显示latent token形成与文本分离的紧凑簇;图5测得latent位置平均熵5.69/5.09远高于文本位置0.26/0.37;最大latent长度32最优(91.4% vs 88.5%);图7显示V2最终训练损失最低。效率(Table 3):压缩预处理5:16:22→0:16:57(-94.6%),τ=60°训练时间较SFT缩短80.3%(9B)/68.7%(27B)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六基准平均(Qwen3.6-27B) | 平均准确率(%) | 93.9(τ=90°) | 92.9(同数据SFT);81.1(原始基座) | 较SFT +1.0,较基座 +12.8 |
| 六基准平均(Qwen3.6-27B) | 平均响应长度(tokens) | 11785 | 14024(SFT);23390(基座) | 较SFT -16.0%,较基座约减半(-49.6%) |
| 六基准平均(Qwen3.6-27B) | ACU | 0.80 | 0.35(原始基座);0.66(SFT) | 较基座 2.29× |
| 六基准平均(Qwen3.5-9B) | 平均准确率(%) | 91.5(τ=90°) | 89.0(SFT);85.1(基座) | 较SFT +2.5,ACU从0.55升至0.68 |
| AIME 2024(Qwen3.6-27B) | 准确率(%) | 96.7 | 84.2(基座);95.8(SFT) | +12.5(较基座),token从29521降至14931 |
| 步骤筛选消融(27B,AIME三集平均) | 平均准确率(%) | 94.5(几何角度筛选) | 92.8(随机角度);91.4(反向选择) | +1.7 / +3.1(压缩率基本持平约48%) |
| 潜在训练机制消融(27B,AIME三集平均) | 平均准确率(%) | 94.5(完整EF+LF) | 92.8(去EF);72.5(去LF);61.7(去EF+LF) | LF贡献 +22.0,双机制合计 +32.8 |
| 数据压缩预处理(OpenR1-Math-3k,3k条) | 预处理耗时 | 0:16:57 | 5:16:22(A*-Thought) | -94.6% |
局限与改进
局限可从作者承认与独立观察两方面看。其一,几何判据依赖3D PCA投影与小模型提取器:附录C.1显示0.8B~9B提取器的角度分布略有差异但下游性能无显著差别(作者以此说明稳健),可3维投影终究是粗糙近似,且阈值 $\tau$(60°/90°)是全局人工常数,未对题目难度、推理阶段自适应——图3(c)自己就显示探索、收敛、精化三阶段中角度的角色不同。其二,latent token不可读:压缩了什么只能靠软标签分布与案例间接推断,缺乏latent内容对被压文本的信息保真度定量指标,出错难以调试。其三,评价限于数学/科学QA,训练数据仅OpenR1-Math-3k约3千条,代码生成、多轮对话、智能体任务未验证;方法还假设推理轨迹可清晰分段,对无步骤边界的自由文本推理如何切分未讨论。其四,训练需8×A100 80GB全参微调,且每换一个 $\tau$ 都要重建数据重训;推理超参(最多4段、每段最长32、256个latent token上限)均为经验值。其五,个别域外基准有波动:如9B τ=60°在GPQA-Diamond为81.6%,略低于同数据SFT的83.5%,说明阈值选择对域外迁移有影响。
独立分析的弱点
(1)筛选信号的单调性假设:方法默认'小角度=执行、大角度=冗余可压',但大角度的检查与修正恰是防错关键(Table 4中[120°,150°)含mistake、however),把它们压进latent意味着纠错过程不可见,latent容量不足时纠错信息可能丢失;改进方向是引入步置信度或验证器反馈做选择性压缩。(2)软标签信息瓶颈:均值池化把整步压成一个向量、标签取平均,长步骤与短步骤被压到同等密度,长步骤信息损失更大;可按步骤熵或困惑度分配可变数量的latent token。(3)阈值全局统一:$\tau$ 对所有题目一刀切,简单题与难题的最优压缩率不同;可做题目级自适应 $\tau$。(4)训练-推理分布差距:训练时latent输入是池化embedding $c^{(n)}$,推理时是末层隐藏状态 $h^{(L)}$,全靠训练桥接;可注入噪声或设计课程对齐。(5)纯SFT、静态压缩:策略离线固定,无法按下游奖励调整,作者也承认需探索强化学习。
未来方向
作者明确提出的方向是把该框架扩展到强化学习:潜在压缩判据目前是离线几何启发式,若以ACU或答案正确性为奖励在线优化'哪些步骤压进latent',有望超越人工阈值。基于本文成果还可自然延伸:(1)把六区间语义分析与过程奖励模型结合,用角度动力学作为轻量过程信号,替代昂贵的逐步人工标注;(2)阶段自适应压缩——利用探索/收敛/精化三阶段结构,在收敛与精化阶段加大压缩力度、在探索阶段保留更多文本;(3)与投机解码、KV缓存量化等推理加速正交组合,latent段只有 $m$ 个位置,也可研究其并行生成;(4)可解释性:用latent位置的软标签分布反向解码被压缩语义,建立对latent内容的审计与调试手段;(5)跨域与规模化验证:在代码、智能体规划等任务上检验几何判据是否同样对应'检查/试探'语义,在更大模型(70B+)上验证缩放性;(6)混合训练目标:把latent软标签与隐藏态对齐等蒸馏目标联用,进一步压低潜在学习的信息损失。
复现评估
复现条件较好。代码开源于GitHub(github.com/AI9Stars/AStar-Thought),权重发布于Hugging Face(AStar-Thought-V2-OpenR1-Math-3k),训练数据OpenR1-Math-3k公开,三个骨干(Qwen3.5-9B、27B、提取器0.8B)均为开源模型。附录D给出完整超参:8×A100 80GB、总batch 64(设备batch 1×梯度累积8)、cutoff 20480、AdamW、学习率 $1.0\times10^{-5}$、warmup 0.1、3个epoch;方法超参含 $\lambda$(0.1~0.3,步长0.1网格搜索)、latent token上限256、推理最多4段×长32、温度1.0、top-p 0.95、重复4次。Algorithm 1给出数据构造伪代码,提取器规模敏感性也有消融(附录C.1)。主要门槛是算力:全参SFT 27B需8张A100 80GB、约6.7~21.4小时,9B约2.4~12.4小时;但数据构造部分计算便宜,压缩3k条数据仅约17分钟,单卡可复现。论文未详述答案抽取与评分脚本细节,需对照开源仓库确认。
论文图表
并排对比三种推理范式:(a)标准CoT全部为文本步骤;(b)A*-Thought硬剪枝,保留选中步骤、直接丢弃其余;(c)A*-Thought-V2把冗余步骤编码为潜在token,形成文本与latent交织的信息密集序列。
一张图说清本文与硬剪枝范式的本质区别——'删除'变'折叠',是理解全文定位的入口。
(a)某推理轨迹在3D PCA空间的表示轨迹;(b)六个30°角度区间的语义倾向(如直接推导、常规演算、条件检查、分支重考虑)及各步角度;(c)角度随步序的变化呈现探索、收敛、精化三个阶段,并标注了不同区间的代表性步骤。
这是全文方法论的经验基石:方向角为何能区分'执行'与'检查/试探'步骤、进而指导筛选,全靠此图的实证。
以条形图汇总六个角度区间及其区内平均角:19.44°(直接推导/结论)、46.20°(常规演算/检查)、75.31°(混合执行/过渡)、104.70°(条件检查/修正)、133.67°(重解释/纠错)、160.32°(重考虑/分支)。
一图看懂角度阈值τ=60°/90°各覆盖哪些语义区段,是理解两档压缩策略语义含义的速查图。
展示同一轨迹中覆盖六个连续角度区间的六步原文:θ=8.2°的步骤做直接代数化简,θ=39.0°做常规推导,θ=76.5°开始检查备选,θ=106.7°出现'但wait'式条件修正,θ=137.0°是重新解释,θ=161.8°考虑另一分支。
用真实推理文本印证'角度大=检查与试探'的语义假设,让几何判据从统计规律落到可读的例子。
完整输出案例:模型在显式推导(如由Vieta公式推出 $n^2-144n+1584=0$,得n=132)之间插入多段<latent>标记(latent_1~latent_8),latent段之后文本自然衔接继续推理并给出最终答案132。
展示显式-隐式交织序列的真实生成形态,直观说明latent边界标签与文本推理如何衔接。
博弈题案例:模型显式给出Grundy值表与归纳证明,把模式验证、归纳确认等中间环节压成三段latent(latent_1~latent_9),最后显式计数得404+405=809。
第二个真实案例,说明压缩多发生在'验证/确认'类环节,与角度语义分析相互印证。
训练配置:8×A100 80GB、设备batch 1×梯度累积8(总batch 64)、cutoff 20480、AdamW、学习率 $1.0\times10^{-5}$、warmup 0.1、3个epoch;A*-Thought超参α=0.5、β=0.1、k∈[25,40];V2的角度阈值、latent权重λ(9B为0.2/0.3,27B为0.1/0.1)与新增latent token数256。
复现训练的完整超参清单,λ的取值还附带网格搜索与失败模式(太小不触发latent、太大过拟合)的说明。
完整伪代码:隐藏态轨迹构建与PCA投影、方向角计算与阈值决策 $f_n=\mathbb{I}[\theta_n\le\tau]$(含零向量容错默认保留)、显式-隐式序列构造(边界标签插写、池化embedding与软标签生成)、最终拆分输出 $E_{t'}$、$Y_{t'}$ 与压缩决策 $f$。
方法所有实现细节(含边界情况处理)的唯一完整描述,照此即可写出数据构造脚本。