← 返回 2026-09-09

A*-Thought-V2:基于大语言模型几何动力学的高效潜在推理 A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM

Xiaoang Xu, Siyuan Liu, Shuo Wang, Junlan Feng, Fanyu Meng, Zhu Zhang, Jixun Wang, Xiaorong Wang, Zihan Zhou, Xin Li, Chaojun Xiao, Yiming Zhang, Huijia Wu, Liuyu Xiang, Peipei Li, Zhaofeng He 📅 2026-09-07 👍 15 2026-09-12 18:30
几何动力学 思维链压缩 显式-隐式交织 潜在推理 高效推理

按隐藏状态轨迹方向角把冗余思维链压成潜在token,精度升2.6%、长度近半。

前置知识

Chain-of-Thought(CoT)与高效推理

思维链让模型在给出最终答案前先生成一串中间推理步骤,能显著提升数学、逻辑类任务的准确率,但长推理序列带来巨大的计算、显存和上下文开销。高效推理研究如何在尽量不掉点的前提下缩短推理痕迹,代表思路包括token级剪枝(TokenSkip)、步级搜索剪枝(A*-Thought)与早退机制等。

本文的问题起点正是CoT冗长:Qwen3.6-27B在AIME 2025上平均每题生成约3.8万token。理解硬剪枝范式及其信息丢失缺陷,才能理解本文'软压缩成潜在token'的动机。

潜在推理(Latent Reasoning)

让模型不用离散词表token、而用连续向量(潜在空间表示)进行思考的范式,代表工作有Coconut、SwiReasoning、CODI等。一个连续向量可承载多个token的语义,相当于提高信息密度、缩短序列;代价是难以解释与监督。

本文属于'显式-隐式交织'的潜在推理:被判冗余的步骤被压成latent token。理解该范式才能明白Embedding Forcing与Label Forcing要解决的核心问题——如何训练模型生成并利用连续思考向量。

PCA 主成分分析

经典线性降维方法:寻找方差最大的正交投影方向,把高维数据映射到低维空间(如把数千维的LLM隐藏状态投到3维),在尽量保留主要变化结构的同时便于可视化与分析。

本文的'几何动力学'分析完全建立在PCA之上:把问题、各步骤、解答的隐藏状态投到3D空间后计算轨迹方向角$\theta_n$。不懂PCA就无法理解方向角这一核心筛选信号的来源。

软标签与交叉熵损失

标准SFT用one-hot硬标签做下一词预测,交叉熵 $\mathcal{L}=-\sum_v y_v \log \hat{p}_v$ 惩罚真实词的低概率。软标签把目标从单个词换成概率分布(多个词按权重共享概率质量),适合监督'一个位置需同时编码多个token语义'的场景。

Label Forcing的本质就是把整步所有token的one-hot取平均,得到多峰软分布来监督latent位置。没有软标签概念,就无法理解latent token为何能学到整步语义。

ACU(单位计算精度)

Accuracy per Computation Unit,定义为 $\text{ACU}=100\times\text{Accuracy}/\text{Length}$,其中准确率以百分点计、长度为平均生成token数。它同时衡量正确性与推理开销,是高效推理常用的综合指标,越大越好。

论文的主要效率结论都以ACU表述(如27B上从基座0.35升至0.80、约2.29倍),理解它才能读懂实验表格中'又快又准'的权衡。

KV缓存与自回归推理

自回归LLM逐token生成,每个位置的Key/Value被缓存,供后续位置通过因果注意力复用历史信息,避免重复计算;修改某个新位置的输入向量不会影响已缓存的历史。

推理时latent位置不查词表embedding,而是把边界标签的末层隐藏状态 $u_{i+j}=h^{(L)}_{i+j-1}$ 直接作为输入继续前传,这依赖KV缓存机制保证因果一致性,是理解训练-推理一致设计的关键。

研究动机

推理模型靠长思维链换准确率,代价极其高昂:论文实测Qwen3.5-9B在AIME 2025上平均每题生成40545个token,Qwen3.6-27B在AIME 2024上也需约29521个token,其中大量是检查、修正、分支试探等'冗余思考'。现有压缩方法几乎都是硬剪枝:TokenSkip按重要度删token,A*-Thought用A*搜索挑出保留步骤、其余直接丢弃。硬剪枝有两个问题:其一,被删掉的检查与修正信息可能正是模型自我纠错的关键——A*-Thought在Qwen3.6-27B上平均准确率反而从基座的81.1%降到80.4%,AIME 2025更是从71.7%跌到65.8%;其二,搜索式预处理昂贵,A*-Thought压缩3k条训练数据需要5小时16分22秒。另一类潜在推理方法(Coconut、SwiReasoning、CopT等)虽能把思考编码进连续空间,但'哪些步骤该显式保留、哪些该压缩、被压信息去哪了'缺乏一个有原则的判据。

本文的目标是本文目标是构建'信息保真的CoT压缩'框架:不是删除冗余步骤,而是把它们压缩成高密度的连续潜在token,与保留的文本步骤交织成显式-隐式混合推理序列。具体包括三件事:(1)找到有原则、可解释、计算便宜的判据来决定每个推理步骤的去留,作者希望判据来自模型内部几何而非外部打分模型;(2)设计配套训练目标,让模型学会在latent位置'一次性表达'被压缩步骤的语义,并在推理时与文本生成无缝衔接;(3)在精度不掉甚至提升的前提下大幅缩短生成长度,同时把数据预处理与训练开销降到远低于前作A*-Thought——目标是压缩预处理从5小时级降到分钟级、响应长度近乎减半。

与已有工作不同的是,本文的独特切入是把'推理压缩'从文本重要度排序问题转化为'隐藏状态轨迹的几何动力学'问题。作者将问题→各步骤→解答的表示投影到3D PCA空间,定义全局方向 $z_0=h_s-h_q$ 与局部转移 $z_n=h_{t^{(n)}}-h_{t^{(n-1)}}$,用夹角 $\theta_n=\arccos\frac{z_n^\top z_0}{\|z_n\|\|z_0\|}$ 刻画每步偏离'通往答案主方向'的程度。经验发现极为规整:六个30°角度区间分别对应'直接推导/常规演算/混合执行/条件检查/重解释修正/分支重考虑'六类语义(如[0°,30°)高频词是hence、simplify,[120°,150°)是mistake、however),角度随时间的波动还呈现探索→收敛→精化三阶段。这给出了以往文献没有的、纯几何的显式/潜在分配准则:沿主方向前进的步骤留作文本,绕路的检查与试探压进潜在空间;再辅以'池化embedding+步级软标签'让被压步骤的信息真正进入训练信号,而非像A*-Thought那样硬删除。

核心方法

方法分'数据构造'与'训练/推理改造'两半。直觉上:推理轨迹在隐藏状态空间里是一条从问题走向答案的路径,沿主路推进的步骤是'执行',偏离主路的步骤是'检查、犹豫、试错'——前者读者需要看清,后者可以'折叠'。技术上,先用小模型(默认Qwen3.5-0.8B)提取问题、每步、解答的隐藏状态并做3D PCA投影,计算每步方向角 $\theta_n$;给定阈值 $\tau$(60°或90°),$\theta_n\le\tau$ 的步骤保留为显式文本,$\theta_n>\tau$ 的连续冗余段被替换为潜在token序列。训练时用Embedding Forcing把每个被压缩步骤的词embedding均值池化为一个latent输入向量,用Label Forcing把该步所有token的one-hot平均成软分布作为latent位置的监督目标,再与标准交叉熵按权重 $\lambda$ 混合。推理时模型按训练格式自行生成latent边界标签,在latent位置直接把上一位的末层隐藏状态当作输入前传,实现文本与连续思考的交替生成。

核心创新有三点且相互咬合。第一,几何动力学筛选:不同于A*-Thought的双向重要度打分+A*树搜索(计算重、耗时长),本文用PCA投影轨迹上的夹角作筛选信号——无参数、无训练,把压缩3k条数据的预处理从5:16:22降到0:16:57(-94.6%),且角度区间与步骤语义高度对应,可解释,并可通过 $\tau$ 连续调节压缩强度(60°保留约31.67%的token,90°保留48.09%)。第二,显式-隐式交织而非硬删:被压步骤不消失,而是变成信息密度更高的latent token夹在文本之间,保留推理的时序进程。第三,步级软标签监督:标准下一词预测的one-hot目标无法监督'一个向量代表一整步'的位置,本文把整步token的one-hot平均成多峰软分布 $y^{(n)}_{\text{soft}}$,配合latent损失缩放权重 $\lambda$(0.1~0.3);消融证明这是最关键的组件——去掉Label Forcing后AIME三集平均准确率从94.5%暴跌到72.5%。

方法步骤详情

完整流程见Algorithm 1。(1)轨迹构建:用Qwen3.5-0.8B提取问题、各步骤与解答的隐藏状态 $\{h_q, h_{t^{(n)}}, h_s\}$,PCA投影到3维并中心化。(2)方向决策:计算全局方向 $z_0=h_s-h_q$ 与局部转移 $z_n$,夹角 $\theta_n=\arccos\frac{z_n^\top z_0}{\|z_n\|\|z_0\|}$(向量近零时默认保留),$f_n=\mathbb{I}[\theta_n\le\tau]$ 决定去留。(3)序列构造:保留步原样写入文本;连续冗余段两侧插入边界标签,段内每个冗余步($l^{(n)}$个token)生成latent输入 $c^{(n)}=\frac{1}{l^{(n)}}\sum_{j} e^{(n)}_j$ 与软目标 $y^{(n)}_{\text{soft}}=\frac{1}{l^{(n)}}\sum_j y^{(n)}_j$。(4)训练:教师强制输入 $(e_q; e_{t'}; e_s)$,总损失 $\mathcal{L}=\frac{1}{N_{valid}}(\sum_{I_{text}}\mathcal{L}_{CE}+\lambda\sum_{I_{latent}}\mathcal{L}_{latent})$,$\lambda$ 取0.1~0.3,latent token上限256。(5)推理:latent位置用上一位末层隐藏状态 $u_{i+j}=h^{(L)}_{i+j-1}$ 作输入前传,KV缓存保留全部上文,随后恢复文本生成;最多4个latent段、每段最长32。

技术新颖性

与三条已有技术路线相比,新颖性明确。对比硬剪枝(TokenSkip、A*-Thought):它们输出是变短的纯文本,本文输出是文本+连续token的混合序列,冗余信息以潜变量形式保留——消融显示这套latent机制贡献了主要增益(EF与LF全去掉仅61.7%,完整方法94.5%)。对比训练无关/外挂式的潜在推理(SwiReasoning在文本与潜在模式间动态切换、CopT用连续空间验证器做on-policy修正):它们不改变'哪些内容值得压缩'的判断依据,本文则由模型自身隐藏状态的几何性质给出数据级判据,压缩离线一次性完成,可解释、可调。对比自蒸馏式潜在推理(CODI等):那些方法用固定策略整体压缩CoT,本文做到步级、变长、位置自适应的压缩,并用多峰软标签而非单一目标向量监督——图5测得latent位置平均预测熵高达5.69/5.09(两个模型),而文本位置仅0.26/0.37,说明latent位置拟合的是宽分布软目标而非某个具体词。此外,'六角度区间—语义词汇'的对应关系(Table 4)本身也是对LLM推理动力学的可复用观察。

Framework of A*-Thought-V2
Figure 2: Framework of A*-Thought-V2

实验结果

主实验(Table 1)在9B与27B上、六个基准(Math500、AIME 2024/2025/2026、ARC-Challenge、GPQA-Diamond,各重复4次)结论一致。27B上τ=90°变体平均准确率93.9%(基座81.1%、SFT 92.9%、SwiReasoning 92.6%、CopT 91.8%、A*-Thought 80.4%),平均长度11785 token(SFT为14024,缩短16.0%),ACU 0.80,较基座0.35提升2.29倍;AIME 2024达96.7%,Math500达96.7%/2496 token(较SFT缩短64%)。9B上τ=90°平均91.5%、13462 token、ACU 0.68(SFT为89.0%/16157/0.55)。消融(Table 2,AIME三集平均):几何筛选94.5%/ACU 0.51,优于随机角度92.8%与反向选择91.4%(三者压缩率均约48%),说明增益来自选对步骤;去Embedding Forcing降至92.8%,去Label Forcing暴跌至72.5%,两者皆去仅61.7%。分析实验:图4显示latent token形成与文本分离的紧凑簇;图5测得latent位置平均熵5.69/5.09远高于文本位置0.26/0.37;最大latent长度32最优(91.4% vs 88.5%);图7显示V2最终训练损失最低。效率(Table 3):压缩预处理5:16:22→0:16:57(-94.6%),τ=60°训练时间较SFT缩短80.3%(9B)/68.7%(27B)。

Main results
Table 1: Main results
Ablation study of geometric step selection, Embedding Forcing, and Label Forcing
Table 2: Ablation study of geometric step selection, Embedding Forcing, and Label Forcing
Compression rates and preprocessing and training times across methods
Table 3: Compression rates and preprocessing and training times across methods
Semantic keyword groups and proportions associated with directional-angle intervals
Table 4: Semantic keyword groups and proportions associated with directional-angle intervals
Inference configuration
Table 6: Inference configuration
PCA projections of text-token and latent-token hidden states produced by A*-Thought-V2-Qwen3.5-9B on AIME2024 case 79
Figure 4: PCA projections of text-token and latent-token hidden states produced by A*-Thought-V2-Qwen3.5-9B on AIME2024 case 79
The token entropy along the entire CoT trajectory
Figure 5: The token entropy along the entire CoT trajectory
Ablation study of max latent length on AIME2024 and GPQA-Diamond
Figure 6: Ablation study of max latent length on AIME2024 and GPQA-Diamond
Training-loss curves of different methods at two model scales
Figure 7: Training-loss curves of different methods at two model scales
Directional-angle distributions produced by CoT-PCA extractors of different sizes
Figure 10: Directional-angle distributions produced by CoT-PCA extractors of different sizes
查看结构化数据
任务指标本文基线提升
六基准平均(Qwen3.6-27B) 平均准确率(%) 93.9(τ=90°) 92.9(同数据SFT);81.1(原始基座) 较SFT +1.0,较基座 +12.8
六基准平均(Qwen3.6-27B) 平均响应长度(tokens) 11785 14024(SFT);23390(基座) 较SFT -16.0%,较基座约减半(-49.6%)
六基准平均(Qwen3.6-27B) ACU 0.80 0.35(原始基座);0.66(SFT) 较基座 2.29×
六基准平均(Qwen3.5-9B) 平均准确率(%) 91.5(τ=90°) 89.0(SFT);85.1(基座) 较SFT +2.5,ACU从0.55升至0.68
AIME 2024(Qwen3.6-27B) 准确率(%) 96.7 84.2(基座);95.8(SFT) +12.5(较基座),token从29521降至14931
步骤筛选消融(27B,AIME三集平均) 平均准确率(%) 94.5(几何角度筛选) 92.8(随机角度);91.4(反向选择) +1.7 / +3.1(压缩率基本持平约48%)
潜在训练机制消融(27B,AIME三集平均) 平均准确率(%) 94.5(完整EF+LF) 92.8(去EF);72.5(去LF);61.7(去EF+LF) LF贡献 +22.0,双机制合计 +32.8
数据压缩预处理(OpenR1-Math-3k,3k条) 预处理耗时 0:16:57 5:16:22(A*-Thought) -94.6%

局限与改进

局限可从作者承认与独立观察两方面看。其一,几何判据依赖3D PCA投影与小模型提取器:附录C.1显示0.8B~9B提取器的角度分布略有差异但下游性能无显著差别(作者以此说明稳健),可3维投影终究是粗糙近似,且阈值 $\tau$(60°/90°)是全局人工常数,未对题目难度、推理阶段自适应——图3(c)自己就显示探索、收敛、精化三阶段中角度的角色不同。其二,latent token不可读:压缩了什么只能靠软标签分布与案例间接推断,缺乏latent内容对被压文本的信息保真度定量指标,出错难以调试。其三,评价限于数学/科学QA,训练数据仅OpenR1-Math-3k约3千条,代码生成、多轮对话、智能体任务未验证;方法还假设推理轨迹可清晰分段,对无步骤边界的自由文本推理如何切分未讨论。其四,训练需8×A100 80GB全参微调,且每换一个 $\tau$ 都要重建数据重训;推理超参(最多4段、每段最长32、256个latent token上限)均为经验值。其五,个别域外基准有波动:如9B τ=60°在GPQA-Diamond为81.6%,略低于同数据SFT的83.5%,说明阈值选择对域外迁移有影响。

独立分析的弱点

(1)筛选信号的单调性假设:方法默认'小角度=执行、大角度=冗余可压',但大角度的检查与修正恰是防错关键(Table 4中[120°,150°)含mistake、however),把它们压进latent意味着纠错过程不可见,latent容量不足时纠错信息可能丢失;改进方向是引入步置信度或验证器反馈做选择性压缩。(2)软标签信息瓶颈:均值池化把整步压成一个向量、标签取平均,长步骤与短步骤被压到同等密度,长步骤信息损失更大;可按步骤熵或困惑度分配可变数量的latent token。(3)阈值全局统一:$\tau$ 对所有题目一刀切,简单题与难题的最优压缩率不同;可做题目级自适应 $\tau$。(4)训练-推理分布差距:训练时latent输入是池化embedding $c^{(n)}$,推理时是末层隐藏状态 $h^{(L)}$,全靠训练桥接;可注入噪声或设计课程对齐。(5)纯SFT、静态压缩:策略离线固定,无法按下游奖励调整,作者也承认需探索强化学习。

未来方向

作者明确提出的方向是把该框架扩展到强化学习:潜在压缩判据目前是离线几何启发式,若以ACU或答案正确性为奖励在线优化'哪些步骤压进latent',有望超越人工阈值。基于本文成果还可自然延伸:(1)把六区间语义分析与过程奖励模型结合,用角度动力学作为轻量过程信号,替代昂贵的逐步人工标注;(2)阶段自适应压缩——利用探索/收敛/精化三阶段结构,在收敛与精化阶段加大压缩力度、在探索阶段保留更多文本;(3)与投机解码、KV缓存量化等推理加速正交组合,latent段只有 $m$ 个位置,也可研究其并行生成;(4)可解释性:用latent位置的软标签分布反向解码被压缩语义,建立对latent内容的审计与调试手段;(5)跨域与规模化验证:在代码、智能体规划等任务上检验几何判据是否同样对应'检查/试探'语义,在更大模型(70B+)上验证缩放性;(6)混合训练目标:把latent软标签与隐藏态对齐等蒸馏目标联用,进一步压低潜在学习的信息损失。

复现评估

复现条件较好。代码开源于GitHub(github.com/AI9Stars/AStar-Thought),权重发布于Hugging Face(AStar-Thought-V2-OpenR1-Math-3k),训练数据OpenR1-Math-3k公开,三个骨干(Qwen3.5-9B、27B、提取器0.8B)均为开源模型。附录D给出完整超参:8×A100 80GB、总batch 64(设备batch 1×梯度累积8)、cutoff 20480、AdamW、学习率 $1.0\times10^{-5}$、warmup 0.1、3个epoch;方法超参含 $\lambda$(0.1~0.3,步长0.1网格搜索)、latent token上限256、推理最多4段×长32、温度1.0、top-p 0.95、重复4次。Algorithm 1给出数据构造伪代码,提取器规模敏感性也有消融(附录C.1)。主要门槛是算力:全参SFT 27B需8张A100 80GB、约6.7~21.4小时,9B约2.4~12.4小时;但数据构造部分计算便宜,压缩3k条数据仅约17分钟,单卡可复现。论文未详述答案抽取与评分脚本细节,需对照开源仓库确认。