← 返回 2026-09-01

SHAPE:数学推理中思维链的语义空间与启发式分析框架 SHAPE of Chain-of-Thought in Math Reasoning

Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee, Yohan Jo 📅 2026-06-28 👍 24 2026-09-01 18:30
LLM推理 RLVR 可解释性 思维链分析 数学教育学

用数学教育学的启发式与语义空间解析LLM思维链,诊断推理失败并改进RLVR后训练

前置知识

Chain-of-Thought(思维链)

LLM 在给出最终答案前生成的一系列中间推理文本,包含重述、变形、验证、结论等“可见的解题动作”。推理模型(如 DeepSeek-R1、Qwen3)通过强化学习被训练生成更长的思维链以提升数学基准正确率。本文把思维链视作人类“出声思维”(think-aloud)记录在 LLM 上的对应物,是可以被编码分析的观测数据。

SHAPE 的全部分析对象就是思维链轨迹,理解其粒度(句子、步骤)与局限(可能不忠实)是读懂全文的前提。

数学启发式(Heuristics)

源自波利亚《怎样解题》等数学教育研究,指解题者采取的有目的的策略性动作,如简化问题、倒推、引入辅助对象、分类讨论、反证、考察特例、利用对称性等。启发式不保证成功,但引导探索方向。本文把 Pólya、Koichu、Favier 等多个分类体系整合为 H1–H11 共 11 大类(含 H3a/H11b 等子类),外加 N1–N4 非启发式标签(重复、例行计算、无关陈述、给出答案)。

启发式标注是 SHAPE 两大支柱之一,“模型用了哪些启发式”是全文所有统计分析的基本单位。

语义空间(Semantic Space)

解题者对问题的当前数学解释:采用什么表示(代数方程、几何图形、枚举计数)、考虑哪些约束与目标、哪些操作被视为可行。同一问题可以在不同语义空间下推进,且空间通常不会被显式说出,只能从动作序列推断。例如“建立方程组”与“逐个试数”就是两个不同的语义空间。

SHAPE 用“启发式活动分布在多少个语义空间、如何在这些空间间迁移”来刻画推理质量,这是区别于以往 CoT 分析的核心变量。

RLVR 与 GRPO

RLVR(可验证奖励的强化学习)用答案正确性等可自动验证的信号对 LLM 做后训练,是推理模型的主流训练方式;GRPO 是其代表算法,对同一提示采样多个回答,以组内相对优势更新策略。已有研究争论 RLVR 是扩展了模型能力边界,还是只提高了对既有行为的采样效率并导致多样性坍缩。

本文既用 SHAPE 分析 RLVR 后训练如何改变推理“形状”,又基于 GRPO 训练了启发式增强变体来验证诊断结论的实用价值。

有效数(Effective Number)

分布熵的指数 $\exp(H)$,借自生态学多样性度量(Jost, 2006),表示“等效上被使用了多少类”。对启发式的空间分布 $q(i)$ 和连续段分布 $p(k)$ 分别取指数,得到 $N_{\text{space}}^{\text{eff}}$(有效语义空间数)与 $N_{\text{trans}}^{\text{eff}}$(有效转移段数,指数减一),二者之比 $\rho$ 衡量平均每个空间被重访的强度。

论文所有语义空间分析都建立在这组指标上,不理解有效数就无法读懂 Table 2 和扰动实验的结果。

研究动机

最终答案正确率只回答“模型做没做对”,无法回答“它如何组织解题”。在数学基准上,模型可能在一条完全正确的轨迹里先建立代数方程组,中途放弃转向逐个试数,最后又回到代数框架解出答案——只看答案或轨迹长度,这些策略活动完全不可见。现有 CoT 分析停留在表面特征:长度统计(Wu et al., 2025b;Su et al., 2025)、“wait/aha”等自我修正词汇标记(Guo et al., 2025)、ThinkARM 等方法使用的 8 类通用认知 episode(Read/Analyze/Plan/Implement/Explore/Verify/Answer/Monitor),以及图、树等全局结构模式。没有一项能追踪“模型此刻在什么数学解释下操作”。这使得诊断推理失败变得盲目:不知道模型在哪个解释框架里卡住、为什么反复折返,就无法定位失败根源、设计针对性训练;同时,RLVR 后训练究竟是扩展了策略库还是仅仅收缩到已有模式,靠答案正确率和表层相似度也无法判断。

本文的目标是本文要构建理论上有根基、工程上可规模化的过程级分析框架 SHAPE(Semantic-space and Heuristic Analysis for Problem-solving Evolution):把 LLM 的数学推理表示为语义空间序列与启发式序列的双层结构,配以三阶段自动化标注流水线,能处理数千条轨迹。在此之上达成三个可验证的目标:(1) 证明启发式特征预测答案正确性的能力超过既有 CoT 表示——在 Omni-MATH 100 题 × 15 个模型的轨迹预测任务上 AUROC 超过 ThinkARM 的 0.618;(2) 揭示正确与错误轨迹在语义空间使用上的结构性差异,并刻画 RL 后训练对启发式分布的影响(是否收窄、是否创造新策略);(3) 把诊断结论转化为训练改进——在 GRPO 的 rollout 提示中加入 11 条数学启发式,证明仅此一项即可在 MATH-Perturb 原始/simple/hard 三个条件下提升性能,例如原始集 Avg@64 从基线 23.54 提升到 36.80。

与已有工作不同的是,本文的切入点是数学教育学界几十年积累的问题求解分析传统——这是 LLM 社区此前忽视的资源。Pólya(1945)与 Schoenfeld(1985)早已确立从两个正交轴分析人类解题:解题者对问题的当前数学解释(语义空间,Newell et al., 1972;Favier & Dorier, 2024)与在该解释下采取的目的性动作(启发式,Koichu et al., 2007)。Favier & Dorier(2024)用这套框架分析学生的试误式解题。而已有 LLM CoT 分析要么用表层词汇标记,要么用通用 episode 标签,要么用图结构,没有一项把“模型当前采用什么数学解释”作为一等公民来追踪。SHAPE 把这套理论操作化为机器可执行的标注方案(H1–H11 分类 + NEW/RETURN/MAINTAIN 空间状态机),先用作诊断工具揭示 RL 训练的模式坍缩,再反哺为训练信号注入 RLVR——“理论→诊断→训练改进”这条完整链路是已有工作不具备的。

核心方法

直觉上,SHAPE 像给思维链拍 X 光片:不看轨迹多长、出现了几次“wait”,而是看解题者在哪些“数学解释”里活动、每种解释下做了哪些策略动作、在解释之间如何迁移。技术路线是三阶段流水线(Figure 2):先把 CoT 切成内容单元——承载单一启发式解释的最小连贯片段;再用标注模型给每个单元打多标签启发式(H1–H11,或无策略动作时的 N1–N4);最后用状态跟踪模型维护语义空间记忆缓冲区,仅当单元包含“改变表示”类启发式(H1、H2、H3、H5、H8、H11)时判断 MAINTAIN(维持)、NEW(开新空间)或 RETURN(回到历史空间)。在标注之上定义分布与指标:空间分布 $q(i)$、连续段分布 $p(k)$ 及其有效数 $N_{\text{space}}^{\text{eff}}$、$N_{\text{trans}}^{\text{eff}}$,转移比 $\rho$,以及启发式频率分布 $u(h)$。标注质量用 48 条人工金标轨迹校验(四位作者含数学教育研究生共识编码,8,334 句切出 1,598 个单元),主标注器为开源的 Qwen3.5-27B(加权 F1 70.44)。

核心创新是双层标注 + 状态机跟踪的组合。启发式层记录“可见的策略动作”,语义空间层刻画“动作背后的数学解释”;由于空间通常不被显式说出,SHAPE 从动作序列推断空间——只有出现改变表示的启发式时才触发空间判定,RETURN 时由跟踪模型对照记忆缓冲区中每个历史空间的定义(表示格式、约束、核心工具、摘要、锚文本)找回空间 ID。这使框架能区分两种以往特征无法区分的推理形态:在少数空间内深挖 vs 在多个空间间浅尝辄止;尤其“低 $N_{\text{space}}^{\text{eff}}$ 高 $N_{\text{trans}}^{\text{eff}}$”意味着模型在窄小的空间集合里反复横跳却不推进,这正是错误轨迹与过度思考的信号。与 ThinkARM 的本质区别在标签的数学具体性:ThinkARM 的 8 个通用 episode(读题/分析/计划……)任何领域都能套上,SHAPE 的 H1–H11 是数学特异动作(引入记号、考察特例、倒推、反证、对称性探索……),能回答“模型在代数框架里做了什么、为何放弃”。与“wait/aha”词汇标记的区别在于后者只捕捉修正的表面痕迹,不触及策略内容本身。

方法步骤详情

第一步,内容单元切分:输入带句索引的 CoT,输出单元边界与策略码,规则是“计划与紧随执行合并、弱监控句(Okay/Wait)并入邻近实质单元、仅在主动策略变化处切开”;金标集上从 8,334 句切出 1,598 个单元。第二步,启发式标注:输入单元 + 题目 + 最近 4 个单元上下文,输出多标签 H1–H11/N1–N4 及证据引文,遵循“启发式优先”规则(含任一 H 码就不打 N 码),并区分策略性代入(设 $u=x^2$ 记 H3)与例行计算($2x+3x=5x$ 记 N2)。第三步,语义空间跟踪(Algorithm 1):仅当单元触发 H1/H2/H3/H5/H8/H11 时调用跟踪模型,对照记忆缓冲区 $M$ 中的历史空间定义,输出 NEW(开新空间并写入 $M$)、RETURN(回到 $M$ 中空间 $j$)或 MAINTAIN;其余单元保持当前空间,初始空间为题面(ID 0)。第四步,指标计算:从空间序列 $S$ 与启发式序列 $H$ 得到空间分布 $q(i)$、连续段分布 $p(k)$ 与频率分布 $u(h)$,算出 $N_{\text{space}}^{\text{eff}}=\exp(-\sum_i q(i)\log q(i))$、$N_{\text{trans}}^{\text{eff}}=\exp(-\sum_k p(k)\log p(k))-1$,二者之比为 $\rho$。以 Figure 1 为例:$S=(1,2,1)$ 给出 $N_{\text{space}}^{\text{eff}}=2$、$N_{\text{trans}}^{\text{eff}}\approx 1.83$。

技术新颖性

新颖性体现在三个层面。理论层面,首次把数学教育学的“启发式+语义空间”双轴完整移植到 LLM 推理分析:标签体系整合自 Pólya(1945)、Koichu et al.(2007)、Favier(2022)、Posamentier & Krulik(2008)的实证分类而非自造词汇,且金标构建遵循该领域的共识编码传统(分歧通过讨论裁决,如一个单元可同时保留 H9a/H11b/H5 三个标签)。工程层面,用“表示变化启发式触发 + 记忆缓冲区状态机”解决了语义空间没有客观金标、只能从动作推断的难题,使解释性标注可以规模化——Grok-4.1-Fast 标注 445 条轨迹约 100 美元,故主力标注改用开源 Qwen3.5-27B(加权 F1 70.44 对 Grok 的 76.98),保证可复现性。应用层面,把诊断结论直接转化为训练干预:先前 RLVR 研究只测答案正确率或表层输出多样性,本文证明在 rollout 提示中列出 11 条启发式即带来稳定增益,且提供启发式层面的证据说明 RLVR 是收窄而非重塑策略空间,补充了 Yue et al.(2025)、Wu et al.(2025a)等基于表层相似度的结论。

Illustrative example of SHAPE annotation applied to a synthetic CoT trace.
Figure 1: Illustrative example of SHAPE annotation applied to a synthetic CoT trace.
Overview of the automated SHAPE analysis pipeline.
Figure 2: Overview of the automated SHAPE analysis pipeline.

实验结果

五个实验。(1) 正确性预测(Table 1):在 Omni-MATH 100 题 × 15 模型轨迹上做 5 折分层交叉验证,CoT 长度 AUROC 仅 0.504±0.03(近乎随机),加推理 token 特征无改善(0.503);自修正标记 0.618±0.03 以 3 个特征追平 8 特征的 ThinkARM(0.618±0.02);SHAPE 11 个启发式频率特征达 0.653±0.02,加非启发式后 0.664±0.02 最佳。(2) 语义空间结构(Table 2):推理模型 $N_{\text{space}}^{\text{eff}}$ 1.81–2.53、$\rho$ 0.40–0.51,明显高于指令模型(1.37–1.71;0.19–0.32);几乎所有模型错误轨迹三项指标更高,如 QwQ-32B 错误 $N_{\text{space}}^{\text{eff}}$ 2.74 对正确 1.74、$\rho$ 0.60 对 0.32——成功=少数空间内集中投入,失败=高频折返而不推进,与人类解题一致。(3) 扰动实验(Table 3):MATH-Perturb 115 题上 hard 扰动使 Pass@1 大跌(Qwen3-32B .92→.76、Olmo-3-7B-Think-RLVR .97→.76),simple 几乎不变;但 hard 下 $D_{\text{freq}}^{\text{JS}}$、$\Delta N_{\text{space}}^{\text{eff}}$、$\Delta\rho$ 均显著更高(p<.05)——模型“察觉”问题变了并调整动作,却开了更多空间又更频繁重访、无法收敛;附录 E 显示分歧在前 5 个内容单元即出现。(4) RL 收窄启发式(Table 4、Figure 3):所有 base→post-trained 对 Density>1(1.032–1.250)且 Coverage<1(0.531–0.871),无关模型对照仅 0.520/0.437——RLVR 把成功轨迹压进 base 分布的密集核。(5) 训练应用(Table 5):HA-Plan-GRPO 与 Plan-GRPO 仅 rollout 提示不同,Avg@64 原始 36.80 对 30.00 对基线 23.54,hard 17.72 对 14.52 对 11.84——启发式信息本身带来可测增益。

Correctness prediction under 5-fold stratified cross-validation.
Table 1: Correctness prediction under 5-fold stratified cross-validation.
Descriptive statistics of SHAPE metrics by correctness.
Table 2: Descriptive statistics of SHAPE metrics by correctness.
CoT structural analysis under perturbation.
Table 3: CoT structural analysis under perturbation.
Density and Coverage of post-trained model trajectories relative to base model trajectories in heuristic frequency space.
Table 4: Density and Coverage of post-trained model trajectories relative to base model trajectories in heuristic frequency space.
Preliminary results for Heuristic-Augmented GRPO on the MATH-Perturb test split.
Table 5: Preliminary results for Heuristic-Augmented GRPO on the MATH-Perturb test split.
Heuristic-tagging performance of candidate annotator models on the gold set.
Table 8: Heuristic-tagging performance of candidate annotator models on the gold set.
Early-stage heuristic-frequency divergence under perturbation (post-trained models only).
Table 10: Early-stage heuristic-frequency divergence under perturbation (post-trained models only).
Projection of successful Olmo-3-{Base, Think-RLVR} trajectories onto the first principal component of heuristic frequency space.
Figure 3: Projection of successful Olmo-3-{Base, Think-RLVR} trajectories onto the first principal component of heuristic frequency space.
查看结构化数据
任务指标本文基线提升
CoT 正确性预测(Omni-MATH 100 题 × 15 模型轨迹) AUROC(5 折分层交叉验证,逻辑回归) SHAPE (H+N) 0.664±0.02(12 特征);SHAPE (H) 0.653±0.02(11 特征) ThinkARM 0.618±0.02(8 特征);自修正标记 0.618±0.03(3 特征);CoT 长度 0.504±0.03 较最佳基线 +0.046 AUROC;且 3 个自修正特征即追平 8 特征的 ThinkARM
hard 扰动下的结构适应(MATH-Perturb 115 题,Qwen3-32B) Pass@1 与结构指标变化 hard:Pass@1 .92→.76(-16pt),$D_{\text{freq}}^{\text{JS}}$ .24、$\Delta N_{\text{space}}^{\text{eff}}$ .08、$\Delta\rho$ .11(均 p<.05) simple:Pass@1 .92→.90(-2pt),$D_{\text{freq}}^{\text{JS}}$ .19、$\Delta N_{\text{space}}^{\text{eff}}$ -.06、$\Delta\rho$ -.05 诊断性发现:模型调整了启发式却没有扩展语义空间承诺,准确率仍大跌
启发式增强 RL 训练(MATH-Perturb hard 集,Qwen3-1.7B-Base) Avg@64 HA-Plan-GRPO 17.72 Qwen3-1.7B-Base 11.84;Plan-GRPO 14.52 较基线 +5.88(约 +50%);较同结构无启发式对照 +3.20
RL 后训练的启发式分布变化(成功轨迹,k=3 近邻) Density / Coverage Qwen3-1.7B-GRPO 1.220/0.871;Olmo-Think-RL-Zero 1.250/0.707;Olmo-Think-RLVR 1.032/0.531 无关模型对照 0.520/0.437 证明模式收窄(Density>1、Coverage<1)是 base→post-trained 特有现象,而非任意分布重叠

局限与改进

作者承认:框架验证仅限数学基准,向其他领域扩展是未来工作;语义空间没有客观金标,只能通过 48 条轨迹的人工迭代校准提示;标注模型对稀有类别(H7 反证 F1 0.6667、H10 倒推 0.5000,金标实例少导致估计不稳)性能偏低。我观察到更多问题:其一,CoT 忠实性问题未被正面处理——若模型生成事后编造或装饰性步骤(Arcuschin et al., 2025),SHAPE 测到的是“叙述出的策略”而非“计算中真实使用的策略”;其二,错误轨迹的 $N_{\text{space}}^{\text{eff}}$、$\rho$ 更高可能与错误轨迹更长有关(单元更多→开新空间机会更多),论文未做长度匹配对照,“专注=正确”的因果方向存疑(也可能是不确定导致折返而非折返导致错误);其三,RLVR 是收窄而非重塑的结论基于成功轨迹的启发式频率向量,而通过率过滤本身会使成功子集分布变窄,对照实验未完全排除这一混杂;其四,训练验证是初步的:仅 Qwen3-1.7B 一个 1.7B 模型、200 步、MATH 训练集,hard 集 Avg@64 仅 17.72 远未饱和,增益能否随规模与训练时长保持未知。

独立分析的弱点

弱点一:语义空间跟踪完全由提示驱动、无外部监督,NEW/RETURN 判定依赖“根本性结构转变”这类模糊标准,跨模型、跨题目的可比性存疑——改进方向是用已知空间切换点的受控合成数据构建跟踪评测集,或训练专用分类器替代提示。弱点二:启发式频率 $u(h)$ 依赖标注模型,稀有类(H7、H10)估计不稳,而 RL 收窄分析恰恰依赖 $u(h)$ 的准确性,Density/Coverage 结论可能是标注偏差的投影——改进方向是对金标做 bootstrap 误差传递,为下游指标报告置信区间。弱点三:错误轨迹更高的空间扩散与轨迹长度混杂,未排除“更长→更乱”的替代解释——改进方向是按长度分层比较或在回归中控制轨迹长度。弱点四:HA-Plan-GRPO 只验证了“提示中列出启发式”这一种注入方式,模型可能学会口头引用启发式名而未真正改变搜索行为——改进方向是用 SHAPE 指标检验训练前后轨迹结构是否真变宽,或把启发式选择做成显式动作并配过程奖励。弱点五:Pass@64 在原始集上三个配置几乎相同(77.40→80.00→80.00)而 Avg@64 差距大,说明主要收益是采样效率与一致性而非能力上限,标题性结论应更克制。

未来方向

作者明确提出把框架扩展到数学以外的领域。基于本文成果可延伸的方向:(1) 把 SHAPE 指标变成过程奖励或 RL 中的显式探索正则,例如奖励覆盖 base 模型中未被访问的启发式区域,直接对抗模式坍缩,这比仅在提示中列出启发式更根本;(2) 结合忠实性研究(如 thought anchors、激活分析)检验启发式标签与模型内部计算的对应关系,回答“SHAPE 分析的是叙述还是计算”;(3) 面向“语义空间承诺”做干预研究——用解码控制(作者组的 ThinkBrake 思路)或训练抑制无进展的 RETURN 折返,检验折返与错误间的因果关系;(4) 课程式后训练设计:先广度(鼓励多启发式、多空间探索)后深度(空间内专注收束),并在 MATH-Perturb 类扰动集上验证泛化;(5) 把分类体系迁移到代码生成、科学推理等领域的对应“策略动词”,检验有效数指标是否跨领域成立。

复现评估

复现条件总体友好。代码已开源(github.com/holi-lab/SHAPE-of-CoT),包含全部提示模板、启发式与语义空间两本 guidebook、Algorithm 1 实现及运行时模板。标注环节首选开源 Qwen3.5-27B(加权 F1 70.44、宏 F1 61.36,可通过 HuggingFace 获取,无需 API),闭源 Grok-4.1-Fast 更准(76.98/65.04)但 445 条轨迹约需 100 美元;§4.1 的扰动实验使用 Grok-4.1-Fast,完整复现需少量 API 预算。数据全部公开:MATH、MATH-Perturb(115 题测试集)、Omni-MATH 子集。分析部分只需对数千条轨迹做推理加标注,单卡或 API 即可;训练部分非常轻量:Qwen3-1.7B-Base、2×B200、200 步 GRPO 约 3–3.5 小时(verl 实现,batch 32、每提示 4 个 rollout、学习率 1e-6、最大生成长度 2048)。主要风险是语义空间提示的手工校准依赖作者判断,跨实验室复现时可能需要重新校准;总体难度评为:分析实验低到中,训练实验低。