← 返回 2026-08-05

TurnSight:面向工具集成推理的轮次级事后自蒸馏 TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu 📅 2026-08-04 👍 19 2026-08-10 18:30
GRPO LLM智能体 信用分配 工具集成推理 强化学习 自蒸馏

用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。

前置知识

工具集成推理 (Tool-Integrated Reasoning, TIR)

LLM 通过反复“推理—调工具—观察结果—再推理”的迭代循环解决复杂任务的范式。一条轨迹 $\tau=(s_1,...,s_K)$,每个非终止轮 $s_k=(n_k,C_k,o_k)$ 含自然语言推理 $n_k$、工具调用集 $C_k$、执行结果 $o_k$。与单步生成不同,它需要选工具、构造参数、解读输出并据此调整后续行为,因此本质上是一个多轮、状态不断变化的序列决策过程。

TurnSight 整个方法都建立在“TIR 的基本决策单元是一次完整工具交互”这一假设上,理解 TIR 的多轮结构才能理解为什么 token 级监督粒度不对、为什么轮次级 hindsight 才匹配。

在策略自蒸馏 (On-Policy Self-Distillation, OPSD)

评估学生自己生成的轨迹、但用一个仅在训练时可用的“特权视角(privileged view)”作为教师来打分的自蒸馏机制。教师与学生是同一个模型,关键用对数概率差 $\delta=\log\pi_T(y|c^+)-\log\pi_\theta(y|c)$ 衡量特权信息如何改变对已采样 token 的信心,而非直接匹配教师分布。TurnSight、SDPO、RLSD、SDAR 都属此类。

TurnSight 属于 OPSD 家族但更换了特权上下文的来源,必须先理解 OPSD 的“教师—学生对数概率差”机制,才能看懂它究竟改了什么、为什么改了之后更有效。

GRPO 与轨迹级信用分配

Group Relative Policy Optimization 是一种无需训练额外价值函数的策略梯度算法:对每个 prompt 采样一组 $G$ 条轨迹,用组内奖励的相对比较构造优势 $\hat A$,作为 prompt 相关的基线,降低价值估计成本。优化目标是带 clip 与 KL 正则的 PPO 式目标。传统用法把单一轨迹级优势传播给该轨迹所有动作,这就是轨迹级信用分配。

TurnSight 的目标函数就是 GRPO 换掉优势项,基础优势 $\hat A^{base}$ 也来自 GRPO 的组相对比较。理解 GRPO 才能看懂它“只调制优势幅度而不改优化方向”到底改在哪。

信用分配 (Credit Assignment)

强化学习里把最终奖励归因到具体中间动作的核心难题。在 TIR 中,任务最终成功/失败只告诉整条轨迹好不好,却不说哪一次工具调用有用、冗余还是有害。轨迹级监督把相同信用给所有轮次,粒度太粗;token 级监督又太细,且会因格式符、参数变化在同一轮内给出幅度甚至符号矛盾的信用。

信用分配是本文要解决的核心问题。TurnSight 的轮次级 hindsight 正是为了在“太粗的轨迹级”和“自相矛盾的 token 级”之间找到自然粒度。

事后经验 (Hindsight)

用“事后才有的信息”去重新评估当时决策的思路。在 TIR 中,工具执行结果在调用时未知、调用之后才产生,因此是天然的事后信息;把它拼回上下文、重新对已采样的 token 打分,就能判断“这次工具调用是否恰当”。它不依赖外部参考轨迹,而是把智能体自身的执行结果当作监督源。

TurnSight 的特权上下文就是执行 hindsight。理解 hindsight 才能理解为什么“工具执行结果”比“标准答案”更状态对齐、是本文最核心的切入点。

研究动机

现有强化学习方法在训练工具集成推理(TIR)智能体时面临严重的信用分配难题。以 GRPO 为代表的结果级方法只把单一轨迹级优势传播给所有动作,把推理、工具选择、参数构造等因果作用截然不同的决策赋予相似信用,在长程多轮场景下尤其低效。另一方面,在策略自蒸馏(OPSD)虽能提供更密集的监督,但现有方法(如 SDPO、RLSD、SDAR)通常用标准答案、参考轨迹或蒸馏技能作为教师特权上下文,这些信号描述的是“如何解决整个任务”而非“在该状态下这次工具调用是否恰当”,且与智能体实际访问的状态错位——一旦智能体做出不同工具调用,环境状态就偏离参考路径,监督随之失效。更关键的是,这类方法多在 token 级别产生监督,而 TIR 的基本决策单元是一次完整工具交互(含推理+工具选择+参数构造),token 级信号会因格式符、参数变化在同一轮内出现幅度甚至符号冲突,给出矛盾的信用。Figure 1 把这三种失败模式并排画了出来。

本文的目标是本文目标是设计一个完全在策略、无需参考轨迹、且能在自然交互粒度上提供可靠信用分配的训练框架。具体而言,作者提出 TurnSight,希望做到四点:(1) 直接从学生自身轨迹产生的工具执行结果中提炼“事后(hindsight)”监督,使特权上下文与策略实际访问的状态天然对齐;(2) 把 token 级事后证据聚合到轮次级,使每次完整工具交互获得一致而非矛盾的信用;(3) 用多个不同前瞻深度 $D_H=\{1,2,3\}$ 的事后视角捕捉从即时反馈到下游延迟效应的多样时间依赖,并通过跨视角方向一致性筛选可靠监督;(4) 把筛选后的事后信号做组归一化并构造有界的符号感知权重 $w_{i,t}=1+\epsilon_w\tanh(\mathrm{sign}(\hat A^{base})\hat\delta)$,仅调制而不改变 GRPO 基础优势的优化方向,从而保持 RL 的探索能力,且不引入任何辅助模仿目标。

与已有工作不同的是,本文的独特切入点在于“把轨迹自身当作监督源”。已有 OPSD 方法依赖外部全局信息(标准答案/参考技能),但这些信息一旦智能体做出不同工具调用就会失效;而 TurnSight 抓住一个关键事实:在 TIR 中每次工具调用都会改变外部环境,因此轨迹本身就蕴含最状态对齐的监督,工具执行结果天然构成有效的事后信号。作者用 Figure 3 的实验定量佐证:仅用工具结果(FTRL avg 46.92)竟显著优于“工具结果+标准答案”(40.89)和“仅标准答案”(42.80)——特权信息越多反而越糟,因为标准答案含轨迹级信息会掩盖轮次级因果贡献。这与“越多特权上下文越好”的直觉相反,是 TurnSight 区别于 SDPO/RLSD/SDAR 的本质所在,也是它无需标注或参考轨迹的理论支撑。

核心方法

TurnSight 整体思路是“用执行后见之明去加权而非替代强化学习信号”,分四层。第一,构造执行条件化特权上下文:对学生第 $k$ 轮、前瞻深度 $d$,收集执行后见块 $H_{i,k}^{(d)}=\{(C_{i,k},o_{i,k}),...,(C_{i,\bar k},o_{i,\bar k})\}$($\bar k=\min(k+d-1,K)$),拼到原始上下文得 $c^+=c_{i,t}\oplus H$。第二,用冻结参考策略 $\pi_{ref}$ 在特权上下文下对学生采样 token 做 teacher-forcing,算断开的对数概率差 $\delta=\log\pi_{ref}(y|c^+)-\log\pi_\theta(y|c)$,正差表示执行结果增强了参考分支对该 token 的信心。第三,把 token 级差聚合到轮次级。第四,做多前瞻教师选择+组归一化+有界加权后注入 GRPO 目标。所有教师计算均断开计算图,仅训练时用,部署只需学到的策略。

核心创新有两点本质区别。其一,特权上下文的来源:现有 OPSD 从标准答案/参考轨迹取全局信息,TurnSight 直接从学生自己轨迹产生的工具执行结果取事后信号,既天然状态对齐又完全在策略,无需任何标注。其二,监督粒度:现有方法给 token 级信号,会在同一轮内因格式/参数产生矛盾信用;TurnSight 坚持“轮次是 TIR 的基本决策单元”,把事后证据聚合到轮次级,使一次完整工具交互获得一致信用。此外它用三个前瞻深度 $D_H=\{1,2,3\}$ 构造互补视角,浅深度捕捉即时执行质量、深深度反映下游贡献,再通过多数投票的方向一致性筛选+选最强教师,避免孤立噪声被放大,也避免无差别融合稀释信号。最终只调制优势幅度而不改方向,方法与底座 RL 算法解耦、与奖励构造无关、可即插即用地接在任意 policy-gradient RL 上。

方法步骤详情

流程九步。(1) 用 $\pi_{\theta_{old}}$ 采 16 条轨迹,记每轮推理、调用与结果。(2) 对每轮、每深度 $d\in\{1,2,3\}$ 拼执行后见块成特权上下文 $c^+$。(3) 用冻结 $\pi_{ref}$ teacher-force 学生 token,算 token 级差 $\delta=\log\pi_{ref}(y|c^+)-\log\pi_\theta(y|c)$。(4) 轮次级聚合 $\bar\delta_k=\frac{1}{|Y_k|}\sum_{t\in Y_k}\delta_t$。(5) 方向一致性选择:按 $\mathrm{sign}(\bar\delta)$ 多数投票得共识方向,在其内选 $\bar\delta$ 最大教师得 $\bar\delta^*$。(6) 组归一化 $\hat\delta=(\bar\delta^*-\mu)/(\sigma+\epsilon)$,统计量在同 prompt 所有有效轮次与策略 token 上算。(7) 有界权重 $w=1+\epsilon_w\tanh(\mathrm{sign}(\hat A^{base})\hat\delta)\in[1-\epsilon_w,1+\epsilon_w]$。(8) 积分优势 $\hat A=\hat A^{base}[(1-\lambda)+\lambda w]$。(9) 代入 GRPO 目标,环境观测 token 不算梯度。

技术新颖性

技术新颖性体现在五处协同设计。其一,执行条件化的特权上下文是该领域首次明确论证“工具结果比标准答案更有效的事后信号”,并用 Figure 3 实验定量支持(46.92 vs 42.80/40.89)。其二,轮次级聚合把 TIR 的决策单元还原为完整交互,消融显示去掉它 FTRL avg 从 46.92 掉到 43.23(−3.69),是掉得最多的组件,证明 token 级监督存在内在矛盾。其三,多前瞻教师选择消融显示单一固定深度(LA1=45.62、LA2=44.83、LA3=42.30)和无差别教师融合(45.70)都不如方向一致性选择(46.92),证明“选择性保留而非平均”更优。其四,组归一化解决跨轨迹幅度不可比问题(去掉掉到 43.65),把事后信号校准到可比尺度。其五,有界符号感知权重保证只调幅度不改方向,且 $w\in[1-\epsilon_w,1+\epsilon_w]$ 抑制极端噪声,使方法与底座 RL 算法、与奖励构造完全解耦。整体无需辅助模仿目标、无需参考轨迹,且与奖励设计正交。

The illustration of our proposed turn-level hindsight self-distillation framework TurnSight for TIR
Figure 2: The illustration of our proposed turn-level hindsight self-distillation framework TurnSight for TIR

实验结果

实验在 FTRL(域内)、BFCL、ToolHop(域外)三基准展开,发现四层。第一,TurnSight 全面领先:Qwen3-8B 上 FTRL avg 46.92、BFCL 多轮 avg 37.56、Agentic 41.58、ToolHop 27.74、总均 42.02,比最强基线 MatchTIR(39.03)高 7.7%,8B 创 SOTA;4B 总均 37.51 vs 34.76。第二,纯结果级 RL 泛化差:GRPO 域内涨但域外弱,说明结果级奖励无法定位该给哪个工具交互信用。第三,单纯套 OPSD 不够:SDPO/RLSD/SDAR 虽胜 GRPO 但都落后于有显式轮次级信心的方法,证明全局特权+token 级蒸馏会给同一轮矛盾信用。第四,最大增益在 BFCL Long Context(45.00 vs 39.50)与 Miss Parameter(42.00 vs 37.00)。消融显示去轮次聚合 43.23、去组归一化 43.65、去多教师 45.62,缺一不可;$\lambda$、$\epsilon_w$ 均在 0.5 最优。

Main results of TurnSight and baseline methods across three benchmarks using two LLM backbones
Table 1: Main results of TurnSight and baseline methods across three benchmarks using two LLM backbones
Ablation study of the core components
Table 2: Ablation study of the core components
Data used for post-training and evaluation
Table 3: Data used for post-training and evaluation
Training, rollout, and method-specific hyperparameters shared across experiments
Table 4: Training, rollout, and method-specific hyperparameters shared across experiments
Effect of hindsight context composition
Figure 3: Effect of hindsight context composition
Comparison of fixed-lookahead teachers, teacher fusion, and our direction-consistent teacher selection
Figure 4: Comparison of fixed-lookahead teachers, teacher fusion, and our direction-consistent teacher selection
Effect of temporal self-distillation coverage
Figure 5: Effect of temporal self-distillation coverage
Sensitivity analysis of performance to hyperparameters
Figure 6: Sensitivity analysis of performance to hyperparameters
查看结构化数据
任务指标本文基线提升
FTRL 域内多轮工具推理 Solve-P / Solve-R / Solve-F1 / Avg Qwen3-8B: 46.99 / 50.71 / 43.07 / 46.92 MatchTIR 40.88/46.64/40.83/42.78;SDAR 35.02/44.23/36.72/38.66;GRPO 35.97/39.78/35.02/36.92 FTRL avg 比 MatchTIR 高 +4.14,比 GRPO 高 +10.00;Solve-P 比 MatchTIR 高 +6.11
BFCL 多轮函数调用(Base/MF/MP/LC) Multi-Turn Avg Qwen3-8B: Base 59.50, MF 51.50, MP 42.00, LC 45.00, avg 37.56 MatchTIR avg 33.78(LC 39.50, MP 37.00);SDAR avg 34.09 多轮 avg 比 MatchTIR 高 +3.78;Long Context +5.50、Miss Parameter +5.00,需跨多轮归因子集增益最大
BFCL 智能体子集(Web Search + Memory) Agentic Avg Qwen3-8B: Search 23.50, Memory 41.58, Agentic avg 41.58 MatchTIR Search 20.00/Memory 40.54/avg 40.54;SDAR avg 41.37 Web Search +3.50,Memory +1.04,整体 +1.04
ToolHop 多跳工具泛化 最终答案准确率 Qwen3-8B: 27.74 MatchTIR 23.87;SDAR 25.38;GRPO 22.15 比 MatchTIR 高 +3.87,比 SDAR 高 +2.36,验证对未见工具/交互结构的迁移能力

局限与改进

作者未设独立局限章节,但文中与可推断的局限有:训练成本高——每个轮次要跑 3 个前瞻深度的教师前向(再乘以 16 条 rollout),8×A800-80GB 仅验证了 4B/8B,更大模型的扩展性与开销未讨论;方法强依赖可确定性回放的工具执行环境来构造 hindsight,对随机或不可逆环境(如真实 Web 搜索、有副作用的 API)的鲁棒性未论证;虽展示 $\lambda=0.5$ 最优,但该值是否随模型规模/任务分布迁移未做敏感性外推;只用 FTRL 一个训练集、三个评测基准,覆盖的工具类型有限;教师用冻结 $\pi_{ref}$ 且训练全程不更新,可能在长训练后与策略分布漂移。我额外观察到:方向一致性采用硬多数投票,在教师间平票或噪声大时可能不稳;缺少“hindsight 何时失效/误导”的失败案例分析;未与最新基于大模型的 outcome-level 方法对比。

独立分析的弱点

独立弱点与改进方向有七点。(1) 教师前向开销大:3 深度×16 rollout 显著增加成本,可改为按需动态选择深度(图4 显示浅深度 LA1 已优于深深度,可只对不确定轮次加深),或用推测解码/共享 KV 缓存复用。(2) 固定深度集 $\{1,2,3\}$ 是经验设定,可改为基于该轮工具调用类型自适应(即时校验类用 $d=1$,需链式验证类用更大 $d$)。(3) 硬多数投票可换为基于教师置信度的软加权或贝叶斯投票,缓解边界不稳。(4) 仅在 4B/8B 验证,缺 70B+ 与推理模型(o1 类)的 scale 实验。(5) hindsight 依赖确定性回放,对随机环境可引入重要性加权修正或执行结果分布建模。(6) 缺失败案例:何时执行成功但方向错误的工具调用会得到与真实因果相反的事后判断,需专门分析。(7) 未与过程奖励模型(PRM)结合对比纯执行 hindsight 与 PRM 信号的互补性。

未来方向

作者展望 TurnSight 可推广到更多智能体场景,因其方法与奖励构造、底座 RL 算法解耦。基于成果可延伸若干方向:把执行条件化 hindsight 思想迁移到代码生成(执行结果即 hindsight)、Web 导航(页面变化即 hindsight)、具身操作(传感器反馈即 hindsight)等“动作会改变环境”的场景;探索动态前瞻深度调度以降本;研究把多教师选择扩展为在线学习各教师权重的元学习;结合过程奖励模型形成混合监督;在更大模型与推理模型上验证 scale law;分析 hindsight 信号随训练进行的分布漂移并提出教师周期性更新策略;把轮次级聚合推广到更一般的“决策单元”定义(如可变长子图),用于非工具型多步推理。

复现评估

复现性较好。代码开源在 https://github.com/quchangle1/TurnSight;训练用 FTRL 数据集(2215 训练实例,公开,bytedance/FTRL);评测用 BFCL(gorilla)、ToolHop(bytedance-research/ToolHub,995 查询)均公开且本地可执行;实现基于开源 verl 框架;Table 4 给出完整超参(query batch 32、每查询 16 rollout、最多 10 轮、lr $1\times10^{-6}$、3 epoch、8×A800-80GB、$\lambda=0.5$、$\epsilon_w=0.5$、$D_H=\{1,2,3\}$、checkpoint 间隔 5 iter)。主要门槛是算力:8×A800-80GB 对多数实验室偏高,且每轮 3 个教师前向带来额外显存/时间开销,4B 尚可、8B 已较重;BFCL Web Search 子集需 Serper API key。整体实验协议统一(同环境、同解码设置),差异可归因于策略,便于复现验证。