← 返回 2026-08-31

DART-SD:菱形拓扑感知的多轮工具调用智能体自蒸馏检索与调优 DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song 📅 2026-08-19 👍 88 2026-09-01 18:30
LLM智能体 后训练 图结构建模 多轮工具调用 自蒸馏

把执行轨迹建成状态图,定位首个偏离断点,仅对恢复段做局部监督的自蒸馏框架

前置知识

行为克隆(BC)与全轨迹 SFT

把教师模型的完整交互轨迹(每步工具调用与回复)拼成序列,用标准监督微调让学生逐 token 模仿。损失均匀作用在所有 token 上,等价于对整条轨迹施加无差别的全局约束,是当前智能体蒸馏最常用的基线范式。

本文的核心批判对象就是这种全局 forcing 范式,理解它的失效方式才能明白作者为何转向局部监督。

GRPO 与信用分配

GRPO(组相对策略优化)对同一任务采样一组轨迹,用组内相对优势做策略梯度。当奖励只在任务终点给出时,优势被均匀摊到所有中间动作上,失败轨迹中本来正确的步骤也会被连带惩罚,这就是信用错配问题。

论文把 GRPO 的信用错配与 SFT 的全局覆盖并列为两大痛点,DART-SD 的断点定位本质上是精确到步骤的信用分配方案。

自蒸馏与在策略蒸馏

自蒸馏指学生模型自己生成轨迹,再把修正知识蒸馏回学生参数并循环迭代。在策略版本(如 OPSD)由当前学生策略动态 rollout 再蒸馏,可缓解离线数据与模型当前分布的偏移;HINT-SD 则用事后脚手架做针对性修正。

DART-SD 的训练循环就是渐进式自蒸馏,只是把「蒸馏哪一段」的决定权从启发式换成了图拓扑。

图的可达性与投影

有向图中若存在从节点 u 到节点 v 的路径,则称 v 从 u 可达。投影指把一个空间中的点映射到另一空间中最接近的合法对象。本文把学生状态投影到教师图的成功可达区域,投影失败即意味着学生走出了教师支撑的解空间。

临界拓扑断点(CTB)的定义完全建立在投影是否成功之上,是理解方法如何判定错误的数学前提。

菱形拓扑(Diamond Lattice)

当任务包含多个顺序无关的子目标时(如可并行执行的独立子问题),不同合法路径会在相同信息状态处分叉后又汇合,解空间呈菱形网格结构。把这种结构压扁成单条线性轨迹会无差别惩罚等价的替代探索,即拓扑坍缩。

这是论文最核心的概念,ISTG 的设计目标就是显式保留菱形结构而非压扁它。

研究动机

当前智能体蒸馏的主流做法是对教师完整轨迹做行为克隆式 SFT。但多轮工具调用任务常包含顺序无关的子目标——例如 FTRL 数据集中可并行的独立子问题(Para-Single、Para-Multi 类任务),其最优解空间本是一个巨大的组合菱形格。把这种拓扑压扁成单条线性轨迹会引发「拓扑坍缩」:全局损失无差别覆盖学生的有效探索步骤,模型只能死记冗余轨迹而非提取逻辑主干。另一条路是标准 RL:GRPO 等方法把终点稀疏奖励均匀摊到每个中间工具调用上,失败轨迹中正确的步骤也被连带惩罚,产生信用错配;更细粒度的 MatchTIR 用二部匹配给轮级奖励,但仍把交互当刚性线性序列。实验佐证:Qwen3-4B 基座在 FTRL 上 Solve-F1 仅 21.81,SFT 后升至 37.96,但 BFCL 多轮分只有 14.57,全局模仿范式在跨域泛化与多样性保持上明显吃力。

本文的目标是本文目标是把多轮工具调用智能体的训练范式从「全局强制」转为「拓扑引导的局部修正」。具体包括四点:(1) 设计能忠实保留菱形拓扑的执行表示,使顺序无关的等价路径在图中自然汇合,成功与失败的探索都被保留;(2) 当学生自主 rollout 失败时,精确定位它第一次离开教师支持的成功可达区域的临界拓扑断点(CTB),并从图中检索成功支撑的恢复参考;(3) 只对断点后的恢复步骤计算训练损失,严格保护已掌握的有效前缀不被破坏性梯度更新污染;(4) 通过多轮渐进自蒸馏让断点不断后移、能力边界持续扩张,最终在五个基准、两种规模(Qwen3-4B/8B)上稳定超越 SFT 与 RL 基线,同时减少冗余工具调用、保留通用能力。

与已有工作不同的是,已有改进要么仍在轨迹层面打转,要么依赖复杂匹配。HINT-SD 等事后脚手架方法依旧把多轮交互当严格线性序列,无法区分致命错误与无害探索;OPSD 解决了离线分布偏移却没回答「蒸馏哪一段」;MatchTIR 的二部匹配发生在动作序列之间,忽略状态拓扑。本文的独特切入点是把表示单元从「动作」换成「累积交互状态」$X_t=(I_t, U_t)$——已获信息原子集合加上无用操作计数。只要获得的信息相同,表面形式、调用工具、执行顺序不同的路径都收敛到同一个主节点,菱形结构自动涌现。据此做类型化投影,把学生每一步映射到教师图上,「第一个投不进去的状态」就是需要修正的断点——这比用 LLM 裁判找错误更客观、可复算,也第一次把训练瓶颈形式化为可操作的图问题。

核心方法

直觉上,一条失败的 rollout 往往只有一步走错,前面的探索可能完全有效。DART-SD 先从教师混合池(Qwen3.6-27B 与 GLM-5.2)的所有成功与失败轨迹中构建交互状态转移图 ISTG,再让学生自主 rollout(每任务 8 条、温度 0.7、最多 9 轮交互、生成长度上限 4096 token),把学生状态逐一投影到按预算过滤的成功可达区域 $\mathcal{R}_x^+$ 上,第一个投影失败的状态即临界拓扑断点 CTB。随后以保留的学生前缀加特权教师参考(2 条成功 + 1 条失败轨迹及其教师分析)喂给增强生成器 AugGen,产出断点后的恢复续写,损失掩码 $m_i$ 只对恢复段的助手 token 置 1。整个「rollout→定位 CTB→恢复采样→局部 SFT」循环在 FTRL 全部 2,215 个任务上重复 5 轮,学习率 $5\times10^{-7}$、batch 32。失败轨迹的 CTB 位置从第 1 轮的 0.348 逐轮后移至第 5 轮的 1.452,说明能力边界在持续扩张。

核心创新有两点。其一是信息原子的累积状态表示:工具响应先经确定性规范化剔除纯状态信号,再由语义阶段在任务内联合判定原子映射 $\alpha_x: (t_l(e), \bar{o}(e)) \mapsto \alpha_x(e)$——同一事实无论由哪个工具、何种格式返回都对应同一原子,非信息响应统一映射为 $\emptyset$。状态 $X_t=(I_t, U_t)$ 由此天然消解顺序依赖,菱形拓扑在图中显式存在,这是对「轨迹必须线性」这一隐含假设的根本否定。其二是 CTB 引导的局部监督:$t_C = \min\{t : \rho_{t-1}=1, \rho_t=0\}$,损失 $\mathcal{L}_{DART} = -\sum_{i=1}^{L} m_i \log p_\theta(e_i^y \mid e_{<i}^y, x)$ 只覆盖断点后、最终答案之前的助手 token。与 GRPO 把奖励摊满全轨迹、SFT 全局覆盖相比,梯度被精确限制在「学生尚不会、教师有支撑」的恢复段上,有效前缀零梯度。

方法步骤详情

第一步,信息原子抽取:确定性阶段规范化工具响应,仅当所有字段都是状态信号或占位值才判为非信息;语义阶段结合任务与一条成功 rollout 联合判定,得 $\Delta I_t$ 并更新 $I_t = I_{t-1} \cup \Delta I_t$。第二步,构建 ISTG:教师 rollout 共享根节点,$\Delta I_t \ne \emptyset$ 生成主节点、否则记辅助节点,保留并行边与成功/失败终点。第三步,定义成功可达区域:预算 $B_x = \min(d_x^{\min} + \Delta_x, B_x^{\max})$,到成功终点剩余步数不超过 $B_x$ 的节点入 $\mathcal{R}_x^+$。第四步,类型化投影:主节点要求 $I(v) \subseteq I_t^s$,辅助节点还要求无用操作计数相等,得 $\rho_t$、断点 $t_C$ 与锚点 $a_C$。第五步,恢复采样:AugGen 以任务、学生前缀和 2 正 1 负教师参考生成恢复续写 $c^*_{t_C}$。第六步,掩码 SFT 单 epoch,重复 5 轮渐进蒸馏。

技术新颖性

技术新颖性体现在四处。第一,首次把智能体训练的性能瓶颈形式化为「拓扑坍缩」,并给出可操作的图表示 ISTG 加以保留;与 MatchTIR 在动作层做二部匹配有本质区别——匹配单元是累积信息状态而非具体调用。第二,CTB 判定是确定性的图投影而非 LLM 裁判打分,可复算、可增量维护;消融显示把 LLM 裁判检测换成 ISTG 投影使 FTRL Solve-F1 从 43.93 升至 45.66。第三,损失掩码按响应步骤定义且严格排除最终答案步,避免「连答案都被改写」的过拟合风险,是对 SFT/OPSD 类全局损失的直接改进。第四,渐进自蒸馏形成自定步进课程:学生变强后投影可维持的前缀越来越长,监督焦点自动滑向当前能力边界之外,无需人工课程设计。学生最终在 FTRL、ToolHop、τ-bench 三项反超教师(如 FTRL 45.7 对教师 45.0),说明学到的是可复用结构而非轨迹记忆。

Overview of DART-SD
Figure 2: Overview of DART-SD

实验结果

主实验(Table 1):Qwen3-8B 于 FTRL 取 Solve-F1 45.66(SFT 41.89、FTRL-GRPO 40.22、基座 23.48),ToolHop AC 45.03,τ-bench Pass^1 27.12,RoTBench 平均 45.58(PI 57.38 远超 SFT 的 48.81),BFCL 多轮 27.63(基座 18.38;FTRL-GRPO 35.25 为唯一更高者);Qwen3-4B 上 BFCL 从 14.57 跃至 23.88(+9.31)。Figure 3 显示 8B 学生在 FTRL、ToolHop、τ-bench 反超教师(45.7/45.0、45.0/44.7、27.1/25.4)。平均工具调用数从 4.23 降至 3.55,短于 golden 参考 4.02;CTB 位置从 0.348 后移至 1.452。思考模式下三项最优(41.03/49.75/46.43);通用能力从 43.92 升至 49.89。消融:+SD 38.10 → +CTB 39.51 → +渐进 43.93 → +ISTG 45.66。

Performance comparison of different training methods on five tool-use benchmarks using Qwen3-4B and Qwen3-8B backbones.
Table 1: Performance comparison of different training methods on five tool-use benchmarks using Qwen3-4B and Qwen3-8B backbones.
Average tool-call length of successful trajectories across progressive SFT iterations on the FTRL test set.
Table 2: Average tool-call length of successful trajectories across progressive SFT iterations on the FTRL test set.
Average CTB positions of failed training trajectories across progressive SFT.
Table 3: Average CTB positions of failed training trajectories across progressive SFT.
Performance comparison under the thinking setting.
Table 4: Performance comparison under the thinking setting.
General capability evaluation on representative benchmarks.
Table 5: General capability evaluation on representative benchmarks.
Component ablation of DART-SD on the FTRL test set using Solve-P, Solve-R, and Solve-F1.
Table 6: Component ablation of DART-SD on the FTRL test set using Solve-P, Solve-R, and Solve-F1.
Performance comparison of Qwen3-8B, DART-SD, and the teacher across five tool-use benchmarks.
Figure 3: Performance comparison of Qwen3-8B, DART-SD, and the teacher across five tool-use benchmarks.
查看结构化数据
任务指标本文基线提升
FTRL 域内测试(Qwen3-8B) Solve-F1 45.66 SFT 41.89(最强基线);FTRL-GRPO 40.22;Base 23.48 +3.77(vs SFT),较基座 +22.18
FTRL 域内测试(Qwen3-4B) Solve-F1 39.77 SFT 37.96;FTRL-GRPO 37.84;Base 21.81 +1.81(vs SFT)
BFCL 多轮(Qwen3-4B) Multi-Turn 平均分 23.88 SFT 14.57;FTRL-GRPO 13.50;Base 10.14 +9.31(vs SFT),所有方法中最高
BFCL 多轮(Qwen3-8B) Multi-Turn 平均分 27.63 SFT 19.25;FTRL-GRPO 35.25 +9.25(vs 基座),但落后 FTRL-GRPO 7.62 分,属少数未夺魁指标
ToolHop(Qwen3-8B) Answer Correctness (AC) 45.03 ToolRL 44.72;SFT 43.52;Base 28.54 +0.31(vs ToolRL),8B 与 4B 上均为最优
τ-bench(Qwen3-8B) Pass^1 27.12 SFT 26.06;MatchTIR (KM) 26.06;Base 10.13 +1.06(vs SFT),较基座 +16.99
RoTBench(Qwen3-8B) 平均分(TS/PI/CF) 45.58(PI 57.38) SFT 41.64;FTRL-GRPO 40.33;Base 29.60 +3.94(vs SFT),参数识别 PI 提升 8.57
通用能力(IFEval/AIME24/AIME25/MMLU,Qwen3-8B) 四基准平均 49.89 Qwen3-8B 基座 43.92;标准 SFT 44.18 +5.97(vs 基座),IFEval 从 34.75 升至 45.29

局限与改进

作者承认的局限包括:信息原子判定若出错主要导致漏掉原子而非虚构状态,图会偏稀疏但仍可靠;预算超参 $\Delta_x$ 与 $B_x^{\max}$ 需按任务调节;主实验限定 no-thinking 配置,思考模式只补充验证了三项基准。我的观察:(1) 整个方法依赖教师混合池(Qwen3.6-27B、GLM-5.2)的 rollout 质量,若教师区域本身缺失正确路径,CTB 会把学生的原创正确探索误判为断点;(2) 训练开销大——2,215 个任务 × 8 条 rollout × 5 轮迭代,外加教师轨迹收集与 AugGen 调用,成本远高于一次性 SFT;(3) 辅助节点锚定要求无用操作计数 $|U(v)| = |U_t^s|$ 精确相等,容差为零,可能产生虚假断点;(4) 评测集中在工具调用域,向代码、网页等异构智能体场景的迁移未验证;(5) BFCL 8B 上落后 FTRL-GRPO 7.62 分,说明局部 SFT 并非在所有基准都占优。

独立分析的弱点

弱点一:成功可达区域完全由教师轨迹经验定义,学生超出教师视野的新颖解法都会被记为不可投影并遭受修正梯度,能力上限被教师先验锁住;改进方向是把学生自己的成功轨迹增量并入 ISTG,让可达区域随训练自我扩张。弱点二:辅助投影对计数过于敏感,一次额外的无害重试即触发 $\rho_t=0$ 造成虚假断点;可改为容忍窗口或比例匹配。弱点三:语义原子判定依赖任务内联合 LLM 判断,在工具返回大量噪声或原子数量很大时,判定开销与一致性都存疑;可用嵌入检索预筛加结果缓存缓解。弱点四:恢复参考的「2 正 1 负」组合是启发式设定,论文未消融参考数量、负例配比与教师分析质量的影响,值得系统扫参。弱点五:五轮迭代后 CTB 位置仍在上升(1.452)且未报告收敛点,更长时间的收益曲线与何时停止的准则缺失。

未来方向

作者在结论中呼吁:有效的智能体蒸馏应由交互状态拓扑而非刚性轨迹模仿引导,并期待图表示用于长程推理与决策。可延伸的方向:(1) 把 CTB 转化为轮级奖励信号与 GRPO 类 RL 联合训练,兼得局部监督的稳定性与 RL 的探索性;(2) 在线更新 ISTG——学生已在三个基准反超教师,说明图中尚有未挖掘的结构,可让学生成功路径反哺教师图;(3) 跨任务共享信息原子与拓扑模式,实现小样本任务的快速蒸馏;(4) 将 ISTG+CTB 迁移到网页导航、代码修复等状态空间更复杂的场景,并探索多模态观测的原子化;(5) 预算 $B_x$ 的自适应调度,按任务难度与训练进度动态调整 $\Delta_x$,替代固定设定;(6) 引入过程奖励模型对恢复段候选做更细粒度的质量过滤,降低增强生成器的采样噪声。

复现评估

复现评估:论文未提及代码或数据开源(正文与摘要均无仓库链接),这是最大障碍。可获得的组件:FTRL 训练集来自先前工作 FTRL-GRPO(2,215 个任务、含可验证反馈),评测基准 BFCL、ToolHop、τ-bench、RoTBench 均有公开协议,学生基座 Qwen3-4B/8B 开源。难点在教师:Qwen3.6-27B 与 GLM-5.2 混合池不一定可得,需替换为同量级开源教师并重调预算超参。算力方面:8B 模型、batch 32、学习率 $5\times10^{-7}$、每轮 2,215×8 条 rollout 加 5 个 epoch 的局部 SFT,属中等规模多卡任务,远低于全参数 RL。工程难度中高:需自研信息原子联合判定、ISTG 构建与维护、类型化投影、恢复采样四条流水线,其中原子判定的 prompt 设计与增强生成器的具体实现未公开细节。综合评估:有经验团队复现约需 2-4 周,且部分指标(如 BFCL 上与 GRPO 的差距)可能因教师选择而波动。