多智能体协议蒸馏:连接专有模型与开源模型的分布鸿沟 From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
用结构化JSON协议蒸馏专有模型推理能力,提升开源模型智能体搜索
前置知识
智能体搜索(Agentic Search)
智能体搜索指大语言模型通过交替进行多步推理与外部检索来解决知识密集型任务的多轮交互范式。给定问题 $x$,策略 $\pi_\theta$ 与检索增强环境最多交互 $K$ 轮,每轮生成推理步骤并可选择性地发出检索查询,环境返回相关段落作为观测,直到模型给出最终答案或达到轮数上限。整个轨迹被展平为单一 token 序列 $y=(y_1,...,y_T) \sim \pi_\theta(\cdot|x)$,由最终答案与真实答案的精确匹配(EM)给出稀疏的二值奖励 $R(x,y)\in\{0,1\}$。
本文的研究对象正是智能体搜索的训练优化,理解其多轮交互、稀疏奖励特性才能明白为什么需要更稠密的监督信号。
GRPO(Group Relative Policy Optimization)
GRPO 是一种基于组相对优势的策略优化算法。对每个 prompt $x$ 采样一组 $G$ 个 rollout $\{y^{(i)}\}_{i=1}^G$,根据终端奖励计算优势 $\hat{A}^{(i)}$,再用裁剪代理目标 $J_t^{(i)}=\min(\rho_t^{(i)}\hat{A}^{(i)}, \text{clip}(\rho_t^{(i)},1-\epsilon,1+\epsilon)\hat{A}^{(i)})$ 更新策略,并附加对参考模型 $\pi_{\text{ref}}$ 的逐 token KL 惩罚。它有效驱动探索,但只评估结果是否成功,缺乏优化复杂中间推理步骤所需的细粒度监督。
GRPO 是本文联合训练目标中的稀疏 RL 分量,理解其只看结果、不看过程的局限,才能理解为什么要叠加稠密蒸馏信号。
在线策略自蒸馏(OPSD)与特权信息
在线策略自蒸馏通过从同一当前策略 $\pi_{\theta_k}$ 中获取两个下一 token 分布来提供更稠密的逐 token 监督。学生分支条件于 $s_t=(x,y_{<t})$,教师分支额外条件于特权信息 $p$,即 $s_t^+=(x,p,y_{<t})$,仅在反向传播时限制梯度只流经学生路径,最小化逐 token 反向 KL:$\mathcal{L}_{\text{OPSD}}^{(t)}=\mathbb{D}_{\text{KL}}[\pi_{\theta_k}(\cdot|s_t)\|\pi_{\theta_k}(\cdot|s_t^+)]$。由于两端是同一模型,天然规避了跨词表的词表不匹配问题。
OPSD 是本文框架的稠密蒸馏核心,特权信息的质量直接决定监督上限,本文的关键贡献正是用结构化协议改造特权信息的来源。
从专有模型的知识蒸馏(Distillation from Proprietary Models)
把专有大模型的能力迁移到较小的开源模型是一种主流范式。经典知识蒸馏依赖匹配输出概率分布,但被黑箱 API 不可访问 logit 和异构词表所阻碍;因此现代方法转向文本级模仿,蒸馏专有教师生成的自然语言推理轨迹或思维链。然而直接模仿无约束的教师轨迹会让学生过拟合教师冗长的语言模式和权威语气,导致严重的风格漂移和幻觉加剧。
本文要解决的根本矛盾就是专有教师与开源学生之间的异构分布鸿沟,理解传统蒸馏为何失败,才能理解结构化协议为何有效。
多智能体系统(Multi-Agent System, MAS)
基于大模型的多智能体系统通过多个具有专门角色的智能体协作完成复杂推理与开放式问题求解。在检索增强场景中,多智能体协作可通过并行子查询编排和迭代辩论显著提升多步问题的召回率。其代价是推理时计算开销巨大、延迟严重、API 成本高昂,因此直接在测试时部署协作群体往往不切实际。本文将其用作离线训练时的知识合成器而非推理时组件。
理解多智能体系统的协作价值与部署成本,才能理解本文'离线合成协议、推理零开销'设计的精妙之处。
研究动机
智能体搜索让大模型通过多步推理与检索交替解决知识密集型任务,但现有系统通常用基于可验证奖励的结果强化学习(RLVR)来优化,最终答案正确性只能为长交互轨迹提供极其稀疏的监督。为补充更稠密的引导,研究界引入在线策略蒸馏(OPD),用 token 级分布对齐为中间决策提供指导。然而 OPD 的效果严重依赖高质量教师策略,而最强的教师往往是专有模型,它们拥有出色的动态任务分解、多跳推理和信息综合能力。把专有教师的能力迁移到开源学生面临两大瓶颈:其一,传统 OPD 依赖 token 级 KL 散度对齐,但异构词表的差异和教师 logit 不可访问,使这种数学对齐无从定义;其二,作为退路的自然语言轨迹蒸馏在智能体场景下频繁失效,强迫开源学生模仿专有专家冗长且特异的推理风格会加剧分布鸿沟,引发严重风格漂移和幻觉,却无法迁移底层认知策略。论文还观察到,纯 OPSD 在该配置下会让 Qwen3-1.7B 崩溃到 5.9%、Qwen3-4B 崩溃到 20.9%,长度截断比例从约 5% 飙升到约 74%,说明缺乏外部信息增益的自蒸馏会驱使模型产生病态超长输出。
本文的目标是本文的目标是为智能体搜索构建一个既能利用专有模型强推理能力、又能安全迁移到开源学生模型的训练框架,从而弥合专有与开源之间的分布鸿沟。具体而言,作者希望在完全不访问专有 logit、不做跨词表对齐的前提下,为开源学生提供稠密的中间决策监督,让其在七个知识密集型 QA 基准(NQ、TriviaQA、PopQA、HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle)上稳定超越纯 RL 与现有混合蒸馏方法。同时,该框架应保证推理时零额外开销——专有模型和多智能体系统只在离线合成阶段使用,不增加学生模型上线后的延迟与成本。此外,作者希望框架对教师来源具备可迁移性,即在不重调流水线的前提下可无缝替换 Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro 等不同专有教师,实现成本延迟的灵活权衡。
与已有工作不同的是,现有方法的本质缺口在于缺乏一种中间表示,能把黑箱专有教师的行为转化为稠密监督,又不让学生暴露于教师特有的表层语言形式。传统 logit 匹配在异构词表下数学上未定义;自然语言轨迹模仿又把风格污染当成了推理能力。本文的独特切入点是用一个结构化、风格归一化的 JSON 协议作为'认知内核与语言外壳之间的解耦层':专有模型的多智能体系统先把推理过程离线蒸馏成只含任务类型、推理计划、证据事实、部分发现和答案验证的紧凑协议,剥离掉冗长措辞和格式怪癖;训练时再把协议作为特权信息只喂给学生的一个特权分支,通过同源 token 分布自蒸馏提供稠密信号。这一设计同时绕开了 logit 不可访问和风格漂移两道难关,是过去工作没有触及的切入角度。
核心方法
MAPD 的整体思路是'解耦离线合成与在线对齐'。直觉上,专有教师真正有价值的是解决多跳问题的认知策略而非冗长措辞——把策略从语言外壳抽离就能安全喂给开源学生。技术上分两条线:离线阶段,由专有模型驱动的多智能体系统(MAS)对每个查询做任务分解、证据检索、失败修复,再把探索轨迹转换成风格归一化的结构化 JSON 协议;训练阶段,协议被格式化为特权信息注入学生的特权分支,该分支与学生分支共享同一权重,二者下一 token 分布通过逐 token 反向 KL 对齐作稠密自蒸馏信号,与稀疏 GRPO 强化信号联合优化,总目标 $\mathcal{L}(\theta)=\lambda\cdot\mathcal{L}_{\text{OPSD}}(\theta)+\mathcal{L}_{\text{GRPO}}(\theta)$,最优 $\lambda=0.05$。训练用 Qwen3-1.7B 与 4B、组大小 $n=8$、批大小 128、prompt 4096/response 512、学习率 $1\times10^{-6}$、10% 预热、8 卡 200 步、检索最多 4 轮。
核心创新点是用结构化、风格归一化的 JSON 协议作为专有教师与开源学生之间的中间表示,并通过'特权分支 + 同源自蒸馏'把它变成稠密监督。与已有方法的本质区别有三:第一,不同于依赖教师 logit 的传统蒸馏,MAPD 的两个分布来自同一学生策略,天然规避异构词表和 logit 不可访问问题;第二,不同于让学生模仿原始自然语言轨迹的方法,结构化协议只保留任务类型、推理计划、抽取式证据事实等五个维度,剥离了教师的冗长措辞和格式怪癖,从源头消除风格漂移;第三,不同于把多智能体系统放在推理时的做法,MAS 只在离线协议合成中使用,推理时学生是单模型,零额外开销。这套'离线 MAS 合成结构化协议 → 在线同源特权分支自蒸馏'的组合,把传统蒸馏中纠缠在一起的'语义策略'与'语言风格'彻底解耦,是本文区别于 GRPO+OPSD、SDAR 等方法的关键。
方法步骤详情
方法分三阶段 MAS 流水线加联合训练。阶段 A 协作搜索:Orchestrator 把问题分解成带依赖标注的子任务并行分派给独立 Searcher,每个 Searcher 向本地 wiki-18 语料最多发 3 条查询并把段落压成简短发现;证据不足再加轮(最多 $M=2$ 轮、每查询最多 4 子问题)。初探后做精确匹配,失败则由 Repair 用真实答案(从不进入日志与查询)诊断是表达还是搜索问题并触发再分解(最多 $R=2$ 轮)。阶段 B 协议生成:Protocolizer 依成功标签把日志编译成两种 JSON 变体——成功协议含已验证答案,失败协议省略答案改用部分发现的中立摘要;强制无后见(plan 禁提最终结果)与抽取式接地(事实须为段落逐字子串)。阶段 C 质量门:须过 schema、EM 一致、接地验证、泄漏检测四项自动检查,任一不过即丢弃回退自 rollout,3000 实例抽检 99.33% 准确。训练时把协议经模板 $f(\cdot)$ 格式化为 $p=f(z)$ 注入特权分支,默认教师 Claude-Opus-4.6。
技术新颖性
技术新颖性体现在三个层面。表示层面,引入'结构化 JSON 协议'这一全新中间表示,把任务类型、推理计划、抽取式事实、部分发现、答案验证五个维度固化下来,首次实现了认知策略与专有模型表层语言模式的风格归一化解耦,并要求事实严格抽取式接地以抑制参数化幻觉。流水线层面,构建了带专门角色(Orchestrator/Searcher/Repair/Protocolizer)和严格自动检查的稳健 MAS,用 Repair 智能体回溯诊断失败链路、用质量门四重检查保证协议合规,25,600 个实例产出 25,584 个有效协议(99.94% 产出率)。训练层面,首次把外部生成的协议作为特权信息嵌入 OPSD 的同源特权分支,发现简单 token 级 KL 目标在足够干净、风格解耦的协议下即可媲美带门控的 SDAR,说明蒸馏瓶颈在特权信息质量而非训练机制,这一洞见刷新了该领域的认知。
实验结果
核心发现见表 1-3 与图 3-4。主结果(表 1):MAPD 全面领先,Qwen3-1.7B 平均 39.4%、4B 为 44.4%,分别比最强基线 SDAR 相对提升 4.8%、3.3%;多跳提升更显著,1.7B 多跳平均相对增益 7.9%(远超单跳 2.3%),4B 为 5.1% 对 1.8%,Bamboogle 从 32.0 升到 36.8(相对 +15.0%)。消融(表 2)证明三组件缺一不可:直接蒸馏原始轨迹反而比不用专有模型的 GRPO+OPSD 还差(30.1 vs 30.5),印证漂移;单代理协议 37.1 优于原始轨迹但不及 SDAR,三者俱全才达 39.4。教师可迁移性(表 3、图 4):三教师方差约 2 点(39.4/44.4、39.0/44.6、37.9/44.0)。权重敏感性(图 3):$\lambda=0.05$ 最优,$\lambda=0.1$ 过度正则使 4B 响应从 135 token 塌缩到约 42、退化成'只检索不推理',多跳骤降(2Wiki 从 45.7 到 38.4)。成本:每实例约 6.3 次调用、$0.057,整训练集约 $1,454。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 七基准平均成功率(Qwen3-1.7B) | Success Rate (%) | 39.4 | SDAR 37.6 | 相对 +4.8% |
| 七基准平均成功率(Qwen3-4B) | Success Rate (%) | 44.4 | SDAR 43.0 | 相对 +3.3% |
| 多跳 QA 平均(Qwen3-1.7B:HotpotQA/2Wiki/MuSiQue/Bamboogle) | Success Rate (%) | 多跳平均相对增益 7.9% | SDAR | 远超单跳的 2.3% |
| Bamboogle(Qwen3-1.7B) | Success Rate (%) | 36.8 | SDAR 32.0 | 相对 +15.0%(最大单点增益) |
| 组件消融:完整 MAPD vs 仅结构化协议单代理(Qwen3-1.7B) | Avg Success Rate (%) | 39.4(完整) | 37.1(无 MAS) | MAS 贡献 +2.3 个点 |
局限与改进
作者承认的局限主要有:训练仅使用 NQ 与 HotpotQA 的训练集,泛化范围受限于问答式知识密集任务,能否推广到代码生成、数学推理、工具调用等其他智能体场景未验证;协议合成依赖专有 API(默认 Claude-Opus-4.6),虽离线一次性但仍有约 $1,454 成本且受 API 政策制约;最优超参 $\lambda_{\text{OPSD}}=0.05$ 与 MAS 参数(4 子问题/2 轮/2 修复轮)是在特定配置下调出来的,换学生规模或换教师时是否仍是最优缺乏系统论证。我自己观察到的局限:第一,实验只在 Qwen3-1.7B 与 4B 两个较小模型上做,未验证 7B/14B 等更大规模下的规律是否一致,'协议蒸馏'对已具备较强推理的大模型边际收益可能缩水;第二,纯 OPSD 在该配置下灾难性崩溃(5.9%/20.9%)这一现象的根因(是 OPSD 本身脆弱还是该特定配置导致)未被单独剖析;第三,评估仅用精确匹配单一指标,对答案格式敏感、无法奖励语义近似正确;第四,与 SDAR 的对比虽详尽,但未提供训练算力与收敛步数的对齐比较,相对提升的成本效率不清晰。
独立分析的弱点
独立分析有四大弱点。其一,强依赖专有 API 教师带来成本与可复现性风险——尽管离线一次性合成,但 $1,454 的教师调用成本与 Claude-Opus-4.6/GPT-5.5/Gemini-3.1-Pro 的定价波动、API 变更会直接影响复现;改进方向是探索用强开源模型(如 Qwen3-235B、DeepSeek)作为'开源教师'驱动同一 MAS,验证协议抽象能否让弱教师逼近专有效果。其二,五字段协议的表达力有限,固定 schema 可能无法刻画开放式或创造性任务(如数学证明、长文写作)的策略;改进方向是把协议扩展为可学习的层级化结构,或引入非问答任务的协议模板族。其三,评估指标单一(仅 EM)且仅在英文 QA 基准上测试,改进方向是引入语义匹配指标与多语言、多任务基准,并报告 token 成本与延迟以体现推理零开销的实际收益。其四,质量门依赖严格抽取式子串匹配,可能丢弃虽非逐字但语义正确的证据,导致有效协议损失;改进方向是用语义等价性检查替代或补充子串匹配,并报告丢弃实例的特征分布以评估潜在偏差。
未来方向
作者明确提出的方向是延续 MAPD 的'结构化解耦'思想,激励社区摆脱对专有模型的依赖,走向完全自治、自我改进的智能体框架——暗示未来可让开源学生自我合成协议实现自举式提升。基于成果可延伸的方向包括:第一,把 MAS 协议合成从离线缓存扩展到在线自适应,让协议随学生能力动态调整难度与策略;第二,将结构化协议思想迁移到非搜索智能体(代码、数学、工具使用),设计对应任务类型的协议维度;第三,研究跨教师协议融合,即同时用多个专有教师合成互补协议以进一步提升特权信息质量;第四,把协议作为可解释产物,用于事后审计学生推理是否符合证据接地、是否泄漏,服务于对齐与安全;第五,结合参数高效蒸馏(如 LoRA)探索协议蒸馏与轻量适配器的协同,降低多教师/多任务部署成本。
复现评估
复现评估总体较好。代码已开源于 https://github.com/AaronLiu0702/MAPD,是重要加分项;论文详尽披露训练超参(Qwen3-1.7B/4B、组大小 8、批大小 128、prompt 4096/response 512、学习率 $1\times10^{-6}$、200 步、8 GPU)、MAS 配置(Orchestrator 4 子问题/2 轮、Searcher 3 查询、Repair 2 轮)、检索环境(wiki-18、top-3 段落、4 轮)与成本(25,600 实例、99.94% 产出率、$0.057/实例)。主要障碍有三:一是协议合成强依赖三个专有 API(Claude-Opus-4.6/GPT-5.5/Gemini-3.1-Pro),他人难逐字节复现且 API 版本会漂移;二是训练需 8 卡 GPU 跑 200 步 GRPO+OPSD,算力有一定门槛;三是 quality gate 99.33% 人工抽检依赖 3000 实例标注,复现者难完全对齐。综合看方法层面可复现,数据/教师层面需替代或近似。
论文图表
该图展示了把专有教师蒸馏到开源学生面临的两大瓶颈:左侧是异构词表与不可访问的 logit 阻断了直接的对齐;右侧是自由形式的自然语言轨迹模仿会引发风格漂移与幻觉。通过对比两种失败路径,直观说明了为什么需要一种中间表示。
这张图是理解论文动机的钥匙,把全文要解决的两个核心难题用视觉方式一次性讲清楚,为后续引出结构化协议做了完美铺垫。