← 返回 2026-07-27

多头潜控:大模型智能体决策的统一接口 Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu 📅 2026-07-15 👍 10 2026-08-01 18:30
工具调用 智能体决策 模型路由 自我感知 轻量适配 隐状态控制

给冻结大模型挂两个轻量头,从隐状态读出能力判断与干预决策,大幅降低调用强模型的成本。

前置知识

隐状态(hidden state / latent state)

Transformer 每一层在生成每个 token 时都会产生一个向量 $h_t^{(\ell)} \in \mathbb{R}^d$,编码该位置的中间推理表征。一篇完整回答对应一条长度为 $N$ 的轨迹 $H^{(\ell)} \in \mathbb{R}^{N \times d}$。本文核心洞察是:这条轨迹比模型最终输出的文字蕴含更丰富的信息,甚至能暴露模型自己'答错'这件事本身。

本文整个方法建立在'从隐状态轨迹读出控制信号'之上,不理解它就无法理解为什么两个头分别读最后一层和中间层,也无法理解冻结骨干为何能获得新决策能力。

模型路由(model routing / cascade)

在强弱模型间分配查询以平衡质量与成本。传统方法如 FrugalGPT、RouteLLM、RouterDC 基于输入侧信号(prompt 特征、任务类别)做粗粒度路由;级联让弱模型先答、不确定时升级到强模型。本文关键区别是:判断发生在生成之后、基于模型自身隐状态,而非生成之前基于输入。

理解传统路由仅看输入、不评估实例级能力的局限,是理解本文动机与 Capability Head 价值的前提。

冻结骨干 + 轻量头(frozen backbone + lightweight heads)

保持预训练大模型参数完全不变(frozen),只在它之上训练少量额外参数(head)。本文的两个头很小,训练仅需 16GB 显存、单卡一天内完成。优势是新一代骨干(如 Qwen3.5、Gemma)发布时,无需重微调整个模型,只需快速重训小头即可复用控制能力。

这是本文'可快速迁移到新模型'这一核心卖点的技术根基,也是区别于任务级微调(如 When2Call-SFT)的关键。

工具调用与干预决策(tool use / intervention)

智能体需在推理中决定是否调用外部工具(搜索、API)、是否请求澄清信息、是否在当前设定下弃答(abstain),或直接作答。When2Call、Toolformer、Gorilla 等通过训练骨干本身改善工具调用;本文则用一个小头从隐状态推断'该不该干预、干预什么',不修改骨干,动作空间为 $\mathcal{A}=\{\text{info}, \text{tool}, \text{cant}\}$,直接作答由全零隐式表示。

Resolution Head 的本职正是干预决策,理解这套动作空间与全零隐式直接作答的设计,是理解方法与 TriviaQA/When2Call 实验的前提。

研究动机

大模型越来越多地被当作智能体部署,但可靠的智能体行为需要的远不止 next-token 预测——它还得在推理时做出一连串'元决策':当前推理要不要继续、是否该升级到更强的模型 $m_2$、是否补充信息、是否调用外部工具、或当前设定下根本无解应弃答。现有方案各有硬伤:基于 prompt 特征或任务类别的路由(FrugalGPT、RouteLLM、RouterDC、级联)只看输入侧信号,做粗粒度路由,无法判断'这个具体实例、这个模型到底够不够格';多智能体协作(MetaGPT、多智能体辩论)依赖重脚手架或端到端训练;而为每个新骨干专门微调来扮演协作者/编排者,根本赶不上基础模型每几个月迭代一次的速度。更现实的是,作者观察到商业前沿智能体(如 Anthropic 的 Claude agents)即便处理简单任务 token 消耗仍很高,说明靠让模型'自我感知'来降本有巨大空间。

本文的目标是本文要解决的问题是:能否不修改、不微调骨干,就让一个冻结的 LLM/VLM 暴露出实用的部署期控制接口,从中直接读出两类决策?一是实例级的模型能力判断(够不够强,要不要把控制权交给更强的 $m_2$);二是动作级的干预决策(留在当前模型时,该请求澄清、调工具、弃答,还是直接作答)。目标是既要显著改善质量-成本权衡(减少强模型调用),又要足够轻量、可事后快速挂载到任何新骨干,从而跟上基础模型的演进节奏。作者希望证明:模型自己的隐状态轨迹是可扩展的基底,足以支撑这种统一的轻量控制接口。

与已有工作不同的是,本文的独特切入角度是把'部署期决策'重新形式化为隐状态轨迹上的潜决策问题,与已有工作正交且互补。它不是单纯路由(只做输入侧分配,不评估实例级能力,也不管工具调用);不是单纯工具调用训练(要改骨干本身);不是推测解码(只加速已被调用的大模型推理,不减少调用次数);也不是标量自验证(更窄)。最关键的区别有二:第一,控制信号来自模型自己的生成过程(生成后的隐状态轨迹),而非输入侧 prompt 特征;第二,即便模型表面的最终答案或所选动作是错的,隐状态轨迹仍可能编码正确的控制信息,于是小头能'纠错式'地恢复正确决策。这种统一接口同时管辖转交、澄清、工具调用、弃答、直接作答五种行为,是已有任何单一方向都做不到的。

核心方法

直觉是:模型生成时每一层在每个 token 上都留下隐状态向量,这条轨迹比最终文字'更像模型的内心独白'——它不仅含答案,还透露模型对自己能否解出此题的信心、以及下一步该干预什么。据此作者提出 Multi-Head Latent Control:在冻结骨干上挂两个轻量头。Capability Head 读最后一层轨迹 $H_{cap}=H^{(L)}$,输出标量能力分 $p_{cap}\in[0,1]$ 判断当前模型是否足够;Resolution Head 读一个选定中间层轨迹 $H_{res}=H^{(\ell_{res})}$,输出动作分 $s_{res}=[s_{info},s_{tool},s_{cant}]$ 判断该不该请求信息/调工具/弃答。变长轨迹先投影成固定预算表示 $\tilde{H}_{cap}=\Pi_{cap}(H_{cap})$、$\tilde{H}_{res}=\Pi_{res}(H_{res})$。两个头用与 Gnosis [12] 相同的编码器架构,骨干完全冻结只训头。推理时先查 Capability Head:仅当 $p_{cap}<\tau_{cap}$(默认 0.8)才转交 $m_2$;否则留在 $m_1$ 查 Resolution Head,仅当最大动作分超过 $\tau_{res}$(默认 0.5)才执行对应干预,否则直接作答(由全零状态隐式表示)。

核心创新在于把部署期控制分解为两个互补、且在不同深度最可分的决策。作者注意到能力判断(我行不行)在最后一层信号最强,而干预判断(该怎么补救)在中间层最强,于是让两个头各读各的层、各受各的监督。第二个关键创新是'纠错式恢复':训练标签来自隐状态轨迹而非模型表面行为——即使模型最终答错或选错动作,其隐状态仍编码了'正确答案/正确该不该调工具',于是小头能从潜轨迹恢复正确控制信号,这在 WHEN2CALL 实验中被直接证实。第三是统一接口:同一个潜生成过程同时支撑转交、澄清、工具调用、弃答、直接作答五种行为,而非像以往那样每件事单独训一个系统。这与依赖输入侧信号的传统路由、依赖重训练的多智能体编排形成本质区别。

方法步骤详情

完整流程分四步。第一步数据生成:用冻结骨干对训练集每条样本生成回答,并收集对齐到生成 token 的多层隐状态轨迹(仅生成 token,排除 prompt,以保证纯文本与视觉语言设定统一)。第二步构造标签:Capability Head 标签是 LLM judge(Qwen3vl-30B-A3B)给的标量能力分 $y_{cap}\in[0,1]$(对比输出与参考答案),用标量而非二元正确性因部分正确回答能提供更丰富信号;Resolution Head 标签来自 WHEN2CALL 四类正确行为,映射成 $\{0,1\}^3$ 动作向量,直接作答由全零隐式表示。第三步训练:Adam、学习率 $1\times10^{-4}$,Capability Head 优化加权 MSE $\mathcal{L}_{cap}=\frac{1}{M_{cap}}\sum w_i\,\ell_{reg}(p_{cap}^{(i)}, y_{cap}^{(i)})$($w_i$ 补偿样本不平衡),Resolution Head 优化 BCE $\mathcal{L}_{res}=\frac{1}{M_{res}}\sum\sum \ell_{BCE}(s_a^{(i)}, y_{res,a}^{(i)})$;骨干与编码器均冻结以隔离控制公式本身的贡献。9B 规模下数据生成+训练单卡一天完成,头训练 16GB 显存即可。第四步推理:先跑骨干生成,算 $p_{cap}=\sigma(h_{cap}(z_{cap}))$,若 $p_{cap}<\tau_{cap}$ 转交 $m_2$;否则算 $s_{res}$,若 $\max_a s_{res,a}>\tau_{res}$ 执行 $a^*=\arg\max_a s_{res,a}$,否则直接作答。

技术新颖性

技术新颖性体现在四层。其一,形式化:首次把部署期决策建模为隐状态轨迹上的潜控制问题,给出 capability–resolution 二级分解,统一管辖转交与干预且不碰骨干。其二,分层监督:两头读不同层(最终层 vs 中间层),附录 C.1/C.2 的 ablation 证明这种分层经验最优,是'不同决策在不同深度最可分'的实证支撑。其三,纠错式恢复:标签来自潜轨迹而非表面行为,使小头能纠正模型自身的错误动作,区别于'让骨干学会更好用工具'的传统路线。其四,迁移性设计:Capability Head 在刻意异构的混合数据(多模态 QA、视觉理解、grounding、长推理、开放域 QA、API、agentic 设定)上训练,学跨领域/任务/模态的广适能力信号;附录 C.3 证明仅在视觉数学上窄训会导致 ScreenSpot-Pro 迁移明显变差。直接作答由全零状态隐式表示的设计让 Resolution Head 只在确实需要干预时激活。作者明确把方法定位为与推测解码正交、可叠加:推测解码减每次调用代价,本文减调用次数。

Multi-head latent control as an intrinsic control interface for frozen foundation models.
Figure 1: Multi-head latent control as an intrinsic control interface for frozen foundation models.

实验结果

实验从两条互补维度展开。多模型协作(Table 1, AndroidWorld 长程智能体):Qwen3-VL-4B→32B 把成功率从 0.47 提到 0.60,付费成本下降 90.7%($2.70→$0.25,强模型调用 3595→300 次);Qwen3.5-9B→27B 从 0.51 提到 0.56,成本降 85.8%($1.49→$0.21)。这是每步由 Capability Head 决定去留,而非固定角色。Table 2 跨基准(CharXiv、MathVerse、MathVista、ScreenSpot-Pro、SimpleVQA、MMLU-Pro)显示路由一致优于纯小模型、又比'永远用大模型'便宜:Qwen3.5 平均降本 45–53%,Qwen3-VL 27–47%,Gemma 27–31%,且基本保住大模型性能。WHEN2CALL(Table 3, 干预决策):Resolution Head 一致改善同一骨干的表面行为——Qwen-VL-2B F1 37.3→49.0、Acc 52.7→65.1,Qwen3.5-4B F1 43.5→54.5、Acc 57.9→69.5,部分甚至超过专为该基准全量微调的 MNM 4B/8B When2Call-SFT 基线(F1≈48–49)。TriviaQA(Table 4):Capability Head 用于工具升级时 Qwen3-VL-4B 任务分 0.292→0.756(+158.9%),漏调必需网页调用 708→244;强模型 Qwen3-VL-32B 也获益(0.672→0.778,工具精度 72.7%→75.5%),关键是效果来自升级决策质量而非简单抑制工具调用。前缀时间预测(Table 5)显示 200 token 前缀直接训练能恢复比'全长训练套到前缀上'更强的信号质量。对照显示:让小模型自己弃答会导致严重升级不足;token 级置信度几乎区分不了对错预测,而 Capability Head 显著更具区分度。

AndroidWorld success rate and backend usage for single-model and routed runs.
Table 1: AndroidWorld success rate and backend usage for single-model and routed runs.
Score-cost tradeoff across model families and benchmarks.
Table 2: Score-cost tradeoff across model families and benchmarks.
Resolution decision prediction on WHEN2CALL.
Table 3: Resolution decision prediction on WHEN2CALL.
TriviaQA web-search decision quality.
Table 4: TriviaQA web-search decision quality.
Prefix-time evaluation of the Capability Head.
Table 5: Prefix-time evaluation of the Capability Head.
查看结构化数据
任务指标本文基线提升
AndroidWorld 长程智能体(小模型→大模型路由) 成功率 / 强模型 API 成本 Qwen3-VL-4B→32B:0.60 / $0.25;Qwen3.5-9B→27B:0.56 / $0.21 纯大模型 m2:0.58 / $2.70(VL);0.59 / $1.49(3.5) 成功率反超大模型基线的同时,付费成本分别降 90.7% 与 85.8%
跨基准平均(CharXiv/MathVerse/MathVista/ScreenSpot-Pro/SimpleVQA/MMLU-Pro) 平均分 / 总成本 各路由系统保分或略升,成本大幅下降 永远用大模型 m2 Qwen3.5 系列平均降本 45–53%,Qwen3-VL 系列 27–47%,Gemma 系列 27–31%
WHEN2CALL 干预决策(Qwen-VL-2B) F1 / Acc Backbone + Resolution Head:49.0 / 65.1 骨干原生行为:37.3 / 52.7;MNM 8B When2Call-SFT:F1≈49.4 F1 +11.7,Acc +12.4,轻量头追平甚至超过全量微调基线
TriviaQA 网页搜索升级决策(Qwen3-VL-4B) 任务分 / 漏调必需网页调用 0.756 / 244 骨干原生搜索:0.292 / 708 相对分 +158.9%,漏调减少 464 次(约 65.5%)

局限与改进

作者明确承认若干局限。首先前缀时间预测(Table 5)弱于全长轨迹预测——把全长训练的头套到 200 token 前缀上 ROC-AUC 明显下降,只有'前缀训练/推理'对齐才恢复,说明早期信号不够强,做不到真正最优的'生成中途省算力'。其次运行点固定($\tau_{cap}=0.8$、$\tau_{res}=0.5$),作者自己指出更高路由阈值会把更多样本交给强模型、提分但更贵(附录 Figure 2),即存在质量-成本 Pareto,固定阈值未必最优。我自己的观察还有:编码器被刻意固定(沿用 Gnosis)以隔离方法贡献,意味着头与编码器无法联合自适应,可能压低上限;Capability 标签质量完全依赖 LLM judge(Qwen3vl-30B-A3B)给标量分,judge 偏差会直接传染;层选择与阈值需按骨干经验调参;成本只是 token 用量的代理估计(附录 D),非真实账单;方法强依赖骨干暴露隐状态,闭源商业模型(正是作者想降本的 Claude 等)天然不可用;每步只取 argmax 单一 resolution 动作,无法表达'既该澄清又该弃答'这类复合需求。

独立分析的弱点

第一,对 LLM judge 的依赖是隐性单点:Capability Head 的全部监督来自 Qwen3vl-30B-A3B 的标量打分,judge 若系统偏置(偏袒更长回答、或对某领域过严/过宽)能力信号就会带偏,且这种偏差难被察觉。改进:引入多 judge 投票、人类校准子集、或对比学习式相对标签替代绝对标量分。第二,层选择与两个阈值需按骨干经验调,跨骨干迁移仍需小幅调参,削弱'即插即用'承诺。改进:让层选择本身可学习(对所有层做软注意力加权),阈值用校准概率而非裸分数设定。第三,每步只取 argmax 单一动作,无法处理复合干预(同时澄清且弃答)。改进:动作建模为多标签或结构化输出。第四,仅用生成 token 隐状态、丢弃 prompt 信息,在任务信息主要在 prompt 时可能吃亏。改进:加入 prompt 侧条件特征。第五,无在线适应,头训练后固定、不随部署分布漂移更新。改进:在线轻量微调或不确定性触发主动重训。第六,闭源模型不可用,与'给 Claude 类商业 agent 降本'的动机有张力。改进:探查能否用 logits/采样一致性近似隐状态。

未来方向

作者自己指出的方向:与推测解码叠加(两者正交,一个减每次调用代价、一个减调用次数)、扩展到更多动作类型与更长程 agentic 循环、把前缀时间控制做到更早更准。基于成果我认为有五条可延伸方向。一是联合自适应编码器与头(当前固定),可能抬高能力信号上限。二是把固定阈值替换为校准概率+自适应阈值,让系统沿质量-成本 Pareto 在线滑动、按用户预算动态调节。三是把动作从单标签扩展为多标签/结构化序列,覆盖复合干预与多步规划,真正服务长程 agent。四是在线持续学习:随部署分布漂移增量更新轻量头,缓解静态头老化。五是与推测解码、奖励引导解码系统组合,给出'减调用次数+减每次代价+提每次质量'的三重优化端到端管线,并探索在仅能拿到 logits 或采样一致性的闭源模型上近似复现控制信号,从而真正把 Claude 类商业 agent 纳入射程。

复现评估

整体复现友好度较高。代码已在 GitHub 开源(github.com/Amirhosein-gh98/Multi-Head-Latent-Control),用公开基准(SimpleVQA、ScreenSpot-Pro、CharXiv-Reasoning、MathVerse、MathVista、MMLU-Pro、AndroidWorld、WHEN2CALL、TriviaQA),骨干也是开源的 Qwen3-VL、Qwen3.5、Gemma。算力门槛很低:9B 规模下数据生成+双头训练单卡一天完成,头训练 16GB 显存即可,Adam、学习率 $1\times10^{-4}$,运行点阈值在正文给出($\tau_{cap}=0.8$、$\tau_{res}=0.5$)。主要门槛有三:一是需骨干导出对齐到生成 token 的多层隐状态,这要求修改推理框架(逐 token 取隐状态并对齐),工程上有要求;二是 Capability 标签依赖 Qwen3vl-30B-A3B 作 judge 全量打分,算力与数据准备成本不可忽视;三是层选择与阈值需按骨干经验调,部分对照(self-abstention、token 置信度基线)细节散落附录。综合看方法轻量、依赖开源、代码公开,复现核心路由实验(AndroidWorld 90% 降本)现实可行,但完整复现跨骨干/跨基准全部结果仍需相当的生成与调参工作量。