从序列到结构:面向 LLM 智能体的关系式不确定性传播 From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
把智能体执行轨迹建模为依赖图并传播不确定性,实现长程任务失败的早期检测。
前置知识
不确定性量化(UQ)
不确定性量化是估计模型对自身输出有多大把握的技术家族,主要分三类:基于概率的方法直接从输出分布计算预测熵、序列生成概率等数值;语言化方法让模型自己用文字报告一个置信分数;采样式方法生成多个候选回答并度量彼此一致性来发现幻觉。好的 UQ 分数应能把成功的执行和失败的执行在排序上区分开。
本文的全部目标就是为 LLM 智能体做轨迹级 UQ,只有理解这三类基线范式,才能看清 RUPA 的定位以及它相对 Entropy/Seq-prob/SAUP/Tracer/UProp 的改进点。
预测熵与序列概率
预测熵是对输出 token 分布求熵 $U_t=-\sum_v p(v)\log p(v)$,熵高表示模型在多个候选之间犹豫不决;序列概率是整条生成序列的联合似然,取对数后等于各 token 对数概率之和。两者都是典型的'局部信号':只刻画当前这一步的生成置信度,完全不涉及之前的执行历史。
RUPA 中每个助手节点的局部不确定性 $U_t$ 正是用预测熵计算的,它是与图传播来的历史风险 $H_t$ 相加融合的另一路输入,也是论文实验中被证明不够用的对照基线。
LLM 智能体与执行轨迹
LLM 智能体通过多步'推理-行动-观察'循环完成复杂任务:模型生成思考与工具调用,环境返回观察结果,如此迭代直到产出最终答案。一条执行轨迹就是这次完整交互的日志,混合了推理状态、工具调用、用户反馈和环境观察等异构事件;失败可能埋藏在轨迹中段,而非最终答案附近。
RUPA 的处理对象就是这种轨迹,把它建模成图而非线性序列,正是论文标题'从序列到结构'的含义,也是理解全部方法设计的出发点。
AUROC、AUPRC 与 F1
AUROC 衡量排序质量:随机取一个失败样本和一个成功样本,模型给失败者打分更高的概率,0.5 等于随机猜;AUPRC 是精确率-召回率曲线下面积,在失败样本稀少的类别不平衡场景下比 AUROC 更严格;F1 是精确率与召回率的调和平均,本文取所有决策阈值上的最佳值。
论文所有实验结论都用这三个指标表达,是读懂 Table 2-4 和 Figure 3-4 数字的先决条件。
图上的消息传递
消息传递是图神经网络的基本运算:每个节点收集邻居的状态,按边权加权聚合后更新自身,堆叠多层即可让信息沿依赖路径传播数跳,聚合公式形如 $h_t=\sum_{i\in N(t)} w_{it}h_i / \sum_{i\in N(t)} w_{it}$。
RUPA 的传播式 (3)(4) 本质上就是一次带时间衰减的加权消息传递,但不需要训练任何 GNN;理解这一点才能正确估计方法的实现成本与开销。
研究动机
将 LLM 部署为自主智能体执行数十甚至上百步的推理、工具调用与环境交互时,可靠性成为落地的核心瓶颈。与单轮文本生成不同,智能体任务很少因某一步的孤立错误而失败,更多是错误沿相互依赖的步骤不断累积与放大的结果。作者在 τ-2 基准上的初步实验(Table 1)显示,专为单轮预测设计的传统 UQ 方法几乎失效:在 Airline 域上序列概率的 AUROC 仅 0.205,语言化置信度也只有 0.485,均接近随机水平(0.441);Retail 域结论相同。进一步的结构分析(Figure 2)表明,失败相关的高风险步骤的中位数出现在轨迹归一化位置 0.54 处,分散在整个执行过程而非集中在最终答案附近;失败步骤的平均重复度高达 0.981、停滞度 0.883,反馈冲突与纠正/重试关系也频繁出现。这说明失败信号本质上是关系性、结构性的,只看当前生成的局部置信度无法捕捉几步之前埋下的祸根。
本文的目标是本文的目标是构建一个轨迹级的不确定性量化框架 RUPA,在智能体执行过程中(甚至只观察到前缀时)就准确估计整条轨迹失败的概率,从而支撑风险检测、提前干预、候选动作筛选等下游策略。具体而言,作者希望方法能够:(1)把执行历史中的推理状态、工具调用、用户交互与环境观察统一表示为结构化对象,而不是压平的序列;(2)显式刻画步骤间的依赖关系,让早期关键错误的影响能沿依赖路径持续传递到后续决策,同时自动抑制来自无关分支的不确定性;(3)全程不接触测试标签或最终验证器结果,仅用可观察的前缀信息在线估计,并在 τ-2、Terminal-Bench-2、GAIA 三个基准、6 个开源模型(26B-230B)上系统验证 AUROC/AUPRC/F1 的优越性与早期失败检测能力。
与已有工作不同的是,已有面向智能体的 UQ 方法(SAUP、Tracer、UProp)虽然开始引入历史信息,但都把轨迹当作线性序列,按时间距离或语义相似度做聚合。本文的独特切入是指出步骤间的依赖本质上是'关系性'而非纯'时序性'的:一个早期错误可能当时毫无影响,却会在持续左右后续决策时演变成灾难;一个看似可疑但与主线无关的分支则不应污染整体风险。为此 RUPA 显式定义了七类依赖关系——顺序转移、最近指令、重复行为、解法推进、并行分支、失败反馈和目标对齐,把执行轨迹转成有向图并沿边传播不确定性,使风险优先沿'有影响力的执行路径'累积。这种'类型化结构依赖'的视角是与所有序列聚合方法的本质分野。
核心方法
直觉上,一个早期小错误是否致命,取决于它是否影响了后续的推理与动作;而与主线无关的分支即使看起来可疑,也不应抬高整体风险。因此不确定性应被看作随关系结构演化的轨迹级属性,而非一串独立的逐步置信度。技术上 RUPA 分三步:第一步把执行前缀转成有向轨迹图 $G_t=(V,E)$,节点是用户指令、推理/动作、工具调用和环境观察等事件,边是七类依赖关系(顺序、最近、重复、推进、并行、反馈、目标对齐);第二步做关系感知传播,边权 $w_i^t=\rho_\tau\tilde{r}_i^t\delta^{\mathrm{age}(i,t)-1}$ 由关系可靠性 $\rho_\tau$、关系强度 $\tilde{r}_i^t$ 与时间衰减 $\delta$ 决定,历史节点的不确定性沿图聚合为结构风险 $G_t$,再叠加指数衰减动量 $m_t$ 得到历史风险 $H_t$;第三步把当前步局部不确定性 $U_t$(助手节点用预测熵,环境节点用可观察交互信号)与 $H_t$ 线性融合为 $R_t=\lambda_u U_t+\lambda_h H_t$,轨迹级失败概率由逐步分数聚合而成。
核心创新在于把'依赖结构'而非'时间顺序'确立为不确定性演化的载体。序列式方法即便引入历史,也只能表达'越近越重要'这一种先验,无法刻画'反复卡在同一操作''对环境反馈的纠正''与目标渐行渐远'等结构模式。RUPA 为七类关系定义独立语义,并让边权由关系的统计重要性自适应决定:在无标签训练轨迹上计算每类关系强度的归一化变异 $q_\tau=\mathrm{Var}(\tilde{r}_\tau)/(\mathbb{E}(\tilde{r}_\tau)+\epsilon)$,经温度 softmax 得到可靠性系数 $\rho_\tau$(式 (6)),于是结构上变化更大的关系获得更大的传播权重,陈旧状态则被 $\delta^{\mathrm{age}-1}$ 逐步折扣。目标对齐边不参与常规加权,而是单独用相似度缺口 $Q_i^t=1-S(y_t,x)$ 度量当前步与原始任务的偏离。Figure 4 的熵匹配实验证明这套图信号携带局部置信度之外的增量信息;Table 4 显示把图换成随机拓扑会把 AUROC 从 0.718 拉回 0.681,收益确实来自真实的依赖结构。
方法步骤详情
流程分五步。第一步状态归一化:把每步的助手消息、推理内容、工具调用签名与观察文本拼成节点文本,做小写化、去标点、停用词与数字过滤,工具调用规范化为'函数名-参数'签名。输入是原始轨迹前缀,输出是节点集合。第二步图构建:用 bge-m3 嵌入距离计算历史节点 $v_i$ 与当前节点 $v_t$ 的匹配分,结合词汇线索判定七类关系,只在有界历史窗口内连边,全程不用未来标签。第三步边权校准:按式 (6) 从无标签轨迹估计各关系强度的变异 $q_\tau$,softmax 得可靠性 $\rho_\tau$,故 $w_i^t=\rho_\tau\tilde{r}_i^t\delta^{\mathrm{age}(i,t)-1}$。第四步局部不确定性:助手节点取预测熵 $U_t$,环境节点由执行失败、空工具响应、冲突反馈估计。第五步传播融合:按边权加权聚合得 $G_t$,叠加衰减动量 $m_t$ 得 $H_t=\eta_g G_t+\eta_m m_t$,最终 $R_t=\lambda_u U_t+\lambda_h H_t$,轨迹分数由步级分数聚合。
技术新颖性
技术新颖性体现在四点。(1)问题形式化:首次把'关系依赖'确立为智能体不确定性演化的关键来源,并用 Figure 2 的实证(高风险步骤中位位置 0.54、失败步骤重复度 0.981、停滞度 0.883)给出动机,而非纯工程改进。(2)轻量结构建模:不训练 GNN,用确定性检测器加单个嵌入模型(bge-m3,无嵌入时可退化为 token 重叠)构建七类类型化边,推理开销小且完全 outcome-blind,适合在线部署。(3)自校准边权:关系可靠性 $\rho_\tau$ 从无标签轨迹的关系强度变异中自动学出,且跨模型家族、跨数据集固定不变(附录 A.2 明确说明),免去逐场景调参。(4)传播机制:归一化加权聚合叠加指数衰减动量,既让局部尖峰风险沿依赖路径持续累积,又保留长程执行趋势,与 Tracer 的序列聚合、UProp 的逐点互信息、SAUP 的场景感知风险在机制上本质不同。Figure 5 的敏感性分析显示默认超参数位于宽泛的近平坦最优区,工程上相当稳健。
实验结果
Table 2 覆盖 3 基准、6 模型,RUPA 全部取得最优平均 AUROC/AUPRC/F1:Qwen3.5-27B 从最强基线 Tracer 的 0.608 升到 0.656;Gemma4-31B 达 0.861;MiniMax-M2.7 从 0.694 到 0.718。传统 Entropy 接近随机:Qwen3.5-27B 与 GPT-OSS-120B 上仅 0.559/0.492。Figure 3 显示只看 10%-30% 轨迹时 RUPA 优势最大,风险信号早现。Table 3 不确定性引导采样:Terminal-Bench-2 上 Qwen3.5-27B 成功率从随机 0.105 升到 0.213,GPT-OSS-120B 从 0.079 到 0.202,GAIA 上 MiniMax-M2.7 达 0.339。Figure 4 证明图信号含置信度之外的信息:低熵 Q1 区间传统方法 AUROC 约 0.5,RUPA 仍达约 0.85、AUPRC 约 0.93。Table 4 消融:去图建模 AUROC 跌至 0.678,去传播 0.689,随机图 0.681,收益源于真实依赖结构。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| τ-2 轨迹失败检测(Qwen3.5-27B) | AUROC | 0.677 | Tracer 0.634 | +0.043 |
| Terminal-Bench-2 轨迹失败检测(Qwen3.5-27B) | AUROC | 0.594 | UProp 0.530 | +0.064 |
| GAIA 轨迹失败检测(Qwen3.5-27B) | AUROC | 0.697 | Tracer 0.680 | +0.017 |
| Terminal-Bench-2 轨迹失败检测(GPT-OSS-120B) | F1 | 0.902 | SAUP 0.801 | +0.101 |
| 六模型三基准平均(以 Gemma4-31B 为例) | 平均 AUROC | 0.861 | SAUP 0.842 | +0.019 |
| Terminal-Bench-2 不确定性引导采样(Qwen3.5-27B) | 任务成功率 | 0.213 | 随机选择 0.105 | +0.108(约翻倍) |
| GAIA 不确定性引导采样(MiniMax-M2.7) | 任务成功率 | 0.339 | Tracer 0.316 | +0.023 |
局限与改进
作者承认的局限:图构建依赖确定性检测器与英文词汇线索,关系判别质量受嵌入模型(bge-m3)影响,无嵌入时退化为 token 重叠;边只在有界历史窗口内连接,超长轨迹中更早的关键依赖可能被截断;超参数虽经 Figure 5 验证在默认值附近稳健,但仍是手工设定的固定值。我自己的观察:(1)所有方法都需要 token 级概率,无法直接用于只开放文本接口的闭源 API 模型,且 GPT-OSS-120B 上所有方法 AUROC 都低于 0.66,提示对某些模型家族泛化仍有限;(2)SAUP 与 UProp 没有官方实现,基线为作者按论文自行复现,存在低估基线的风险;(3)失败标签完全依赖各基准的最终验证器,'中间步部分正确'的情形未被刻画,粒度上仍是 0/1 轨迹级判定;(4)论文未报告图构建与传播的每步延迟、显存开销,在线部署的可用性缺乏量化证据;(5)只评估了失败检测与采样选择,未测试更重的干预策略(如回滚、重规划)下的收益。
独立分析的弱点
独立分析出几个弱点。第一,关系检测靠固定英文触发词(next、therefore、alternative、traceback 等),在中文任务、代码之外的工具生态或措辞风格差异大的场景下可能失灵,改进方向是把词汇线索换成轻量的学习式关系分类器,或用指令微调的小模型做关系判别。第二,助手节点的局部不确定性只取预测熵,而经过 RLHF/推理训练的模型熵分布被压得很平,这正是 GPT-OSS-120B 上全体方法 AUROC 偏低(不超过 0.577)的合理解释;可以引入语义一致性(多次采样答案聚类)或隐藏状态探针作为更强的 $U_t$。第三,融合采用线性式 $R_t=\lambda_u U_t+\lambda_h H_t$,局部与结构风险的交互未必线性,可用在小规模验证集上训练的门控或两层模型替代,同时保留可解释性。第四,评价集中在判别指标(AUROC/AUPRC/F1),缺乏校准性分析(如 ECE)与代价敏感评估,而实际'何时终止/重试'的决策阈值应按业务代价选择。第五,建模范围是单智能体单会话图,未覆盖多智能体协作、跨会话记忆等更复杂依赖,错误在智能体间的传播路径无从刻画。
未来方向
可以沿几个方向延伸。其一是从检测走向干预:论文只做了多候选采样中的低风险选择,而传播出的节点级风险 $P_i$ 天然适合驱动在线自我修正——在高风险节点处回滚、重规划或插入验证步骤,并研究风险引导的提前终止以节省算力。其二是端到端学习:当前边权是解析校准的,可在少量标注轨迹上用 GNN 联合学习关系权重与传播函数,同时把无标签校准保留为先验或正则以维持泛化。其三是跨模型与跨语言泛化:用多语言嵌入与语言无关的结构信号替代英文触发词,并在闭源模型上用采样一致性替代基于熵的局部不确定性。其四是扩展到多智能体系统:把智能体间通信也建模为图边,研究信任与错误在智能体网络中的传播与隔离。其五是理论工作:分析传播式 (3)(4) 的收敛性与误差放大条件,给出关系图结构与失败可检测性之间的形式化保证。作者在结论中指出显式关系建模是可信智能体执行的实用基础,未来也可与过程奖励模型(PRM)联合训练,让结构风险信号直接进入策略优化。
复现评估
复现条件较好。代码已在 GitHub 开源(icip-cas/RUPA),三个基准 τ-2、Terminal-Bench-2、GAIA 均公开,执行与验证使用 Harbor 框架,解码温度固定 0.7,重复采样基线每题 3 个样本。方法本身很轻:只需一个 bge-m3 嵌入模型(或退化为 token 重叠),传播是解析公式,没有任何模型训练。真正的成本在轨迹生成——要为 6 个 26B-230B 的开源模型在三个基准上跑完整 rollout 并记录 token 级概率,需要多卡 GPU 推理资源,这是复现 Table 2 规模结论的主要门槛。注意事项:SAUP 与 UProp 无官方实现,需按原文自行复现并保持其原始聚合策略;关系可靠性校准只用无标签训练轨迹且跨实验固定,复现时应严格遵守 outcome-blind 设定;附录 Table 5/6 与 Figure 5 给出了默认超参数及敏感性曲线,可直接采用。总体属于中等难度:算法实现一两天可完成,算力开销取决于想复现的模型范围。
论文图表
左图是失败轨迹中最高异常步归一化位置的分布直方图,中位数约 0.54,说明高风险步骤散布在整条轨迹而非集中在末尾;右图是失败轨迹的平均结构诊断强度,重复行为、目标漂移、停滞、反馈冲突、纠正/重试等关系频繁出现,其中重复度 0.981、停滞度 0.883。
这是全文动机的实证支柱:直接证明失败信号是关系性、结构性且分布于全轨迹的,从而论证线性序列聚合不够、必须做关系图建模。