← 返回 2026-05-27

超越最终答案:审计多代理工业工作流程中的轨迹级幻觉 Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin Lin, Dhaval Patel 📅 2026-05-26 👍 9 2026-07-13 08:36
多代理系统 工业AI 幻觉检测 评估基准 轨迹审计

Trajel框架:审计多代理轨迹级幻觉,五种类型分类法

前置知识

Thought-Action-Observation循环

代理执行过程的核心模式:先思考如何行动,再执行具体操作,最后观察结果。形成序列 $s_t = (a_t, \tau_t, \alpha_t, \omega_t)$,其中 $\tau_t$ 是推理过程,$\alpha_t$ 是工具调用,$\omega_t = T(\alpha_t)$ 是观察结果。

理解这个循环是理解轨迹级幻觉的基础。幻觉可能发生在思考、行动或观察的任何环节,只有追踪完整循环才能定位问题根源。

幻觉分类法

将幻觉现象按失败模式系统分类:事实性(与证据矛盾)、引用性(引用不存在的内容)、逻辑性(推理不连贯)、程序性(违反工作流程)、范围性(越权操作)。

不同类型的幻觉需要不同的检测方法。本文核心贡献就是提出这种分类法,用于指导检测模型的设计和评估。

轨迹级评估

将整个代理执行轨迹 $T = (s_1, \dots, s_N)$ 作为评估单元,而非仅看最终输出。能够检测过程错误、累积偏差和级联失败,这些在最终答案中往往被隐藏。

这是本文与传统评估方法的本质区别。在高风险工业场景中,过程错误可能导致灾难性后果,即使最终答案看似正确。

研究动机

现有的幻觉评估基准仅关注最终输出,无法捕捉多步代理工作流程中出现的中间错误。例如在数据中心监控和基础设施维护等高风险工业场景中,代理可能通过跳过必要步骤、引用不存在的历史结果或越权操作导致级联故障,但这些失败在最终输出中往往被隐藏。实验数据显示,不同模型的幻觉率在 52.4% 到 81.0% 之间,程序性幻觉占识别故障的 38.5%,表明现有评估方法严重低估了实际风险。

本文的目标是开发 Trajel 框架,提供轨迹级别的幻觉审计能力,包括五个类型的形式化分类法、225 条专家标注的轨迹数据集、以及三种检测范式的基准测试。目标是回答四个研究问题:幻觉类型的分布规律、定位偏差起源的方法、不同检测模型的性能对比、以及实时预测的最佳信号。

与已有工作不同的是,现有工作如 AgentBench、MIRAGE-Bench、ToolBH 等都承认幻觉问题,但它们要么缺乏结构化的分类法,要么仅关注单步错误,要么依赖 LLM-as-a-Judge 而未探索监督学习。Trajel 是首个结合工业多代理轨迹、完整轨迹级评估、基于结构的分类法、专家人工标注和 LLM-as-a-Judge 基准的综合框架。

核心方法

Trajel 框架包含三个核心组件:轨迹感知的分类法、专家标注数据集和 ML 建模框架。评估流程分为三个阶段:首先生成并标注轨迹,通过 LLM-as-a-Judge 初评再由人工盲审;然后通过提示变体进行压力测试;最后训练和评估监督检测模型。整体思路是将轨迹作为结构化对象,用形式化谓词定义幻觉类型,然后在不同上下文粒度上训练检测器。

核心创新是将轨迹作为分析单元而非单个响应,并按上下文需求对幻觉类型进行分层:事实性幻觉从单步可检测(局部上下文),引用性和逻辑性需要轨迹历史(中间上下文),程序性和范围性需要工作流程规范和代理角色定义(全局上下文)。这种分类法直接指导了三种检测范式的设计,实现了从直觉到技术路线的系统性创新。

方法步骤详情

步骤1:轨迹生成与标注。从 AssetOpsBench 收集 6 个模型配置在 42 个工业任务上的执行轨迹,每条轨迹包含 Thought-Action-Observation 三元组的完整序列。步骤2:双层标注协议。先用 LLM-as-a-Judge 进行初始标注,再由两所机构的盲审人员进行人工审核,提供每步的幻觉类型、轨迹内定位和评审理由。步骤3:提示变体压力测试。通过系统修改评估提示(指令特异性、子目标排序、程序细节程度)生成轨迹变体,分析幻觉频率和类型分布的变化。步骤4:检测建模训练。基于标注数据训练三种范式:子任务级 BERT 分类器(输入单步 $\tau_t \oplus \alpha_t \oplus \omega_t$)、轨迹级 NLI 模型(以历史为前提、当前步骤为假设)、Longformer 长上下文模型(输入完整轨迹 $T$)。

技术新颖性

技术新颖性体现在三个方面:首次将幻觉定义为形式化谓词 $h(g_t | E_t, K, a_t) \equiv g_t \nvdash E_t \lor g_t \nvdash K \lor g_t \nvdash role(a_t)$,而非模糊的自然语言描述;首次在工业多代理场景下验证了执行质量信号(如清晰度和理由,$r = -0.833$)作为实时预测指标的可行性;首次系统地比较了三种检测范式在不同上下文粒度上的互补性,证明了轻量级运行时监控比后分类更具实用价值。

Overview of the Trajel framework
Figure 1: Overview of the Trajel framework

实验结果

实验在 224 条完整人工标注轨迹上进行,揭示了三个关键发现。首先,程序性幻觉占识别故障的 38.5%,是主导类型,但现有基准完全无法检测这种在工作流程级别违反规范的行为。其次,48.7% 的幻觉轨迹同时包含多种类型(75/154),单标签公式化会严重误表征实际失败。第三,自动检测器即使二元准确率高(LLM judge F1 = 0.855),在最微妙的类型上也系统性误分类:引用性幻觉的 Cohen's $\kappa$ = 0.176,逻辑性幻觉的 $\kappa$ = 0.211。执行质量信号分析显示,清晰度和理由信号是最强的单变量预测因子($r = -0.833$,AUC = 0.908),当其缺失时幻觉率达 94.3%,而存在时仅为 9.1%。任务完成和结果验证信号也表现出强相关性($r = -0.786$ 和 $r = -0.784$,AUC = 0.853 和 0.863)。相比之下,最佳监督分类器(NLI)的 AUC = 0.689,远不及轻量级运行时信号。

Comparison of agentic evaluation benchmarks for hallucination analysis
Table 1: Comparison of agentic evaluation benchmarks for hallucination analysis
Trajel dataset overview
Table 2: Trajel dataset overview
Per-type LLM-judge performance against human labels (left, n = 224) and type-level disagreement among trajectories where both flagged a hallucination (right, n = 141)
Table 3: Per-type LLM-judge performance against human labels (left, n = 224) and type-level disagreement among trajectories where both flagged a hallucination (right, n = 141)
LLM-judge binary detection F1 per model configuration
Table 4: LLM-judge binary detection F1 per model configuration
Hallucination type vs. step component (human evaluation)
Table 5: Hallucination type vs. step component (human evaluation)
Supervised detection model comparison on Trajel
Table 6: Supervised detection model comparison on Trajel
Execution-quality signals as univariate predictors of hallucination (n = 213)
Table 7: Execution-quality signals as univariate predictors of hallucination (n = 213)
查看结构化数据
任务指标本文基线提升
子任务级幻觉检测 ROC-AUC 0.613 0.500 (多数类基线) 22.6%
轨迹级 NLI 检测 ROC-AUC 0.689 0.500 (多数类基线) 37.8%
长上下文幻觉检测 ROC-AUC 0.599 0.500 (多数类基线) 19.8%
二元幻觉检测 F1 分数 0.855 (LLM judge) 0.812 (多数类基线) 5.3%
程序性幻觉检测 F1 分数 0.784 未评估 首创基准

局限与改进

作者承认 Trajel 数据集的局限性:仅包含 225 条轨迹,来自单一工业领域(资产运维)和六个共享相同编排器(AssetOpsBench)的模型配置。在替代领域(医疗、金融、开放网络)、替代编排器或代理架构下的行为未经验证。标注者间一致性中等(总体 $\kappa$ = 0.456),引用性和逻辑性类型的一致性尤其低($\kappa \leq 0.211$),表明需要更丰富的标注协议(如要求标注者将每个引用声明追溯到特定前序步骤)。五种分类法未被声称穷尽,在更丰富的工具生态系统或对抗条件下可能出现其他类型。监督分类器 AUC(0.689)与 LLM judge F1(0.855)之间的差距表明需要混合架构。

独立分析的弱点

样本规模不足导致监督模型泛化能力有限,仅 225 条轨迹难以训练鲁棒的检测器,特别是在数据稀疏的引用性和逻辑性类型上。改进方向是扩展数据集到数千条轨迹,覆盖更多领域和模型。标注质量不均衡,人工标注者的主观判断可能引入偏差,特别是在边界情况下的程序性和范围性幻觉。改进方向是采用多轮标注、标注者培训和更细化的标注指南。检测器性能瓶颈明显,即使最佳监督模型的 AUC 仅为 0.689,远低于运行时信号,表明纯监督路线的局限性。改进方向是探索 LLM-derived features 与判别式分类器的混合架构,以及 token 级别不确定性和语义熵作为额外信号。

未来方向

作者提出三个延伸方向:混合架构探索,将 LLM-derived features 整合到判别式分类器中,结合 token 级别不确定性和语义熵;多模型集成,直接测量代理间分歧而非通过执行标志代理;替代领域验证,在医疗、金融、开放网络等不同领域测试 Trajel 分类法的泛化性。基于成果的可延伸方向包括:实时干预系统开发,基于清晰度和理由信号的 kill-switch 条件在真实工作负载上的前瞻性评估;对抗性幻觉生成,在压力条件下测试系统的鲁棒性;自动标注流水线,减少人工标注成本的同时保持质量。

复现评估

论文提供了详细的实验设置描述,包括数据集组成(表 2)、有效样本规模说明、模型配置细节和评估指标选择。然而代码和数据集的开源情况未在正文中明确说明,需要检查项目网站或 GitHub 仓库。计算资源方面,训练 BERT、NLI 和 Longformer 模型需要标准 GPU 资源,推测单张 A100 或 V100 足够,但大规模数据标注的人力成本是主要瓶颈。复现难度中等,主要挑战在于人工标注协议的精确复制。建议提供标注指南、示例轨迹和标注者间一致性分析报告以提升可复现性。