代理CLEAR:自动化LLM代理的多层级评估 Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents
自动化评估框架,在系统、轨迹、节点三级洞察LLM代理行为
前置知识
LLM代理
LLM代理是由大语言模型驱动的自主系统,能定义策略、执行动作、与外部环境交互,解决复杂的多步骤任务。代理通常包含多个子组件或节点,通过工具调用和环境交互来完成目标。
论文的评估对象就是这类多节点、多步骤的代理系统,理解其架构和执行模式是理解评估方法的基础。
执行轨迹
执行轨迹是代理系统运行时产生的完整记录,表示为输入输出对序列,包含LLM调用、节点标识符等信息。轨迹捕获了代理的决策过程、工具调用序列和中间结果。
Agentic CLEAR的核心就是分析这些执行轨迹来发现问题,理解轨迹的格式和内容是理解整个方法的前提。
LLM-as-a-Judge
LLM-as-a-Judge是使用另一个LLM评估目标系统输出的方法。评判者通过提示词对输入输出对的质量进行打分和批评。Agentic CLEAR使用三种评判模式:步骤级、轨迹级和Rubric级。
Agentic CLEAR的核心评估组件就是LLM Judge,它负责在步骤级、轨迹级和Rubric级三个层面进行评估。
CLEAR聚合方法
CLEAR通过聚类和总结从大量实例级反馈中发现高层级模式。它将相似的批评分组到簇中,每个簇代表一种重复出现的失败模式,然后生成简洁的描述性洞察。不依赖预定义分类法。
这是Agentic CLEAR第二阶段的核心,用于将成千上万的个体评估结果聚合成可操作的系统性洞察。
研究动机
随着LLM代理系统变得越来越强大和广泛应用,从软件工程到科学发现再到开放网页浏览,这种民主化的代理构建带来了严重的监督和评估挑战。现有工具存在根本性局限:可观测性平台虽然记录执行轨迹,但评估能力主要局限于基础指标聚合或粗粒度的单提示词LLM-as-a-judge评估,无法发现隐蔽故障;研究社区构建的代理错误分类法和高保真基准测试虽然有价值,但产生静态、刚性的类别,需要大量手工工程,无法动态适应日常代理开发者面临的定制任务。开发者仍然需要手动检查大量轨迹来识别系统性问题,效率极低且容易遗漏隐蔽故障,如复杂代理系统中常见的错误循环、子代理行为不协调、跨步骤错误传播等问题。
本文的目标是论文的目标是提供一个自动化的、动态的、易用的评估框架,能够在不依赖手工制作的评估标准或大量人类标注的情况下,产生丰富的文本化洞察来分析代理行为。该框架应在三个粒度级别提供评估:系统级揭示整体行为模式和重复出现的失败,轨迹级提供单个执行实例的详细分析,节点级定位特定组件的问题。目标是让开发者不仅知道什么失败了,还知道为什么失败,从而支持快速迭代、改进可靠性和系统性理解。框架应作为pip可安装的Python包提供,支持通过YAML配置文件进行单命令执行,并提供交互式UI支持深度分析。
与已有工作不同的是,本文的独特切入角度在于提出一个完全无需预定义错误分类法的动态评估方法。与现有工作不同,Agentic CLEAR从执行轨迹中自动发现失败模式,能够适应不同领域和任务,而不是应用固定、刚性的类别。Agentic CLEAR的三种评判模式提供了多维度的评估视角,而现有方法通常只关注单一维度。三级粒度(系统、轨迹、节点)的设计提供了从宏观到微观的完整诊断视角,这与只关注执行层或只提供宏观统计的现有方法形成对比。此外,它强调文本化洞察而非仅数值评分,提供可操作的建议而非黑盒指标。Rubric评估自动生成任务特定标准的机制也是独特的创新点,而现有方法要么依赖预定义标准,要么使用通用的评估维度。
核心方法
Agentic CLEAR采用两阶段流水线设计。输入是数据集(任务描述)、目标代理系统(由多个节点组成)、LLM评判者和CLEAR聚合器。第一阶段是细粒度评估:对于每个任务,执行代理获得轨迹。然后使用评判者进行三种评估:步骤级评估为每个输入输出对产生质量评分和批评,并按节点分组存储;轨迹级评估评估完整轨迹的质量;Rubric评估分两步:先生成任务特定标准集合,然后检查轨迹是否符合这些标准,两者都收集到系统级容器。第二阶段是洞察聚合:对每个节点,使用CLEAR聚合其相关评估以发现组件特定模式;对系统级反馈使用CLEAR聚合以发现全局模式。最终输出系统洞察、节点洞察和轨迹评估。
核心创新点在于结合三级评估(步骤、轨迹、Rubric)与动态模式发现(CLEAR)来构建无需预定义分类法的自动化评估系统。与依赖固定错误分类法的传统方法不同,Agentic CLEAR从数据中动态发现问题模式,能够适应不同领域和任务。这意味着该方法可以处理研究基准、企业自动化和个人定制任务,而无需为每个场景手工设计评估标准。另一个关键创新是Rubric评估,它让评判者根据任务描述自动生成评估标准,然后检查轨迹是否符合。这使得评估可以适应各种定制任务,而无需任务特定的手工标注。三级粒度(系统、轨迹、节点)的设计提供了从宏观到微观的完整诊断视角:系统级揭示全局模式,轨迹级提供实例详情,节点级定位组件根因。
方法步骤详情
方法流程分为两个阶段。阶段一:执行和细粒度评估。首先初始化反馈容器为空集合。对于每个任务:执行代理获得轨迹。对轨迹中的每个步骤:执行节点级评估并按节点分组存储到对应节点的容器中。对整条轨迹执行轨迹级评估。生成任务特定标准,然后检查符合度。将轨迹级和Rubric级评估收集到系统级容器。将所有评估存储到轨迹评估记录中。阶段二:洞察聚合。对每个节点,使用CLEAR聚合其相关评估以发现节点特定模式。对系统级评估使用CLEAR聚合以发现全局模式。返回系统洞察、节点洞察和轨迹评估。整个过程从原始任务描述开始,经过执行、三级评估和CLEAR聚合,最终产生多粒度的可操作洞察。
技术新颖性
技术新颖性体现在多个方面。首先,这是首个完全无需预定义错误分类法的代理评估方法,通过动态模式发现适应不同领域。与TRAIL等依赖固定类别的方法不同,Agentic CLEAR从数据中自动发现问题,这意味着它可以处理新领域和新任务而无需重新设计分类体系。其次,三级粒度架构提供了前所未有的诊断深度,既支持高层概览也支持细粒度根因分析。第三,自动Rubric生成机制使评估能够适应各种定制任务,而不需要任务特定的手工标注。第四,与可观测性平台的深度集成支持实际工作流,使用OpenTelemetry兼容格式意味着可以无缝插入现有开发流程。第五,开源Python包和交互式UI大大降低了使用门槛。实验证明该方法能够恢复大多数推理和规划错误类别,且生成的洞察往往比预定义分类更细粒度、更具可操作性。
实验结果
在四个基准测试和七种代理配置上的大规模实验表明Agentic CLEAR的有效性。与TRAIL人工标注错误的对比显示,GPT-5评判者实现了Macro F1等于0.459和Micro F1等于0.497,明显优于随机基线(Macro F1等于0.288, Micro F1等于0.342)和多数基线(Macro F1等于0.199, Micro F1等于0.459)。所有15个GPT-5问题和12个OSS-120B问题都映射到至少一个TRAIL类别,分别覆盖12个相关TRAIL类别中的12个和10个。预测轨迹成功率的AUC分析显示轨迹级方法是最强预测器,在AppWorld上GPT-5达到AUC大于等于0.82,而tau2-Bench不超过0.62。通用错误模式分析识别出四类跨基准共享问题:冗余低效工具使用、错误处理和恢复不足、工作流不完整、输出格式和模式合规问题。对比GPT-5和OSS-120B评判者发现:OSS-120B平均67字符而GPT-5的130字符,更关注操作导向失败,而GPT-5产生更细致、领域特定的失败模式。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 错误类别预测(vs TRAIL) | Macro F1 | 0.459 (GPT-5) | 0.288 (Random weighted by GT freq) | 59%提升 |
| 错误类别预测(vs TRAIL) | Micro F1 | 0.497 (GPT-5) | 0.459 (Always top-4) | 8%提升 |
| 预测轨迹成功率(AppWorld, CUGA, GPT-4o) | AUC (Trace-level) | 0.890 (GPT-5) | N/A | 最强预测性能 |
| 预测轨迹成功率(tau2-Bench, Generalist Agent, Claude 3.7) | AUC (Trace-level) | 0.554 (GPT-5) | N/A | 最弱预测性能(基准难度高) |
局限与改进
作者承认几个局限性。Rubric方法假设任务描述包含确定成功所需的所有要求,这在涉及隐式政策合规的基准上会失效,例如对抗性任务中正确行为是拒绝请求而非完成它,但生成器只看到表面请求,产生奖励完成而非拒绝的rubrics。步骤级方法假设轨迹评估可以分解为独立步骤的质量,这在某些代理架构上不如轨迹级评估有效,例如紧密耦合的步骤可能无法独立评估。评判者选择至关重要,不同评判者产生定性和定量上不同的诊断:OSS-120B产生更短、更通用的问题(平均67字符),而GPT-5产生更长、更细致的问题(平均130字符)。当前实现主要关注LLM推理和规划(覆盖TRAIL 20个类别中的12个),较少关注系统执行层。我观察到额外局限性:方法依赖于评判者的可靠性,如果评判者本身有偏见或能力不足,评估质量会受影响;聚合阶段CLEAR可能错过罕见但关键的失败模式。
独立分析的弱点
独立分析发现几个具体弱点,每个都对应具体的改进方向。首先是Rubric生成仅基于任务描述,对于对抗性任务会错误地奖励任务完成而非合规拒绝。改进方向是整合任务元数据和领域知识来增强Rubric生成的准确性,例如从基准测试中提取隐式约束或政策要求。其次是评判者的可靠性问题,不同模型产生的诊断深度和特异性差异明显,GPT-5平均130字符而OSS-120B仅67字符。需要建立评判者校准机制和可靠性评估指标,例如引入标准测试集来评估评判者本身的能力。第三是评分预测在不同基准间表现差异巨大(AppWorld AUC大于等于0.82 vs tau2-Bench AUC小于等于0.62),说明评估方法对代理架构和任务类型敏感。需要开发自适应评估策略,根据代理特征自动选择最优评估方法组合。第四是当前专注于推理和规划层,系统执行层的覆盖不足。第五是文本化洞察的主观性,需要开发结构化的洞察表示方法。
未来方向
作者提出的未来方向包括:扩展Agentic CLEAR以分析系统执行层 alongside 推理和规划,当前覆盖TRAIL 20个类别中的12个推理规划相关类别,未来可扩展到更多执行层类别;改进评判者能力及其在不同代理设置下的可靠性,开发评判者校准和选择机制;支持系统化的跨配置比较,帮助开发者比较不同代理架构或模型的表现;开发更强大的洞察表示和可视化方法,使洞察更易于理解和行动。基于论文成果可延伸的方向包括:引入多评判者集成和置信度校准机制,类似于集成学习提高鲁棒性;开发主动学习框架,让代理开发者反馈帮助改进评估;构建代理行为基准库,用于跨代理比较和最佳实践发现;研究评估方法的元评估,建立评估可靠性的量化指标;探索实时评估能力,在代理执行过程中提供即时反馈;开发针对特定领域的领域特定评估模块。
复现评估
论文提供了良好的复现支持。代码已开源,以pip可安装的Python包形式提供,使用Apache 2.0许可,这使得研究人员和开发者可以轻松集成和修改。分析可通过单一CLI命令执行,配置通过YAML文件,降低了使用门槛。使用OpenTelemetry兼容格式(特别是LangFuse格式的轨迹),易于集成到现有工作流。实验在4个基准的7种设置上进行,包括AppWorld CUGA (417条轨迹)、GAIA (165条)、SWE-Bench Verified Mini (50条)、TRAIL (117条)等,总计处理了数万次LLM调用。评判者使用OSS-120B和GPT-5,代表了开源和闭源的最先进模型。主要限制是运行大规模评估需要大量API调用,成本较高;某些基准的轨迹需要从外部来源获取,可能存在获取困难。论文附录详细描述了提示词、基准、代理和数据来源。整体而言,复现难度中等,主要挑战是API成本和外部数据访问。
论文图表