LongRCA Bench:诊断长程智能体失败中的责任角色与最早根因步骤 LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures
首个长轨迹失败归因基准:1140条真实失败轨迹,定位责任角色与最早根因步
前置知识
LLM 智能体与执行轨迹
大模型智能体通过规划、工具调用、多角色协作等一长串记录步骤完成任务;每次消息、工具调用、观察结果都被记为一个带 0 起始索引的步骤,串成轨迹 $H=(h_0,\ldots,h_{T-1})$。本文收集的失败轨迹平均 156.3 步、中位 145 步、最长 728 步,由 MiniMax-M2.5、Kimi-K2.5、Qwen3.5-Plus 三种模型生成。
论文的问题 precisely 发生在长轨迹里:错误往往在轨迹早期引入,之后上百步才暴露为最终失败,理解轨迹的步级结构是讨论根因定位的前提。
失败归因与结果级评测
结果级评测只判断任务最终成败(如隐藏测试 0/47 通过),不回答决定性错误从哪一步进入轨迹、哪个角色该负责。失败归因是过程级诊断:在完整日志中找出最早引入决定性错误且未被修复的步骤(根因步 $r^*$)与责任角色 $\rho^*$,两者独立预测、独立打分。
本文的核心主张就是:结果级评测之外,必须把责任角色归因和最早根因步定位当作两个独立的评测目标,全文的基准设计与指标协议都围绕这一点展开。
交接指令(handoff instruction)
多智能体工作流中角色 X 向角色 Y 下达指令的日志消息,记为 X (-> Y)。规划者把修复计划交给执行者、执行者把结果交给验证者都属于交接。若指令本身已含决定性错误且下游照办未修复,则根因是这条指令步骤而非执行步骤。
RCTA 的关键设计就是把候选错误步回溯到更早的交接指令上做原文比对,这是它大幅超越基线的主要原因;Fig. 1 的案例正是典型的交接错误。
根因步精确/±5 准确率与 MAE
精确准确率要求预测步 $\hat{r}$ 与标注根因步 $r^*$ 完全相等(0 起始索引严格匹配);±5 准确率允许绝对误差不超过 5 步;MAE 是有效数值输出的平均绝对步误差,按来源加权。角色准确率对显式输出的 $\hat{\rho}$ 单独计分,绝不允许从 $\hat{r}$ 的发出者反推。
论文所有实验结论都建立在这套独立双指标协议上,读懂指标才能理解认得出谁负责容易、定位到哪一步难这一核心发现。
免训练(training-free)方法
不对模型做微调、不引入可学习参数,仅靠提示词组织的多阶段 LLM 调用(如分段摘要、候选召回、最终归因)完成任务,成本主要是推理 API 调用:一条 m 段的轨迹约需 m+2 次调用。Who&When 的三种提示基线、ECHO、FALAT 与 RCTA 都属此类。
RCTA 与全部五个基线共用同一推理骨干 DeepSeek-V4-Flash、同一 1,140 条实例与同一评分协议,这样才能把差异归因于方法本身而非模型能力。
研究动机
当智能体经过上百步规划、工具调用与多角色协作后任务失败时,结果级评测只能告诉你失败了,却无法回答决定性错误是在哪一步进入轨迹、哪个角色应该负责,开发者只能人工翻查完整执行日志。已有失败归因基准的轨迹普遍太短:Who&When 平均仅 22.2 步、Who&When Pro 7.5 步、TraceElephant 20.5–29.3 次调用、RootSE 50.9 步、Failure as a Process 42 步,而本文测得的真实长轨迹中位数就有 145 步(均值 156.3、最长 728)。更棘手的是错误与其暴露位置相距很远:参考根因步中位在第 55 步,根因到轨迹结束的距离(root-to-end distance $(T-1)-r^*$)中位 48 步、90 分位 183 步、最大 605 步;49.0% 的轨迹在根因之后还有超过 50 步记录,28.4% 超过 100 步,7.7% 超过 200 步。最强基线在这样的数据上精确根因步准确率只有 13.2%,最弱的 FALAT 仅 2.8%,说明从上百步下游噪声中找出最早决定性错误这一能力远未解决。
本文的目标是本文要为长轨迹失败诊断建立可复现的评测基础设施,并给出一个更强的诊断方法。具体目标有三:第一,构建 LongRCA Bench——从 SWE-bench Pro、Terminal Bench 2、TravelPlanner、VitaBench、WebArena Verified 五个来源收集 1,140 条真实发生(非注入错误)的失败轨迹,覆盖软件修复、终端任务、旅行规划、服务型工具调用、网页交互五个领域,共 178,137 步记录;第二,为每条轨迹提供人工标注的责任角色与最早决定性根因步两个独立标签(22 名计算机专业研究生经 100 条轨迹校准后共提交 1,444 份注释,每条约 30–40 分钟),并把两个目标分开打分;第三,提出免训练的 RCTA 方法,在同一骨干模型、同一实例、同一评分协议下与五个代表性基线比较,验证分段召回加交接回溯能否显著提升长轨迹归因精度。
与已有工作不同的是,本文的独特切入点有三。第一,任务定义上的切分:把责任角色归因与最早根因步定位定义为两个独立预测、独立打分的任务,角色不得从所选步骤的发出者反推,避免方法靠选出某步再顺带推出角色来蒙混过关;且角色标签必须出现在轨迹记录的角色集合中,环境等外部主体不在输出空间内。第二,数据上的切入:坚持自然失败(不注入合成错误)、全量人工覆盖(1,140/1,140),并首次把根因到结束距离 $(T-1)-r^*$ 作为可量化的难度维度——现有基准要么靠错误注入(Who&When Pro)、要么只抽样人工校验,轨迹也普遍短一个数量级。第三,方法上的切入:RCTA 不做逐步线性扫描也不做递归二分,而是先粗后精——用分段摘要做廉价的全局候选召回,再把每个候选步回溯到更早的交接指令做原文级比对,把标注协议中指令已含错误则指令步为根因这一操作性规则显式编码进推理流程。
核心方法
先用一个直觉概括整体思路:在一条 145 步的失败轨迹里,真正的错误往往只有一两处,且常常藏在早期某个规划者到执行者的交接指令里,之后百余步都在忠实地执行一个错误计划,最终失败只是迟到的暴露。所以与其线性地从头读到尾,不如先快速缩小范围、再对少数候选做精细的证据比对。技术路线上论文做了两件事。其一是基准构建四阶段:筛选评测器确认失败的真实执行(排除基础设施、冒烟测试与调试运行,跨阶段去重)→把五种异构日志规范化为统一的 0 起始步索引历史(保留原始角色名、内容与时间顺序,不虚构步骤、不拆分不可分事件)→22 名研究生经 100 条轨迹校准协议后独立标注责任角色、根因步与轨迹证据理由→结构校验、多数共识、分歧仲裁与去重,产出 1,140 条带标注轨迹。其二是 RCTA 三段式流水线:(1) 规则分段(每段至多 80 个非重叠步、32,000 字符、附 5 步重叠上下文);(2) 每段一次 LLM 调用生成摘要并给出候选错误步 ID,再一次调用合并成按子目标组织的轨迹大纲,汇总候选并截取原文;(3) 将每个候选与相关早前交接指令的原文比对,独立输出角色与根因步,并由程序化校验器检查角色与步 ID 是否真实存在、引用文本是否有出处。
核心创新是候选召回与根因判定的分离,加上向交接指令的向后回溯。与已有方法的本质区别在于:Who&When 的 all-at-once、step-by-step、binary-search 都是把整条轨迹或其二分区塞给模型直接问答案;ECHO 用层级上下文加共识投票;FALAT 沿依赖图搜索——它们都没有显式建模多智能体系统中错误经由指令交接传播这一机制。RCTA 则把标注协议中的操作性规则直接编码进推理流程:若某条交接指令本身已含决定性错误、且下游照办未修复,根因就是该指令步骤而非执行步骤;若执行偏离指令或引入新错误,根因才是执行步;已被成功修复的错误不能作为根因;在多个有证据支持的候选中选最早引入者。这样,方法天然能把第 37 步规划者的错误 is_sequence API 计划、而不是第 163 步的最终完成报告选为根因。另外,角色与根因步在输出 schema 中就是两个独立字段、互不推导,评分前还有程序化校验器检查输出有效性(角色在角色集中、ID 为真实记录步、引用文本有出处、system evaluation 只能作为不评分的链尾),这保证了方法设计与评测协议的一致。
方法步骤详情
完整步骤如下。输入:任务指令、规范化轨迹 $H=(h_0,\ldots,h_{T-1})$、来源评测器的失败结果。第一步,步富化与分段:为每步标注角色、动作类型、验证信号等元数据;按规则切分为连续段——加入下一步将超过 32,000 字符则断段、每段至多 80 个非重叠步,边界可对齐 finish 步之后或角色交接/完成步之前(当前段需至少 8 步且 10,000 字符),验证信号变化前只需 10,000 字符;除首段外每段附带前段最多 5 步作为重叠上下文;此步不用语言模型。第二步,分段摘要与候选召回:每段一次 LLM 调用(DeepSeek-V4-Flash,关闭思考模式,输出上限 4,000 token),产出段落目的与带步骤 ID 的候选错误步及证据;再一次调用把相邻段摘要组织成 3–8 个按子目标划分的阶段大纲(开启高强度推理,上限 6,000 token)。第三步,候选检索与回溯:汇总各段候选 ID 并排优先级,截取每步原文,候选上限 80;对来自执行者或验证者角色 Y 的候选,检索最近一条发给 Y 的交接指令,其他候选取最近的早前交接作为计划上下文。第四步,最终归因:一次 LLM 调用(上限 8,000 token,截断则加倍重试)对比候选原文与交接上下文,按指令已含错误选指令步、执行偏离选执行步、已修复错误排除、选最早支持引入的规则,在独立字段中输出角色与根因步。第五步,程序化校验与重试:检查角色属于轨迹角色集、根因与证据 ID 均为真实记录步、引用文本与被引指令匹配(规范化子串或词重叠);无效字段携带校验反馈重试一次,仍无效则剔除不支持的字段并标记审查或弃权。一条 m 段轨迹约需 m+2 次调用。
技术新颖性
技术新颖性体现在四个层面。第一,评测协议新颖:此前没有基准同时以全量人工标注、自然失败、超长轨迹三个条件评估责任角色与最早根因步两个目标——Table 1 显示最接近的 Who&When 只有 184 条、22.2 步,RootSE 102 条、50.9 步,TraceElephant 220 条、20.5–29.3 次调用,而 LongRCA 是 1,140 条全人工覆盖、156.3 步。第二,难度刻画新颖:正式定义 root-to-end distance $(T-1)-r^*$ 并统计其分布(中位 48、P90 183、最大 605),把错误与失败的时间分离变成可复现的基准维度,并明确它不是标注的传播链长度。第三,方法结构新颖:分段摘要召回(降低长上下文的注意力稀释)+ 交接指令回溯(利用多智能体组织结构这一先验)+ 程序化出处校验(保证输出可审计)三者组合是新的;把标注决策规则写进推理流程这一点,与 RAFFLES、CHIEF 依赖评审循环或因果图回溯的路线都不同,也与 SAFARI 的选择性访问+短期记忆不同。第四,工程严谨性:三套提示词冻结并记录 SHA-256 哈希、20 个最终运行快照哈希一致、阶段化推理配置(摘要关闭思考、大纲与归因开启高强度)、无效输出重试与弃权机制、角色独立打分——这些让结果可复现、可审计。
实验结果
核心发现一:长轨迹根因定位极难。在全部 1,140 条轨迹、统一使用 DeepSeek-V4-Flash 的条件下(Table 4),最强基线 ECHO 的精确根因步准确率只有 13.2%,±5 准确率 24.7%,角色准确率 27.5%,根因 MAE 50.4;朴素的 all-at-once 提示精确准确率 7.6%,而依赖引导搜索的 FALAT 只有 2.8%、甚至低于 all-at-once,说明单纯的依赖图搜索在该场景失效。核心发现二:RCTA 在全部四个指标上领先,达到 51.1% 角色准确率、24.1% 精确根因准确率、37.4% ±5 准确率、MAE 38.6,相对 ECHO 分别提升 23.6、10.9、12.7 个百分点,MAE 降低 11.8 步。核心发现三:认得出谁负责与定位到哪一步的能力不对等——RCTA 的角色准确率(51.1%)几乎是精确步准确率(24.1%)的两倍,作者据此主张两个目标必须分开评测,否则角色得分会掩盖事件定位的短板。核心发现四(分层分析,Figure 6 与 Table 7/8):随轨迹变长准确率总体下降但不单调——RCTA 在 ≤100 步段为 30.3%,101–200 步段 20.3%,201–400 步 20.2%,>400 步段反而 31.0%(但该段仅 42 条且来源构成不同);按根因到结束距离分箱为 21.5%/27.1%/20.9%/25.6%。作者强调分箱之间混入了不同来源与工作流,这些只能作描述性关联结论,不能推断长度或距离的因果效应。此外附录 E 披露:1,140 条输出中有 308 条的阶段数落在请求的 3–8 之外,属于解析失败后的回退行为。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 责任角色归因(全部 1,140 条轨迹) | 角色准确率 | 51.1% | ECHO 27.5%(最强基线) | +23.6 个百分点 |
| 根因步定位 | 精确步准确率 | 24.1% | ECHO 13.2%(最强基线) | +10.9 个百分点 |
| 根因步定位(容差±5步) | ±5 准确率 | 37.4% | ECHO 24.7%(最强基线) | +12.7 个百分点 |
| 根因步定位误差 | 根因 MAE(步,来源加权) | 38.6 | ECHO 50.4(最强基线) | 降低 11.8 步 |
局限与改进
作者承认的局限有五点:标注层面,每条轨迹只保留一个最终角色标签、一个根因步标签与一份不评分的理由,不评测中间因果链重建;任务范围只覆盖事后离线诊断,不涉及早期预警或在线干预;全部方法用同一骨干 DeepSeek-V4-Flash,绝对数值会随骨干变化,结论仅在匹配骨干下成立;长度与距离分箱中来源、工作流、角色结构与失败分布相互纠缠,分层结论只是关联而非因果;RCTA 缺少组件消融,无法分离候选召回、交接回溯与校验各自的贡献。我自己的观察还有几点:第一,数据来源失衡,TravelPlanner 占 60.1%(685 条),结论对旅行规划与群聊式组织偏重,SWE-bench Pro 仅 128 条、Terminal Bench 2 仅 42 条;第二,人工标注本身一致性有限——冗余标注子集上根因步的完全一致率只有 39.5%、联合标签 38.4%,意味着金标准存在真实歧义,方法 24.1% 的精度与人工 39.5% 一致率之间的差距应谨慎解读;第三,标注成本高(全量阶段约 722–963 标注小时,不含校准与仲裁),扩展到更多领域不易;第四,论文未报告多次运行的方差或显著性检验,+10.9 个百分点的领先虽大但统计稳定性未给出;第五,失败轨迹仅来自三种生成模型,未来更强模型的失败模式可能不同。
独立分析的弱点
弱点一:精确步定位上限仍低(24.1%),MAE 仍有 38.6 步——在生产环境中平均偏差近 39 步的定位对开发者帮助有限;改进方向是把交接回溯做成多跳递归(沿指令链一直回溯到最早引入点),或引入反事实重放验证去掉该步失败是否消失。弱点二:最早决定性错误的定义依赖日志保留了交接指令原文,若框架不记录角色间交接(如单智能体顺序执行或工具内部日志),RCTA 的核心机制就退化为普通候选排序;改进方向是为无交接日志设计基于状态快照差异的回溯机制。弱点三:校验器只查引用文本是否出现这类形式正确性,不验证因果语义,模型可能引用真实指令却给出错误因果解读;改进方向是增加一层独立评审调用对因果论证打分,或要求给出最少反事实证据。弱点四:基准以 TravelPlanner 为主,根因步与角色分布可能偏向群聊式组织,固定角色团队(诊断-执行-验证)上的方法表现可能被低估;改进方向是按来源分层报告主要结果,或扩充软件工程域样本量。弱点五:推理成本随轨迹长度线性增长(700+ 步时需多次长上下文调用),且方法不利用跨任务的历史失败经验;改进方向是引入可检索的错误模式记忆(如 CORRECT 的错误 schema 蒸馏),或把 RCTA 的诊断输出蒸馏为更小的本地模型。
未来方向
作者明确提出的后续方向包括:对 RCTA 做组件消融,隔离候选召回、候选到交接的回溯、向后指令检查与校验各自的贡献;在匹配骨干下评测更多归因方法以拓宽比较面;设计匹配来源的受控实验,分离轨迹长度与根因距离各自的因果效应。基于其成果可以自然延伸的方向还有:其一,把 1,140 条带根因标注的轨迹用作过程奖励模型或失败预测器的训练数据,从课后诊断走向课中预防;其二,把评测从单一(角色,步)对扩展到完整因果链重建——RCTA 本就产出根因-传播-表现的链式解释,可为其设计评分协议;其三,在线版本:在执行过程中实时估计当前步是否已成为不可修复错误的根因,对接早停与干预策略;其四,在更强推理骨干上复测并研究跨骨干方差,检验结论的模型无关性;其五,跨任务错误记忆:把已诊断根因沉淀为可检索的错误 schema,使新轨迹诊断能复用历史证据;其六,把根因距离与人工一致率(步级仅 39.5%)本身作为研究对象,改进含歧义案例的标注协议与软评价指标。
复现评估
复现条件总体较好。基准层面:项目主页与排行榜公开(https://longrca-bench.github.io/),发布数据遵循明确 schema(Table 5):预测阶段只提供 question ID 与含任务指令的 history,mistake agent、mistake step、mistake reason 三个参考字段在预测期被保留(withheld);所有轨迹已统一为步索引历史,跨源评测可直接进行。方法层面:RCTA 免训练,唯一外部依赖是 DeepSeek-V4-Flash API;三套提示词冻结发布且 20 个最终运行快照的 SHA-256 哈希一致,附录 E 给出分段阈值(80 步/32,000 字符/5 步重叠/候选上限 80)、各阶段 token 上限(4,000/6,000/8,000,11 条轨迹用 16,000 并以 32,000 重试)与完整伪代码。算力上,一条 m 段轨迹约 m+2 次调用加校验,1,140 条轨迹的推理成本在普通实验室预算内可控。最难复现的是标注本身:22 名研究生的两阶段标注(100 条校准 + 1,444 份正式标注,每条 30–40 分钟,约 722–963 小时)加上分歧仲裁几乎无法低成本重做,多数团队只能直接使用发布标签或做增量标注。复现细节上还需注意:308/1,140 的输出阶段数落在请求的 3–8 之外(解析失败的回退行为),各阶段推理配置不同(摘要关闭思考、大纲与归因开启高强度),要严格按附录执行才能对齐报告数字。
论文图表
展示一条 SWE-bench Pro 失败轨迹的时间线:第 37 步诊断智能体 DiagnostAgent 在交接给执行者的修复计划中使用了与任务要求不一致的 is_sequence API,执行者照办,系统在第 163 步报告完成,但事后评测显示 47 个必需测试全部失败(0/47 通过);中间 126 步都是错误的下游传播,基线方法容易被晚期的执行者或最终错误吸引。
这是全文任务定义的具象化:根因在早期交接指令、失败在一百多步之后,root-to-end distance 这一难度维度的来源一目了然,也直观解释了为什么把责任归于晚期执行者是错误的。
条形图展示基准的来源构成:TravelPlanner 685 条(60.1%)、WebArena Verified 177 条(15.5%)、SWE-bench Pro 128 条(11.2%)、VitaBench 108 条(9.5%)、Terminal Bench 2 42 条(3.7%),合计 1,140 条。
直接暴露了数据集来源失衡这一重要事实:六成轨迹来自旅行规划域,解读总体指标和分层数据时必须考虑这一构成偏差。
双面板统计图。面板 (a) 给出总轨迹步数(中位 145、均值 156.3、P90 268、最大 728)、裁定根因步位置(中位 55、P90 179、最大 521)与根因到结束距离(中位 48、P90 183、最大 605)三个分布;面板 (b) 给出根因先于最终失败超过 50 步的轨迹占 49.0%(n=559)、超过 100 步占 28.4%(n=324)、超过 200 步占 7.7%(n=88)。
用数据量化了长程诊断难度的核心维度:错误引入与失败暴露之间的时间分离普遍存在且跨度巨大,这是论文区别于既有短轨迹基准的关键证据。