← 返回 2026-08-25

ClawProBench:具备运行时覆盖与冻结工作区留存集的轨迹感知智能体评测基准 ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

YuanHang Xiao 📅 2026-08-23 👍 4 2026-08-30 18:30
可靠性分析 基准测试 安全门控 智能体评测 轨迹评分 运行时敏感性

以执行轨迹联合诊断“模型+运行时”配置的能力、可靠性与运行时敏感性

前置知识

声明式配置(Declared Configuration)

指被评测的完整智能体系统捆绑包:模型端点、提示词包装、控制器、运行时与工具、schema、安全过滤器、执行策略、检查器与评分代码的总和。ClawProBench 认为评测对象是这一整套配置而非裸模型,排行榜分数归属于声明的“模型+运行时”捆绑包,而不是模型名称本身。

本文所有实验(运行时版本扫描、跨 harness 比较)都建立在“分数属于完整配置”这一前提上;不理解它就无法理解为什么同一个模型换运行时分数会变化。

pass@k 与严格三试通过

每个场景固定执行 3 次试验。pass@k-any 指 k 次中至少一次成功;严格三试通过(Pass3,即 pass@k-all)要求三次全部成功。论文还用 $p_{all}=(\mathrm{Pass3})^{1/3}$ 与 $p_{any}=1-(1-\mathrm{Pass@3})^{1/3}$ 构造排行榜复合分。

留存集上 0.6638 对 0.2890 的巨大口径差距是论文核心发现之一,必须理解“至少成功一次”与“每次都成功”的区别才能读懂可靠性分析。

非补偿性安全门 $G_{safety}$

评分公式中的严重性感知门控:一旦发生严重安全违规(如越权操作、未经审批的破坏性行为),无论正确性与过程分多高,试验分都会被门控压低甚至归零——安全失败不能用其他维度的高分来补偿,体现“正确但危险不等于好”的评测哲学。

它是试验分公式 $S_{trial}$ 的最外层因子,也是理解论文安全场景设计、审批边界检查和失败模式分析的关键。

Spearman 等级相关与 tie-aware bootstrap

Spearman $\rho$ 衡量两个排行榜排名之间的单调一致性,取值范围 $[-1,1]$。本文在模型层面做考虑并列名的 bootstrap 重采样,给出 95% 置信区间,例如全量档案对留存集的 $\rho=0.1754$,区间 $[-0.23, 0.54]$ 跨越零点。

论文反复强调“不支撑精确排序声明”,只有读懂置信区间跨零的统计学含义,才能正确解读跨轨道相关性这类描述性结论。

冻结留存集(Frozen Holdout)

由稳定选择器 realistic-holdout-68-20260511 锁定的 68 个工作区场景:场景身份、终态契约与检查器接口全部固定。候选集经过 6 模型面板 live 校准,剔除了饱和、聚集或相同失败的任务。它使可靠性分析与跨运行时比较不随全量档案演化而漂移。

它是重复试验可靠性测量和 OpenClaw/IronClaw/NanoClaw 三 harness 固定契约比较的共同基础,没有它就没有可对齐的跨运行时评测。

研究动机

现有智能体评测大多把行为压缩成最终任务成功率:WebArena、OSWorld、TheAgentCompany、ToolBench 等基准验证了浏览器、桌面与工作流环境中的交互能力,但一个“最终答案正确”的智能体仍可能用错了工具表面、跳过了获取必要证据的步骤、违反审批边界、浪费性地反复重试,或留下用户与审计者无法检查的轨迹。近年 WildClawBench、Claw-Eval、ClawMark 等虽然把 live 执行、轨迹证据、安全性或鲁棒性引入评测,但各自只覆盖问题的一个侧面:没有哪个排行榜同时测量原生运行时表面覆盖、重复试验可靠性、执行状态语义与过程证据,并把它们整合到同一个可审计协议下。此外,多数排行榜的行不绑定运行时版本、适配器版本或检查器哈希,模型能力与运行时行为混在一个数字里,跨系统比较的含义因此变得模糊。

本文的目标是本文的目标是构建一个轨迹感知的智能体基准,对“声明的模型+运行时配置”做联合诊断,而不是给出裸模型的单一智力分数。具体包括三条主线:其一,建立 102 场景的全量 live 档案,含 66 个工作区任务与 36 个 OpenClaw 原生表面任务,覆盖约束、恢复、规划、安全、综合、工具 6 个能力维度以及 skills、browser、memory、messages、sessions、directory、cron、agents 委派 8 个原生表面;其二,建立冻结的 68 场景工作区留存集,以固定契约支撑重复试验可靠性与跨运行时比较;其三,用安全门控的轨迹评分公式结合正确性、过程质量与效率打分,同时保留执行状态与失败检查证据,使每个分数都能定位失败发生在哪一环。

与已有工作不同的是,论文的独特切入不在于任何单一要素的首创性——作者明确承认 live 执行、轨迹、重复试验、安全性都已有先例——而在于把这些要素整合成“每个配置的联合诊断”:同一协议下,原生场景定位运行时路由与表面使用失败,冻结工作区留存集诊断重复可靠性并支持固定契约的跨运行时比较,轨迹组件与状态语义区分系统究竟败在终态、证据获取、原生路由、安全边界、执行状态还是重复可靠性。配套的运行时适配契约不通过“工具重命名”假设原生场景可移植,而是要求适配器把工作区状态、轨迹事件、证据元数据、产物后置条件、安全标签映射进统一的评测记录,使跨 harness 比较第一次拥有了显式、可检查、带哈希绑定的接口。

核心方法

直觉上,评测对象应从“模型答题”升级为“模型通过运行时完成真实工作”,因此每次试验都应从执行轨迹中取证打分,而非只看最终输出。技术路线上,ClawProBench 让两条轨道共享同一条 live 执行、轨迹捕获、状态报告与安全门控评分管线:全量档案含 102 个活跃场景(66 个 workspace-live、36 个 native,91/102 为 hard/expert),冻结留存集含 68 个闭世界 JSON 契约的工作区场景。每场景跑 3 次试验,试验分为 $S_{\mathrm{trial}} = G_{\mathrm{safety}}\,(0.65C + 0.35P)(1-E)$,其中 $C$ 是终态与产物正确性检查的得分率,$P$ 由所需工具集恰当性、有序子序列覆盖、冗余步控制或场景专属评分细则给出,$E$ 惩罚超出最优步数估计的过量工具调用,$G_{\mathrm{safety}}$ 是非补偿性的严重性感知安全门。聚合时三试分数按场景平均,再按难度权重 1/2/4/8 在维度内平均,最后按维度权重(工具与规划 0.20,其余维度各 0.15)合成总分。

核心创新是把“一个分数”变成“一组诊断视图”,与已有基准的本质区别有三点。其一,原生表面场景(skills、browser、memory、messages、sessions、directory、cron、agents 委派)与工作区证据任务互补,能定位“最终答案对但走错了运行时路径”的失败:实测原生切片均分 0.5238,显著低于工作区的 0.6415。其二,过程信用有界:公式中 $C$ 权重 0.65、$P$ 的最大直接成本 0.35——即便 $C=1, P=0, G_{\mathrm{safety}}=1, E=0$ 也能得 0.65——过程分歧永远不会主导结果;效率惩罚 $E$ 同样被限制在不能压过任务成功。其三,执行状态与来源绑定是一等公民:干净基线运行、重跑后干净、含执行失败的运行是不同测量条件,每个结果行绑定模型端点、运行时版本/摘要、适配器版本、基准与检查器哈希、超时与重试策略。权重是声明的正确性主导策略而非拟合参数:0.50/0.50 与 0.80/0.20 的 C/P 权重消融对基线的 Spearman 分别为 0.9638 与 0.9781,结论对权重选择稳健。

方法步骤详情

第一步,场景构建:每个场景是结构化 YAML 规范,含元数据、工作区输入、期望表面、检查项与可选的自定义 Python 评分器,经静态校验、检查器导入编译、试运行与合成标准答案探针验证。第二步,留存集冻结:候选批在 6 模型面板上 live 校准,剔除饱和、聚集或相同失败的任务,由选择器 realistic-holdout-68-20260511 冻结 68 个场景的身份与 JSON 契约。第三步,执行与轨迹捕获:每次试验在全新隔离的工作区副本上进行,缓存与记忆跨试验隔离,规范化记录观测、工具调用、参数、结果与产物。第四步,评分:检查终态输出、工具调用与参数、顺序(仅当声明能力要求证据先于行动或原生路由)、恢复行为与审计状态;YAML 检查不足时用确定性自定义评分器。第五步,聚合:三试分数按场景平均,按难度权重 1/2/4/8 在维度内平均,再按维度权重(工具与规划 0.20、其余 0.15)合成总分,并报告效率惩罚前的能力分与各通过口径。第六步,跨运行时:适配器按契约映射场景身份、模型身份、终态 schema、轨迹事件、证据元数据、后置条件与安全标签,每行绑定运行时与适配器版本。

技术新颖性

与最接近的 WildClawBench(live OpenClaw 环境、保留运行工件)和 Claw-Eval(轨迹级证据、完成、安全与鲁棒性)相比,本文的贡献不是新要素本身,而是联合诊断框架与显式可移植契约。36 个原生场景被明确声明不可通过工具重命名移植;跨运行时评测从工作区留存集出发,要求适配器把场景身份、模型身份、终态 schema、规范化轨迹、证据与工具元数据、产物后置条件、安全标签、确定性评分与状态报告等语义层映射进统一记录(Table 3 给出完整契约)。评测语义上,把执行状态(成功、超时、重试、提供商失败、未解决失败)作为排行榜可见元数据而非隐藏项;把污染风险管理(分级发布、暴露标签、退役记录)写进基准契约。替代路径的处理(Table 5)区分了“有效替代路线”与“实质过程失败”:正确的替代推理路线得满分,但缺失必要证据或只在文本中模拟原生表面调用会被扣分,这避免了要求逐字匹配参考轨迹的僵化评分。

CLAWPROBENCH overview. A 102-scenario runtime-coverage profile and a frozen 68-scenario realistic holdout feed the same live execution, trace capture, status reporting, and safety-gated scoring pipeline.
Figure 1: CLAWPROBENCH overview. A 102-scenario runtime-coverage profile and a frozen 68-scenario realistic holdout feed the same live execution, trace capture, status reporting, and safety-gated scoring pipeline.
Full-profile scenario composition. The 102-scenario profile covers six capability dimensions, is deliberately skewed toward hard/expert tasks (91/102), and separates 66 workspace-live tasks from 36 OpenClaw-native tasks.
Figure 2: Full-profile scenario composition. The 102-scenario profile covers six capability dimensions, is deliberately skewed toward hard/expert tasks (91/102), and separates 66 workspace-live tasks from 36 OpenClaw-native tasks.

实验结果

①未饱和:最高分 0.7671,top-5 差距 0.0661;GPT-5.5 Final 0.679 居首,Gemini-3.1-Pro 0.540 垫底。②原生切片更难:native 均分 0.5238 对工作区 0.6415,分层后仍 >0.10。③可靠性缺口:37 个留存条目 pass@k-any 0.6638,严格三试仅 0.2890。④排序:全量对留存 ρ=0.1754,CI [-0.23,0.54] 跨零;对原生 0.7612。⑤口径敏感:正确性均值对复合分 ρ=0.8060,最大排名移动 46 位。⑥版本敏感:4 模型 × 4 版本共 3,264 条记录全部成功,同模型分差最大 0.0519、严格 3/3 极差 10/68(14.7pp),与跨模型分差 ≈0.041 同量级。⑦harness 敏感:12 单元 2,448 条记录全部成功,分差最大 0.0716、严格极差 13/68(19.1pp);最佳 harness 依模型而变(Kimi/GLM→NanoClaw,Qwen→IronClaw)。⑧主要失败:结构约束、证据缺失、审批/时间边界错误、运行时路由。

CLAWPROBENCH at a glance. The full profile tests runtime coverage; the frozen holdout tests reliability under fixed realistic tasks.
Table 1: CLAWPROBENCH at a glance. The full profile tests runtime coverage; the frozen holdout tests reliability under fixed realistic tasks.
Scenario construction and validation protocol. The benchmark records both broad runtime coverage and a separately frozen realistic holdout.
Table 2: Scenario construction and validation protocol. The benchmark records both broad runtime coverage and a separately frozen realistic holdout.
Runtime adaptation contract for the workspace holdout. An adapter preserves task and measurement semantics while using the target runtime's native dispatcher.
Table 3: Runtime adaptation contract for the workspace holdout. An adapter preserves task and measurement semantics while using the target runtime's native dispatcher.
Representative full-profile model diagnostics. Rows are nine public models with complete paper-facing diagnostics.
Table 4: Representative full-profile model diagnostics. Rows are nine public models with complete paper-facing diagnostics.
Alternative-route treatment. Correctness follows end-state and artifact postconditions.
Table 5: Alternative-route treatment. Correctness follows end-state and artifact postconditions.
Diagnostic evidence beyond the leaderboard. Primary expanded views use the 29-model cross-profile denominator and all 66 component-resolved scoring rows.
Table 6: Diagnostic evidence beyond the leaderboard. Primary expanded views use the 29-model cross-profile denominator and all 66 component-resolved scoring rows.
Configuration sensitivity across four OpenClaw releases from March through June 2026.
Table 7: Configuration sensitivity across four OpenClaw releases from March through June 2026.
Matched three-harness configuration comparison across OpenClaw v2026.6.11, IronClaw, and NanoClaw.
Table 8: Matched three-harness configuration comparison across OpenClaw v2026.6.11, IronClaw, and NanoClaw.
Frozen-holdout reliability and rank robustness. Over 37 evaluated 68-scenario holdout entries, pass@k-any exceeds strict three-trial success (0.6638 vs. 0.2890).
Figure 3: Frozen-holdout reliability and rank robustness. Over 37 evaluated 68-scenario holdout entries, pass@k-any exceeds strict three-trial success (0.6638 vs. 0.2890).
Scoring views are not interchangeable. The plotted fixed-denominator view covers 60 resolved positive-score full-profile reports.
Figure 4: Scoring views are not interchangeable. The plotted fixed-denominator view covers 60 resolved positive-score full-profile reports.
查看结构化数据
任务指标本文基线提升
全量档案排行榜(102 场景 × 3 试) Final 复合分 / Avg 安全门控轨迹分(0–1) 清单最高 0.7671(能力分 0.7796);面板最高 GPT-5.5:Final 0.679、Avg 0.693 面板最低 Gemini-3.1-Pro:Final 0.540、Avg 0.581 top-5 分差仅 0.0661,头部模型仍未饱和,工具使用维度(0.60–0.78)普遍强于综合维度
OpenClaw 原生表面任务(36 场景,8 种表面) 场景平均轨迹分 0.5238 工作区 live 任务 0.6415 分层后差距仍大于 0.10,证明原生路由/表面使用是工作区分数掩盖不了的互补诊断信号
冻结工作区留存集(68 场景,37 个干净条目) pass@k-any 对 严格三试通过率 0.6638 对 0.2890 同一批试验的两种统计口径 0.3748 的差距量化了“一次成功不等于稳定成功”,说明单次通过率会高估智能体可靠性
运行时版本扫描(4 模型 × 4 个 OpenClaw 版本,16 单元) 同模型聚合分极差 / 严格 3/3 场景数极差 0.0519(deepseek-v4-flash)/ 10/68 即 14.7 个百分点 同版本内跨模型最大分差约 0.041 版本效应与模型效应同量级,证明在每行绑定运行时版本是实质性要求而非记账
跨 harness 比较(OpenClaw/IronClaw/NanoClaw,12 单元) 同模型聚合分极差 / 严格 3/3 场景数极差 0.0716(qwen3.6-plus)/ 13/68 即 19.1 个百分点(deepseek-v4-flash) OpenClaw 版本内扫描最大 0.0519 与 10/68 harness 效应超过版本效应,且最佳 harness 依赖模型(Kimi、GLM 在 NanoClaw 最佳,Qwen 在 IronClaw 最佳)
评分口径敏感性(66 行组件解析视图) Spearman 相关 / 最大排名移动 0.8060 / 46 位(无加权正确性均值 对 源报告复合分) 60 行正分过滤视图为 0.8334 / 42 位 不同评分视图不可互换,排行榜必须披露口径;C/P 权重消融(0.9638 与 0.9781)则显示声明权重稳健

局限与改进

作者承认的局限:基准测量的是“模型+运行时”配置而非脱离 harness 的模型能力;三 harness 比较固定了模型身份与工作区契约,但没有隔离 wrapper、路由、工具 schema、安全层或控制器机制,属于配置级证据而非单组件因果消融;覆盖受限于当前任务域、语言、模型访问路径与可用 provider 配置;冻结留存集是校准选择器冻结而非永久未见的私有测试集,公开带来过拟合风险;native 与 workspace 的差距在分层后仍大于 0.10,但检查器密度与输出格式差异也可能是原因;跨轨道排序相关区间跨零,不做稳定排序推断;失败分类由失败检查详情自动聚类,只能当审计优先级而非真实流行度。我的补充观察:这是单作者项目,102/68 的场景规模偏小,严格 3/3 口径下 1 个场景约值 1.5 个百分点、分辨率有限;效率项 $E$ 依赖“最优步数估计”,其设定方式对探索型策略是否公平未展开;留存集场景为合成的 workplaces 式请求,对真实用户任务的生态效度未经外部验证。

独立分析的弱点

独立分析的弱点与改进方向:①留存集一旦公开就会被曝光,过拟合风险随时间累积——建议尽快实现自动化的场景轮换、延迟释放与提交暴露标签(论文已提出协议但尚未落地为可执行机制)。②跨 harness 差异是配置级证据,无法归因到具体组件——建议做受控消融,例如固定 wrapper 与安全层只替换路由器,或固定路由只替换工具 schema,把 0.0716 的同模型分差分解到具体机制。③原生剖面只在 OpenClaw 上实例化,native 对 workspace 的 0.1177 差距可能混入检查器密度与输出格式差异——建议为第二个运行时构建检查器密度匹配的原生剖面做对照。④严格 3/3 口径在 68 个场景上分辨率粗糙且对超时/重试策略敏感——建议扩大留存集或对可靠性指标给出置信区间。⑤效率惩罚 $E$ 依赖最优步数估计,可能系统性惩罚合理的探索型策略——建议按任务族校准步数估计并报告 $E$ 的敏感性分析。⑥跨运行时研究仅覆盖 4 个模型身份,结论向更大模型池外推的稳健性未知,应扩展模型面板。

未来方向

作者提出的方向:未来排行榜刷新采用分级、延迟释放或轮换场景,配合已发布哈希与提交暴露标签管理污染;把评测契约扩展到更多运行时、语言、模型访问路径与部署设定;将失败分类从自动聚类升级为更可信的审计体系。基于本文成果可延伸的研究:把运行时适配契约标准化为开源的轨迹中间表示(类似评测界的 schema 规范),降低新 harness 的接入成本;在已有的 agents 委派表面之上构建多智能体协作与委派深水区场景;引入成本维度,绘制质量—可靠性—开销的前沿曲线(论文已从公开数据文件读取资源成本,说明数据可得);对运行时组件(路由、工具 schema、安全层)做单变量因果消融;把三试协议扩展到更多试验,并结合成本感知的 pass^k 估计研究可靠性与预算的权衡;为留存集增加多语言与非英语工作区任务以检验结论的语言泛化性。

复现评估

开源情况:项目页 suyoumo.github.io/bench 与代码库 github.com/suyoumo/ClawProBench 公开;场景以 YAML 规范发布,自定义检查器与所评场景打包,选择器 realistic-holdout-68-20260511、场景与检查器哈希、行级来源 schema、状态标签与分级发布协议均有文档,确定性检查器使评分复现相对容易。复现门槛:需要部署 OpenClaw(跨运行时研究还需 IronClaw 与 NanoClaw)并访问十余个商业模型 API(GPT-5.5、Claude Sonnet 4.6、Gemini-3.1-Pro、Kimi-K2.6、GLM-5.1、Qwen3.6-Plus、Doubao Seed 2.0 Pro 等)。计算量:每场景 3 试 × 102/68 场景 × 多模型 × 多版本,API 费用与挂钟时间可观,论文本身也从公开排行榜数据文件读取资源成本而非重跑。总体评估:协议与评分复现为中等难度(有哈希与状态绑定保护),完整复现跨 harness 矩阵则需要可观的 API 预算与运行时环境搭建经验。