← 返回 2026-08-25

一次成功不等于可靠:面向有状态业务工作流的智能体沙箱与基准 Thinkingbox One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy 📅 2026-08-20 👍 12 2026-08-30 18:30
MCP 可靠性基准 工具调用 智能体评测 有状态工作流 沙箱环境

沙箱+基准揭示:智能体一次成功容易,可靠完成有状态业务工作流仍很难

前置知识

MCP(Model Context Protocol)

一种标准化协议,让 LLM 应用通过统一接口发现并调用外部工具服务器。每个 MCP 服务器暴露一组带 JSON 参数模式的工具,模型以函数调用方式请求执行,服务器返回结构化结果。本文沙箱把零售、酒店、保险、银行等领域的后端系统封装为 MCP 兼容工具,并为每次评测创建隔离会话,保证任务可重置、可复现。

Thinkingbox 的工具环境、会话隔离与整个交互循环都建立在 MCP 之上:每次尝试都会重建隔离的 MCP 工具会话并从中提取副作用,不理解 MCP 就无法理解沙箱如何做到同一任务世界的干净重置与可复现实例化。

POMDP(部分可观测马尔可夫决策过程)

一种决策过程形式化:智能体无法直接观测真实状态,只能通过观测选择动作。论文把每个任务 $x=(b_0,g,\mathcal{T},U,C)$ 形式化为有限视野 POMDP $M_x=(S_x,A_x,O_x,P_x,Z_x,R_x,\mu_x,H)$,隐状态 $s_t=(b_t,z_t,\ell_t,q_t)$ 包含后端状态、模拟用户私有状态、事件日志与回合状态,奖励稀疏且只在终止时由可执行判定 $V$ 给出。

这是论文的理论骨架:它解释了为什么评测必须检查终态与副作用而非对话表面(奖励只在终止时由 $V$ 给出),也说明了模拟用户属于环境动力学 $P_x,Z_x$ 而非第二个决策者,从而使不同模型行之间可比。

pass@k 与 pass^k

pass@k 估计 k 次独立尝试中至少一次成功的概率,用无偏估计器 $\mathrm{pass@}k=\frac{1}{M}\sum_i\left[1-\frac{\binom{n-c_i}{k}}{\binom{n}{k}}\right]$;pass^k 估计 k 次全部成功的概率,论文采用 plug-in 估计器 $\mathrm{pass\hat{}k}=\frac{1}{M}\sum_i\left(\frac{c_i}{n}\right)^k$,因为 τ-bench 的无偏版本在成功次数 $c_i<k$ 时恒为零、分辨率不足。前者衡量发现成功轨迹的能力,后者衡量可靠重复执行的能力。

论文标题「一次成功不等于可靠」正建立在 pass@20 与 pass^20 的巨大差距上:Qwen3.8-27B 前者 89.35%、后者仅 7.50%。区分这两个指标是读懂全部实验结论(Table 11、Figure 3、Figure 4)的前提。

副作用与终态判定

副作用指工具调用对持久后端(数据库)造成的写入性改变,如退款、改预订、建工单。Thinkingbox 在交互结束后用 $e=\Delta_x(s_0,s_T,\rho)$ 提取状态变更与动作记录,再做合取判定 $V(x,\rho)=\prod_{i=1}^{m} c_i(s_T,e,\rho)\in\{0,1\}$:任务只有当全部隐藏检查通过才算成功,能拒绝错误、缺失或多余的持久效应。

这是本文与检查单次调用正确性的 BFCL 类基准的本质区别;Table 12 显示 84.86% 的失败试验看起来已干净完成,只有理解终态合取判定 $V$ 才能明白它们为何被拒,以及 43.30% 的多余副作用如何被检出。

用户模拟器

扮演任务用户的 LLM(本文固定 GPT-5.4-mini,温度 0.3),只依据任务的用户规格(开场请求+可披露事实集)和用户可见的对话历史生成回复;不能发明事实、不改目标、只答所问、最多 10 轮追问。它是环境的一部分,对所有被评智能体保持一致,使不同模型行之间可直接比较。

多轮业务任务的正确动作往往依赖用户才透露的信息,模拟器的「闭世界」设计使追问澄清成为硬需求;它对所有被评智能体固定不变,正是评测结果可以完全归因于智能体策略的原因。

研究动机

可执行评测正成为智能体评测主流:SWE-bench 用测试套件检查代码补丁,BFCL、ToolBench 检查函数调用,WebArena、OSWorld 在交互环境中打分。但这类设计天然偏向结果容易定义的任务,而真实业务代理要做的是改订单、办退款、处理理赔、路由内部工单——这些工作多轮、有状态、有后果,需要协调用户追问、领域政策约束、相互依赖的工具调用以及正确的持久状态转移。函数调用式评测只验证调用是否语法合法或可执行,无法验证工作是否真正完成:论文指出智能体可能对错误的实体调用正确的 API、在收集必要确认之前就写库、输出得体的用户回复但后端毫无变化、或执行违反政策的额外副作用。换言之,「看起来完成了」与「真正完成了」之间存在系统性裂缝,而现有基准缺少能直接度量这一差距的基础设施。

本文的目标是本文要为有状态业务工作建立可执行评测的完整基础设施。目标有三:其一,构建 Thinkingbox——一个可复用的工具-智能体-用户交互沙箱,在单一可复现循环中运行智能体、固定模拟用户、隔离的 MCP 领域工具、副作用提取器与可执行裁判,使每次尝试都重置到相同初始状态;其二,在其上构建 Thinkingbox-Bench:507 个政策约束的工作流任务,覆盖零售/电商、旅行酒店、车险、新银行内部 IT 支持、咨询 IT/HR 支持五个领域,每个任务用终态+副作用(另 30 个任务附加对话 rubric)的可执行检查合取评分;其三,按可靠性导向的评测惯例每任务独立跑 N=20 次试验,用 pass@1、pass@k、pass^k 三个指标区分「偶然发现成功轨迹」与「可靠重复完成」,并对 17 个专有与开源模型排出榜单、剖析失败模式。

与已有工作不同的是,本文的独特切入是以副作用为中心的终态判定,而非检查单个工具调用或参考轨迹。与 τ-bench、τ²-bench 相比,它把五个手工审核的业务领域、任务特定评估器、附带效应检查与重复试验可靠性统一进一个沙箱;与 AppWorld 相比它加入了用户对话与政策条件;与 MCP-Atlas、MCPMark 的真实服务器 CRUD 任务相比它强调政策约束下的多轮人机协作。三个设计凸显差异:(1) 用户规格拆为开场请求加单独的可披露事实集,信息只在被问到时才释放,使追问澄清成为硬需求;(2) 检查接受不同的合法工具调用路径——只要终态正确即给分,但拒绝改错记录、越权更新等附带效应;(3) 同一沙箱的判定 $V$ 直接可用作训练奖励,单个检查还能给出奖励向量 $r_i(\rho)=c_i(b_T,e,\rho)$,使评测与训练共用一套环境。

核心方法

直觉上,论文把「办理一笔业务」变成一个可执行的测试用例:准备一个充满关联记录的初始数据库、一个信息不全的用户请求、一组领域工具和一份隐藏的黄金终态,然后看智能体能否在与模拟用户的多轮对话中把数据库推进到正确状态。技术路线分四步:先把任务形式化为 $x=(b_0,g,\mathcal{T},U,C)$——初始后端状态、用户目标、领域工具集、模拟用户策略、隐藏检查集 $C=\{c_i\}_{i=1}^m$,并说明其诱导一个有限视野 POMDP;再由编排器驱动交互循环:重置状态、创建隔离 MCP 工具会话、转发消息、执行工具调用、记录完整轨迹 $\rho$,回合上限为 10 次模拟用户追问外加独立的工具调用上限;交互终止后提取副作用 $e=\Delta_x(s_0,s_T,\rho)$;最后计算合取判定 $V(x,\rho)=\prod_i c_i(s_T,e,\rho)$,作为奖励与 pass 指标的原子信号。同一循环原样用于推理评测、失败分析与训练采样。

核心创新是「面向工作成果而非轨迹表面」的评分方式。已有基准要么检查单次调用的语法与可执行性(BFCL、ToolBench),要么检查一条参考答案,要么只看终态数据库(τ-bench)。Thinkingbox 的判定是任务特定检查集合的合取:确定性比对终态数据库哈希并报告字段级差异,能同时检出错误值、缺失的必需副作用和多余的非预期副作用,因此它接受多条不同的合法路径——允许更换检索顺序、从工具错误中恢复、额外澄清——却拒绝改错实体、未确认即写入、越权更新这类政策违规。第二个关键想法是把模拟用户严格约束为闭世界、被动响应的实体:只复述上下文中的事实、绝不代劳,使信息引出成为智能体的必答题。第三个想法是评测与训练共用同一沙箱与奖励定义:替换策略时,用户模拟器、工具会话、副作用提取与奖励全部复用。

方法步骤详情

任务构建分三阶段并配六项人工审查。阶段一,工作流设计:从非公开的企业支持与运营案例库提炼五个领域的复现模式(订单/退款变更、预订修改、理赔、账户支持、内部 IT/HR 请求),每个模板须含真实用户目标、领域工具、政策约束和可验证结果,并以合成记录自洽重写(五个虚构组织:TechHome Direct、StayBridge、HorizonShield、Velocity Digital Bank、Meridian)。阶段二,可执行实例化:为每任务创建含关联记录的初始后端状态、暴露 MCP 读写工具、规定模拟用户的开场请求与可披露事实集及行为规则、附上决定允许/必需/禁止动作的领域政策,并编写针对终态、副作用与对话的检查。阶段三,验证过滤:在沙箱内实际运行,剔除工具损坏、初始状态不一致、目标含糊、结果不可验证、检查依赖调用轨迹或反复不终止的用例;每个保留任务经清单唯一性、隐私一致性、政策可解性、执行重置、黄金态与 rubric、完整 rollout 审查六道检查。评测时每模型每任务独立 N=20 次(共 10,140 次试验/模型),智能体温度 1.0、中等推理力度。

技术新颖性

技术新颖性有五点。(1) 副作用提取器 $\Delta_x$ 可由任务作者定制,把「什么算这次工作的状态变更」参数化,使同一沙箱适配异构领域。(2) 终态判定用哈希级比对加字段级差异报告,能检出 98.95% 失败试验中的数据库不一致,其中 56.99% 是集合长度不匹配(如多建/漏建记录)——仅看回复或单次调用不可见。(3) 指标上为 pass^k 选用 plug-in 估计器 $(c_i/n)^k$,绕开 τ-bench 无偏估计在 $c_i<k$ 时恒为零、难以区分弱模型的缺陷。(4) 数据管线采用「私有案例库→合成重建」,用关系保持的合成数据(订单连着客户与履约历史、保单连着驾驶员/车辆/理赔)既规避隐私又保留评估器区分正确动作与改错记录所需的推理结构。(5) 规模化可靠性研究:17 个模型 × 507 任务 × 20 次试验,并对 121,680 条有效轨迹做回溯性评估器消融与四类失败签名分析,这种「发现-可靠性差距」的系统量化是此前基准未给出的。

Overview of THINKINGBOX
Figure 2: Overview of THINKINGBOX

实验结果

榜单(Table 4):Claude Opus 5 以 66.50% pass@1 居首(零售 80.71%、银行 70.63%、咨询 66.19%,但预订仅 49.95%),GPT-5.4 以 65.36% 紧随并在预订领域以 68.13% 领跑;开源最强 Qwen3.8-27B 达 51.70%,超过 1.6T/49B 的 DeepSeek-V4-Pro(43.26%);尾部坍塌:o3-pro 20.60%、Grok-4.3 14.38%、Mistral-Large-3 4.66%、MiniMax-M2.5 0.19%。可靠性(Table 11):Claude Opus 5 pass^20=47.53% 为唯一超 40% 者,GPT-5.4 pass@20 最高 91.12% 但 pass^20 仅 25.25%;Qwen3.8-27B pass@20 达 89.35% 而 pass^20 只有 7.50%,Grok-4.3 与 Mistral-Large-3 的 pass^20 为 0;Claude Opus 5 有 106 个任务 20 次全败、241 个全胜。领域难度(平均 pass@1):零售最易 55.79%,车险最难 31.10%。失败签名(Table 5):工具使用错误平均占 79.9%(Claude Opus 5 达 96.4%)、错误状态更新 9.4%(o3-pro 27.8%)、用户侧解决不完整 7.5%(DeepSeek-V4-Pro 24.7%)、未做状态变更仅 3.2%。评估器消融(Table 12,79,853 条失败试验):84.86% 干净终止、80.88% 还执行过写工具、67.24% 终末工具响应无显式错误——按表面信号评分大多数失败会被误判为成功;98.95% 的失败被数据库哈希不匹配捕获。轨迹统计(Table 14/15):GLM-5.1 平均 44.86 条消息、Qwen3.8-27B 平均 12.11 次工具调用,均未胜过 GPT-5.4。

Comparison with representative agent and tool-use benchmarks
Table 1: Comparison with representative agent and tool-use benchmarks
Key statistics for the THINKINGBOX-BENCH domains
Table 2: Key statistics for the THINKINGBOX-BENCH domains
Representative THINKINGBOX-BENCH scenario patterns
Table 3: Representative THINKINGBOX-BENCH scenario patterns
THINKINGBOX-BENCH pass@1 (%) by domain
Table 4: THINKINGBOX-BENCH pass@1 (%) by domain
Failure mode breakdown (%)
Table 5: Failure mode breakdown (%)
Composition of the 507-task evaluation set
Table 6: Composition of the 507-task evaluation set
Artifacts in a final Thinkingbox-bench case and the corresponding construction or review question
Table 7: Artifacts in a final Thinkingbox-bench case and the corresponding construction or review question
Representative evaluator targets drawn from the final task families
Table 8: Representative evaluator targets drawn from the final task families
Azure API inference parameters for the agent, fixed GPT-5.4-mini simulated user, and fixed GPT-5.4-mini response judge
Table 9: Azure API inference parameters for the agent, fixed GPT-5.4-mini simulated user, and fixed GPT-5.4-mini response judge
vLLM serving parameters for the locally hosted Qwen-series models
Table 10: vLLM serving parameters for the locally hosted Qwen-series models
Repeated-trial discovery and reliability on Thinkingbox-bench
Table 11: Repeated-trial discovery and reliability on Thinkingbox-bench
Retrospective evaluator ablation study
Table 12: Retrospective evaluator ablation study
Failure distribution (%) by domain on Thinkingbox-bench
Table 13: Failure distribution (%) by domain on Thinkingbox-bench
Average trajectory-level interaction counts on Thinkingbox-bench
Table 14: Average trajectory-level interaction counts on Thinkingbox-bench
Average token usage per model turn and average model turns per trial by model and domain
Table 15: Average token usage per model turn and average model turns per trial by model and domain
Pass@k progression of models used for evaluation
Figure 3: Pass@k progression of models used for evaluation
pass^k progression of models used for evaluation
Figure 4: pass^k progression of models used for evaluation
查看结构化数据
任务指标本文基线提升
507 有状态业务工作流(全量) pass@1 66.50%(Claude Opus 5) GPT-5.4 65.36% +1.14 个百分点,两者 95% 置信区间高度重叠
507 有状态业务工作流(全量) pass^20(20 次全部成功) 47.53%(Claude Opus 5) GPT-5.4 25.25% +22.28 个百分点,可靠性差距远大于 pass@1 差距
507 有状态业务工作流(全量) pass@20(至少一次成功) 91.12%(GPT-5.4,最高) Claude Opus 5 79.09% +12.03 个百分点,但其 pass^20 反而更低,直观展示发现-可靠性差距
旅行/酒店预订(104 任务) pass@1 68.13%(GPT-5.4) Claude Opus 5 49.95% +18.18 个百分点,显示没有任何模型在所有领域占优
开源模型对比 pass@1 51.70%(Qwen3.8-27B 稠密) DeepSeek-V4-Pro(1.6T/49B MoE)43.26% +8.44 个百分点,27B 稠密模型击败约 60 倍激活规模更大的 MoE,说明智能体后训练比参数量更关键

局限与改进

作者承认(Appendix A):其一,507 任务中 477 个的判定只依赖终态后端状态与副作用,后端执行正确却向用户错误汇报的试验仍可能判成功,分数衡量的是合规后端结果而非沟通保真度;其二,任务是非公开来源的合成重建,不声称代表企业工作分布,且每任务只有单一黄金终态,天然排除有多种合理解法的工作流;其三,结果受 harness 约定( 终止标记、轮次与 token 上限)制约。最关键的是模拟器依赖:全部轨迹由固定的 GPT-5.4-mini 用户生成,它从不记错事实、不改目标、在智能体反复失败后依然配合、最多 10 轮追问,因此无法考察应对难缠用户的能力,且与最强被评模型同家族、无法排除同族交互风格偏好。我的观察:pass^20 要求 20 次全对,在温度 1.0 采样下极严苛,部分「不可靠」其实是高方差采样的放大;四类失败签名按固定优先级互斥归属,只是可观察诊断而非因果解释,且缺少独立的政策违反类别;30 个 rubric 任务引入 LLM 裁判方差;±3 个百分点的任务簇 bootstrap 区间意味着头部模型排名并不稳固。

独立分析的弱点

独立分析四点弱点。(1) 判定粒度过粗:黄金终态要求精确匹配,若智能体以不同但合理的工单字段(时间戳、描述措辞)达成同一业务结果可能被误拒;改进方向是引入语义等价层或按业务关键字段分组的部分匹配。(2) 模拟用户过于理想:真实用户会中途改需求、提供矛盾信息、施加情绪压力,这些恰是企业部署的高频风险场景,而本基准对「管理难缠用户」的失败完全不罚分;改进方向是构建对抗性/目标漂移用户变体并报告敏感性分析。(3) 失败分类较粗:Wrong State Update 只占 9.4%,但政策理解错误可能隐藏在 Tool Usage 类(未按政策做前置检查)之中,四分法掩盖了政策遵循这一企业最关心的维度;改进方向是增加政策条款级细粒度标注。(4) 领域与工具面窄:仅五个合成组织、每域 3–18 个后端系统,结论难以外推到其他行业;且检查集对智能体隐藏,无法考察模型是否会对可验证奖励过拟合。此外每模型 10,140 次试验的 API 成本使小实验室难以复现完整榜单。

未来方向

作者提出的方向:量化对模拟器的敏感性(更换 backbone、披露行为、合作程度),把 rubric 扩展到更多任务而不重新引入裁判方差,以及归一化 harness 约定。基于成果可延伸的方向:(1) 训练——沙箱原生输出奖励 $V$ 与奖励向量 $r_i$,可直接做 RLVR 或拒绝采样微调,重点优化「从工具错误中恢复」这一占 79.9% 失败的能力;(2) 把 pass^k 或 k 次一致性作为测试时策略(自一致性、重试规划),研究发现-可靠性差距能否用推理时计算弥合;(3) 用户模拟器多样化:引入目标漂移、记忆错误、不合作策略,形成用户侧压力测试套件;(4) 把任务分布与真实企业工单对齐,做跨组织校准研究;(5) 扩展到双控制场景(用户侧也持有工具,如 τ²-bench)与安全场景(系统提示已含注入检测钩子,可发展为对抗评测);(6) 领域扩展至医疗、政务等高后果行业。

复现评估

复现条件较好。代码与基准完全开源(github.com/microsoft/thinkingbox),507 个任务全部合成、无隐私数据;沙箱基于 MCP,工具环境与任务清单随代码发布。算力与成本:Azure 托管的 API 模型每任务 20 次试验(10,140 trials/模型),17 个模型的完整榜单是数十万级 API 调用,主要成本在 API 费用与时间(每请求 600 秒超时、502/503/504 最多重试 5 次);本地复现 Qwen 系列只需单机 vLLM(数据并行 8、最大上下文 65,536)。注意模拟用户与响应裁判固定为 GPT-5.4-mini,需要 OpenAI 侧 API 访问。难度评估:跑通沙箱与任务子集属中等难度(需部署 MCP 服务器与数据库重置);完整复现主表结论依赖可观的 API 预算;由于采样随机性(用户措辞也随试验变化),复现数值应预期任务簇 bootstrap 约 ±3 个百分点的波动。