← 返回 2026-08-04

ScrambleToolBench:通过语义混淆与动态映射漂移评测智能体的行为推理能力 ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria 📅 2026-08-03 👍 11 2026-08-09 18:30
LLM推理 基准测试 工具调用 智能体评测 行为推理

新增行为推理基准,揭示智能体面对工具映射漂移时迷信穷举搜索而非演绎。

前置知识

语义先验(Semantic Priors)

语义先验指 LLM 智能体在调用工具时依赖函数名、参数名、返回字段名等语言线索来推断工具行为的能力。例如看到 read_file(path)、search(query) 这样的直观命名,模型凭借预训练时记忆的常识就能直接正确调用,而不必真的去观察输入输出。本文证明这种依赖极强:在保留语义线索的非混淆环境下,主流模型 P_ep 普遍 ≥0.60,但去掉语义线索后大批模型直接崩溃到 0.00。

理解语义先验是读懂本文动机的关键,因为 ScrambleToolBench 的核心设计就是把语义先验全部剥离(混淆函数名、参数名、输出字段、成功状态),从而逼迫智能体只能靠行为观察去推理,以此来隔离『行为推理』与『死记硬背』两种能力。

映射漂移(Mapping Drift)

映射漂移模拟软件更新或 API 迁移:在课程式任务的相邻任务之间,工具的混淆标识符会被部分置换。形式上若任务 $t$ 时函数到标识符的映射为 $\Phi_t: \mathcal{F} \to \mathcal{N}$,则在任务边界施加置换 $\psi_t$ 得到 $\Phi_{t+1} = \psi_t \circ \Phi_t$。本文每个漂移事件从 $M=28$ 个标识符中选出 $k=7$ 个做循环置换($\rho_{drift}=0.25$),meta 命令被排除以保证可导航性。

映射漂移是本文最有特色的动态挑战之一,它测试智能体能否在规则发生变化后修订自己的心智模型并复用旧知识。论文核心结论『智能体即使地图指向下一步也要穷举搜索』正是围绕映射漂移下的失败模式展开的。

循环追踪(Cycle Tracing)

循环追踪是作者推导出的针对映射漂移的廉价恢复策略。由于漂移是循环置换,当智能体调用标识符 $n$ 却观察到函数 $f'$ 时,可在双向表中查出 $f'$ 旧标识符 $x' = \hat{\Phi}(f')$,由于置换满足 $n = \psi_t(x')$,调用 $x'$ 即沿置换链倒退一步;重复此过程最多 $\ell-1$ 步即可找回原函数,其中 $\ell$ 是所在循环长度。本文 $k=7$,故最多 6 次额外调用即可恢复一次漂移事件。

循环追踪是论文的灵魂概念:作者用它证明了即使存在一条廉价(期望仅 4.25 次额外调用)的演绎恢复路径,前沿模型也几乎不去走,反而选择昂贵的穷举搜索——这正是标题『Even When Their Own Map Points to the Next Step』的核心论点。

随机动作失败与时间窗(Stochastic Failure & Temporal Window)

随机动作失败以概率 $p_{fail}$ 让有效调用返回超时错误,模拟网络抖动,本文取 $p_{fail}=0.15$,且不计入动作预算;它测试智能体能把瞬时噪声与结构性故障区分开。时间窗要求在触发某个命令后的严格 $k=10$ 步内完成目标序列并提交,否则状态重置、中间变量重新生成,用以惩罚暴力探索、检验程序性熟练度;剩余步数倒计时会被追加到每次反馈中。

这两种动态与映射漂移共同构成『+All』组合压力测试。理解它们的作用机制才能解释为何平均完成率从 0.93 雪崩到 0.03,以及为何前沿模型在 +Window/+All 下也纷纷崩盘。

持久记忆智能体(Persistent Memory Agent)

持久记忆增强架构将长期抽象知识与瞬时执行状态解耦,维护两个跨任务和重置持久化的结构化数据库:Task Recipes(参数化逻辑步骤序列)和 Tool Knowledge(混淆命令到推断行为、参数约束与置信度的映射)。每一步环境交互前,框架把两个数据库序列化成 JSON 注入系统提示;智能体在单次 JSON 响应里同时给出 action 和可选的 memory_update,框架先解析并更新记忆再执行主动作。

持久记忆是本文最重要的缓解方案,它在 +All 下为 Gemini 3.1 Pro 把完成率从 0.20 提升到 0.50、任务数从 2.35 提到 3.60,证明把探索与执行解耦能减少冗余重发现循环;但作者同时指出记忆需要主动剪枝否则陈旧信念会持续,这是理解结论『记忆改善召回但不带来演绎』的关键。

研究动机

当前 LLM 智能体在与文档完善的 API、稳定软件环境交互时表现亮眼,但这种能力严重依赖语义先验——即理解 read_file、search 这类直观函数名,而非真正的『行为推理』(仅凭观察输入输出推断工具机制)。一旦语义线索被移除或环境意外变化,即便是 SOTA 智能体也频频无法适应。然而现有评测框架几乎都假设底层环境一旦被理解就保持结构稳定,并保留标准 API 命名,等于在测模型的记忆知识而非演绎推理。它们无法评估智能体面对时间窗、随机失败、映射漂移这类动态环境漂移时,能否在不重新学习整个环境的前提下修订已建立的心智模型。真实部署的 API 常与文档不符、网络超时频发,这种适应能力的缺失是致命的。

本文的目标是本文目标是构建一个能严格隔离『演绎推理』与『预训练记忆』的交互式终端基准 ScrambleToolBench:用语义混淆强制智能体只能靠试探-纠错来发现隐藏的工具行为;用连续递进的课程式任务检验知识保留与复用;并系统引入映射漂移、随机动作失败、时间执行窗三种独立环境动态,专门暴露『初次发现成功 ≠ 稳健适应』这一推理差距。作者尤其想回答:当环境结构发生置换式变化时,前沿模型究竟能否像循环追踪那样廉价地利用自己已经建立的映射去演绎恢复,还是会退化为信念惯性与暴力搜索。

与已有工作不同的是,独特切入点在于『把语义混淆与结构性不稳定同时叠加』。以往的互动/工具基准(ToolBench、MCP-Atlas/Universe、OpaqueToolsBench、SWE-bench、OSWorld、Terminal-Bench 2.0、LifelongAgentBench、AgentGym2)至多覆盖一部分维度(主动发现、混淆语义、有状态交互、课程、随机失败),但没有任何一个同时满足『混淆 + 互动 + 课程 + 随机失败 + 动态漂移』六项。更进一步,作者不满足于『发现一次就成功』,而是主动构造循环置换式漂移,使其存在一条可计算代价(期望 4.25 次额外调用)的演绎恢复路径,从而能用极清晰的量化对照来论证『智能体放弃了便宜路径而选择暴力穷举』这一尖锐结论。

核心方法

直觉上,ScrambleToolBench 把工具用环境改造成一个『没有说明书且规则会偷偷变』的终端:智能体拿到的是像 fn_3d8a(arg_0) 这样的随机命名,参数、输出字段、成功/失败标记都被混淆,唯一能做的就是反复调用、观察、记笔记。技术路线上,基准是轻量 Python 模拟器(非 Docker),内含 28 个核心工具(list_dir、network_ping 等系统操作)加 3 个明文 meta 命令(submit_solution、skip_task、end_episode),上层叠 20 个程序化任务模板(系统管理/诊断/网络安全),每个 episode 采样 N=5 个连续任务、每任务 100 步预算、累计预算跨重试延续。一次 episode 实例化一个双射映射 $\Phi$,对函数标识符、参数键、输出字段、执行状态四个维度做混淆;提交用精确字符串匹配判分。

核心创新是『用语义混淆 + 课程式连续任务 + 三种可调环境动态』来隔离并量化行为推理,并借此揭示一个反直觉现象:智能体建立了内部映射却不会用它去演绎。本质区别在于:以往基准要么保留语义让人靠记忆作弊,要么只测『一次性逆向工程』就默认工具行为恒定;ScrambleToolBench 则故意把漂移设计成循环置换($\psi_t(n_i)=n_{(i+1)\bmod k}$,$k=7$),让恢复问题有廉价最优解(循环追踪最多 6 次调用),从而把『暴力探索 vs 演绎推理』的代价差距显化——5 任务 episode 平均仅约 4.25 次额外调用即可恢复,而盲搜平均要 $M/2=14$ 次,前沿模型实际却花到参考值的 5.57×–7.52×。

方法步骤详情

步骤分四块。①混淆与扰乱:episode 开始实例化双射 $\Phi$,函数标识符→fn_随机别名且初始 schema 不含参数定义,参数键→arg_0 等泛名(类型仅通过 schema mismatch 错误暴露),输出字段→out_c2b 等前缀,执行状态→每 episode 两个随机 token。②课程评测:每个任务 $T_i$ 配文本目标与预算 $B=100$,智能体需发现工具、取回信息并用 submit_solution 提交(精确串匹配);skip_task 让任务重入队且预算累计,耗尽判失败并推进;跨任务保连续上下文以测复用。③环境动态:映射漂移按 $\rho_{drift}=0.25$ 对选中标识符做循环置换;随机失败按 $p_{fail}=0.15$ 返回超时且不计预算;时间窗在触发命令后给 $k=10$ 步硬限制,超时重置状态、重生成中间变量。④记忆增强:Task Recipes + Tool Knowledge 两库持久化,每步序列化注入提示,单次响应同时含 action 与 memory_update,框架先更新库再执行。固定随机种子,仅跑 20 个 5 任务 episode。

技术新颖性

技术新颖性体现在三处。一是评测维度的全覆盖:表 1 显示 ScrambleToolBench 是唯一同时勾选『主动发现 + 混淆语义 + 持续互动 + 递进课程 + 随机失败 + 动态漂移』六项的基准,把『结构稳定性』这一隐含假设从评测里彻底拆除。二是把『适应』问题数学化为可分析对象:漂移被设计成循环置换 $\Phi_{t+1}=\psi_t\circ\Phi_t$,于是能用期望恢复代价 $\mathbb{E}[\Delta]=\left(1-\tfrac{\binom{M-k}{r}}{\binom{M}{r}}\right)(k-1)=4.25$ 和全发现参考成本 $A_{ref}^{disc}=9+2\times19=47$(任务1 共 48 步)给出清晰基线,使『智能体偏离最优策略的程度』可被精确量化为倍率。三是诊断性的记忆基线和推理档位消融:不仅测『能不能』,还拆出『记住映射』与『恢复映射』两个能力,证明记忆只补前者、推理档位只降浪费,两者都未能引导智能体走上便宜的循环追踪链——这是对当前 test-time scaling 论调的有力反驳。

Overview of a ScrambleToolBench evaluation episode
Figure 1: Overview of a ScrambleToolBench evaluation episode

实验结果

①严重依赖语义先验:非混淆控制下 15 个无记忆模型平均 $P_{ep}=0.93$、$T_{avg}=4.88$,移除语义的 Base 让 Gemma 4 26B-A4B、GPT-5.4 Mini、Gemini 3.1 Flash Lite 归零,仅 Gemini 3.1 Pro/3.5 Flash 与 Claude Sonnet 5 仍保 1.00。②动态扰动逐级打击:Base 0.32/2.31→+Drift 0.23/1.87→+Failure 0.26/2.09→+Window 0.19/1.87,三者叠加的 +All 直接砸到 0.03/0.84;Claude Sonnet 5 从 1.00 跌到 0.00,仅 Gemini 3.1 Pro(0.20)、3.5 Flash(0.25) 仍能解题。③持久记忆救场:+All 平均 +0.09 完成率、+0.59 任务数,把 Gemini 3.1 Pro 从 0.20/2.35 拉到 0.50/3.60。④开销与信念惯性:混淆使 Base 行动相对非混淆涨 3–5×(Gemini 3.1 Pro 25.1→80.8),漂移再叠加 1.89×(80.8→152.4);Qwen 3.6 27B 在 +Drift 陈旧调用平均 3.67 次/任务(共 165),Sonnet 5 在 +All 翻倍到 5.32。⑤循环追踪几乎不被发现:Gemini 3.1 Pro『3 步内沿链跟进』仅 11.0% 对随机 10.8%(p=0.934),加记忆 12.8% 对 10.9%(p=0.195)。⑥推理档位不带来演绎:Sonnet 5 中/高档恢复开销仍是参考的 7.38×/7.52×,单解任务 token Base/Drift 为 7326/11652,是 Gemini 的 4.6×/3.5×,更多推理只是把穷举做得更贵。

Comparison of ScrambleToolBench with existing tool-use and agentic benchmarks
Table 1: Comparison of ScrambleToolBench with existing tool-use and agentic benchmarks
Main results on ScrambleToolBench
Table 2: Main results on ScrambleToolBench
Combined behavioral metrics across all models
Table 3: Combined behavioral metrics across all models
Mean action cost including budget-failed attempts (Cycle Tracing)
Table 4: Mean action cost including budget-failed attempts (Cycle Tracing)
Use of the recovery chain under drift
Table 5: Use of the recovery chain under drift
Reasoning-budget ablation over 20 five-task episodes per cell
Figure 2: Reasoning-budget ablation over 20 five-task episodes per cell
查看结构化数据
任务指标本文基线提升
无记忆模型综合表现 P_ep / T_avg(20×5 任务 episode) Unscr 0.93/4.88 → Base 0.32/2.31 → +Drift 0.23/1.87 → +Failure 0.26/2.09 → +Window 0.19/1.87 → +All 0.03/0.84 非混淆控制 0.93/4.88(语义先验可解) 动态扰动综合使完成率相对非混淆下降约 90 个百分点
持久记忆在 +All 下的增益 ΔP_ep / ΔT_avg(四组记忆配对均值) +0.09 / +0.59(+All),Gemini 3.1 Pro 从 0.20/2.35 → 0.50/3.60 无记忆 +All 0.03/0.84 记忆在 Drift +0.14、Window +0.13、All +0.09,显著缓解复合错误
映射漂移的循环追踪恢复代价 恢复开销相对期望参考 4.25 次(Tasks 2–5 均值倍率) Gemini 3.1 Pro 5.57×;Claude Sonnet 5 低/中/高推理 8.94×/7.38×/7.52× 理论最优循环追踪 E[Δ]=4.25,盲搜约 M/2=14 前沿模型离最优策略仍有 5.5–8.9 倍差距,盲搜更差
沿恢复链的跟进率 3 步内沿链跟进比例 vs 随机基线(双尾 p 值) Gemini 3.1 Pro 11.0%(p=0.934);+Memory 12.8%(p=0.195);Sonnet 5 14.0/11.9/14.1% 均匀随机约 10.6–10.9% 无显著优于随机的演绎行为,推理档位越高也未能改善
推理档位对 token 成本 单解任务 completion token(含失败 episode) Sonnet 5 高推理 Base 7326 / Drift 11652;Gemini 3.1 Pro 1584 / 3332 Gemini 3.1 Pro 同档 同性能下 Sonnet 5 token 是 Gemini 的 3.5–4.6×,推理越多越贵而非越演绎

局限与改进

作者坦承的局限主要有三点。一是评测规模受限:因推理预算只跑 20 个 5 任务 episode、每任务 100 步,统计样本较小,且固定随机种子虽保证可复现却也意味着结论对特定任务采样敏感。二是循环追踪的最优性依赖特定参数:当循环长度 $\ell$ 接近或超过 $M/2$ 时,盲搜平均可能更便宜,作者也明示『不等式不成立时盲搜可能更优』,因此该廉价恢复路径是构造出来的、未必普适于任意漂移。三是持久记忆的有效性强依赖剪枝策略:Claude Sonnet 4.5 加记忆后陈旧调用反而从 2.38 升到 2.76,说明错误更新策略会把过时映射锁死。我自己的观察补充:基准是纯模拟器、28 工具与 20 模板的覆盖面相对窄,是否能把结论外推到真实 SWE/OS 场景存疑;对『信念惯性』只做了行为层面刻画,缺少对模型内部注意/表示的机制性解释;记忆库结构是手工设计的两类 JSON,未探讨自动化的记忆架构检索。

独立分析的弱点

第一个弱点是基准规模与覆盖面有限:28 工具、20 模板、20 episode、固定种子的统计置信度偏弱且窄域。改进方向:扩大到文件系统、数据库、CI/CD 等更多真实运维域,并用多组种子给置信区间。第二个弱点是循环追踪的最优性被参数绑架:当 $k$ 接近 $M/2$ 或置换打散成多环时盲搜可能更便宜,论文的『廉价恢复』论证对参数敏感。改进方向:扫描 $k/M$ 比与多环/部分不动点拓扑,给出『何时演绎最优、何时盲搜最优』的相图。第三个弱点是记忆方案粗糙且双刃:手工两类 JSON 无法处理复杂冲突,且会锁死陈旧映射(Sonnet 4.5 陈旧调用反升到 2.76)。改进方向:引入带置信度衰减与冲突仲裁的可检索记忆架构,显式建模『陈旧检测-剪枝』子策略。第四个弱点是只停留在行为层面、缺机制解释。改进方向:做可解释性分析,定位漂移时模型内部哪些注意力头对应『旧映射』,给出『为何不演绎』的因果证据而非仅统计 p 值。

未来方向

作者显式提出的方向有:扩大评测到更多动态组合、更强噪声;把循环追踪这类演绎策略做成可学习的目标,研究如何通过训练或提示让智能体自发发现置换结构;以及改进持久记忆的剪枝与更新策略,避免陈旧信念。基于成果可延伸的方向包括:将基准从模拟器迁移到真实 SWE/运维任务,检验结论的外部效度;研究 test-time scaling 的更优用法——不是单纯加推理步数而是引导『先试最简局部解释』的策略性推理;探索多智能体协作下的行为推理(互相混淆的工具接口);把『记忆+演绎』解耦成两个可分别评测与训练的能力,开发针对『恢复』而非『发现』的专门训练目标;甚至将循环追踪思路推广到 API 版本迁移、A/B 测试灰度切换等真实场景作为落地。

复现评估

复现性总体良好。论文已开源代码(https://github.com/declare-lab/ScrambleToolBench),环境是轻量 Python 模拟器而非真实 Docker,部署成本低、无需大算力跑环境本身;关键超参数($\rho_{drift}=0.25$、$p_{fail}=0.15$、$k=10$、$M=28$、漂移 $k=7$、N=5 任务、100 步预算、20 episode)和数学推导(期望恢复代价 $\mathbb{E}[\Delta]=4.25$、全发现参考 48 步)都给得很清楚,固定随机种子保证可复现。主要难点在于推理成本:要在 Gemini 3.1 Pro、Claude Sonnet 5、GPT-5.4 等闭源前沿模型上跑全档位消融(含低/中/高推理、有/无记忆、五种动态设置)非常烧 token,作者自己都声明『因推理预算限制只跑 20 episode』,这意味着第三方完整复现 15 模型×多档位的开销不菲;记忆增强的 JSON schema 与提示模板见附录 A,但模型调用层细节、智能体 harness 实现未完全披露,跨实现差异可能影响绝对数值。