← 返回 2026-08-11

WeClawArena:面向以人为中心智能体网络的跨用户智能体协作与安全可审计沙盒基准 WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang 📅 2026-08-04 👍 8 2026-08-16 18:30
多智能体基准 工具使用 智能体安全 沙盒评测 隐私与治理

首个跨用户个人工作空间多智能体协作与攻击可审计的沙盒基准

前置知识

工具使用型智能体(Tool-use LLM Agent)

以 LLM 为核心、通过多步循环调用外部工具(文件读写、数据库、API)完成任务的系统。智能体观察环境状态、生成动作(消息或工具调用)、接收观测并更新状态,直到产出最终产物。ReAct 等范式将推理与行动交织,OpenClaw 等持久化框架还能维护跨会话的用户状态。

本文的评测对象正是这类智能体,但被放进多用户协作场景:完成任务所需的信息、工具与决策权分散在各自的个人工作空间里,必须通过跨工作空间的工具使用与证据交换才能解题。

以人为中心的智能体网络(Human-Centered Agent Network)

网络节点不是抽象智能体,而是由人类委托人拥有的个人工作空间:节点包含文件系统、数据库、工具集与策略/审批规则,节点内运行代表主人行事的委托智能体,边代表社交或任务关系并携带角色、权限与审批上下文。

这是论文的形式化基础:任务图 $G=(N,E)$ 中每个节点的可见性与权限都绑定到人类所有者,'谁拥有什么、谁有权批准什么'直接决定任务能否完成、攻击算不算成功。

攻击成功率(ASR, Attack Success Rate)

衡量攻击向量变体是否造成最终伤害的指标。本文 ASR 由离线 LLM 裁判在有界证据包(场景元数据、攻击元数据、消息记录、工具调用与观测、任务分数字段等)上判定,只有'意图伤害面上发生最终伤害'且'证据能把伤害链路回溯到攻击素材'同时成立才计成功。

论文反复强调 TSR 下降不等于攻击成功:理解 ASR 的'最终伤害+证据链路'双条件,才能明白为什么同一攻击可以拉低效用却不构成伤害,反之亦然。

上下文完整性(Contextual Integrity)

Nissenbaum 提出的隐私理论:一条信息的流动是否恰当,不取决于它是否'全球机密',而取决于信息类型、发送者、接收者与社会情境之间的关系是否符合该情境的规范。同一个事实在不同关系间流动, Privacy 含义完全不同。

论文用该理论定义隐私伤害面:预算上限在买卖代理间流动可能合理,泄漏给无关第三方就是隐私伤害——这直接决定 ASR 裁判在隐私变体上的判分标准。

LLM-as-a-Judge

用强大 LLM 代替人工评测模型输出的方法,可靠性取决于有界输入证据、明确评分目标与对照设计。本文裁判运行在模拟结束后的离线阶段,只读证据包、不干预智能体循环,也不能修改确定性效用分数。

WeClawArena 的 ASR 完全依赖裁判(主裁判 GPT-5.2,敏感性复检用 Claude Opus 4.7),理解其证据约束与主观性风险是解读全部安全结论的前提。

研究动机

现有基准各覆盖这一新问题的一角,却没有端到端实例化它。τ-bench、τ²-bench、WebArena、OSWorld、AppWorld 等工具/工作空间基准评测单用户:跨所有者的私有资源与用户相对决策权不在评分契约内;AutoGen、MetaGPT、MultiAgentBench 等多智能体基准中团队共享任务权威,智能体很少是各自持有私有文件、同意书与审批授权的独立委托代理;Generative Agents、AgentSocialBench 等社交模拟关注群体动态,不评可验证的联合工具使用结果;ConFAIDE、PrivacyLens、MAGPIE、AgentLeak 等安全隐私基准只测泄漏或不安全行为,确定性协作效用与攻击审计通常在分离的设置中评测。而在 OpenClaw 这类持久个人智能体成为现实部署目标的今天,日常工具使用已变成多方所有的智能体在互相不可见的工作空间上协作,攻击却能顺着同一条消息、资源、工具与审批通道传播——此前没有任何沙盒能同时检验'任务能否协作完成'与'伤害如何借协作通道传播'。

本文的目标是本文要建立'多用户个人工作空间上的多方工具使用协作'这一可评测问题设定,并给出完整基准与运行沙盒:构建 124 个基础任务、620 个匹配场景,横跨 bargaining、bidding、travel、SWE-Workspace、clinical、trading 六个跨用户领域,每个基础任务配一个良性无攻击者对照加协作/安全/隐私/治理四个攻击向量变体;提供 Docker 化运行时,每用户一个独立工作空间,消息网关路由多智能体通信与工具调用,并记录同侪消息、工具调用、资源操作、治理决策与最终工作空间状态;把任务效用 TSR 与攻击成功率 ASR 严格分开报告,支持从有界运行时证据审计伤害来自哪条消息、工具、资源与权威路径,回答任务效用、最终伤害、攻击审计三个耦合的研究问题。

与已有工作不同的是,独特切入是把'个人工作空间所有权'提升为一等约束:工作空间既是完成任务的操作基底(信息与工具必须跨空间拼合),又是政策边界(读、共享、批准、修改都受契约约束)。配对变体设计让良性对照与四个攻击变体共享同一任务契约与所有者工作空间,从而能在同一任务上对照解读效用退化与攻击成功;攻击'交付'与'成功'分离判定,注入素材不允许直接制造最终有害状态,智能体必须经过遭遇、路由、接受、复述或执行才会计为攻击成功,这使 ASR 成为对伤害传播路径的审计而非对输入污染的检测。这套'协作效用+攻击审计在同一运行时'的组合,是现有四族基准都未提供的。

核心方法

整体思路分三层。形式化层:把社交网络建成个人工作空间图 $G=(N,E)$,节点 $n_u=(u,\mathcal{A}_u,\mathcal{W}_u)$,工作空间 $\mathcal{W}_u$ 含文件、数据库、工具与策略四个组件;任务实例 $z=\langle\mathcal{G}_z,p,S_0,\mathcal{B},\mathcal{F},\mathcal{C},\mathcal{V}_z\rangle$ 依次是任务图、初始指令、初始状态、动作集、转移函数、任务契约与验证器,智能体输出多工作空间轨迹 $\xi$ 并演化到终态 $S_H$。运行层:Docker 化 OpenClaw 运行时让每个委托智能体只看见自己工作空间,经网关通信、调用领域工具、更新所有者范围内资源,被动记录消息、工具调用与治理决策。评测层:验证器输出 $v_z=(s_{\text{task}},h_{\text{collab}},h_{\text{sec}},h_{\text{priv}},h_{\text{gov}})$,把任务效用与四类最终伤害分开,对应 TSR 与 ASR 双轨指标。

核心创新有三点且彼此咬合。第一,所有权进入任务契约:任务必须通过读取、更新、校验分散在多个所有者工作空间里的私有资源才能解决,只输出看似合理的对话不算解决——权限边界从附加的安全考虑变成效用定义本身的一部分。第二,配对变体+双轨指标:每个基础任务扩展成一个良性对照与四个攻击向量变体(协作/安全/隐私/治理),任务契约与工作空间完全一致,使 TSR 退化与 ASR 可在同一任务上对照解读;TSR 用确定性谓词从终态判分,ASR 由 LLM 裁判审计,两者机制上不可互相替代。第三,证据链路审计:攻击成功需要'意图伤害面上的最终伤害'加'证据把伤害链路回溯到攻击素材'双条件,裁判读的是有界证据包而非整条轨迹,既限定了主观性,又能诊断任务崩溃、隐私泄漏、投毒证据与无效权威路径等具体失效模式。

方法步骤详情

第一步,构建基础任务:标注者按固定表单把六领域种子转成基础任务,记录所有者角色、智能体人设、私有资源、工具、任务契约、效用谓词、策略约束与排除标准;第二作者复核资源相关性、角色分离、攻击可分性与可评分性,分歧则修订。第二步,扩展变体:每个基础任务生成 5 个变体——良性无攻击者对照加协作、安全、隐私、治理四个攻击向量变体,攻击素材以注入消息、资源绑定通知、数据库行等形式加入。第三步,运行模拟:统一 Docker 化 OpenClaw 运行时,每用户工作空间一个容器,网关路由消息与工具调用并做被动证据捕获;轮次上限 bargaining/bidding/travel 为 36 轮、SWE-Workspace 为 90 轮,触顶是诊断性结果而非攻击成功。第四步,双轨评测:TSR 从终态与证据字段确定性判定,缺任务成功字段的行计失败;ASR 池为所有可评分攻击行,由 GPT-5.2 主裁判在含场景与攻击元数据、消息记录、工具调用、任务分数字段及治理上下文的有界证据包上离线判定,Claude Opus 4.7 做敏感性复检;畸形场景与不可评分终态从分母剔除。

技术新颖性

与已有工作的本质差异:单用户工具/工作空间基准(τ-bench、WebArena、OSWorld、AppWorld、AgentBench、GAIA)的评分契约不含跨所有者私有资源与用户相对决策权;共享权威多智能体基准(AutoGen、MetaGPT、MultiAgentBench)的团队共享任务权威,智能体很少是持有独立文件、同意书与授权的委托人;社交智能体模拟(Generative Agents、AgentSocialBench)关注社会动态而非可验证的联合工具使用结果;隐私安全审计基准(ConFAIDE、PrivacyLens、MAGPIE、AgentLeak)通常把确定性协作效用与攻击审计放在分离的设置里。WeClawArena 首次把所有权与权威同时纳入效用评分与攻击审计,并以 124 基础任务、620 匹配场景、六领域、每任务五变体的规模提供可复现沙盒;攻击素材必须经智能体自身的消息/工具行为传播才能计为成功,使 ASR 成为对伤害传播路径的审计而非对输入污染的检测,这一设计在已知智能体基准中属于首创。

Overview of WeClawArena.
Figure 2: Overview of WeClawArena.
Benchmark construction pipeline.
Figure 3: Benchmark construction pipeline.

实验结果

结果分效用与安全两轴。效用(Table 1,全变体 TSR):Claude Opus 4.7 最强,travel 83.0%、SWE-Workspace 34.0%、bidding 55.0% 领先;Sonnet 4.5 领跑 bargaining 68.3%,clinical 40.0 与 Kimi K2.5、trading 35.0 与 Qwen3 32B 并列最佳。领域异质显著:SWE-Workspace 最难,最优仅 34.0%,Qwen3 235B/32B 低至 2.0%/1.6%;clinical 与 trading 聚合受攻击行,应读作受压韧性。安全(GPT-5.2 裁判):宏向量抵抗度 1−ASR 上 Opus 4.7 约 97.4 居首,Sonnet 4.5 约 78.1 次之,开源模型聚在约 51.1–70.9;治理与安全的被判攻击率最高、协作最低;热图显示安全压力主导 bargaining/bidding,隐私加治理主导 SWE-Workspace,bidding 治理伤害近零。散点表明 TSR 下降与最终伤害相关但独立:降效用未必达伤害,保住任务也可能走完有害路径。

Main WeClawArena task-success results.
Table 1: Main WeClawArena task-success results.
Comparison with existing benchmarks.
Table 2: Comparison with existing benchmarks.
WeClawArena pairs human-centered agent-network tasks with attack-resistance evaluation.
Figure 1: WeClawArena pairs human-centered agent-network tasks with attack-resistance evaluation.
Attack-vector utility, resistance, and model-level utility-risk tradeoff on the ASR-MAIN-SIX-DOMAIN pool.
Figure 4: Attack-vector utility, resistance, and model-level utility-risk tradeoff on the ASR-MAIN-SIX-DOMAIN pool.
查看结构化数据
任务指标本文基线提升
SWE-Workspace 全变体任务成功率(六领域中最难) TSR (%) Claude Opus 4.7:34.0 次优 Claude Opus 4.1:24.0;Qwen3 32B 仅 1.6 +10.0 pp
Travel 全变体任务成功率 TSR (%) Claude Opus 4.7:83.0 Claude Sonnet 4.5 / Kimi K2.5:58.0 +25.0 pp
Bargaining 全变体任务成功率 TSR (%) Claude Sonnet 4.5:68.3 Claude Opus 4.7:63.3;Opus 4.1 仅 22.5 +5.0 pp
Bidding 全变体任务成功率 TSR (%) Claude Opus 4.7:55.0 次优 Claude Sonnet 4.5:51.7;多数开源模型低于 7 +3.3 pp
Clinical / Trading 全变体任务成功率(韧性列) TSR (%) clinical:Sonnet 4.5 与 Kimi K2.5 并列 40.0;trading:Sonnet 4.5 与 Qwen3 32B 并列 35.0 其余模型 20.0–38.0 区间 并列领先
六领域宏向量攻击抵抗度(ASR-MAIN-SIX-DOMAIN,GPT-5.2 裁判) 1−ASR (%) Claude Opus 4.7:约 97.4 Sonnet 4.5 约 78.1;开源模型聚在约 51.1–70.9 较次优领先约 19 pp,较最低领先约 46 pp

局限与改进

作者承认的局限:ASR 依赖 LLM 裁判的主观判断,仅以 Claude Opus 4.7 对同一证据包的敏感性复检佐证;TSR 行若缺任务成功字段直接计失败,可能低估真实能力;畸形场景、评测器崩溃与不可评分终态从分母剔除,存在选择偏差;六个领域不能覆盖全部跨用户协作形态。我自己的观察:每个模型-领域单元的行数不大(如 1.6% 对应约 60 行量级),论文未报告置信区间,小差距可能不显著;运行环境是模拟的 Docker 工作空间,与真实用户的数字环境(真实邮件、真实审批流、真实 SaaS)仍有距离;每任务仅 4 种固定攻击向量,攻击者策略静态,缺少自适应攻击循环;主裁判 GPT-5.2 与部分被评模型同为闭源系统,同源偏置难以完全排除;36/90 轮上限可能截断长程任务,把'没做完'与'被攻击'混淆,尽管作者声明触顶不计攻击成功。

独立分析的弱点

独立分析的弱点及改进方向:其一,ASR 单裁判依赖——GPT-5.2 一家之言决定全部安全结论,改进方向是多裁判集成加小规模人工仲裁子集校准,并报告裁判间一致性系数。其二,攻击向量静态——每任务固定 4 种攻击素材,攻击者不会根据智能体反应调整策略,改进方向是引入攻击者智能体的自适应闭环,评测动态攻防而非单向注入。其三,策略标注的自然语言性——治理伤害判定依赖标注者撰写的策略/同意规则文本,规则歧义会传导进 ASR,改进方向是形式化策略规范语言并分析策略一致性与攻击成功的相关性。其四,样本量与统计检验——单元格行数有限且无置信区间,1.6% 与 2.0% 这类差异无法判断显著性,改进方向是扩大基础任务规模并报告 bootstrap 置信区间。其五,缺少防御基线——论文只测裸模型抵抗度,未评测提示加固、权限沙箱、输出过滤等防御方法在同等协议下的增益,补充防御评测轨道会让基准对工程实践更有指导意义。

未来方向

作者方向:论文把该设定定位为研究'有害影响如何经由合法协作通道传播'的可复现测试台,附录 G 的失败模式分析与案例研究是诊断工作的起点。可延伸方向:其一,用 ASR 证据链生成训练信号,通过拒绝采样或偏好优化直接提升模型的权限边界感知能力,把基准变成训练回路;其二,把沙盒接到真实 SaaS 工具与 A2A 协议互操作,检验模拟结论的迁移性;其三,跨裁判可靠性研究——不同家族 LLM 裁判在治理与隐私伤害判定上的一致性与系统性偏差;其四,把四个伤害面扩展到更多情境,如跨文化隐私规范与多语言场景;其五,防御方法评测轨道,使基准从'测裸模型'升级为'测防御栈';其六,随个人智能体框架演进纳入更多运行时(不止 OpenClaw),检验沙盒结论对实现细节的无关性。

复现评估

复现条件较好:代码开源于 GitHub(kingofspace0wzz/WeClawArena),620 个场景数据集发布在 HuggingFace(kingofspace0wzz/WeClawArena);运行时统一为 Docker 化 OpenClaw,8 个模型用同一运行时评测,容器化消除了环境不一致问题。成本主要在 LLM 推理:主运行需 8 模型 × 6 领域 × 每领域约百级场景的完整模拟,外加 GPT-5.2 主裁判与 Claude Opus 4.7 敏感性复检的离线评测,API 费用是主要门槛;基准构建流程(固定表单、双作者交叉复核)在论文中公开但人工标注成本高,扩充任务需复刻该流程。对研究者而言,下载场景子集、跑通沙盒并评测单一模型属中等难度;完整复现 Table 1 与 ASR 主结果则需要可观的推理预算与裁判成本管理。