← 返回 2026-08-20

有界智能体:多智能体AI系统的委托授权安全 Bounded Agents: Delegation Security for Multi-Agent AI Systems

Xabier Muruaga 📅 2026-08-16 👍 4 2026-08-25 18:30
多智能体系统 授权架构 提示注入防御 智能体安全 最小权限 组合闭包

把提示注入防御从模型层移到授权架构层,用组合闭包将外泄攻击成功率压到0%

前置知识

间接提示注入

攻击者不直接对模型说话,而是把恶意指令藏进智能体会读取的外部内容——网页、检索文档、邮件、工具输出中。模型在推理时难以区分"数据"与"指令",可能据此执行攻击者意图的动作。经验研究(Gray Swan IPI Arena,272,000 次攻击)显示全部 13 个前沿模型都会以 0.5–8.5% 的概率服从注入指令,TRAP 基准测得 13–43% 的 ASR。

本文的核心立场是注入终会发生、模型终会被操纵,防御必须不依赖模型鲁棒性;理解这一威胁模型才能理解为什么安全控制要从模型层移到授权架构层。

混淆代理人问题

持有合法权限的代理人被诱导用自己的权限去损害委托人利益。在智能体场景表现为动作序列层面的组合:"读机密文档"与"发外部邮件"各自都被授权,但组合起来就是数据外泄——没有任何单条权限被违反,这正是本文要封堵的核心缺口。

论文的组合闭包(Theorem 4.7)就是针对动作序列混淆代理人的形式化解法,理解它才能明白禁令集 $X$ 为何是全文中枢。

RBAC / ABAC / OAuth 委托授权

RBAC 按角色、ABAC 按属性对每个请求独立判定放行与否;OAuth 2.0 生态(Token Exchange RFC 8693、Rich Authorization Requests)处理委托。共同点:授权在令牌签发时刻静态确定,逐请求评估、不随会话历史变化,也无法表达"某些操作不得被组合"。

论文反复对照这些经典机制指出缺口:记录委托链不等于逐跳收窄,静态授权写不出"read 与 send_external 不得同会话出现"——这正是 APC 的立足点。

PEP / PDP 架构

策略决策点(PDP)负责判定请求是否合规,策略执行点(PEP)在执行前强制该判定,二者分离是 XACML 以来的经典架构。本文把 PEP 实现为工具/MCP 网关,置于模型运行时之外,成为所有动作执行的唯一咽喉,模型无法用文字绕过。

"把模型排除在自己的信任边界之外"是论文第一原则,PEP/PDP 是该原则的工程落点,也是全部六个授权条件得以强制执行的位置。

爆炸半径(Blast Radius)

衡量一个主体被攻陷后可造成的最大破坏范围。本文将其形式化为资源集 $\{r: \mathrm{blast}(r) \le \beta_{\max} - \beta_{\mathrm{consumed}}\}$,其中 $\mathrm{blast}(r)\in[0,1]$ 由部署时按影响范围、不可逆性、数据敏感度加权赋值,随委托逐跳消耗。

Theorem 4.6 证明每跳委托后可达爆炸半径单调不增,这是"假设已被攻陷"(assume breach)思想的数学化,也是多智能体委托安全的关键保证。

MCP(Model Context Protocol)

让 LLM 智能体以标准化方式调用外部工具与数据源的开放协议,企业智能体常通过 MCP 服务器访问云服务。工具调用从"模型输出文字"变成真实世界副作用,因此 MCP 网关成为天然的授权强制执行点。

APC 的 PEP 就实现为工具网关/MCP 网关,理解 MCP 有助于理解部署形态与"单一咽喉"设计的工程可行性。

研究动机

企业正把 LLM 智能体接入云服务、工具与子智能体,其执行路径由运行时推理决定而非预先静态指定。现有访问控制为"人类主体、显式委托、静态范围"的世界设计,这三条假设对智能体全部失效:行动者是非人类身份、委托动态且跨子智能体递归、会话有效范围随工具调用不断演化。被操纵的智能体可以在名义权限内造成三类破坏:意图违背(做与任务无关但被允许的动作)、委托范围扩张(子智能体行使超出传递给它的权限,或权限向下游无衰减传播)、不安全组合(先读机密文档再发外部邮件即完成外泄,单独看每个动作都合规)。经典授权逐请求独立判定,完全不推理动作序列;而把"删除前必须确认"写进提示词的模型层控制只是可被覆盖的指令,不构成强制执行。经验证据同样不乐观:Gray Swan IPI Arena 的 272,000 次攻击显示 13 个前沿模型全部会服从注入(0.5–8.5% ASR),TRAP 基准测得六模型 13–43% ASR。只要底层权限结构允许,注入的破坏就与模型鲁棒性无关。

本文的目标是本文要把提示注入的安全后果从"模型鲁棒性问题"重新定义为"授权架构问题",并给出可证明的会话级授权模型。具体目标有四:其一,把"哪些动作类型组合被禁止"形式化为组合闭包原语——作者论证这一约束在 RBAC、ABAC、OAuth 及现有智能体安全系统中均不存在;其二,证明两个结构性定理:爆炸半径单调性(Theorem 4.6,每跳委托后可达破坏不增)与组合可靠性(Theorem 4.7 与 Proposition 4.2,在禁令集完备且串行准入的前提下,任何可许可动作序列都无法实现被禁结果);其三,构建在模型运行时之外强制执行的参考实现(Python 源码 2,500 行、测试 3,000 行),并把全部形式性质对齐为可执行测试;其四,用 3,154 个评估实例做多层验证,覆盖公开确定性基准(InjecAgent 1,054 例、ASB 400 例)、完全模型妥协下的在线 LLM 评估(AgentDojo 609 对)、99 个深度 2–8 的委托链场景与 43 个自适应攻击变体。

与已有工作不同的是,本文的独特之处在于切入层面:不试图造更聪明的提示护栏,而是先声明三条结构性事实——模型必须被排除在自己的信任边界之外;逐动作授权在结构上不足;系统必须假设某处已被攻陷。由此推出安全状态必须由基础设施持有、密码学签名并逐跳收窄。与现有工作的本质区别在于证明对象:SEAgent、CaMeL、Progent 证明的是各自引擎的性质(Progent v3 证明的是单智能体动作空间跨策略更新不增的时序性质),而 APC 的定理是委托代数的性质——对任何忠实于其语义的实现都成立,且涵盖既有方案缺失的逐跳范围衰减、链上累计预算继承与动作类型组合闭包。另一个差异化是评估方法学:compromised-model 协议把基准的 ground-truth 攻击调用直接注入流水线,模拟完全模型妥协,从而把基础设施强制的贡献与模型鲁棒性剥离开来测量,这是对"防御是否真的不依赖模型"的独立检验。

核心方法

直觉:一个无法组合出外泄所需动作序列的智能体,对试图诱导外泄的注入天然免疫——无论模型是否被操纵。技术路线是把授权主体定义为绑定到会话的主体链 $C=\langle p_0,p_1,\dots,p_n\rangle$:人类 $p_0$ 发起任务,编排器 $p_1$ 与子智能体 $p_2,\dots,p_n$ 依次接受衰减后的授权。基础设施在会话初始化时创建密码学签名的授权信封,内含四要素:授权范围 $S=(R,A,D,X)$(允许的资源、动作类型、数据分级与禁止组合)、六维委托预算 $B$(深度 $\delta$、累计爆炸半径 $\beta$、不可逆效果 $\rho$、敏感级 $\sigma$、跨域组合、计算成本)、先验动作状态与预声明意图 $\Psi$。每经一次委托跳,范围按 meet 运算收窄:$S(p_i)=S(p_{i-1})\sqcap S_{\mathrm{role}}(p_i)=(R_1\cap R_2,\ A_1\cap A_2,\ D_1\cap D_2,\ X_1\cup X_2)$,预算上限只降不升。每个提议动作由 PDP 对六个条件做合取判定 $C_1\wedge\dots\wedge C_6$,PEP(工具/MCP 网关)在模型运行时之外执行门禁、原子更新预算并提交哈希链证据;任何条件不满足即拒绝,缺证据即 fail-closed。

核心创新是组合闭包:会话级的动作类型组合禁令 $X\subseteq\binom{A}{2}$,实现进一步扩展为有序 $k$ 元组禁令 $K$,按子序列匹配检查完整会话历史。它与经典授权的本质区别在于问题的形式:RBAC/ABAC/OAuth 回答"该主体能否对该资源执行该动作",组合闭包回答"在此会话已发生动作的上下文中,该动作是否仍可被允许"——安全性第一次依赖于会话历史而非静态授权。这个原语可视为把信息流控制粗粒度化到动作类型层:对变量级信息流不可行的黑盒 LLM 智能体,动作类型层面的污点模型既可行又够用。第二个关键设计是预算的累计继承:子主体以父主体已消耗预算为下限 $\beta_{\mathrm{consumed}}(p_i)\ge\beta_{\mathrm{consumed}}(p_{i-1})$,与范围收窄共同导出 Theorem 4.6——每跳后可达爆炸半径 $BR_{\max}(p_i)\subseteq BR_{\max}(p_{i-1})$,妥协在深度 $k$ 处的破坏被该位置的 scope 与 budget 界住。第三是意图绑定:$\Psi$ 在信封创建时预声明、只能收窄不能扩张(Proposition 4.1),负向约束优先级最高,支持 strict/warn/audit 三档渐进上线。

方法步骤详情

方法分五步。第一步会话初始化:基础设施生成签名授权信封,声明范围、预算与意图 $\Psi$(任务目标、资源 glob 模式、允许动作类型、负向约束及可选动作–资源映射),并在创建时强制 $R_\Psi\subseteq R(S(p_i))$,确保意图无法扩大范围。第二步委托跳:对每个子智能体 $p_i$,基础设施计算 meet 收窄范围、下调六维预算上限、把父级已消耗预算作为下限继承(保守默认 $\beta_{\max}(p_i)=0.7\cdot\beta_{\max}(p_{i-1})$),随后重新签名信封;收窄在会话内不可逆。第三步动作判定:PDP 评估合取谓词 $\mathrm{Admissible}(a)=C_1\wedge C_2\wedge C_3\wedge C_4\wedge C_5\wedge C_6$——C1 身份绑定;C2 范围衰减含三个子检查(2a 动作/资源/数据分级在衰减后范围内、2b 与先验动作无禁令组合、2c 预算上限内);C3 上下文与状态绑定(防跨会话重放);C4 审批绑定(影响分 $I(a)=w_\rho\rho(a)+w_\beta Bl(a)+w_\sigma Se(a)>\theta$ 时需与动作哈希绑定的一次性审批令牌);C5 证据提交(证据存储不可达即拒绝);C6 意图绑定(负向约束最先评估且覆盖其他一切许可)。第四步执行与审计:PEP 门禁执行、原子扣减预算,把动作、主体、范围、参数上下文与决策写入 SHA-256 哈希链的 append-only 证据存储。第五步策略编写:按四步法(动作类枚举→被禁结果识别→映射→覆盖率验证 $\mathrm{coverage}=|\{o:\mathrm{pairs}(o)\subseteq X\vee\mathrm{tuples}(o)\subseteq K\}|/|O|$)编写 $X$,实测每域 3–9 条成对禁令加 0–8 条 $k$ 元组即可覆盖全部被禁结果。

技术新颖性

新颖性可从四个层面评估。第一,组合闭包作为一等授权原语是新的:经典中的最近亲是 RBAC 动态职责分离与 Brewer–Nash 中文墙,但二者都不约束跨工具调用的动作类型组合,也不建模带衰减的多跳委托;OAuth Token Exchange 的嵌套 act 声明只记录委托链而不收窄它。第二,定理的证明对象是委托代数而非某个检查器:Progent 证明的是引擎的时序单调性,CaMeL 证明数据流隔离,APC 的 Theorem 4.6/4.7 对任何忠实实现成立,并补齐了既有方案缺失的逐跳范围衰减与链上累计预算继承。第三,评估方法学创新:compromised-model 协议把 ground-truth 攻击调用在首个合法工具调用后直接注入,独立于模型强度测试基础设施;配合同协议 Progent 对比(双方 0% 观测 ASR,效用差 +1.6pp 偏向 Progent、在预设 ±2pp 等效阈值内),作者诚实地报告了这一点。第四,边界声明清晰:组合可靠性是条件性的($X$ 完备、串行准入、会话内静态),APC 明确不做参数级校验、不替代后端授权,定位为叠加在 OAuth/策略引擎之上的会话层。

Delegation chain with scope narrowing (⊓) at each hop (blue). Infrastructure enforcement (orange): the PDP evaluates six admissibility conditions before the PEP permits execution. The PEP commits tamper-evident evidence to an append-only store; if the store is unreachable, the action is denied (C5).
Figure 1: Delegation chain with scope narrowing (⊓) at each hop (blue). Infrastructure enforcement (orange): the PDP evaluates six admissibility conditions before the PEP permits execution. The PEP commits tamper-evident evidence to an append-only store; if the store is unreachable, the action is denied (C5).
Composition closure distinguishes legitimate workflows from attacks. Top: reading then sharing internally is admitted. Middle: direct exfiltration is blocked by pairwise restriction. Bottom: staged exfiltration via an intermediate write evades pairwise but is caught by k-tuple restriction.
Figure 2: Composition closure distinguishes legitimate workflows from attacks. Top: reading then sharing internally is admitted. Middle: direct exfiltration is blocked by pairwise restriction. Bottom: staged exfiltration via an intermediate write evades pairwise but is caught by k-tuple restriction.

实验结果

在 3,154 个评估实例上,结果分五块。其一,InjecAgent(1,054 例,确定性评估):完整禁令集把 544 例数据窃取 ASR 从 100% 压到 0%,510 例直接伤害降到 60.4%(残余全是范围内单动作攻击,需参数级校验),总 ASR 29.2%;仅移除一条禁令对,数据窃取即回升到 39.9%,精确量化了 Theorem 4.7 完备性假设的价值。其二,ASB(400 攻击工具、10 场景):破坏类 100%→0%,隐蔽类 100%→30%,总 ASR 15%;残余的 DataExfiltrationTool 与 DataExportTool 是基准分类器把外泄语义误标为 write 类所致,语义审计确认其可被既有 $(\mathrm{read},\mathrm{send\_external})$ 禁令覆盖,问题在动作类型分类学 $\mu$ 而非闭包机制。其三,完全妥协模型下的 AgentDojo(Claude Haiku 4.5,609 对、1,218 次执行):四个域外泄 ASR 全部为 0%(基线 75–100%),破坏 38.6%→4.0%,操纵 90.5%→12.1%;残余 18 例中 78% 为意图重叠、22% 为禁令缺对。其四,效用代价(Claude Sonnet 4.6,949 对、3 次运行):strict 模式平均 -13.9pp,interactive 模式 -8.6pp;分域 strict 为工作区 -14.7、银行 -18.8、旅行 -4.0、Slack -16.5pp。其五,工程与对抗验证:99 个深度 2–8 委托链场景 99/99 符合预测(23 正例/76 负例);23 个命名攻击的 43 个变体中 23 个攻击变体全部阻断(会话拆分按设计放行);授权延迟在空闲 i5-1245U 笔记本上为 0.049ms p50 / 0.240ms p99,有负载时 p99 升至 0.66ms。

Adversary capabilities.
Table 1: Adversary capabilities.
Trust boundaries (capabilities the adversary does not have).
Table 2: Trust boundaries (capabilities the adversary does not have).
Security goals and the mechanisms that enforce them.
Table 3: Security goals and the mechanisms that enforce them.
InjecAgent results (1,054 test cases). ASR = attack success rate (lower is better).
Table 4: InjecAgent results (1,054 test cases). ASR = attack success rate (lower is better).
ASB results (400 attack tools, 10 scenarios). ASR = attack success rate.
Table 5: ASB results (400 attack tools, 10 scenarios). ASR = attack success rate.
Per-domain authoring burden.
Table 6: Per-domain authoring burden.
Utility preservation on four AgentDojo suites (Claude Sonnet 4.6). UPR = fraction of task–injection pairs where the user task is completed successfully.
Table 7: Utility preservation on four AgentDojo suites (Claude Sonnet 4.6). UPR = fraction of task–injection pairs where the user task is completed successfully.
Compromised-model evaluation on four AgentDojo suites (Claude Haiku 4.5). Ground-truth attack injection simulates a fully compromised model. Total: 609 unique task–injection pairs, 1,218 executions.
Table 8: Compromised-model evaluation on four AgentDojo suites (Claude Haiku 4.5). Ground-truth attack injection simulates a fully compromised model. Total: 609 unique task–injection pairs, 1,218 executions.
Taxonomy of residual attack successes (18 of 609 runs, 3.0% aggregated observed ASR).
Table 9: Taxonomy of residual attack successes (18 of 609 runs, 3.0% aggregated observed ASR).
Evaluation coverage across all benchmarks (3,154 evaluation instances).
Table 10: Evaluation coverage across all benchmarks (3,154 evaluation instances).
Attack-class coverage summary. Residual values are observed ASR.
Table 11: Attack-class coverage summary. Residual values are observed ASR.
Formal results: assumptions, guarantees, and supporting evidence.
Table 12: Formal results: assumptions, guarantees, and supporting evidence.
Adaptive attack results (representative subset). Twenty-three named attacks with 43 variants target all six conditions.
Table 13: Adaptive attack results (representative subset). Twenty-three named attacks with 43 variants target all six conditions.
Enforcement mechanism comparison on InjecAgent (1,054 cases) and ASB (400 cases).
Table 14: Enforcement mechanism comparison on InjecAgent (1,054 cases) and ASB (400 cases).
Enforcement latency on the environment above. Median of five repetitions; bracketed values are the range across repetitions.
Table 15: Enforcement latency on the environment above. Median of five repetitions; bracketed values are the range across repetitions.
Standalone coverage of APC properties by existing authorization mechanisms.
Table 16: Standalone coverage of APC properties by existing authorization mechanisms.
APC versus modern agentic security systems.
Table 17: APC versus modern agentic security systems.
Illustrative blast scores under default weights.
Table 18: Illustrative blast scores under default weights.
Compromised-model evaluation by attack type, pooled across all four AgentDojo domains (609 task–injection pairs). Exfiltration is eliminated by composition closure (C2b); destruction and manipulation are reduced by intent binding (C6).
Figure 3: Compromised-model evaluation by attack type, pooled across all four AgentDojo domains (609 task–injection pairs). Exfiltration is eliminated by composition closure (C2b); destruction and manipulation are reduced by intent binding (C6).
查看结构化数据
任务指标本文基线提升
InjecAgent 数据窃取(544 例) ASR(越低越好) 0%(完整禁令集 X) 100%(无防御) 降 100pp;移除一条禁令对后回升至 39.9%,验证完备性假设的代价
InjecAgent 直接伤害(510 例) ASR 60.4% 100% 降 39.6pp;残余为范围内单动作攻击,属设计边界外
ASB 破坏类/隐蔽类(400 攻击工具) ASR 0% / 30% 100% / 100% 总 ASR 100%→15%;隐蔽类残余源于基准级动作类误标而非机制失效
AgentDojo 完全妥协模型外泄(4 域 609 对) ASR 0%(工作区/银行/旅行/Slack 全部) 75–100% 外泄清零,由 C2b 组合闭包实现
AgentDojo 破坏/操纵 ASR 4.0% / 12.1% 38.6% / 90.5% 由 C6 意图绑定实现;残余集中在意图重叠
AgentDojo 任务效用(949 对,Claude Sonnet 4.6) UPR 变化(百分点) interactive -8.6pp;strict -13.9pp 无防御 安全-效用权衡,interactive 模式把损失收窄约四成
Progent 同协议对比(银行/工作区) ASR / 攻击时 UPR 0% / 58.8±1.7%、86.7±0.4% Progent 0% / 59.7±1.0%、88.5±0.3% 效用差 +1.6pp 偏向 Progent,落在 ±2pp 等效阈值内
委托链形式验证(深度 2–8,20 攻击类) 场景一致率 99/99(23 正例/76 负例) 验证 Theorem 4.6 与完整六条件谓词
自适应攻击(23 命名攻击/43 变体) 攻击变体阻断率 23/23(会话拆分按设计放行) 覆盖全部六条件、两定理与对手能力 A1–A4
授权强制延迟(空闲 i5-1245U) p99 延迟 0.240 ms(完整六条件) —(仅自身测量) 亚毫秒级;有负载时 p99 最高 0.66 ms,且不含网络往返

局限与改进

作者承认的局限:组合可靠性是条件性的,依赖禁令集完备、串行准入与会话内静态 $X$;单动作范围内滥用(直接伤害残余 60.4%)与参数级攻击在设计边界之外;compromised-model 注入是在首个合法调用后插入 ground-truth 攻击调用这一特定模拟,未建模多轮交错或对抗反馈的自适应对手,且自适应攻击为作者自设计而非外部红队;全部基准均为合成数据,无生产部署证据;两个定理未做机器化证明。我的补充观察:意图重叠残余(609 例中 18 例的 78%)暴露动作类型分类学粒度这一结构性软肋——分类越粗攻击类与任务类越难区分;组合状态严格按会话隔离,跨会话攻击被按设计放行,而真实攻击者恰恰能任意控制会话边界;延迟测量限定在空闲单线程笔记本(有负载 p99 达 0.66ms),且不含到远程 PDP 的网络往返与真实网关开销;为避免 TOCTOU 要求组合检查串行化,在高并发子智能体场景可能成为吞吐瓶颈;银行域 strict 效用损失 -18.8pp 显示高频高危操作域的安全-效用权衡依然尖锐;意图解析质量(C6 属配置依赖层)直接决定破坏/操纵类残余 ASR。

独立分析的弱点

独立分析四点弱点。其一,禁令集的人工编写是可扩展性瓶颈:覆盖度量虽量化了完备性,但四步编写法依赖专家识别被禁结果,面对快速演化的工具生态与长尾被禁结果,$X$ 会滞后于攻击面;改进方向是用 LLM 辅助从威胁模型自动挖掘候选禁令,再以覆盖度量与 SMT 检查验证完备性、人工审批入库。其二,动作类型分类学 $\mu$ 的粒度困境被实验自身证实:ASB 隐蔽类残余 30% 源于 write 类误标,AgentDojo 操纵残余主要靠意图重叠,过细则意图重叠消失但编写负担爆炸、过粗则防护退化——需要按域自适应的分级分类法并充分利用 $\Psi$ 的动作–资源映射(现有实现依赖关键词解析,鲁棒性存疑)。其三,会话内状态的边界假设过强:跨会话攻击按设计放行、多主体妥协后只剩跨会话协调问题,这在攻击者可任意开关会话的现实里偏乐观,应引入持久谱系状态做跨会话组合追踪。其四,工程外推性未经验证:参考实现是单线程 Python,串行准入加网关咽喉在真实多租户并发下的延迟与可用性(证据存储不可达即全局 fail-closed,可能被用作拒绝服务杠杆)都是隐患,需要 Rust/Go 重写、分布式证据存储与容错语义的压测。

未来方向

作者明确列出的方向包括:两个定理的机器化证明(如 Coq/Lean/TLA+)、覆盖单动作残余(60.4%)的参数级校验、经持久谱系状态实现跨会话组合追踪、生产规模多智能体部署的实测评估。基于本文成果可自然延伸:把禁令编写四步法与覆盖度量接上 LLM 辅助策略挖掘,形成"模型提议、SMT 验证、人类批准"的 $X$ 自动化流水线;与 Progent/CaMeL 组合(作者在附录 F 留了接口),让 APC 的会话层闭包与 Progent 的策略 DSL 单调性检查、CaMeL 的数据流隔离构成纵深防御;把 compromised-model 协议扩展到多轮交错与对抗反馈的自适应对手,检验串行准入假设下的新攻击面;从企业既有风险工件(业务影响分析、变更管理类别、职责分离策略)标准化 $\mathrm{blast}(r)$ 与 $\beta_{\max}$ 的推导流程——附录 H 已给默认权重 0.4/0.4/0.2 与逐跳 0.7 衰减因子,但缺实证校准;以及在 OWASP Agentic Top 10、MAESTRO、AIUC-1 等标准中把授权架构要求工程化为可审计控制项,并研究多主体妥协($k\ge2$)下的跨会话协调攻击的形式化界。

复现评估

复现条件相当好。代码与数据全部开源(github.com/xmuruaga/bounded-agents),含 2,500 行 Python 源码、3,000 行测试、全部评估 harness 与域配置;延迟等测量结果以 JSON 形式提交在仓库中,附可重跑的基准脚本(scripts/benchmark_latency.py)。三个基准(InjecAgent 1,054 例、ASB 400 例、AgentDojo v1.2.2)均为公开资源;其中 InjecAgent 与 ASB 评估是确定性的——预填 scratchpad 后判定 APC 谓词是否阻断攻击工具,完全不需要调用 LLM,在普通笔记本(论文用 i5-1245U、16GB)即可复现;99 个委托链场景与 43 个自适应攻击变体同为确定性测试。需要 API 预算的是 AgentDojo 在线评估(Claude Sonnet 4.6 与 Haiku 4.5,经 AWS Bedrock),609+949 对、多次运行会产生可观的 token 费用,但作者提交了运行文件供核对。少数不确定处:Progent 对比一侧数据来自对方 fork 的运行、作者未重新分发该 artifact,严格复现需自行拉取 Progent 仓库并适配 Bedrock;域配置(动作分类器、禁令集、意图关键词)绑定基准域,迁移到自己的环境需重新执行四步编写法并自行校准 $\mathrm{blast}(r)$。总体难度中等:静态与形式验证部分可直接跑通,在线部分需 API 成本。