← 返回 2026-08-13

OpenART:通过开放式环境演化扩展智能体红队测试 OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang 📅 2026-08-01 👍 258 2026-08-18 18:30
基准评测 攻击成功率 智能体安全 环境演化 红队测试

以可执行环境为评测单元,通过环境演化式红队测试将攻击成功率推至85%

前置知识

AI 智能体(Agent)

以大语言模型为大脑、能调用工具并执行多步工作流的自主系统。与传统对话模型不同,智能体在持久环境中通过读取、修改共享状态(文件、数据库、API)来完成长程任务,行为通过环境状态耦合传播。

本文的核心命题是:智能体的安全性不能只看单次回复,而要看它在环境持续演化中的累积行为,理解智能体的运行机制是读懂全文的前提。

红队测试(Red Teaming)

以攻击者视角主动探测系统安全弱点的方法论。在 AI 安全中,红队会构造对抗输入诱导模型产生有害输出;本文将其扩展为:不改攻击指令,而是系统性地演化智能体可见的环境状态,观察安全性何时失效。

OpenART 的全部设计(场景构造、EMHA 策略、Strict ASR 指标)都服务于红队测试这一目标,理解其含义才能把握论文动机。

攻击成功率(ASR)

衡量攻击有效的比例。本文采用严格版 Strict ASR:只有当确定性评估器判定 $D_i=1$ 且 GLM-5.2 大模型裁判判定 $L_i=1$ 时才算攻击成功,即 $\mathrm{ASR}_{strict} = \frac{1}{N}\sum_i \mathbb{1}\{D_i=1 \wedge L_i=1\}$,任何不一致都计为失败。

论文所有关键数字(总体 85.0%、消融 94.7% 等)都基于该指标,理解其双确认设计才能正确解读实验结果。

马尔可夫超图(Markov Hypergraph)

普通图的边只连接两个节点,超边可同时连接多个节点。EMHA 用超图建模攻击:节点是攻击子目标,超边把一组前置子目标连接到其后继。由于就绪集合只依赖当前激活子目标集 $q$,路径演化具有马尔可夫性,可用软值策略采样。

EMHA 是论文的参考攻击策略,超图是其表示协调式环境修改的数学载体,不懂数学形式就无法理解方法章节。

质量多样性搜索(Quality-Diversity / MAP-Elites)

一种进化搜索范式:把解空间划分为行为网格,每个网格只保留适应度最高的精英解,从而同时保持解的多样性和质量。EMHA 借此维护攻击档案,每个行为格子 $c_t = d(\eta_t)$ 保留最优攻击,并用两个图编辑算子生成子代。

档案引导的图演化是 EMHA 区别于普通提示优化(如 GCG、PAIR)的关键组件,消融显示去掉它 ASR 下降 3.9%。

研究动机

AI 智能体运行在持久环境中,工具调用会持续修改共享状态、数据与权限,早期看似无害的状态变更可能在数百步之后才显化为危害行为——安全失败是整条交互轨迹的属性,而非单次动作的属性。但现有智能体安全评测存在两大硬伤:其一,InjecAgent、AgentDojo、ToolEmu、AgentHarm、Agent Security Bench 等基准都用静态或可重置环境中的短工作流,实测任务中位数工具调用仅 1-3.5 次、状态对象 1-3.5 个,几乎无法覆盖持久状态操纵、延迟攻击传播和长程安全失败;即便最接近的 DTap 也只有 15 次工具调用中位数和 2 的依赖深度。其二,各基准与自家基础设施强耦合,接口互不兼容,导致不同智能体运行时之间无法直接对比。结果是:社区实际上只测量了'智能体能否在给定环境中完成任务',而没有测量'当环境在它周围演化时它是否仍然安全'。

本文的目标是论文要把红队测试的基本单元从孤立的提示词升级为'可执行且可演化的环境',构建一个大规模智能体安全竞技场。具体量化目标有三:第一,构造超 1 万个经过验证的有状态场景,覆盖 50 个领域,从超 50 万个 Tools、MCPs 和 Skills 的能力语料中合成,任务中位数需 97 次工具调用、依赖深度 32、并行宽度 12.5、状态对象 96.5 个,远超既有基准;第二,通过目标适配器把同一场景无损投影到 15 个已部署智能体、5 个基础模型、8 种攻击向量,形成 75 个智能体-模型配置的统一可比评测;第三,提出演化式马尔可夫超图攻击(EMHA)作为参考策略,在任务目标和安全契约完全固定的情况下,仅通过反馈驱动的环境状态演化来系统性探索攻击面,并定量回答环境演化随复杂度增长的增益,以及智能体实现对安全性的独立贡献。

与已有工作不同的是,本文的独特切入点是把'环境轨迹'而非'对抗提示'作为评测和优化的基本对象。与优化输入文本的 GCG、AutoDAN、PAIR、TAP 等模型级红队方法不同,也与 DTap-Red 在模拟服务中迭代精炼提示注入位置不同,OpenART 在整个演化过程中保持良性任务目标 $\tau$ 和隐藏安全契约 $\mathcal{E}_q$ 不变,只改目标可见的环境状态,并用评估器反馈授权和引导下一次状态转移。这带来三个此前无人同时具备的能力:一、攻击增益可以被干净地归因于环境复杂度而非提示变化;二、同一场景可通过轻量适配器在异构运行时间保持语义与评估标准一致,实现跨智能体的受控对比;三、演化策略与竞技场解耦,OpenART 是策略无关的,任何黑盒搜索策略都能在同一协议下被评测,EMHA 只是其实例化之一。

核心方法

直觉上,攻击长程智能体不必修改指令,只需悄悄改坏它的工作环境。OpenART 把这一直觉工程化为三阶段流水线。阶段一'可执行场景合成':从 O*NET 等来源整理出 50 个领域,给定场景种子 $q$,规划器从超 50 万能力(Tools/MCPs/Skills)中检索兼容集 $\mathcal{D}_q$,合成场景模型 $S_q$,构造满足拓扑与复杂度约束的有向工作流图 $G_q=(V_q,E_q)$,编译为初始环境 $x_{0,q}=F(S_q,G_q,\mathcal{D}_q)$;仅当验收测试 $\mathcal{A}$ 确认评估器在安全/不安全结局上满足 $\mathcal{E}_q(o^{safe})=0$、$\mathcal{E}_q(o^{unsafe})=1$ 时才准入(人工审计 99.3% 评估器正确)。阶段二'跨智能体投影':适配器 $\psi_r$ 只物化被授权的变更 $m_t=\Pi_r(\Delta_t)$。阶段三'受控演化与评测':攻击者与目标分处独立 Docker 容器,投影是唯一信道,执行 $(\xi_t,x_{t+1})\sim\mathcal{K}_r(\cdot\mid\tau,x_t,m_t)$ 并由 $Y_t=\mathcal{E}_q(\tau,\xi_t,x_{t+1})$ 反馈。

核心创新是'冻结式环境演化':任务目标 $\tau$ 与安全契约 $\mathcal{E}_q$ 全程不变,只演化目标可见的环境状态。EMHA 做纯黑盒、无参数更新的搜索——目标与攻击者模型都冻结($\theta_{t+1}=\theta_t=\theta_0$),改用外部攻击状态 $C_t$ 实现测试期适应。它把协调式环境修改表示为超图 $G_t=(V_t,E_t)$,超边 $e=(H_e,T_e,\phi_e)$ 把前置子目标连到后继;从激活集 $q_0$ 出发按软值策略 $\pi_C(e\mid q,x_t,G_t)=\exp(Q_C(q,e)/\tau_Q)/\sum_{e'}\exp(Q_C(q,e')/\tau_Q)$ 采样就绪超边得到路径 $\rho_t$,再由冻结攻击模型解码为更新 $\Delta_t$。反馈沿路径再分配更新 $Q_C(q_j,e_j)\leftarrow(1-\alpha)Q_C+\alpha[r_{t,j}+\gamma V_C(q_{j+1})]$,优化 $J_{EMHA}=\mathbb{E}[\max_{1\le t\le K}Y_t]$;同时用 MAP-Elites 档案经两个图编辑算子做图策略进化。与 GCG、PAIR 等提示优化的本质区别:搜索单元是环境而非提示。

方法步骤详情

流程分四步。第一步场景构造(输入:场景种子+能力语料):规划器合成场景模型 $S_q$ 与工作流图 $G_q$,编译器 $F$ 物化为任务包——目标只拿到良性指令、含批准证据的工作区、所选能力和服务快照,诱饵与受保护资源埋在工作流旁;验收测试验证评估器真值表($\mathcal{E}_q(o^{safe})=0$、$\mathcal{E}_q(o^{unsafe})=1$),失败回炉,通过后成为初始环境 $x_{0,q}$。第二步跨智能体投影(输入:目标无关场景):适配器 $\psi_r$ 启动未修改的原生智能体,把任务、契约、评估器投影到其原生接口,8 个攻击向量按运行时支持子集暴露。第三步 EMHA 攻击轮(输入:$x_t$、$C_t$):检索上下文 $\ell_t$,选图 $G_t$、采样路径 $\rho_t$,解码 $\Delta_t=D_{\theta_0}(x_t,\ell_t,G_t,\rho_t)$,投影 $m_t=\Pi_r(\Delta_t)$,目标执行产生轨迹 $\xi_t$,评估器给 $Y_t$。第四步状态更新:回报增量 $\delta_t=\max_{s\le t}Y_s-\max_{s<t}Y_s$ 更新 $Q$ 值,攻击按行为格子 $c_t=d(\eta_t)$ 更新 MAP-Elites 档案,父代池经两个图编辑核产生子代,写回 $C_{t+1}$ 进入下一轮。

技术新颖性

技术新颖性体现在五个层面。一、评测对象重构:此前所有智能体安全基准(含 2025 年的 DTap,6,682 任务/14 领域/中位 15 次工具调用/4 个注入向量)都以任务或提示为单元,OpenART 首次把可执行环境作为红队单元,复杂度中位数 97/32/12.5/96.5/7.5(工具调用/依赖深度/并行宽度/状态对象/文件格式),全维度领先 DTap 一个数量级。二、冻结演化协议:任务与评估器双固定、仅状态可变的受控设计,使 ASR 提升能被无歧义归因于环境演化本身,这在方法学上前所未有。三、EMHA 的超图+进化组合:超边天然表达多子目标协同(单一注入向量做不到),马尔可夫就绪集设计让软值策略可用;Q 值回报再分配处理延迟奖励,MAP-Elites 档案维持行为多样性,两个机制分别贡献 2.6% 和 3.9% 的 ASR——这是首个在环境层面做质量多样性搜索的攻击框架。四、跨运行时对齐:15 个异构智能体共享同一场景语义与评估标准,靠轻量适配器实现,使'智能体实现独立贡献 7.6% ASR 方差'这类归因结论成为可能。五、策略无关接口:EMHA 只是参考实现,环境演化接口可插入任意黑盒策略,为后续攻击研究提供基础设施。

OpenART organizes agent-safety evaluation into three stages.
Figure 3: OpenART organizes agent-safety evaluation into three stages.

实验结果

发现一:总体攻击效力。75 个配置上 EMHA 汇总 Strict ASR 达 85.0%;方差分解显示目标模型解释 73.6%、智能体解释 25.2%,模型与良性完成率解释 91.3%,加入智能体身份升至 98.9%(+7.6%),且智能体脆弱性排序跨模型平均 Spearman 相关 0.65。分模型:Qwen-3.7-Max(94.6%)与 DS-V4-Pro(94.7%)最脆弱,GPT-5.5(88.5%)、GLM-5.2(87.9%)次之,Opus-4.8(59.2%)显著最鲁棒;分智能体:OpenCode 90.3% 最高,Aider 仅 59.1%(良性完成率也最低 70.74%)。发现二:环境演化优于指令攻击。DS-V4-Pro 消融中工作区演化 92.5%、超指令基线 10.9%,其余 7 向量均值 71.2% 且全部过 50%;完整 EMHA 94.7%,超基线 13.1%;去档案降 3.9%、去信用再分配降 2.6%。发现三:演化随复杂度放大。五轮累计 ASR 从 42.9% 爬至 94.7%(+51.8%);GPT-5.5 上优势从简单场景 1.8-2.7% 增至最复杂场景 17.2-17.6%。发现四:长程安全漂移。10,000 条轨迹中,演化状态首次消费在执行 23% 处,首个不安全输出在 64%,中位潜伏期 41%,传播距离中位数 37 个动作(IQR 20-66)。发现五:三类复现脆弱模式——过期假设不失效、安全决策被传播而非重计算、风险组合式涌现。

Comparison between DTap and OpenART.
Table 1: Comparison between DTap and OpenART.
OpenART's evaluation objects.
Table 2: OpenART's evaluation objects.
Task-level complexity measured over up to 100 sampled tasks per benchmark.
Table 3: Task-level complexity measured over up to 100 sampled tasks per benchmark.
Attack vectors declared by the 15 target adapters used in the experiment matrix.
Table 4: Attack vectors declared by the 15 target adapters used in the experiment matrix.
Benign task completion (%) on the original OpenART scenarios.
Table 5: Benign task completion (%) on the original OpenART scenarios.
Strict ASR across target agents and target models.
Table 6: Strict ASR across target agents and target models.
Environment and search ablations under DeepSeek-V4-Pro with a matched attack budget.
Figure 4: Environment and search ablations under DeepSeek-V4-Pro with a matched attack budget.
Cumulative Strict ASR across five environment evolution rounds.
Figure 5: Cumulative Strict ASR across five environment evolution rounds.
Strict ASR under GPT-5.5 across five equal-sized complexity groups.
Figure 6: Strict ASR under GPT-5.5 across five equal-sized complexity groups.
Long-horizon safety drift across 10,000 converted trajectories.
Figure 7: Long-horizon safety drift across 10,000 converted trajectories.
查看结构化数据
任务指标本文基线提升
长程智能体场景复杂度对比 中位数:工具调用 / 依赖深度 / 并行宽度 / 状态对象 / 文件格式 OpenART:97 / 32 / 12.5 / 96.5 / 7.5 DTap:15 / 2 / 1.5 / 2.5 / 1(InjecAgent、AgentDojo 等仅 1-3.5 次工具调用) 工具调用提升约 6.5 倍,状态对象提升约 39 倍
75 配置智能体红队攻击 Strict ASR (%) EMHA 全量环境演化:85.0%(DeepSeek-V4-Pro 子集 94.7%) 指令演化(同等预算):81.6% +13.1 个百分点;最复杂场景上优势扩至 17.2-17.6 个百分点
单攻击向量攻击(DeepSeek-V4-Pro) Strict ASR (%) 工作区演化 92.5%(其余 7 向量均值 71.2%,全部超过 50%) 指令演化 81.6% 工作区向量 +10.9 个百分点,证明指令固定时攻击仍有效
五轮环境演化攻击(DeepSeek-V4-Pro) 累计 Strict ASR (%) 42.9% → 69.4% → 73.5% → 89.8% → 94.7% 首轮静态评估 42.9% 五轮累计提升 51.8 个百分点
良性任务完成率(无攻击) 确定性评估器通过率 (%) Claude-Opus-4.8 均值 96.18%,全配置平均 87.38%(Oh My Pi 达 92.29%) Qwen-3.7-Max 均值 80.81%,Aider 全模型最低 70.74% 用于控制能力差异,使 ASR 归因到安全性而非能力

局限与改进

作者明示的局限有三:一是 Strict ASR 依赖确定性评估器与 GLM-5.2 裁判的双重确认,不一致一律计失败,虽保守但裁判本身可能引入偏差,评估器虽经 99.3% 人工审计仍非零错误;二是归因分析只建立统计关联,作者明确声明'该分析不识别底层机制',7.6% 的智能体贡献无法指认到具体实现细节;三是良性完成率低的 Aider(70.74%)其 ASR 数据需结合能力缺口解读,攻击与能力的混杂未完全剥离。我自己的观察:其一,EMHA 每场景需多轮完整执行(中位 97 次工具调用/轮),五轮演化的算力成本论文未披露,实测代价可能极高,且两个结论(消融用 DeepSeek-V4-Pro、复杂度分析用 GPT-5.5)都只基于单模型,跨模型普适性存疑;其二,攻击向量由适配器声明(表 4),各智能体暴露的向量集合不同(Pi 5 个 vs OpenCode 7 个),跨智能体 ASR 比较存在向量覆盖不均的混淆;其三,场景由同一 LLM 规划器合成并自验证,可能存在系统性构造偏置,50 领域的真实分布代表性未验证;其四,五轮 ASR 曲线在 89.8%-94.7% 已近饱和,更高轮次的边际收益未报告。

独立分析的弱点

弱点一:评测成本与结论覆盖不匹配。每配置每轮需完整跑中位 97 次工具调用的任务,75 配置 × 多轮演化总量惊人,因此关键消融只在 DeepSeek-V4-Pro、复杂度分析只在 GPT-5.5 单模型上做,'演化增益×模型强弱'的交叉问题无法回答。改进方向:发布分层抽样子集与标准评测协议并报告方差。弱点二:防御侧完全缺位。论文只攻不防,未给出检测或缓解方案——三类复现脆弱模式其实直接指向防御设计(关键安全决策强制重计算、来源变更触发再验证),但作者未实现。改进方向:把 OpenART 反向用作防御回归测试集。弱点三:跨智能体对比的公平性漏洞。表 4 显示各适配器暴露的攻击向量数不同(OpenCode 7 个 vs Pi 5 个),ASR 差异部分来自攻击面大小而非实现质量,25.2% 的智能体方差贡献可能被高估。改进方向:报告按 15 个智能体共同支持的向量子集约束后的排名。弱点四:评估器由 LLM 规划器生成再自验,可能继承生成模型的盲区;99.3% 人工审计测的是评估器对已构造场景的判断,不是场景集合对真实风险的覆盖。

未来方向

作者提出的方向集中在三处:一是 OpenART 是策略无关的,环境演化接口可容纳 EMHA 之外的黑盒搜索策略,未来可在同一协议下对比不同攻击策略;二是把环境演化作为研究智能体安全性的受控实验台,深入分析智能体实现(运行时)如何独立影响安全性的机制,作者明确表示当前归因分析未识别底层机制;三是覆盖更多攻击向量与运行时的组合。基于本文成果可延伸的方向:防御侧研究首当其冲——三类复现脆弱模式(过期假设、安全决策传播、组合式涌现)直接指向防御设计,可把 OpenART 用作防御回归基准,量化'安全决策强制重计算''来源变更触发再验证'等机制对 85.0% ASR 的削减;其次是廉价代理评估器与主动采样,降低每场景多轮完整执行的评测成本;第三是跨模型复杂度交叉研究,验证'演化增益随复杂度增长'在非 GPT-5.5 模型上是否成立;最后,将环境演化范式迁移到多智能体系统与具身场景的状态安全评估,也是自然延伸。

复现评估

复现评估:中等偏难。有利因素:论文给出 GitHub 仓库(github.com/AI45Lab/OpenART)和项目主页(ai45lab.github.io/OpenART),承诺开源;方法章的公式(式 1-16)完整覆盖场景构造、投影、EMHA 更新全流程;附录 A-E 提供领域分类、对象层级、规划器提示词、攻击者教义提示词和六个完整案例轨迹,复现细节披露程度远超平均水平;评估器是确定性的,不依赖昂贵的人工打分。不利因素:其一,依赖 15 个已部署智能体的原生接口和 5 个闭源前沿模型(GPT-5.5、Claude-Opus-4.8 等),适配器对运行时版本的耦合度高,模型迭代后需重新校准;其二,算力门槛高——50 万能力语料的收集标准化、1 万场景的合成验证(含自动化行为探针)、75 配置 × 多轮的完整执行,估计需要大规模 LLM API 预算,个人研究者只能跑缩小版;其三,Strict ASR 中的 GLM-5.2 裁判需要 API 访问。建议复现路径:先在 2-3 个开源可本地部署的智能体(如 OpenCode、Goose)× 1 个开源模型上,用官方发布的场景子集复现指令演化 vs 工作区演化的 10.9% 差距,这一结论最核心且成本可控。