← 返回 2026-07-30

GPT-Red:基于大规模自博弈的自动化红队智能体 GPT-Red: Automated Red Teaming via Self-Play at Scale

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen 📅 2026-07-28 👍 7 2026-08-04 18:30
GPT-5 LLM安全 对抗训练 指令层级 提示注入 智能体安全 自动化红队 自博弈强化学习

通过大规模自博弈训练的自动化红队智能体,提示注入攻击能力超越人类红队

前置知识

提示注入(Prompt Injection)

攻击者通过在用户输入或模型读取的第三方内容(如网页、工具返回、检索文档)中插入恶意指令,诱导模型偏离开发者或用户的原始意图。论文区分了两类:直接(聊天式)注入直接由用户发起,试图覆盖高优先级的 system/developer 指令;间接(agentic)注入则潜伏在 agent 消费的不受信内容里,例如工具输出、邮件正文、网页文本或截图,伺机劫持 agent 行为。

GPT-Red 的核心目标就是自动发现这两类提示注入攻击,理解攻击向量是读懂整篇论文威胁模型和奖励设计的前提。

指令层级(Instruction Hierarchy, IH)

一种概念性防御框架(Wallace et al., 2024):模型按 system → developer → user → tool response 划分明确的特权等级,所有输入都被标注并强制执行层级关系。当不同层指令冲突时,模型应优先服从更高特权的指令,并在约束下推理如何达成最终目标。论文大量训练环境(如 IH-Challenge)都建立在违反或捍卫这一层级之上。

论文把'是否违反指令层级'作为攻击是否成功的判据,并直接用 GPT-5.1(一个受过 IH 训练但无自博弈的模型)作为 GPT-5.6 的对比基线,因此 IH 是理解评测结果(Figure 13)的钥匙。

自博弈强化学习(Self-Play RL)

一种训练范式:让 attacker 与 defender 两个智能体在同一 RL 流程中互相对抗、同步更新。attacker 因诱发出有效失败(如成功的提示注入)而获奖,defender 因抵御攻击并完成原始任务而获奖。随着 defender 变强,attacker 被迫发现更新更强的攻击;反之 attacker 暴露的新失败又为 defender 提供了逐步加难的训练数据,形成相互逼强的动态。

自博弈是 GPT-Red 区别于'用静态数据集做对抗训练'和'用冻结 LLM 当攻击者'的根本算法创新,也是论文声称的'安全飞轮'的理论基础。

红队测试(Red Teaming)

通过端到端地主动寻找系统漏洞来评估安全性的方法。传统上依赖人类红队专家手动构造攻击,成本高、规模小、覆盖窄。自动化红队(Perez et al., 2022;Beutel et al., 2024)试图用模型替代人类,但以往工作要么用 prompted 攻击者模型、要么在少量环境上做窄目标训练。GPT-Red 把自动化红队扩展到接近生产级 RL 后训练的规模。

理解传统红队的规模与多样性瓶颈,才能体会 GPT-Red 在算力、环境和算法三轴上同时扩展的意义。

对抗训练(Adversarial Training)

通过让模型在对抗样本上学习来提升鲁棒性。早期工作(Goodfellow et al., 2014; Madry et al., 2017)聚焦小规模图像分类;现代 LLM 安全训练通常用 SFT 教会'理想行为先验',再用 RL 在恶意 prompt 上强化安全或正确行为(Guan et al., 2024)。GPT-Red 的产出被注入 GPT-5.6 的 RL 训练,生成对抗 prompt 并度量分布内外指标。

论文最终目标不是训练一个炫技攻击者,而是用 GPT-Red 产出的大量高质量对抗数据把 GPT-5.6 训练得更鲁棒,对抗训练是连接红队与产品改进的桥梁。

研究动机

现有提升 LLM 鲁棒性的方法主要依赖 RL 式对抗训练,但其数据来源——人类红队、prompted LLM、真实生产攻击——规模天然有限。Nasr et al.(2025)已经证明,模型会迅速过拟合到数据集中已出现的特定攻击模式,而对真正自适应的对手依然脆弱。这一问题随着 LLM 能力扩展、用例增多(agentic 编码、浏览、连接器、computer use)只会愈发严重,因为攻击面在持续膨胀。另一条技术路线——基于离散优化的对抗后缀(Zou et al., 2023; Greshake et al., 2023)——往往需要白盒访问、需要海量 defender 查询,且很难迁移到新模型或新设置。结果是:既无法生成足够规模与多样性的对抗数据来覆盖不断扩张的攻击面,也无法跟上模型能力迭代的速度,安全训练长期处于'打补丁式'被动局面。

本文的目标是本文目标是训练一个真正可扩展的自动化红队智能体 GPT-Red,使其能在规模、多样性、质量三个维度上同时满足有效鲁棒性训练所需,进而用于评估并改进 OpenAI 生产系统的鲁棒性。具体而言,作者希望这个红队智能体能(1)发现针对前沿 LLM 的新型提示注入攻击;(2)泛化到训练时未见的场景、目标、红队 harness 和目标模型,可作为'即插即用'的红队;(3)产出多样且合法的攻击,避免 mode collapse 或 reward hacking;(4)在 RL 阶段被用来生成对抗训练 prompt,从而训练出迄今为止对提示注入最鲁棒的 GPT-5.6,并验证鲁棒性可在多个 held-out 评测上单调爬升。

与已有工作不同的是,本文的独特切入角度是把'攻击者'本身当作一个需要被训练的前沿智能体,而不是当作冻结的 prompted LLM 或离线数据集。其创新在于同时沿三条轴线扩展红队能力:推理时算力(通过 agentic harness 与 defender_model 工具,让攻击者像人类红队那样迭代试探)、环境多样性(把现有能力任务批量转换成对抗训练环境,涵盖直接/间接提示注入、多模态、安全拒答越狱)、训练算力(规模达到 OpenAI 主力 GPT-5 系列 RL 后训练量级,号称史上最大的单次 LLM 安全训练 run)。这与以往只在少数环境上训练窄目标攻击者、或仅在推理时扩展 test-time 算力的工作形成本质区别,并首次把自博弈多 defender 训练推到生产级规模。

核心方法

整体思路是模拟人类红队专家'反复交互、迭代精炼攻击'的过程,并把这一过程工业化。直觉层面:一个红队专家不会一次性写出完美攻击,而是先试探目标、观察反应、再调整策略;因此 GPT-Red 被赋予一个有状态的 defender_model 工具,可以在单次 rollout 内做结构化搜索、分支、代码生成。技术路线层面:作者构建了一套自博弈 RL 框架,attacker 与一群 diverse defender 在大量红队环境里同时训练,attacker 因诱发出有效失败而获奖,defender 因抵御并完成任务而获奖,二者相互逼强。该框架覆盖文本与多模态提示注入、安全拒答越狱三类攻击,并通过把现有能力任务(如浏览、连接器、function calling、agentic coding)改造成'插入单点恶意内容'的对抗环境,自然继承 GPT-5.6 整个训练分布。最终用接近生产级 RL 后训练的算力把这三大要素一起 scale 上去,得到 GPT-Red。

核心创新是把红队智能体的训练问题转化为一个'attacker↔多 defender 自博弈 + agentic harness + 大规模 RL'三位一体的工程问题,并与以往方法在本质上区别开来。第一,defender_model 工具让 attacker 在单 rollout 内顺序查询 defender、迭代精炼攻击,使其在同算力预算下显著优于 best-of-N 采样(Figure 3);第二,同时训练多个 strong defender 而非单一 defender,迫使 attacker 去探测每个模型各自的弱点,避免在单一模型上 mode collapse(Figure 7 显示针对不同 defender 的攻击并不总是迁移);第三,把现有能力任务'最小改动'地转换成对抗环境——只在 defender rollout 中断一个工具调用或文件区域,让 attacker 编辑其中受信度最低的部分——这使攻击者能力可随 GPT 训练分布扩张而自然增长。这套组合在论文里被描述为可解锁的'安全飞轮'。

方法步骤详情

单次自博弈迭代分七步:(1)采样一个 RL 环境,含对话、初始文件系统状态与选定 defender 模型;(2)选定攻击插入点(通常是某次工具调用)与 attacker 目标(如触发 $\texttt{rm -rf}$ 或外泄 API key),并提供对抗知识;(3)attacker rollout,经 defender_model 工具交互、写代码、迭代修改攻击文件,满意后提交路径,中间调用全丢弃;(4)用程序化+LLM 判官混合校验合法性与环境,非法则奖励为 0(查 schema、长度等);(5)把攻击插入 defender rollout 预定位置并从该点恢复;(6)按环境计算不对称奖励,分别判定 attacker 是否成功、defender 是否完成原任务(jailbreak 用与'最大有害答案'对比的 rubric 评分,并过滤表层变换或不像真实对话的攻击以防 hacking);(7)用 RL 同时更新 attacker 与 defender。多模态分支里 attacker 还调用 OpenAI Images 2.0 生成图片攻击,要求图片保留原任务可解性。

技术新颖性

技术新颖性体现在四个层面。规模上,这是迄今为止公开文献中最大的单次 LLM 安全 RL run,算力与 OpenAI 主力 GPT-5 系列 RL 后训练相当,远超 Ma et al.(2023)、Liu et al.(2025)等最相近工作。算法上,首次把多 defender 自博弈 + agentic harness + 大规模 RL 三者联合 scale,并通过 controlled self-play 实验(Figure 4、5、6)证明训练动态健康、attacker 单调变强且不遗忘。环境上,提出'把现有能力任务改造成单点注入对抗环境'的通用配方,自然继承 GPT-5.6 训练分布并支持多模态(CUA 截图、浏览/检索图片注入)。验证上,不仅做了 held-out 数据集/领域/攻击类别的鲁棒性评测,还把 GPT-Red 直接对接真实生产系统(OpenAI 办公室的 AI 售货机 Vendy),完成'改价到 $0.50、上架 $100+ 商品并标 $0.50、取消他人订单'全部三个目标,展示了从仿真到真实系统的迁移能力。

GPT-Red devises a complex 'fake chain-of-thought' prompt-injection to exfiltrate simulated user data.
Figure 2: GPT-Red devises a complex 'fake chain-of-thought' prompt-injection to exfiltrate simulated user data.
Defender_tool usage is more query-efficient.
Figure 3: Defender_tool usage is more query-efficient.
Attackers adapt online to improving defenders.
Figure 4: Attackers adapt online to improving defenders.
GPT-Red finds specialized attacks for different defenders.
Figure 7: GPT-Red finds specialized attacks for different defenders.
Example safety RL environments for prompt injections.
Figure 8: Example safety RL environments for prompt injections.

实验结果

其一,GPT-Red 是最强红队:在 2025 Q4 IPI Challenge 上,未给 defender 访问的 GPT-5.5 与人类持平,给 defender_model 工具后 ASR 显著上升,GPT-Red 取得所有方法中最高的平均 ASR 并随 test-time compute 持续提升,明显超过人类;它对历史全部 GPT-5 系列模型都能找到有效攻击,对早期 GPT-5 攻击成功率近乎翻倍。其二,真实世界迁移成功:伪造'可信管理员'元数据攻破 Andon Labs 售货机 Vendy 全部三个目标;对 GPT-5.4 mini 的 Codex CLI,GPT-5.5 在简单任务后停滞而 GPT-Red 持续推进。其三,GPT-5.6 鲁棒性大幅跃升:held-out 攻击/数据集/领域 defender 成功率爬升到 >50%、最高 89.0%;IPI held-out 演练 ASR 降到 4% 以下;fake-CoT 攻击 ASR 从 GPT-5.1 的 0.4% 暴跌到 GPT-5.6 的 5.2%(鲁棒性 5.2%→95.9%)。

GPT-Red is a strong agentic red-teamer.
Figure 1: GPT-Red is a strong agentic red-teamer.
Self-play improves held-out defender robustness.
Figure 5: Self-play improves held-out defender robustness.
Attacker improves over the course of self-play.
Figure 6: Attacker improves over the course of self-play.
GPT-Red discovers a prompt injection attack against an agent that runs a vending machine business.
Figure 9: GPT-Red discovers a prompt injection attack against an agent that runs a vending machine business.
GPT-Red performs better at harder prompt injection tasks.
Figure 10: GPT-Red performs better at harder prompt injection tasks.
GPT-5.6 generalizes to much harder attacks and scenarios than trained on.
Figure 11: GPT-5.6 generalizes to much harder attacks and scenarios than trained on.
GPT-5.6 generalizes across hard robustness evaluations.
Figure 12: GPT-5.6 generalizes across hard robustness evaluations.
Direct prompt injection robustness.
Figure 13: Direct prompt injection robustness.
Attackers improve test-time compute usage through training.
Figure 14: Attackers improve test-time compute usage through training.
查看结构化数据
任务指标本文基线提升
2025 Q4 IPI Challenge(间接提示注入,攻击 GPT-5.1 defender) 平均攻击成功率 ASR(@test-time compute) GPT-Red 在所有 test-time compute 预算下均最高,并随算力持续上升 人类红队 / GPT-5.5(无 defender 访问)≈ 持平;GPT-5.5(带 defender 访问)次之 GPT-Red 明显超越人类红队与带工具的 GPT-5.5,是 SOTA 自动红队
IH-Challenge 直接提示注入(attacker query 效率) ASR vs defender 查询次数(1/5/10/25/50) Agentic harness(defender_model 工具)在相同 query 预算下 ASR 高于 best-of-N Best-of-N 独立采样 随 query 数增加,agentic 与 best-of-N 差距拉大,验证 harness 的查询效率(Figure 3)
Fake Chain-of-Thought 直接提示注入攻击 Defender 鲁棒性(越低越易被攻破) GPT-5.6:95.9% 鲁棒(ASR 5.2%) GPT-5.1(有 IH 训练但无自博弈):鲁棒性 5.2%(ASR ≈94.8%) 鲁棒性从 5.2% 跃升至 95.9%,几乎是 step function(Figure 13)
System Override 攻击(直接提示注入) Defender 鲁棒性 GPT-5.6:99.5% GPT-5.1:89.1% +10.4 个百分点(Figure 13)
Held-out 攻击/数据集/领域(间接提示注入) 平均 defender 成功率 GPT-5.6 全部 >50%,最高 89.0% 早期 GPT-5 系列显著更低 即便从未见过的攻击类别与领域,鲁棒性仍爬升到 50%–89%(Figure 11)
IPI 2025 Challenge(人类攻击,间接提示注入) Defender 鲁棒性 GPT-5.6:100%(1 例误评分,人工核验通过) 此前 GPT-5 系列 对人类红队攻击达到近乎满分鲁棒
内部 IPI held-out 红队演练(GPT-Red 攻击历版 GPT-5) ASR GPT-5.6:<4% GPT-5.3/5.4/5.5 显著更高 随版本单调下降,自博弈带来持续增益(Figure 12)

局限与改进

作者明确承认的局限包括:当前 GPT-Red 在多模态环境、多轮攻击场景以及内容策略越狱上的训练覆盖仍较少,计划后续扩展;鲁棒性'远未解决'(far from solved)。从论文叙述与设计上还能观察到若干额外局限:其一,几乎所有评测都是 OpenAI 内部进行,GPT-Red 既未开源、权重也不公开,攻击能力与人类红队的对比基于自评,存在系统性偏差风险(作者也脚注承认该结果并不意味着 GPT-Red 普遍优于人类,人类可能发现论文未覆盖的新型场景或攻击类别)。其二,held-out 红队演练刻意不启用 system-level 缓解措施,作者自己指出这会相对真实攻击者夸大 ASR。其三,威胁模型假设 attacker 仅能修改单个工具响应或非特权文件,且拥有对 defender rollout 的部分观察与有限黑盒查询——真实世界中攻击者能力边界可能不同,迁移性有待更多外部验证。其四,论文未给出标准公开基准(如 AgentDojo、InjecAgent、ASB)上的横向对比,难以与学术界同期工作直接比较。

独立分析的弱点

第一个弱点是覆盖面不均衡:多模态、多轮、内容策略越狱训练偏少,相关方向上 GPT-Red 与 GPT-5.6 的鲁棒性增益可能被高估;改进方向是按论文规划继续扩这些环境的训练量,并补充多轮对话式攻击(逐步把良性话题引向有害请求)。第二个弱点是评测封闭性:结果几乎全部来自 OpenAI 内部,GPT-Red 不开源,缺乏第三方可重复基准;改进方向是至少在公开基准(AgentDojo、InjecAgent、ASB 等)上发布横向对比,TensorTrust 已被用作外部评测,可进一步扩展。第三个弱点是威胁模型较理想化:限定单点注入、部分观察、有限黑盒查询,且 held-out 红队演练未启用 system-level 缓解——真实部署中攻击者能力边界可能不同;改进方向是引入灰盒威胁模型谱系,并在启用生产级缓解下重新度量 ASR。第四个弱点是 reward hacking 风险:多重过滤检查的误杀/漏杀未量化;改进方向是公开这些过滤的假阳/假阴率。第五个弱点是 defender 种群偏向 OpenAI 自家模型族,跨厂商迁移性未验证;改进方向是与 Claude、Gemini 等做交叉红队。

未来方向

作者明确提出的未来工作包括:扩展多模态、多轮攻击场景与内容策略越狱的训练覆盖;继续 scale 算力、数据与自博弈训练;持续把更强的 GPT-Red 嵌入每一代 GPT 的 RL 训练,形成'今天的 GPT-Red 让明天的模型更鲁棒,明天的模型又给后天的红队提供更强学习信号'的安全飞轮。基于本文成果可延伸的方向还包括:(1)把'把能力任务转换成对抗环境'的配方自动化,让红队环境随模型能力分布自动扩张;(2)研究 attacker↔defender 自博弈的收敛性与稳定性理论,避免 ASR 振荡或 mode collapse;(3)将自博弈范式迁移到非提示注入的安全维度(如隐私泄漏、长期对齐漂移);(4)探索跨组织协作红队,验证多 defender 种群包含异构厂商模型时的迁移性与鲁棒性增益;(5)研究 test-time compute 与训练 compute 的最优分配,以及 attacker 是否能在更少 defender 查询内找到等价攻击。

复现评估

复现难度极高,实际上对外部研究者基本不可复现。代码、权重、训练数据均未开源,论文也未承诺发布。训练数据全部来自 OpenAI 内部数据集(包括 GPT-5.6 的能力任务、IH-Challenge、内部 helpful-only 模型等),算力规模与 OpenAI 主力 GPT-5 系列 RL 后训练相当,号称史上最大单次 LLM 安全训练 run——这种规模的 RL 训练远超学术界资源。威胁模型实现细节(defender_model 工具、攻击合法性校验、rubric 评分、多模态图片注入 API)只在概念层描述,关键超参与训练曲线仅以归一化图呈现(如 Figure 4–7 的训练进度用百分比而非步数)。读者可以复现的是方法层面的思想(自博弈 + agentic harness + 多 defender + 单点注入环境改造),以及在小规模开源模型 + 公开红队基准(如 AgentDojo、IH-Challenge 风格任务)上验证趋势,但无法复现论文报告的绝对数字。可作为产业级方法学参考,而非可直接复现的研究产物。