GPT-Red:基于大规模自博弈的自动化红队智能体 GPT-Red: Automated Red Teaming via Self-Play at Scale
通过大规模自博弈训练的自动化红队智能体,提示注入攻击能力超越人类红队
前置知识
提示注入(Prompt Injection)
攻击者通过在用户输入或模型读取的第三方内容(如网页、工具返回、检索文档)中插入恶意指令,诱导模型偏离开发者或用户的原始意图。论文区分了两类:直接(聊天式)注入直接由用户发起,试图覆盖高优先级的 system/developer 指令;间接(agentic)注入则潜伏在 agent 消费的不受信内容里,例如工具输出、邮件正文、网页文本或截图,伺机劫持 agent 行为。
GPT-Red 的核心目标就是自动发现这两类提示注入攻击,理解攻击向量是读懂整篇论文威胁模型和奖励设计的前提。
指令层级(Instruction Hierarchy, IH)
一种概念性防御框架(Wallace et al., 2024):模型按 system → developer → user → tool response 划分明确的特权等级,所有输入都被标注并强制执行层级关系。当不同层指令冲突时,模型应优先服从更高特权的指令,并在约束下推理如何达成最终目标。论文大量训练环境(如 IH-Challenge)都建立在违反或捍卫这一层级之上。
论文把'是否违反指令层级'作为攻击是否成功的判据,并直接用 GPT-5.1(一个受过 IH 训练但无自博弈的模型)作为 GPT-5.6 的对比基线,因此 IH 是理解评测结果(Figure 13)的钥匙。
自博弈强化学习(Self-Play RL)
一种训练范式:让 attacker 与 defender 两个智能体在同一 RL 流程中互相对抗、同步更新。attacker 因诱发出有效失败(如成功的提示注入)而获奖,defender 因抵御攻击并完成原始任务而获奖。随着 defender 变强,attacker 被迫发现更新更强的攻击;反之 attacker 暴露的新失败又为 defender 提供了逐步加难的训练数据,形成相互逼强的动态。
自博弈是 GPT-Red 区别于'用静态数据集做对抗训练'和'用冻结 LLM 当攻击者'的根本算法创新,也是论文声称的'安全飞轮'的理论基础。
红队测试(Red Teaming)
通过端到端地主动寻找系统漏洞来评估安全性的方法。传统上依赖人类红队专家手动构造攻击,成本高、规模小、覆盖窄。自动化红队(Perez et al., 2022;Beutel et al., 2024)试图用模型替代人类,但以往工作要么用 prompted 攻击者模型、要么在少量环境上做窄目标训练。GPT-Red 把自动化红队扩展到接近生产级 RL 后训练的规模。
理解传统红队的规模与多样性瓶颈,才能体会 GPT-Red 在算力、环境和算法三轴上同时扩展的意义。
对抗训练(Adversarial Training)
通过让模型在对抗样本上学习来提升鲁棒性。早期工作(Goodfellow et al., 2014; Madry et al., 2017)聚焦小规模图像分类;现代 LLM 安全训练通常用 SFT 教会'理想行为先验',再用 RL 在恶意 prompt 上强化安全或正确行为(Guan et al., 2024)。GPT-Red 的产出被注入 GPT-5.6 的 RL 训练,生成对抗 prompt 并度量分布内外指标。
论文最终目标不是训练一个炫技攻击者,而是用 GPT-Red 产出的大量高质量对抗数据把 GPT-5.6 训练得更鲁棒,对抗训练是连接红队与产品改进的桥梁。
研究动机
现有提升 LLM 鲁棒性的方法主要依赖 RL 式对抗训练,但其数据来源——人类红队、prompted LLM、真实生产攻击——规模天然有限。Nasr et al.(2025)已经证明,模型会迅速过拟合到数据集中已出现的特定攻击模式,而对真正自适应的对手依然脆弱。这一问题随着 LLM 能力扩展、用例增多(agentic 编码、浏览、连接器、computer use)只会愈发严重,因为攻击面在持续膨胀。另一条技术路线——基于离散优化的对抗后缀(Zou et al., 2023; Greshake et al., 2023)——往往需要白盒访问、需要海量 defender 查询,且很难迁移到新模型或新设置。结果是:既无法生成足够规模与多样性的对抗数据来覆盖不断扩张的攻击面,也无法跟上模型能力迭代的速度,安全训练长期处于'打补丁式'被动局面。
本文的目标是本文目标是训练一个真正可扩展的自动化红队智能体 GPT-Red,使其能在规模、多样性、质量三个维度上同时满足有效鲁棒性训练所需,进而用于评估并改进 OpenAI 生产系统的鲁棒性。具体而言,作者希望这个红队智能体能(1)发现针对前沿 LLM 的新型提示注入攻击;(2)泛化到训练时未见的场景、目标、红队 harness 和目标模型,可作为'即插即用'的红队;(3)产出多样且合法的攻击,避免 mode collapse 或 reward hacking;(4)在 RL 阶段被用来生成对抗训练 prompt,从而训练出迄今为止对提示注入最鲁棒的 GPT-5.6,并验证鲁棒性可在多个 held-out 评测上单调爬升。
与已有工作不同的是,本文的独特切入角度是把'攻击者'本身当作一个需要被训练的前沿智能体,而不是当作冻结的 prompted LLM 或离线数据集。其创新在于同时沿三条轴线扩展红队能力:推理时算力(通过 agentic harness 与 defender_model 工具,让攻击者像人类红队那样迭代试探)、环境多样性(把现有能力任务批量转换成对抗训练环境,涵盖直接/间接提示注入、多模态、安全拒答越狱)、训练算力(规模达到 OpenAI 主力 GPT-5 系列 RL 后训练量级,号称史上最大的单次 LLM 安全训练 run)。这与以往只在少数环境上训练窄目标攻击者、或仅在推理时扩展 test-time 算力的工作形成本质区别,并首次把自博弈多 defender 训练推到生产级规模。
核心方法
整体思路是模拟人类红队专家'反复交互、迭代精炼攻击'的过程,并把这一过程工业化。直觉层面:一个红队专家不会一次性写出完美攻击,而是先试探目标、观察反应、再调整策略;因此 GPT-Red 被赋予一个有状态的 defender_model 工具,可以在单次 rollout 内做结构化搜索、分支、代码生成。技术路线层面:作者构建了一套自博弈 RL 框架,attacker 与一群 diverse defender 在大量红队环境里同时训练,attacker 因诱发出有效失败而获奖,defender 因抵御并完成任务而获奖,二者相互逼强。该框架覆盖文本与多模态提示注入、安全拒答越狱三类攻击,并通过把现有能力任务(如浏览、连接器、function calling、agentic coding)改造成'插入单点恶意内容'的对抗环境,自然继承 GPT-5.6 整个训练分布。最终用接近生产级 RL 后训练的算力把这三大要素一起 scale 上去,得到 GPT-Red。
核心创新是把红队智能体的训练问题转化为一个'attacker↔多 defender 自博弈 + agentic harness + 大规模 RL'三位一体的工程问题,并与以往方法在本质上区别开来。第一,defender_model 工具让 attacker 在单 rollout 内顺序查询 defender、迭代精炼攻击,使其在同算力预算下显著优于 best-of-N 采样(Figure 3);第二,同时训练多个 strong defender 而非单一 defender,迫使 attacker 去探测每个模型各自的弱点,避免在单一模型上 mode collapse(Figure 7 显示针对不同 defender 的攻击并不总是迁移);第三,把现有能力任务'最小改动'地转换成对抗环境——只在 defender rollout 中断一个工具调用或文件区域,让 attacker 编辑其中受信度最低的部分——这使攻击者能力可随 GPT 训练分布扩张而自然增长。这套组合在论文里被描述为可解锁的'安全飞轮'。
方法步骤详情
单次自博弈迭代分七步:(1)采样一个 RL 环境,含对话、初始文件系统状态与选定 defender 模型;(2)选定攻击插入点(通常是某次工具调用)与 attacker 目标(如触发 $\texttt{rm -rf}$ 或外泄 API key),并提供对抗知识;(3)attacker rollout,经 defender_model 工具交互、写代码、迭代修改攻击文件,满意后提交路径,中间调用全丢弃;(4)用程序化+LLM 判官混合校验合法性与环境,非法则奖励为 0(查 schema、长度等);(5)把攻击插入 defender rollout 预定位置并从该点恢复;(6)按环境计算不对称奖励,分别判定 attacker 是否成功、defender 是否完成原任务(jailbreak 用与'最大有害答案'对比的 rubric 评分,并过滤表层变换或不像真实对话的攻击以防 hacking);(7)用 RL 同时更新 attacker 与 defender。多模态分支里 attacker 还调用 OpenAI Images 2.0 生成图片攻击,要求图片保留原任务可解性。
技术新颖性
技术新颖性体现在四个层面。规模上,这是迄今为止公开文献中最大的单次 LLM 安全 RL run,算力与 OpenAI 主力 GPT-5 系列 RL 后训练相当,远超 Ma et al.(2023)、Liu et al.(2025)等最相近工作。算法上,首次把多 defender 自博弈 + agentic harness + 大规模 RL 三者联合 scale,并通过 controlled self-play 实验(Figure 4、5、6)证明训练动态健康、attacker 单调变强且不遗忘。环境上,提出'把现有能力任务改造成单点注入对抗环境'的通用配方,自然继承 GPT-5.6 训练分布并支持多模态(CUA 截图、浏览/检索图片注入)。验证上,不仅做了 held-out 数据集/领域/攻击类别的鲁棒性评测,还把 GPT-Red 直接对接真实生产系统(OpenAI 办公室的 AI 售货机 Vendy),完成'改价到 $0.50、上架 $100+ 商品并标 $0.50、取消他人订单'全部三个目标,展示了从仿真到真实系统的迁移能力。
实验结果
其一,GPT-Red 是最强红队:在 2025 Q4 IPI Challenge 上,未给 defender 访问的 GPT-5.5 与人类持平,给 defender_model 工具后 ASR 显著上升,GPT-Red 取得所有方法中最高的平均 ASR 并随 test-time compute 持续提升,明显超过人类;它对历史全部 GPT-5 系列模型都能找到有效攻击,对早期 GPT-5 攻击成功率近乎翻倍。其二,真实世界迁移成功:伪造'可信管理员'元数据攻破 Andon Labs 售货机 Vendy 全部三个目标;对 GPT-5.4 mini 的 Codex CLI,GPT-5.5 在简单任务后停滞而 GPT-Red 持续推进。其三,GPT-5.6 鲁棒性大幅跃升:held-out 攻击/数据集/领域 defender 成功率爬升到 >50%、最高 89.0%;IPI held-out 演练 ASR 降到 4% 以下;fake-CoT 攻击 ASR 从 GPT-5.1 的 0.4% 暴跌到 GPT-5.6 的 5.2%(鲁棒性 5.2%→95.9%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 2025 Q4 IPI Challenge(间接提示注入,攻击 GPT-5.1 defender) | 平均攻击成功率 ASR(@test-time compute) | GPT-Red 在所有 test-time compute 预算下均最高,并随算力持续上升 | 人类红队 / GPT-5.5(无 defender 访问)≈ 持平;GPT-5.5(带 defender 访问)次之 | GPT-Red 明显超越人类红队与带工具的 GPT-5.5,是 SOTA 自动红队 |
| IH-Challenge 直接提示注入(attacker query 效率) | ASR vs defender 查询次数(1/5/10/25/50) | Agentic harness(defender_model 工具)在相同 query 预算下 ASR 高于 best-of-N | Best-of-N 独立采样 | 随 query 数增加,agentic 与 best-of-N 差距拉大,验证 harness 的查询效率(Figure 3) |
| Fake Chain-of-Thought 直接提示注入攻击 | Defender 鲁棒性(越低越易被攻破) | GPT-5.6:95.9% 鲁棒(ASR 5.2%) | GPT-5.1(有 IH 训练但无自博弈):鲁棒性 5.2%(ASR ≈94.8%) | 鲁棒性从 5.2% 跃升至 95.9%,几乎是 step function(Figure 13) |
| System Override 攻击(直接提示注入) | Defender 鲁棒性 | GPT-5.6:99.5% | GPT-5.1:89.1% | +10.4 个百分点(Figure 13) |
| Held-out 攻击/数据集/领域(间接提示注入) | 平均 defender 成功率 | GPT-5.6 全部 >50%,最高 89.0% | 早期 GPT-5 系列显著更低 | 即便从未见过的攻击类别与领域,鲁棒性仍爬升到 50%–89%(Figure 11) |
| IPI 2025 Challenge(人类攻击,间接提示注入) | Defender 鲁棒性 | GPT-5.6:100%(1 例误评分,人工核验通过) | 此前 GPT-5 系列 | 对人类红队攻击达到近乎满分鲁棒 |
| 内部 IPI held-out 红队演练(GPT-Red 攻击历版 GPT-5) | ASR | GPT-5.6:<4% | GPT-5.3/5.4/5.5 显著更高 | 随版本单调下降,自博弈带来持续增益(Figure 12) |
局限与改进
作者明确承认的局限包括:当前 GPT-Red 在多模态环境、多轮攻击场景以及内容策略越狱上的训练覆盖仍较少,计划后续扩展;鲁棒性'远未解决'(far from solved)。从论文叙述与设计上还能观察到若干额外局限:其一,几乎所有评测都是 OpenAI 内部进行,GPT-Red 既未开源、权重也不公开,攻击能力与人类红队的对比基于自评,存在系统性偏差风险(作者也脚注承认该结果并不意味着 GPT-Red 普遍优于人类,人类可能发现论文未覆盖的新型场景或攻击类别)。其二,held-out 红队演练刻意不启用 system-level 缓解措施,作者自己指出这会相对真实攻击者夸大 ASR。其三,威胁模型假设 attacker 仅能修改单个工具响应或非特权文件,且拥有对 defender rollout 的部分观察与有限黑盒查询——真实世界中攻击者能力边界可能不同,迁移性有待更多外部验证。其四,论文未给出标准公开基准(如 AgentDojo、InjecAgent、ASB)上的横向对比,难以与学术界同期工作直接比较。
独立分析的弱点
第一个弱点是覆盖面不均衡:多模态、多轮、内容策略越狱训练偏少,相关方向上 GPT-Red 与 GPT-5.6 的鲁棒性增益可能被高估;改进方向是按论文规划继续扩这些环境的训练量,并补充多轮对话式攻击(逐步把良性话题引向有害请求)。第二个弱点是评测封闭性:结果几乎全部来自 OpenAI 内部,GPT-Red 不开源,缺乏第三方可重复基准;改进方向是至少在公开基准(AgentDojo、InjecAgent、ASB 等)上发布横向对比,TensorTrust 已被用作外部评测,可进一步扩展。第三个弱点是威胁模型较理想化:限定单点注入、部分观察、有限黑盒查询,且 held-out 红队演练未启用 system-level 缓解——真实部署中攻击者能力边界可能不同;改进方向是引入灰盒威胁模型谱系,并在启用生产级缓解下重新度量 ASR。第四个弱点是 reward hacking 风险:多重过滤检查的误杀/漏杀未量化;改进方向是公开这些过滤的假阳/假阴率。第五个弱点是 defender 种群偏向 OpenAI 自家模型族,跨厂商迁移性未验证;改进方向是与 Claude、Gemini 等做交叉红队。
未来方向
作者明确提出的未来工作包括:扩展多模态、多轮攻击场景与内容策略越狱的训练覆盖;继续 scale 算力、数据与自博弈训练;持续把更强的 GPT-Red 嵌入每一代 GPT 的 RL 训练,形成'今天的 GPT-Red 让明天的模型更鲁棒,明天的模型又给后天的红队提供更强学习信号'的安全飞轮。基于本文成果可延伸的方向还包括:(1)把'把能力任务转换成对抗环境'的配方自动化,让红队环境随模型能力分布自动扩张;(2)研究 attacker↔defender 自博弈的收敛性与稳定性理论,避免 ASR 振荡或 mode collapse;(3)将自博弈范式迁移到非提示注入的安全维度(如隐私泄漏、长期对齐漂移);(4)探索跨组织协作红队,验证多 defender 种群包含异构厂商模型时的迁移性与鲁棒性增益;(5)研究 test-time compute 与训练 compute 的最优分配,以及 attacker 是否能在更少 defender 查询内找到等价攻击。
复现评估
复现难度极高,实际上对外部研究者基本不可复现。代码、权重、训练数据均未开源,论文也未承诺发布。训练数据全部来自 OpenAI 内部数据集(包括 GPT-5.6 的能力任务、IH-Challenge、内部 helpful-only 模型等),算力规模与 OpenAI 主力 GPT-5 系列 RL 后训练相当,号称史上最大单次 LLM 安全训练 run——这种规模的 RL 训练远超学术界资源。威胁模型实现细节(defender_model 工具、攻击合法性校验、rubric 评分、多模态图片注入 API)只在概念层描述,关键超参与训练曲线仅以归一化图呈现(如 Figure 4–7 的训练进度用百分比而非步数)。读者可以复现的是方法层面的思想(自博弈 + agentic harness + 多 defender + 单点注入环境改造),以及在小规模开源模型 + 公开红队基准(如 AgentDojo、IH-Challenge 风格任务)上验证趋势,但无法复现论文报告的绝对数字。可作为产业级方法学参考,而非可直接复现的研究产物。
论文图表