← 返回 2026-09-11

EvoSafeHarness:为守护智能体安全而自动进化的模型与领域专属安全框架 EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

Nanxi Li, Yingzi Ma, Yulong Cao, Edward Suh, Bo Li, Dawn Song, Chaowei Xiao 📅 2026-09-05 👍 47 2026-09-12 18:30
LLM智能体安全 安全-效用权衡 提示注入防御 自动化程序搜索

为每个模型×领域自动进化专属安全harness,在四大基准上同时提升安全与效用

前置知识

LLM Agent 与 Harness(智能体骨架)

LLM 智能体是围绕一个冻结语言模型 $M$ 构建的循环系统:构造系统提示与初始查询、调用模型、执行模型发出的工具调用、把工具结果回填给模型,循环直到产出最终答案。Harness 就是承载这个循环的系统层代码,是模型、用户、工具之间所有交互的必经通道。本文把防御形式化为对无防御裸循环 $H_0$ 的修改,并用二元组 $H = (\mathcal{P}, \mathcal{C})$ 表示:$\mathcal{P}$ 是自然语言策略(信任边界声明、拒绝标准等上下文变换),$\mathcal{C}$ 是可执行代码逻辑(拦截工具调用、维护轨迹状态、调用隔离分类器等)。

论文的整个优化对象就是 harness:理解这个执行层与"策略+代码"的开放搜索空间,才能明白它在搜什么、以及为什么防御可以不改动模型权重。

间接提示注入与直接有害请求

间接提示注入:攻击者把恶意指令嵌入智能体必须当作数据读取的外部内容(邮件、网页、文档、工具输出、工单)。这些内容本不应成为指令,但若模型把它当权威执行,就会做出用户从未请求的操作,例如把资金转给攻击者账户。直接攻击则相反:有害目标就在用户请求本身,比如恶意用户要求超额转账、删除生产数据或泄露凭证。两个通道跨越不同的信任边界,需要不同的检测证据。

本文威胁模型同时覆盖两个通道:防御必须两栖,评分也把 ASR 拆成直接/间接两路分别报告,这一分解正是搜索反馈信号的设计基础。

安全-效用权衡与帕累托前沿

任何防御都有两面:拦截攻击降低攻击成功率(ASR),但过度拦截会拒绝合法任务、拉低效用 $U$。一个"全部拒绝"的 harness 可以轻松做到零 ASR 却效用归零。因此评估须用联合分数 $\mathrm{score} = 100 \times (U - \mathrm{ASR})$,并在效用-安全平面上比较方法:理想防御位于右上角,方法之间比的是谁的前沿更占优。

本文的核心主张是不同模型/领域的最优权衡点不同、固定防御无法处处最优,所有实验都围绕这条前沿展开。

ASR、UBR 等评测指标

ASR(攻击成功率)衡量攻击任务中攻击被判成功的比例,由基准自带裁判判定;$U$ 是良性任务完成率。Agent-SafetyBench 额外使用干净条件下的不安全行为率 UBR 与受攻击下的效用 UA。安全性数字必须与效用配对报告,否则全拒绝即可作弊。论文还用配对 McNemar 检验确认差异的统计显著性。

论文全部结论以这些指标表述,不理解其配对与分通道报告方式,就看不出它与"刷单项指标"工作的本质差别。

PAIR 式自适应攻击

PAIR 是一种自动化越狱攻击:攻击者模型根据目标系统对每轮提示的响应作为反馈,迭代改写攻击提示,以不断增长的细化预算逼近攻击成功。用冻结的防御面对这种攻击者,可以模拟"攻击者知道防御存在并专门优化"的最坏情形,检验防御是否只对固定攻击语料有效。

本文最怕的作弊方式是搜索出的规则过拟合基准词汇,AgentCanary 的 PAIR 式攻击正是检验这一点的压力测试。

研究动机

语言模型智能体正从演示走向部署,可访问敏感数据、金融账户与生产系统:一次聊天失败只是糟糕回答,一次智能体失败却可能是转账、泄露凭证、删除生产数据或留下持久 shell 进程,安全单元已从单条话语扩展到整条动作轨迹。危害有两个入口:间接提示注入把指令藏在智能体必须当作数据读取的外部内容里;直接攻击的有害目标就是用户请求本身。现有系统级防御(CaMeL 的来源标记、DRIFT 的轨迹监控、Progent 的能力策略、SafeHarness 的手工四层防御)都是专家一次性设计、跨异构模型与域固定复用。实测显示"一套打天下"必然失败:DTAP 上无防御 ASR 从 Sonnet 4.6 的 4.8% 到 DeepSeek-V4-Flash 的 71.0%,模型差异巨大;CaMeL 加在 DeepSeek 上使 AgentDyn 良性效用从 70.0% 崩到 0.0%(过防御),加在 GLM-5 上 ASR 仍高达 29.3%(欠防御)。固定防御还继承了设计域的工具分类法:只在 os-filesystem 有效、finance 部分有效、telecom 完全无效,文件系统的命令/路径过滤根本无法表达金融域"多笔各自合规的交易合起来构成洗单交易"这类关系。

本文的目标是本文的目标是把"设计 harness"从专家手工作品重构为优化问题:对每个冻结模型 $M$ 与目标域 $D$,自动搜索一个可部署、可泛化的防御 $H^\star_{M,D} = \arg\max_H \mathrm{score}(M,H,D)$,其中 $\mathrm{score} = 100 \times (U - \mathrm{ASR})$,结构上保证只有保住效用才奖励安全。搜索出的 harness 须同时抵御直接与间接两个攻击通道;不得依赖基准表面词汇(攻击者改名、换路径、换措辞后即失效的规则要被拒绝);搜索只读训练划分,泛化在留出集上验证;还要能定位每次失败源于哪个通道、该改策略还是改代码。更长远的目标是推动智能体安全实践从"挑选一个通用护栏"转向"为每个部署生成专属护栏"。

与已有工作不同的是,独特切入角度有四。其一,与 Meta-Harness、NLAH、GEPA 等只优化任务效用或成本的 harness 优化工作不同,本文首次把 harness 搜索对准"对抗行为下的表现",并以每模型×每域为单位分别搜索(此前 harness 收益被证明随基座模型非单调变化,但无人逐部署搜索防御)。其二,作者系统识别了把安全搜索当普通奖励搜索时的三种危险捷径——全拒绝换零 ASR、过拟合基准词汇(文件名/路径/攻击短语)、harness 代码自身 fail-open 形成未测执行路径——并为每一种设计了结构性反制。其三,用良性效用、直接 ASR、间接 ASR 三个分离的反馈通道替代标量奖励,使 Designer 能针对具体失败类型定向修改。其四,提出并实证了一个可检验的科学结论:域语义决定"必须保护哪些安全关系与轨迹状态",模型与运行时行为决定"在哪里、以何种强度、用什么机制执行这些关系"。

核心方法

直觉:与其让专家为所有模型和域设计一套固定防御,不如让一个智能体搜索循环替每个部署(模型×域)自动写一个——用目标模型自己的失败轨迹当反馈,用领域规范当约束,用独立对抗评审防作弊。技术路线是一个四组件闭环(Figure 3):领域规范 $\Sigma_D$ 定义冻结受害者、工具、裁判、直接/间接威胁语义与可信上下文、训练级联与评分、泛化要求,并暴露开放适配器(DTAP 上是带 system_prompt_transform、on_pre_tool_call、on_post_tool_call 钩子加任意辅助代码的 Python Defense 对象)。Designer(agentic 编码模型)从显式档案读取历史候选源码、分数与失败轨迹,提出编辑后的候选 $H' = \mu(H_{parent})$;候选表示为 $H = (\mathcal{P}, \mathcal{C})$。档案由八条从 DRIFT、CaMeL 蒸馏出的安全设计经验热启动。每个候选先经 fresh-context Criticizer 洁净评审修复,再进入"从便宜到昂贵"的四段级联测试(静态→冒烟→置信门→搜索扩展),Analyzer 把失败轨迹蒸馏为经验供下一轮。

核心创新有三层。第一,"安全专属"的搜索目标设计:分数 $100 \times (U - \mathrm{ASR})$ 在结构上排除全拒绝解(全拒绝与全放行同为零分),且良性效用、直接 ASR、间接 ASR 保持为三个独立反馈通道,Designer 能区分失败来源并定向修改 $\mathcal{P}$ 或 $\mathcal{C}$,这直接对应普通代码搜索会掉入的三个捷径。第二,把"防基准过拟合"工程化为两个耦合机制:一是每条规则的泛化要求——若攻击者重命名路径、移到未列位置、以同恶意意图换措辞,这条规则还会触发吗?接受标准锚定于攻击不变量(来源可疑性:危险指令来自工具输出而非用户;范围越权:动作触及用户任务从未点名的资源;意图错配:动作与请求无关),它们与词汇无关;二是 fresh-context Criticizer——在独立洁净上下文中以"攻击者保持意图、最便宜的绕过方式是什么"质疑候选,发现的琐碎绕过在花掉评估预算之前修复。第三,与 SafeHarness 这类把防御建模为固定分层生命周期的手工设计的本质区别:既有设计只作为热启动经验而非模板,Designer 可删除、重组或发明机制,搜索空间是开放程序而非机制清单。

方法步骤详情

完整流程见 Algorithm 1,输入为冻结模型 $M$、领域规范 $\Sigma_D$、预算 $B$、既有防御经验、训练语料 $C$。(1)热启动:把八条蒸馏安全经验(如"工具输出必须保持为不可信数据而不能变成指令""工具调用效果须在执行前对照可信用户请求校验")作为种子候选评估入档。(2)主循环: Designer 依策略 $\pi: (\Sigma_D, \mathcal{H}) \mapsto (H_{parent}, \mu)$ 选父候选与自由编辑 $\mu$,尽量每次只改一个机制以保持分数变化可解释; 候选交 fresh-context Criticizer 评审,发现重命名/迁移/复述类绕过则修复重审; 过 Stage 0 静态导入检查与 Stage 1 冒烟前缀; Stage 2 置信门把同一证据流扩展到更广的效用-安全样本,仅当分层 bootstrap 单侧 95% 上界显示比无防御参照低超过 $\delta$ 分才淘汰,不确定者继续; Stage 3 存活者扩展到完整搜索样本得到搜索分;(vi)候选连同分数、评审结论、逐任务轨迹写入档案(保留帕累托前沿)。(3)返回档案中分数最高者。资源按外层搜索模型与内层受害者评估两层分别核算。

技术新颖性

技术新颖性体现在四处。(1)搜索空间是开放的 $H = (\mathcal{P}, \mathcal{C})$ 程序而非预定义机制清单:实证上 15 个返回的 DTAP bundle 中 6 个干脆省去自然语言策略 $\mathcal{P}$、4 个运行时完全不做辅助 LLM 调用,说明开放空间允许搜索把语义推理编译成更简的确定性运行时结构(语义假设→确定性门/过滤器/状态机),这是固定机制分类法做不到的。(2)防作弊不是靠提示词叮嘱而是流程组件:泛化要求 + 独立 Criticizer + 攻击不变量接受标准构成三重屏障,消融给出了干净证据——去掉 Criticizer 后搜索分不降甚至升高,但留出分最多掉 31 分,即"评审改善的是搜索看不见的任务上的最优"。(3)资源感知的嵌套级联在 22 个候选库、93 个候选的重放中选择与全量评估完全一致的防御且省 43.6% token,是把多保真评估引入安全搜索的新做法。(4)结论层面给出可复用的抽象:可移植的是 provenance、scope、effect-authorization 这类原则,而非具体谓词、状态机或钩子图——这为"逐部署生成防御"提供了理论骨架。

EvoSafeHarness searches a deployment-specific security harness.
Figure 3: EvoSafeHarness searches a deployment-specific security harness.
Appendix: complete mechanism graphs per deployment cell.
Figure A1: Appendix: complete mechanism graphs per deployment cell.
Appendix: representative control flows of searched harnesses.
Figure A2: Appendix: representative control flows of searched harnesses.

实验结果

四大基准全面验证。(1)DTAP 主实验:5 受害者×3 域共 15 格独立搜索,每域 30 良性+35 直接+35 间接任务:平均 ASR 从 45.6% 降到 10.0%,效用仅付 3.3 点(83.1%→79.8%),14/15 格最佳;直接 ASR 50.9%→12.6%,间接 40.4%→7.4%;对比 CaMeL 37.7%、DRIFT 42.4%,Progent ASR 10.5% 但效用跌至 56.4%;McNemar 检验 13/15 格显著(385 个攻击被中和 vs 11 个新增,$p \approx 2 \times 10^{-78}$)。(2)Agent-SafetyBench(含非注入型危害):三个受害者全部最低干净 UBR(均值 12.3%)与最低或并列最低 ASR(7.4%),受攻击效用 63.4%,是唯一同时降两项风险又升效用的防御。(3)AgentDojo→AgentDyn:AgentDojo 上 82.8% 效用配 0.0% ASR(同零 ASR 点效用是 CaMeL 两倍),同一 harness 零改动迁移到未见工具/工作流的 AgentDyn 达 75.0%/0.0%,反超无防御的 73.3%;CaMeL 效用归零、Progent 跌至 9.7%。(4)自适应攻击:冻结 harness 面对三个 PAIR 攻击者、预算至 16,均值 ASR 19.5%(预算 0 时 9.7%),仍低于无防御静态水平 23.6%。(5)残余风险:成功攻击 479→105(相对降 78.1%),21 类风险清零。消融:安全热启动为三域留出分各 +9.52/+11.90/+9.52;去掉 Criticizer 留出分掉 9.0–31.0 分而搜索分不降;换外层搜索模型效用稳定(83.33–86.67%)而 ASR 在 5.24–17.62% 波动(GPT-5.6 Sol 均分 81.43 最佳)。

DTAP held-out results across five victims and three domains.
Table 1: DTAP held-out results across five victims and three domains.
Agent-SafetyBench (a) and AgentDojo→AgentDyn transfer (b).
Table 2: Agent-SafetyBench (a) and AgentDojo→AgentDyn transfer (b).
Residual ASR by domain and attack source.
Table 3: Residual ASR by domain and attack source.
What the Criticizer and the nested cascade each contribute.
Table 4: What the Criticizer and the nested cascade each contribute.
EvoSafeHarness dominates the utility–security trade-off on all four benchmarks.
Figure 1: EvoSafeHarness dominates the utility–security trade-off on all four benchmarks.
Robustness and ablations.
Figure 4: Robustness and ablations.
查看结构化数据
任务指标本文基线提升
DTAP 智能体安全(直接+间接攻击,5 模型×3 域 15 格) ASR / 良性效用 ASR 10.0%(直接 12.6%/间接 7.4%),效用 79.8% 无防御 45.6%/83.1%;CaMeL 37.7%/69.7%;DRIFT 42.4%/77.1%;Progent 10.5%/56.4% ASR 相对降 78%;比同安全级的 Progent 多 23.4 点效用;14/15 格最佳(p≈2×10⁻⁷⁸)
AgentDojo 工具智能体注入防御 效用 / ASR 82.8% / 0.0% CaMeL 41.0% / 0.0%(三模型均值) 同一零 ASR 工作点下效用翻倍
AgentDyn 零样本迁移(未见工具与工作流) 效用 / ASR 75.0% / 0.0%(harness 零改动迁移) 无防御 73.3% / 12.8%;CaMeL 0.0% / 0.0%;Progent 9.7% / 2.9% 效用反超无防御,同时 ASR 降到 0
Agent-SafetyBench 广谱危害(240 留出任务×6 条件) UBR / ASR / 受攻击效用 UA 12.3% / 7.4% / 63.4% 无防御 24.6%/17.2%/61.6%;SafeHarness 18.9%/10.5%/44.8% 唯一同时降低 UBR 与 ASR 且提高 UA 的防御
AgentCanary 自适应 PAIR 攻击(细化预算 16) 留出 ASR 均值 19.5%(预算 0 为 9.7%;预算 16 时 16.7%/25.0%) 无防御面对静态提示 23.6% 预算拉满仍低于无防御的静态水平

局限与改进

作者承认的局限:残余失败集中——105 个残余成功中 os-filesystem 占 57、finance 41、telecom 仅 7;五类风险(OS 未授权访问 16、最小权限违反 12、同意违反 9、无保障自动化 8、金融客户欺诈 9)占 54/105。三类风险无任何下降:客户定向欺诈维持 60.0%(9/15)、期权招揽 30.0%、电信金融欺诈 16.7%——这些操作完全在任务范围内,危害在于捏造陈述与误导内容,缺少不误伤合法建议就能验证真伪的轨迹不变量。接口缺口:现有 system-prompt/pre-tool/post-tool 钩子看不到无工具调用的最终回答。弱模型天花板:DeepSeek-V4-Flash 平均 ASR 仍 21.9%(os-fs 达 44.3%)。我的观察:每格需独立完整搜索,模型或域一换就要重搜,跨部署知识共享仅有八条热启动经验这一窄通道;搜索质量高度依赖领域规范,规范没覆盖的关系(如内容真实性)搜索无从发现;优化信号建立在基准自带裁判上,裁判偏差会传播进搜索;外层模型换血导致 ASR 波动 5.24–17.62%,复现者需对齐版本。

独立分析的弱点

弱点一:内容真实性类风险缺乏机制。欺诈、误导性陈述没有可查的轨迹不变量,作者建议的证据感知出站钩子尚未实现;改进方向是引入带引用/证据约束的出站内容校验层,或结合检索事实核查。弱点二:防御面完全可读带来的信息泄露。harness 是明文代码,自适应攻击者虽只把均值 ASR 推到 19.5%,但第三个攻击者在预算 16 已到 25.0%,更长预算或更强攻击模型可能继续攀升;可加入检查顺序随机化、规则冗余多样化提高反向工程成本。弱点三:泛化检验依赖 Criticizer 的想象力。评审器也是 LLM,其没想到的绕过就不会被修复,且训练内重命名/复述测试覆盖有限;可按作者提议对每个幸存者做针对其新引入机制的 train-only 自适应红队探针。弱点四:无跨部署知识迁移结构。15 格搜索彼此独立,八条静态经验之外没有持续学习或关系库复用,新部署要付全价;可建跨部署机制库/关系图做检索增强搜索。弱点五:对最弱模型失效面仍大。DeepSeek-V4-Flash 的 os-fs 直接 ASR 仍 44.3%,确定性门加语义检查的组合可能已到 harness 层上限,需要与模型级安全训练协同而非纯系统层兜底。

未来方向

作者提出的方向:针对 os-fs 授权类直接效应与金融出站内容真实性设计下一轮安全关系;实现 evidence-aware egress 与 pre-response 完整性钩子以覆盖无工具最终回答;用行为多样的归档失败构造搜索期评估集、再对幸存者做 train-only 自适应红队,以修复小固定测试集误排候选的问题(如 Kimi/telecom 中小集分数更高的 v3 实际不如 v6);用内容寻址 delta 包(父子 diff、变更不变量、触发轨迹)压缩 Criticizer 的 fresh token 开销——它消耗 20.7% fresh token 却只产出 6.8% 输出;对内层 97.6% 的输入侧 token 做重复工具结果压缩、旧轨迹状态摘要与结局即终止。基于成果可延伸:把"域定关系、模型定执行"原则做成半自动迁移(新部署先检索近邻部署的关系图再局部搜索);研究 harness 与模型级防御的联合优化前沿;对搜索出的 harness 做形式化验证或差分测试以杜绝 fail-open 路径;在真实生产流量而非基准上检验搜索期分布假设。

复现评估

代码开源(GitHub: SaFo-Lab/EvoSafeHarness),附项目主页 andylinx.github.io/EvoSafeHarness;基准全部公开(DTAP、Agent-SafetyBench、AgentDojo/AgentDyn、AgentCanary),划分与协议在附录 B 有明确定义。主要成本在模型调用:受害者需 Sonnet 4.6、GLM-5、Kimi-K2.5、Qwen3.7-plus、DeepSeek-V4-Flash 等商用模型,外层 Designer/Criticizer 需 Claude Opus/GPT-5.6 级别模型。论文给出罕见的精确成本账本:内层受害者+裁判全量级联 206.6M token、$183.44(嵌套级联降至 116.6M、$104.11,省 43.6% 且选出的防御完全相同);含全部评估共 58,874 次调用、$328.74;外层 40.46M fresh token 加 2.56B 缓存读取(命中率 98.83%)。单格成本随轨迹长度与单价差异大:Sonnet 4.6 库 $45.84 而 DeepSeek-V4-Flash 仅 $0.70。主要不确定性是搜索随机性与外层模型版本敏感性。总体难度评级:中高——跑通评测不难,复现同等结果需对齐外层模型强度并耐心调 $\delta$、预算、级联长度等超参。