StepGuard:基于可扩展监督与安全-效用平衡的步骤级智能体护栏 StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
4B步骤级护栏模型,以前缀对齐数据与Balance-GRPO校正防御偏置,ASR降77.3%
前置知识
LLM智能体与工具调用
LLM智能体在多步推理-行动循环中使用外部工具:给定用户请求$u_i$和工具规格$T_i$,每步提出动作$a_{i,t}$(如发邮件、删文件),执行后获得观察$o_{i,t}$,全部动作-观察对构成轨迹$\tau_i$。与聊天机器人不同,智能体的动作有真实世界后果。
本文的安全风险和护栏对象都定义在工具调用这一层,理解轨迹与步骤的结构才能看懂步骤级护栏要检查什么。
智能体护栏与防御偏置
护栏是不修改、不重训智能体本身,只在执行前后监控并干预行为的独立模型。防御偏置指护栏的两类系统性失衡:过度防御会把大量良性动作误拦(牺牲任务效用),防御不足会漏放风险动作(牺牲安全)。已有护栏在安全/不安全样本上的准确率差距可达数十分。
防御偏置正是本文要解决的核心问题,Balance-GRPO的全部设计都围绕缩小这个类间准确率差距。
间接提示注入
攻击者把恶意指令藏进智能体会读取的外部内容(网页、邮件、文档)中,而非直接对用户输入下手。智能体处理该内容时可能把注入指令当成任务执行,导致信息泄露或未授权操作,是AgentDojo等基准最主要的攻击向量。
这是StepGen采样的核心风险源之一,也是Table 3泛化实验的训练风险源,理解它才能理解风险锚点如何构造。
GRPO(组相对策略优化)
一种在线RL算法:同一提示采样一组(G个)回复,各自计算奖励后做组内归一化得到优势$A_{i,j}=(r_{i,j}-\mu_i)/(\sigma_i+\delta)$,再用裁剪的策略梯度目标加KL正则更新策略。它免去了价值网络,用组内相对比较代替绝对评价,是DeepSeek系模型的主流训练法。
Balance-GRPO是本文方法支柱,它在GRPO基础上只改了优势重加权,不懂GRPO就无法理解这个改动的位置与代价。
ASR与安全-效用权衡
攻击成功率(ASR)衡量部署护栏后恶意任务仍被执行的比例(越低越好);效用衡量良性任务完成质量(越高越好)。理想护栏位于效用以左上角的极乐区,但拦截动作天然可能误伤良性任务,二者构成权衡曲线。
论文所有部署实验都用ASR-效用平面评价,Figure 4和Table 6的结论都要放在这个权衡框架下解读。
研究动机
LLM智能体通过工具调用能修改文件、发送消息、泄露敏感信息、执行交易,动作具有真实世界后果,因此运行时安全保障至关重要。现有做法主要是部署智能体护栏,但它们普遍存在防御偏置:有的拦截过多良性动作,有的漏放过多不安全动作,两个方向都破坏安全-效用平衡。数据点很能说明问题:内容型护栏迁移到智能体场景表现崩溃,Qwen3-Guard在轨迹级三个基准的平均F1仅19.1,LlamaGuard3-8B轨迹级F1只有15.7,Qwen3-Guard在TS-Bench-Dojo上F1甚至为0.0;而StepGuard自己的SFT检查点也明显过防御,安全样本准确率69.3、不安全样本91.1,差距高达21.8。实现更好平衡面临两个挑战:其一,缺乏可扩展的高质量步骤级监督——真实世界的不安全执行本身罕见,人工构建昂贵且难以覆盖多样工具、上下文与风险,现有数据规模和风险覆盖有限,且很少在同一决策点提供上下文匹配的安全与不安全动作;其二,对安全-效用平衡的控制力有限——现有训练方法主要优化整体性能,不会根据护栏观测到的安全/不安全准确率差距动态调整训练行为。
本文的目标是本文要构建一个4B规模的步骤级护栏模型StepGuard,它既能在实际执行前检查候选工具动作,也能对已完成的智能体轨迹做事后审计,对每个执行上下文输出结构化诊断$(\hat{Y},\hat{B},\hat{R},\hat{S})$:安全/不安全判定、风险源是否在场、风险类型、以及可选的不安全步骤定位。具体目标有两个:第一,用自动数据引擎StepGen大规模合成步骤级监督——构造共享执行前缀、在指定风险步骤分叉的安全/不安全轨迹组,外加复用同类工具的良性轨迹,从数据源头消除'工具身份即风险'的捷径学习;第二,提出Balance-GRPO,在在线强化学习中依据观测到的安全-不安全准确率差距动态重新加权优势,压缩类间差距、纠正防御偏置。最终量化目标是:静态评测达到开源护栏最高平均准确率并与GPT-5.4可比;部署为运行时护栏时在AgentDojo与AgentDyn上相对无护栏降低平均ASR 77.3%,同时平均效用只下降2.8点。
与已有工作不同的是,已有工作各有切入但都没堵住缺口。监督侧:TS-Guard虽然做步骤级评估(4种风险模式),但数据规模有限、风险覆盖窄,且不提供上下文匹配的对照样本;Safiron评估完整计划但停留在计划层,没有逐步动作-观察建模和步骤级标签;AuraGen通过在良性计划中注入风险生成执行前样本,监督同样不在步骤级。训练侧:安全对齐中的过拒绝缓解依赖静态奖励加权或通用偏好/组相对方法(DPO、GRPO),这些方法只优化总体性能,重加权系数是固定的,不随训练进程变化——本文消融显示固定权重(Safe/Unsafe按1.5/0.5)虽能把类间差距压到7.9,但不安全类准确率从86.4跌到77.5,等于用牺牲检测能力换平衡。本文的独特角度有两个:一是前缀对齐对比数据构造——同一执行前缀在同一风险锚点分叉出多条安全分支与不安全分支,把'安全与否'的因果信号精确定位到该步动作本身,而不是任务难度或上下文;二是Balance-GRPO把类间准确率差距当作训练过程中的实时反馈信号,动态重加权归一化优势,不改提示、不改原始奖励,实现低侵入式的偏置校正。
核心方法
直觉上,判断动作是否安全,最干净的证据是'同一上下文换个动作会怎样',训练数据应在同一决策点同时呈现安全与不安全选项;而过度/不足防御在训练中表现为两类样本准确率不平衡,理应给弱势类别更多学习信号。技术路线分三阶段。第一阶段StepGen数据引擎:按ATBench采样风险源、失败模式、伤害类型$(r,f,h)$与工具子集$T$,规划器生成含唯一不安全锚点$i^\star$的执行计划,模拟器rollout出不安全基轨迹$\tau_U$。第二阶段前缀对齐对比构造:固定锚点前前缀,以Refuse(拒绝)和Aware(识别风险并用安全替代继续)两种模式重roll后缀,得$\tau^m=\tau_{U_{<i^\star}}\circ\text{ReRoll}(P_{\geq i^\star},m)$,另独立生成复用相同工具子集的良性轨迹。第三阶段两段训练:Qwen3-4B-Instruct先在3K条样本上冷启动SFT学会输出格式与基本风险推理,再用Balance-GRPO在线强化,把批内观测到的安全/不安全准确率差距转译为优势重权重。推理时接收完整轨迹或'前缀+候选动作',执行前输出结构化安全诊断。
核心创新有两个,本质都在'对照'与'反馈'。其一,前缀对齐对比监督:StepGen保证组内轨迹共享锚点前的前缀,只在风险步骤$i^\star$处分叉,使安全标签差异完全归因于该步动作本身而非任务难度或上下文;同时刻意生成复用相同工具子集$T$的良性轨迹,堵死'见敏感工具即判不安全'的捷径——消融显示良性工具复用使TS-Bench-Harm F1从69.2升至75.2。其二,Balance-GRPO:保留GRPO结构化奖励与组内归一化优势$A_{i,j}=\frac{r_{i,j}-\mu_i}{\sigma_i+\delta}$,仅在优势上乘两因子:$c_i=\text{clip}\left(\frac{|B|}{2n_{Y_i}},c_{min},c_{max}\right)$纠正类频次不均;$\omega_i$把类间准确率差$\Delta_{cls}=Acc_{safe}-Acc_{unsafe}$经目标$g_0$中心化、死区过滤与裁剪后,按$\omega_i=1+\lambda\max(\mp\bar{\Delta}_{cls},0)$给低准确率类更大权重,得$A'_{i,j}=c_i\omega_iA_{i,j}$。与静态加权的本质区别:权重是训练状态的函数而非固定超参,构成随进程动态调整的反馈回路。
方法步骤详情
六步流程。第一步风险锚定规划:输入采样风险源r、失败模式f、伤害类型h与工具子集$T$,规划器产出执行计划P(工具调用、参数约束、来源),指定唯一不安全锚点$i^\star$,无唯一锚点则丢弃重采样。第二步轨迹rollout:模拟器执行P得不安全基轨迹$\tau_U$;对响应型风险,在锚点动作可用的环境上下文中放置风险扰动,确保$i^\star$是首个不安全决策。第三步前缀对齐分叉:固定$\tau_{U_{<i^\star}}$,Refuse分支拒绝风险动作,Aware分支经安全替代继续任务;另独立生成复用工具子集$T$的良性轨迹。第四步标注与质检:每动作获Safe/Unsafe标签加结构化解释;规则校验器$\phi_{mech}$查结构、格式、参数血缘,LLM审计器$\phi_{qual}$评语义一致性、锚点正确性,通过$\phi_{mech}$且$\phi_{qual}\geq\eta$才保留。第五步冷启动SFT:Qwen3-4B-Instruct在3K样本上微调(GPT-5.4按标注生成目标回复,不匹配即丢弃),token级交叉熵。第六步Balance-GRPO:按结构化奖励组内归一化后乘$c_i\omega_i$,标准裁剪GRPO目标加KL正则更新;推理时对每个候选工具调用做执行前检查,输出判定、风险类型与步骤定位。
技术新颖性
三个维度看新颖性。数据上:内容安全数据集只有prompt-response对、缺多步执行上下文;AuraGen监督停在计划级;TS-Guard在步骤级但只覆盖4种风险模式且无上下文匹配对照。StepGen首次规模化提供'同一前缀、同一风险锚点、多安全/不安全分支加良性工具复用'的组级对比监督,并以规则加LLM双重质检保证锚点正确性——相当于把对比学习的难负样本思想引入智能体安全数据合成。训练上:过拒绝缓解此前依赖静态奖励加权或直接套用DPO/GRPO,Balance-GRPO首次针对智能体护栏特有的类间防御偏置设计动态重加权:识别出$\Delta_{cls}$这一可观测量,将其中心化、死区过滤、裁剪后转化为优势乘子,不改提示、不改原始奖励、不加价值网络,对任何GRPO流水线即插即用。消融显示它优于Safe upsampling(差距8.3但Acc 81.4略低)与固定权重(差距7.9但不安全Acc跌至77.5,Balance-GRPO保持86.4),说明'平衡'与'检测力'可兼得。把类平衡从一次性超参变为闭环控制变量,是对GRPO家族的方法论贡献,可迁移到任何类别不平衡的对齐任务。
实验结果
静态评测(Table 1):4B的StepGuard轨迹级平均Acc/F1为83.0/83.3(ATBench 71.2/71.2、R-Judge 89.2/89.6、ASSE 88.6/89.1),步骤级84.8/84.1(TS-Bench-Dojo 95.7/93.0、TS-Harm 73.8/75.2),开源最高,与GPT-5.4(轨迹83.0/84.4、步骤81.3/83.3)相当;内容型护栏迁移崩溃(Qwen3-Guard轨迹F1 19.1)。部署评测(底座Qwen3.6-35B-A3B):AgentDojo上ASR 1.2、效用90.7;AgentDyn上ASR 9.3、效用66.7;相对无护栏平均ASR降77.3%、效用仅降2.8点;AgentHarm上恶意分22.8降至3.4但完成率70.9跌至52.8。消融:前缀监督使轨迹级Acc/F1从80.4/82.0升至83.8/83.4,良性工具复用使TS-Harm F1从69.2升至75.2;仅2种风险源训练即在6个未见风险源上达74.9/78.1(骨干49.6/35.6);Balance-GRPO把类间差距从GRPO的13.0压到8.0(SFT检查点21.8),Acc/F1升至82.2/82.1,AgentDojo效用85.3升至90.7、AgentDyn 60.0升至66.7,ASR各仅+0.3。防御偏置还与预测不稳定相关,Balance-GRPO比GRPO更快缩差距且宏F1更高。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 轨迹级静态安全判断(ATBench/R-Judge/ASSE均值) | Acc/F1 | 83.0/83.3 | GPT-5.4 83.0/84.4;最佳开源对手ShieldAgent-THU 76.4/79.4 | 开源模型最高,Acc追平GPT-5.4,较最强agent护栏基线Acc+6.6 |
| 步骤级静态安全判断(TS-Bench-Dojo/Harm均值) | Acc/F1 | 84.8/84.1 | GPT-5.4 81.3/83.3;TS-Guard(7B) 84.0/79.9 | 开源最高步骤级F1,4B超越7B基线F1+4.2 |
| 运行时护栏部署(AgentDojo,注入攻击) | ASR↓/Utility↑ | 1.2/90.7 | 无护栏;GRPO变体0.9/85.3 | 与GRPO相比效用+5.4而ASR仅+0.3 |
| 运行时护栏部署(AgentDyn) | ASR↓/Utility↑ | 9.3/66.7 | 无护栏(ASR约38.7量级);GRPO变体9.0/60.0 | 两环境相对无护栏平均ASR降77.3%、效用仅降2.8点 |
| 运行时护栏部署(AgentHarm) | 恶意分↓/完成率↑ | 3.4/52.8 | 无护栏 22.8/70.9 | 恶意分降85%,但完成率降18.1点,权衡仍不利 |
| 未见风险源泛化(ATBench Subset-6,SFT-only) | Acc/F1 | 74.9/78.1(2源训练) | Qwen3-4B骨干 49.6/35.6;8源全量 76.8/80.7 | 距全量训练仅差1.9/2.6,远超骨干 |
| Balance-GRPO消融(静态评测) | Acc/类间差距|Δ| | 82.2/8.0 | GRPO 81.5/13.0;固定权重 81.8/7.9 | 与固定权重同等平衡但Unsafe Acc保持86.4(对方77.5) |
局限与改进
作者承认的局限:第一,StepGen依赖合成轨迹与LLM标注,数据可能继承教师模型和风险分类法的覆盖盲区、偏见与标注错误;第二,步骤级智能体安全评测本身基准有限,未覆盖开放工具生态、长程工作流、多智能体交互与自适应攻击者;第三,StepGuard是执行前护栏而非形式化安全保证,假阳/假阴仍会发生,部署引入额外推理成本且被拦截动作需要修订策略。我的补充观察:其一,AgentHarm上效用代价沉重(完成率70.9降至52.8),高对抗场景'拦得多'与'误伤重'仍是一体两面;其二,3K SFT样本加RL的配方未报告数据规模扩展曲线,TS-Bench-Harm Acc 73.8离上限尚远;其三,Balance-GRPO的$\lambda$、目标$g_0$、死区宽度等超参敏感性未系统分析,方法主要在过防御初始点上验证,从欠防御起点出发的实验(Figure 5)较初步;其四,前缀对齐质量取决于环境模拟器保真度,模拟器与真实工具环境的分布差异可能造成模拟到真实偏差,真实执行的观察噪声与工具失败未建模;其五,风险源遵循ATBench分类法,多智能体合谋、供应链投毒等新型风险覆盖未知。
独立分析的弱点
弱点一:高对抗场景效用崩塌。AgentHarm上完成率从70.9跌到52.8,护栏一刀切拦截,对降权的合法任务重创。改进方向:风险分级响应——低风险动作降权记录、中风险人工确认、高风险才硬拦截,或让护栏输出置信度并据此调整干预强度。弱点二:Balance-GRPO适用边界未摸清。实验主要从过防御SFT检查点出发,从欠防御骨干出发的训练动态只展示了曲线而缺最终指标。改进方向:系统研究不同初始偏置、不同$\lambda$与死区参数下$\omega_i$的收敛性与稳定性。弱点三:对GPT-5.4深度依赖。目标回复生成与$\phi_{qual}$审计靠单一教师,教师偏差可能固化为系统性标签噪声。改进方向:多教师交叉验证或不确定性加权。弱点四:数据规模小且无扩展实验,3K是否饱和未知。弱点五:部署成本缺失。长任务每步调用4B护栏,延迟与算力可观,可研究轻量分类器初筛加按需大模型的级联架构。弱点六:泛化仅在ATBench风险分类内验证,跨分类法、跨工具生态迁移无数据。
未来方向
作者提出的方向:扩展评测到开放工具生态、长程工作流、多智能体交互与自适应对抗者;为被拦截动作设计修订策略,使拦截不等于任务终止。基于本文成果可延伸的方向:其一,把Balance-GRPO的类间动态重加权推广到多类别风险不平衡或其他对齐权衡(有用性-无害性、诚实性),它本质上是一个通用的类别平衡控制器;其二,在线持续学习——护栏在部署中积累误报/漏报反馈,用同样的优势重加权机制增量更新,形成人类反馈的闭环;其三,深化$\hat{B}$与$\hat{Y}$的解耦建模,训练护栏解释'风险源在场但被正确处理'的案例,产出可审计的安全推理;其四,把StepGen框架搬到多智能体系统,生成涉及智能体间通信的交互级风险轨迹,覆盖论文自认的盲区;其五,为护栏判定附加不确定性估计或一致性检查,输出可信度分数以支持分级响应;其六,研究护栏与模型级对齐(如Meta-SecAlign-70B)的互补组合——护栏管执行时行为、对齐管模型内生倾向,两者叠加的收益与冲突值得量化。
复现评估
复现条件总体友好但有依赖点。论文给出两个GitHub仓库(zheng977/StepGuard与ninty-seven/StepGuard);底座Qwen3-4B-Instruct公开;评测基准ATBench、R-Judge、ASSE、TS-Bench、AgentDojo、AgentHarm均公开,仅AgentDyn较新需确认可获取性。算力上:SFT仅3K样本,4B全参微调8卡级GPU即可;Balance-GRPO是在线RL,需对4B策略rollout采样并维护参考策略,估计需多卡A100/H100,属中等门槛。最大风险在数据引擎:StepGen依赖GPT-5.4生成目标回复、执行$\phi_{qual}$审计并在环境上下文注入风险扰动,教师API成本不低;若仓库未放出完整生成prompt与阈值$\eta$取值,数据侧可复现性会打折——好在附录D.4/D.5提供rationale schema、过滤rubric与保留统计,附录F/E给实现细节与评测协议。综合评估:模型与训练复现中等,数据引擎复现偏高,静态评测容易,部署评测需搭好Qwen3.6-35B-A3B智能体执行循环。
论文图表
散点图:横轴为安全样本准确率,纵轴为不安全样本准确率,对角线上方代表过度防御、下方代表防御不足。各模型分布差异巨大:Qwen3-4B-Instruct、Qwen3-Guard等严重过防御(安全准确率极高但不安全准确率低),StepGuard-SFT也偏过防御;GPT-5.4、Qwen3.5-397B等靠近对角线,StepGuard经过Balance-GRPO后进入对角线附近的理想区域。
一图定义了全文的核心问题——防御偏置的量化方式(安全/不安全准确率差距),直观展示了现有护栏分布散乱、无模型占据'双高'区域,是动机章最有说服力的证据。