← 返回 2026-07-29

Shieldstral:基于二元问答的策略自适应多模态安全分类器 Shieldstral

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan 📅 2026-07-28 👍 16 2026-08-03 18:30
内容审核 多模态 大语言模型 安全分类 数据合成 模型合并 策略自适应

3B参数把内容审核统一成yes/no问答,策略自适应且刷新多模态SOTA

前置知识

护栏模型(Guardrail Model)

护栏模型是部署在大型语言模型前后、用于过滤有害/偏见/违法内容的分类器,例如ShieldGemma、LlamaGuard。它接受用户输入或模型输出,判定是否违反安全策略,传统做法是输出固定的类别标签(如13类违法内容)。

本文的核心目标是改进护栏模型,理解它的输入输出和定位方式,才能明白为何把固定类别换成自然语言问答是关键创新。

策略自适应(Policy-Adaptive)

策略自适应指模型在推理时能根据运营方自由定义的审核策略(用自然语言描述的审核标准)调整判定结果,而非死板套用训练时固定的类别体系。例如网络安全工具和心理健康平台对同一内容会有不同的容忍度。

这是本文区别于传统固定类别护栏的核心卖点,理解这个概念才能领会二元问答框架的价值——它让策略可以灵活地写进Query字段。

LoRA与SLERP模型合并

LoRA(Low-Rank Adaptation)只训练注入到原模型权重旁的低秩矩阵,参数效率高;SLERP(Spherical Linear Interpolation,球面线性插值)是一种在单位球面上沿测地线插值、保持权重范数稳定的模型合并方法。本文用LoRA训练两个分工不同的checkpoint,再用SLERP按权重融合。

本文最终模型是三个checkpoint(PG/P/Instruct)按0.6/0.3/0.1权重SLERP合并的产物,理解这些技术才能看懂第6节和Table 7的消融。

对比学习样本(Contrastive Samples)

对比样本指用同一段内容,搭配不同的查询问题,分别得到正例和负例。例如同一段暴力文本,配上"是否含暴力"的查询是正例,配上"是否含仇恨言论"的查询就成了硬负例,迫使模型区分具体违反了哪条策略而非粗略判断"是否安全"。

对比样本生成是本文数据构建的灵魂(Section 3.2-3.3),既用于训练又用于评测,贯穿全文的方法和实验设计。

研究动机

现有的护栏模型普遍采用固定类别的分类范式:例如LlamaGuard-4-12B、WildGuard-7B、Qwen3Guard-8B等都依赖一套固定的违法类别taxonomy来打标签。这种固定类别方法存在两个关键缺陷。其一,公开安全数据集的类别taxonomy高度异构——有的用二元safe/unsafe标记,有的是多标签体系,没有"一刀切"的统一标准,难以整合训练。其二,固定类别模型无法适应不同的部署需求:同一段内容在网络安全研究工具里完全合理,在心理健康支持平台上却可能严重有害,而现有模型无论谁来用、出于什么目的,都吐出相同的标签。此外作者还指出,开源安全数据集虽然内容多样,但普遍缺少细粒度类别和微妙区分,纯粹基于这类数据训练的模型难以适应用户自定义的策略。

本文的目标是本文的目标是构建一个既小又强、且能策略自适应的多模态安全分类器。具体而言,作者希望一个3B参数的模型能在文本安全基准上匹敌甚至超越近7倍体量(如20B)的大模型,同时在多模态安全分类上刷新SOTA。更重要的是,运营方能在推理时通过自由格式的自然语言查询来定义审核标准,模型据此动态调整判定,实现"谁问、为什么问"敏感的策略自适应审核。为了达成这点,作者还需要解决异构数据集统一、细粒度判别能力获取、以及图像安全数据稀缺等工程难题。

与已有工作不同的是,本文的独特切入角度是把内容审核彻底重构为一个二元问答任务:模型不再输出固定类别,而是接收一段自然语言的安全查询和待评估内容,输出单一的连续安全分数。这与其他自适应模型(如GPT-OSS-Safeguard-20B、Nemotron-3.5-Safety)形成鲜明对比——后者依赖生成冗长推理链再给出标签,推理效率低下。Shieldstral则只对"yes"和"no"两个token做softmax归一化,单token输出,兼顾了策略灵活性和推理效率。同时,作者用独立设计的评测taxonomy(与训练taxonomy在类别名、粒度、分组上都不同)来验证策略自适应泛化能力,杜绝"背训练标签"的可能,这是评测视角上的重要独创。

核心方法

整体思路分三层。直觉上:与其给模型一大堆类别让它分类,不如把它当成一个"听话的判官"——你用自然语言问它一个yes/no安全问题,它读取内容后只回答yes或no,并给出置信度。技术上,作者先把所有异构安全任务(提示词分类、回复审核、拒绝检测、毒性检测)统一成"指令-查询-文档"的三段式结构,再用约54.1M样本训练(其中45.2M开源文本、4.4M合成对比文本、4.5M多模态)。模型基于Ministral-3B-Base-2512(带Pixtral视觉编码器),训练时用全词表的交叉熵损失,推理时只对"yes"和"no"两个token ID做unembed并softmax,得到安全分数$s=\frac{\exp(z_{yes})}{\exp(z_{yes})+\exp(z_{no})}$,阈值$\tau=0.5$做二分类。最后用SLERP合并三个checkpoint得到最终模型。

核心创新点是"策略自适应的二元问答"加"对比样本驱动的数据构建"。与已有方法的本质区别在于:固定类别模型把安全建模成"属于哪类违法",而Shieldstral把安全建模成"这段内容是否满足我这条自然语言策略",策略被显式写进查询字段,推理时可随意更换。为保证这种自适应能力,作者没有枚举所有可能的策略,而是训练模型"区分相似类别"的技能——通过对比样本,让同一段内容配不同查询分别成为正例和负例,迫使模型学到"策略相关 vs 策略无关"的判别力,从而泛化到训练时未见过的全新策略。此外,推理只输出单token、靠logprobs算分数,相比需要生成推理链的对手,效率显著更高。

方法步骤详情

流水线分四阶段加两步组装。阶段一模板化统一:每数据集配手动处理器,用LLM生成指令模板改写变体,编码任务框架、严格度(strict/moderate/lenient)和领域;查询模板分类别特异/二元/拒绝检测三类;文档格式从多家族随机采样,多模态用图独立/文独立/组合三版本。产出45.2M文本样本。阶段二对比策展:为有害内容生成多个正例(粗粒度二元、类别特异、目标群体特异查询),负例靠类别硬负例、群体负例、安全内容负例三种策略;正例复制k次平衡比例;用LLM交叉校验标签剔噪声。阶段三对比生成:定义训练taxonomy(11超类73叶),LLM输入安全文本+目标类别+兄弟类别,一次产出unsafe重写、目标查询、兄弟查询;正例=重写配目标查询yes,负例=同一内容配兄弟查询no,并递归为祖先类别补正例。产出约4.4M样本。阶段四图像处理:LLM从14子类视觉taxonomy生成约2000条查询改写(约30%反向),统一标签后用VL reranker过滤误标,再生成同域硬负例。产出约4.5M多模态样本。组装:LoRA微调P(仅公开)和PG(公开+生成)两checkpoint,SLERP按0.6PG+0.3P+0.1Instruct三路合并。

技术新颖性

技术新颖性体现在几个层面。第一,把异构的安全审核任务统一成单一二元问答框架,靠"指令-查询-文档"三段式和logprobs打分实现,结构上极简但极具包容性。第二,对比样本生成贯穿训练和评测:训练用iso-content设置(同内容配不同查询)逼迫模型关注查询的细粒度语义细节而非粗类别线索,评测则用iso-query设置(同查询配不同内容)测试类别级判别,且评测taxonomy与训练taxonomy独立设计、类别名和粒度都不同,这是非常严谨的泛化检验。第三,三路SLERP合并巧妙平衡了PG的策略自适应性与P的基准校准,还引入Instruct基础模型恢复指令遵循能力,Table 7显示三路合并让taxonomy F1从单模型84.4%推到88.7%同时恢复Aegis v2性能。第四,图像数据稀缺问题的解法也很巧妙——不强行合成有害图像,而是补充通用图像分类/检测数据集作为安全负例,再靠查询变异和VL reranker过滤构造高质量训练对。

Shieldstral architecture
Figure 1: Shieldstral architecture
Training sample examples
Figure 2: Training sample examples
Example contrastive training pair generated from a single LLM call
Figure 3: Example contrastive training pair generated from a single LLM call

实验结果

在16基准、10个baseline上的核心发现。文本安全(Figure 5):3B的Shieldstral以84.9%平均F1追平20B的GPT-OSS-Safeguard-20B,远超WildGuard-7B(54.7%)、OmniGuard-7B(69.1%),多语言(PolyGuard、RTP-LX)也强劲。拒绝检测(Figure 6)XSTest 93.7%、PolyGuard 92.3%、WildGuardTest 90.2%三项居首。策略自适应(Figure 7):91.3% F1仅次于GPT-OSS-Safeguard-20B的94.1%(靠推理链和20B参数,效率低),单token输出的Shieldstral效率优势显著。多模态(Figure 8):83.8% Overall夺冠,领先次优OmniGuard-7B(77.6%)逾6个百分点,用不到其一半参数(3B vs 7B)。消融(Table 5):基座无安全训练F1=0.0%,加公开数据61.1%,再加生成taxonomy数据84.4%(+23.3%),且评测taxonomy与训练独立,证明真实泛化。合并消融(Table 7):0.6PG+0.3P+0.1I把taxonomy F1推到88.7%同时Aegis v2恢复88.0%;LoRA与SFT无显著差异故用更高效的LoRA。

Instruction template strictness levels
Table 1: Instruction template strictness levels
Document format families with examples
Table 2: Document format families with examples
Representative category divergences between the training and evaluation taxonomies
Table 3: Representative category divergences between the training and evaluation taxonomies
Evaluation benchmarks and baselines
Table 4: Evaluation benchmarks and baselines
Training stage ablation on the fine-grained taxonomy validation set
Table 5: Training stage ablation on the fine-grained taxonomy validation set
LoRA vs. SFT on Aegis v2 validation
Table 6: LoRA vs. SFT on Aegis v2 validation
Model merging ablation
Table 7: Model merging ablation
Contrastive evaluation pair for CAT001 (Physical Violence)
Figure 4: Contrastive evaluation pair for CAT001 (Physical Violence)
F1 scores (%) on safety classification benchmarks
Figure 5: F1 scores (%) on safety classification benchmarks
F1 scores (%) on refusal detection benchmarks
Figure 6: F1 scores (%) on refusal detection benchmarks
Scores (%) on the adaptability benchmark
Figure 7: Scores (%) on the adaptability benchmark
F1 scores (%) on multimodal safety benchmarks
Figure 8: F1 scores (%) on multimodal safety benchmarks
查看结构化数据
任务指标本文基线提升
文本安全分类(13个文本基准平均) Overall F1 84.9% GPT-OSS-Safeguard-20B 84.9%;WildGuard-7B 54.7%;OmniGuard-7B 69.1% 用约1/7的参数(3B vs 20B)追平最强对手,并大幅超越7B级模型
多模态安全分类(VLGuard/UnsafeBench/LlavaGuard平均) Overall F1 83.8% OmniGuard-7B 77.6%;LlamaGuard-4-12B 67.7% 较次优OmniGuard提升6.2个百分点,且参数不到其一半
策略自适应(自建细粒度taxonomy评测) F1 91.3% GPT-OSS-Safeguard-20B 94.1%(需长推理链);Nemotron-3.5-Safety-4B 89.3% 单token输出、3B参数下仅次于需推理的20B模型,效率优势显著
策略自适应泛化消融(验证集) F1 公开+生成数据 84.4%(最终合并模型88.7%) 基座Ministral-3B 0.0%;仅公开数据 61.1% 生成taxonomy数据带来+23.3% F1,合并后达88.7%
拒绝检测(XSTest/PolyGuard/WildGuardTest) F1 XSTest 93.7%、PolyGuard 92.3%、WildGuardTest 90.2% GPT-OSS-Safeguard-20B、Qwen3Guard-8B、WildGuard-7B等 在三个拒绝检测基准上均居首

局限与改进

作者承认的局限主要有三点。其一,在策略自适应基准上Shieldstral的91.3% F1仍落后于GPT-OSS-Safeguard-20B的94.1%,后者凭借逐类别策略提示、推理链分解新策略以及20B参数量取胜——说明纯单token输出在面对极新颖策略时,相比"先推理再判定"仍有差距。其二,多模态部分LlavaGuard在自己同名基准上(81.4%)仍优于Shieldstral,说明在特定对话中心的安全框架下,专用模型仍有局部优势;且Figure 8注释提到部分LlavaGuard测试图像不可用,分数基于可用子集,评测存在一定不完整。其三,评测taxonomy虽与训练taxonomy独立设计,但10/12个评测超类在训练taxonomy中有松散对应,完全无对应的全新领域(如训练独有的Jailbreak超类)未纳入评测,泛化边界未被充分探测。从我的观察看,模型依赖固定阈值$\tau=0.5$,对策略严格度的调节主要靠Instruct字段的措辞,缺少对阈值校准的系统性讨论;同时合成对比样本的质量高度依赖生成LLM的能力,若生成LLM本身存在偏差,可能引入隐蔽的标注噪声。

独立分析的弱点

独立分析有几个值得改进的弱点。第一,固定阈值0.5可能不是所有部署场景的最优解:心理健康平台和网络安全工具对误报/漏报的容忍度截然不同,改进方向是引入按策略或按场景的自适应阈值校准机制,甚至让模型同时输出一个不确定性估计。第二,评测taxonomy与训练taxonomy的10/12超类有松散对应,意味着"完全新颖"的策略域(如训练独有但评测未覆盖的Jailbreak/Prompt Injection类)未被测试,改进方向是补充更激进的域外策略评测,例如引入跨文化、跨法律体系的审核标准来检验泛化极限。第三,对比样本生成高度依赖生成LLM,存在标注噪声和分布偏移风险,改进方向是用多LLM集成生成+人工抽样审核+对抗性探测集交叉验证,并公开生成提示和种子样本。第四,多模态数据仅4.5M、约为文本的1/10,且图像安全数据本身稀缺,Shieldstral在LlavaGuard基准上落败部分源于此,改进方向是用扩散模型生成受控的有害/对抗图像扩充多模态训练。第五,缺乏对推理延迟、吞吐、显存占用的实测对比——论文反复强调单token输出的效率优势却没给定量数据,应补充端到端延迟和QPS基准。

未来方向

作者提出的未来方向隐含在结论中:扩展统一的策略自适应审核范式,验证"小模型+精数据"能否在更多安全子领域持续超越大模型。基于本文成果,我认为可延伸的方向包括:(1)把二元问答框架推广到多策略并发判定——单次前向传播回答多个查询,进一步压低推理成本;(2)探索在线策略学习,让模型在部署中根据运营方反馈微调查询表示或adapter;(3)将对比样本生成思路迁移到其他需要细粒度判别的任务,如法律合规、医疗安全、教育内容分级;(4)研究如何把推理链模型的"分解新策略"能力蒸馏到单token模型,缩小与GPT-OSS-Safeguard-20B的3个百分点差距;(5)扩展到音频、视频等多模态安全审核,应对Deepfake和实时流媒体场景;(6)结合不确定性估计和主动学习,让模型标注最有歧义的内容供人工复核,形成人机协作的审核闭环。

复现评估

复现评估较为中等偏上。有利因素:作者公开了详细的分类taxonomy(训练taxonomy 11超类73叶、评测taxonomy 12超类52叶,附录B/C给出层级)、数据构建四个阶段的完整流程、文档格式家族、严格度分级逻辑、模型合并的精确SLERP权重(0.6 PG + 0.3 P + 0.1 I),以及16个评测基准的具体split和样本数。基座模型Ministral-3B-Base-2512和Pixtral视觉编码器也是公开的。不利因素:54.1M训练样本中约4.4M合成对比样本和4.5M多模态样本高度依赖作者内部的LLM生成流水线、VL reranker过滤、约2000条查询改写,这些生成提示、种子文本、过滤阈值大多未完全公开,难以精确复刻数据分布;论文发布时(arXiv v1)未明确代码/权重是否开源;LoRA的超参(秩、学习率、训练轮数)和SLERP的具体实现细节也需查阅附录。算力方面,3B模型LoRA微调相比全参SFT要求较低,但生成54M样本和处理大规模图像数据仍需可观GPU资源。总体上方法路线可复现,但数据细节和工程实现需要相当大的补全工作量。