SafeAtlas-VL:以大规模数据与守卫模型超越二元多模态安全判定 SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models
构建150万五级安全标注数据集并训练出可输出连续风险分的SOTA守卫模型
前置知识
守卫模型(Guard Model)
专门用于内容安全审核的判别式模型,独立于被审核的生成模型运行。输入可以是单张图像、图文请求(图像+用户指令)或完整的图文对话三元组,输出安全/不安全判定(部分模型还给出违规类别)。代表性工作包括 Llama Guard 4、ShieldGemma 2、GuardReasoner-VL 等,通常以中等规模 VLM 为骨干微调而来。
本文的 SafeAtlas Guard 就是一个多模态守卫模型,理解守卫模型的判定目标(图像/请求/回复)与输出形式,是读懂其任务定义与评测协议的前提。
累积有序回归(Cumulative Ordinal Regression)
处理有序类别标签的经典统计模型(McCullagh 1980 的累积链模型)。模型学习一个一维风险变量 $r_i$ 和 $K-1$ 个单调递增阈值 $\beta_1<\cdots<\beta_{K-1}$,用 $P(Z>k)=\sigma(r_i-\beta_k)$ 对每个累积阈值做二分类,再由累积概率差恢复完整类别分布。相比普通多分类,它显式编码了标签间的顺序与距离。
本文把五级安全标签从五分类改造成软累积有序学习,这是其连续风险分数的数学来源,也是核心创新点之一,不懂累积有序回归就无法理解其头训练阶段。
裁判模型集成与分歧校准(Judge Ensemble)
用多个 LLM 判别器给数据打安全标签的做法。单一裁判都有系统性偏差,常见补救是多数投票,但这会把分歧信息压成硬标签。分歧校准则保留各裁判的组合输出,在第三方校准集上统计每种组合的经验 unsafe 率,再按单调性聚合成更细的有序等级,让'裁判意见不一致的程度'本身成为可用的监督信号。
SafeAtlas-VL 数据集的五级标签正是由 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三个异构裁判的 12 种输出组合校准而来,这是其数据标注流程的核心。
CLIP 图文检索与文本锚点过滤
CLIP 将图像和文本编码到同一向量空间,可用余弦相似度衡量图文相关性,配合 FAISS 近邻检索可高效做大规模语义去重与检索。'文本锚点'指为每个风险类别扩写出的一批具体场景描述(如'伪造驾照的照片'),用它们在海量图像中检索与该风险相关的样本,比只用短类别名精准得多。
本文从 2.38 亿候选图中筛选安全相关图像,靠的就是 8480+ 条文本锚点和 CLIP 相似度阈值(去重 0.95、检索 0.3),是理解其数据构建管线的基础。
unsafe-class F1
以'不安全/有害'类为正类计算的 F1 分数,是安全审核领域的标准评测指标,同时惩罚漏报(有害内容没拦住)和误报(正常内容被误杀)。由于连续风险分数需要二值化后才能与二元基准比较,评测时通常在验证集上选取使 F1 最大的操作阈值 $\delta_b$。
论文主表(Table 3)的全部外部评测都报告 unsafe-class F1,且本文模型输出连续分数需按各基准专属阈值转换,不了解该指标与其阈值协议就看不懂实验部分。
越狱攻击(Jailbreak)
绕过对齐模型安全拒绝机制、诱导其产出有害内容的提示攻击技术。常见策略包括角色注入(给模型分配无限制人格)、虚构场景(把任务包装进故事)、强制服从(明令禁止拒绝)、间接表达(用暗语代称表达有害意图)。数据构建中反向使用这些策略,可以批量生成真实多样的有害请求与回复。
SafeAtlas-VL 用这四种越狱策略生成请求和回复,保证数据集中 unsafe 样本的多样性与真实性,理解这一点才能明白其交互数据为何覆盖'用户恶意、助手失守'等复杂情形。
研究动机
现有多模态安全审核存在三个相互纠缠的问题。第一,判定目标单一且输出退化:Llama Guard 4、GuardReasoner-VL、LLaVAGuard 等守卫要么只判图像、要么只判图文请求或回复,且普遍把安全压缩成二元 safe/unsafe 决策,导致同一次交互中'图像本身有害、用户对良性图起坏心思、助手放大或拒绝该意图'三种风险无法相互比较,模糊的边界案例也被硬标签抹平。第二,监督信号碎片化:Table 1 显示 VLGuard 约 3K、LLaVAGuard 约 4.9K、VLSBench 仅 2.2K、BeaverTails-V 约 30K、SPA-VL 约 100K,且监督残缺——SPA-VL 的请求因构造天然有害、回复只有成对偏好标签,MM-SafetyBench 与 VLSBench 只覆盖 unsafe 单侧。第三,裁判标注不可靠:作者实测三个异构裁判对同一请求/回复判定频繁相左,Figure 2 显示成对分歧率最高约 23%(GuardReasoner-VL 与 Llama Guard 4 在请求上完全分歧达 23.0%),若用二元多数投票,分歧携带的不确定性信息会全部丢失。
本文的目标是本文的目标是搭建一套'超越二元判定'的多模态安全基础设施,具体拆成三件事。其一,构建 SafeAtlas-VL 数据集:把图像、用户请求、助手回复三类判定目标统一放到五级有序安全尺度(safe core、safe leaning disputed、boundary uncertain、unsafe leaning disputed、unsafe core)上,训练集达 1,503,284 个实例、基于 746,895 张独立图像,覆盖 15 个危害大类和 55 个细粒度检索子类,同时提供五级离散标签与连续监督。其二,构建 SafeAtlas-Bench 评测集:从同一管线保留 5,000 个不参与训练的实例(2,000 请求 + 2,000 回复 + 1,000 图像),同时考核五级离散预测能力与连续风险分数质量。其三,在此数据之上训练 SafeAtlas Guard 系列守卫模型(基于 Qwen3-VL 的 2B/4B/8B 三个规模),使其既能按判定目标做条件化五分类,又能输出 [0,100] 区间的连续风险分,还能以辅助头模拟 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三种外部安全标准。
与已有工作不同的是,本文的独特切入角度主要有两点。第一,把裁判分歧从'标注噪声'升格为'校准信号':作者不让三个裁判投票压成二元标签,而是保留 Qwen3Guard(三分类)× GuardReasoner-VL(二分类)× Llama Guard 4(二分类)共 $3\times2\times2=12$ 种输出组合,在 BeaverTails-V 与 SPA-VL 校验集上统计每种组合的经验 unsafe 率,把单调位置相近的组合聚成五级——两端等级要求全票一致,中间三级专门承载分歧信息,并用实证 unsafe 率的单调递增验证了该排序的有效性。第二,用同一把有序标尺横跨图像-请求-回复三个目标,提供绝对安全标注而非偏好对或 unsafe-only 集合:此前数据集要么只监督链路一环,要么用目标专属的评分/偏好,无法支撑'同一交互内跨目标比较风险'这一真实审核需求;SafeAtlas-VL 的'5 levels + Continuous'监督形式在 Table 1 对比的 9 个数据集中独一无二。
核心方法
整套系统的逻辑是'先造数据、再造模型、让模型结构贴合标签语义'。数据侧:从直接站点抓取(146.08M,61.3%)、搜索引擎(38.05M)、Common Crawl(27.27M)汇集 211.4M 真实图像,再用 1.1M 提示词驱动 Ideogram、FLUX、SD/SD2/SDXL/SD3、DALL-E 3 生成 26.8M 合成图像,合计 238.2M 候选;经质量过滤与 CLIP+FAISS 语义去重(>0.95 分组取最优)后,用 8,480+ 条文本锚点做分类学引导检索(>0.3 保留并指派唯一风险类)。随后 Gemma 3、Qwen3.5、GLM-4.6V 随机组合,为每图生成 4 条请求(2 标准+2 越狱)、每请求 4 个回复,单图最多 16 种交互,全部经独立模型交叉校验。标注阶段,图像用 GPT-5.4 与 GPT-4o 双裁判一致后保留,请求/回复用三裁判 12 组合校准映射五级。模型侧分两阶段:先以结构化输出做安全指令微调,让 Qwen3-VL 骨干学会区分三类判定目标;再冻结骨干训练软累积有序头、16 类危害类别头与三个裁判模拟头,推理时同时给出五级标签、连续风险分与多标准判定。
核心创新有三层。第一层是分歧感知标注:不同于'多裁判多数投票',本文保留三个异构裁判的 12 种输出组合,用经验 unsafe 率把位置相近的组合聚成五级——两端要求全票一致,中间三级专门承载分歧;校准显示五级 unsafe 率严格单调:请求 2.7%→21.1%→55.8%→84.7%→96.5%,回复 6.6%→29.8%→48.5%→76.9%→96.6%,说明'争议程度'本身构成可靠的有序维度。第二层是软累积有序学习:普通五分类把标签当离散 token,硬阈值有序回归又假设边界清晰、容易过自信;作者用宽度 $\gamma$ 的高斯核把硬标签软化成分布 $\tilde{p}_i(\ell)\propto\exp(-(\ell-y_i)^2/2\gamma^2)$,转为累积目标后对 $K-1=4$ 个阈值做 BCE 损失,既保序又承认边界模糊。第三层是两阶段解耦:SFT 阶段全参训练学'看什么、判什么',头训练阶段冻结骨干只训轻量头,把连续风险分、危害类别与三个外部裁判标准的模拟同主判定解耦,一个模型同时服务多种审核口径。
方法步骤详情
第一步数据收集与过滤:汇集 238.2M 图像(网络 211.4M+生成 26.8M),剔除重复、过亮过暗与模糊图,CLIP+FAISS 以 0.95 相似度语义去重;GPT-4o/Qwen3.5 为 55 个子类生成 8,480+ 条文本锚点,相似度 >0.3 才保留并指派唯一风险类。第二步交互生成:Gemma 3/Qwen3.5/GLM-4.6V 随机采样,每图 4 条请求、每请求 4 个回复,全部由异于生成方的模型独立校验。第三步标注:图像由 GPT-5.4 与 GPT-4o 独立判定、仅留一致对;请求/回复用 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三裁判产生 12 种组合,经校准集映射五级。第四步人工验证:抽检 4,500 实例正确率 94.3%,两两比较 non-reversal 达 89.2%。第五步训练:先做 1 epoch 全参 SFT(lr $5\times10^{-5}$,8×H200,8B 约 24 小时);再冻结骨干,以权重 1.0/0.2/0.2 的 $\mathcal{L}_{\text{head}}$ 训练软有序头($\gamma=0.75$)与类别、模拟头,8B 约 20 小时。
技术新颖性
技术新颖性有四点。其一,监督形式的完备性:据 Table 1,这是首个同时为图像、请求、回复提供绝对五级有序标注的大规模数据集,此前最大的 SPA-VL 也只有约 100K 且回复侧是偏好监督,'5 levels + Continuous'在对比的 9 个数据集中独一份。其二,把经典累积链模型(McCullagh 1980)引入 VLM 守卫并用高斯软标签处理边界模糊:阈值经 softplus 重参数化 $\beta_k=\beta_{k-1}+\text{softplus}(\alpha_k)$ 保证严格单调,配合 $\sigma(r_i-\beta_k)$ 的累积概率,形成'判别式头+生成式 SFT'的混合设计;消融证实收益主要来自有序监督而非规模——二元 SFT 68.3 → 五级 SFT 78.7 → 软有序 81.2(8B)。其三,裁判标准模拟头:让单一冻结表征同时逼近三个外部安全标准,8B 上 Llama Guard 4 复现一致率 90.24%、$\kappa=0.753$,为'安全标准的相对性'提供可量化建模。其四,分歧即标注:12 组合校准成五级在安全数据构建中少见,把标注不确定性显式写进了监督信号。
实验结果
核心结果分五块。①多模态检测(Table 3):8B 在 7 个外部多模态任务上 AvgF1 达 79.7%,超最强基线 GuardReasoner-VL-3B(75.6%)4.1 点;输入均值 80.6%(+2.3)、回复均值 77.7%(+3.8,最强基线为 Nemotron 3.5 的 73.9%)。②纯文本零泛化:未用任何文本训练数据,4 项文本任务均值 83.7%,仍超最强文本守卫 Qwen3Guard(82.5%)1.2 点,OpenAI Moderation 上 F1 达 100%。③五级评估(Table 4):精确五级准确率 71.50%、Within-1 96.60%、MAE 0.326,误差几乎全集中在相邻级别。④人类对齐(Table 6):分数差 $\Delta\ge50$ 时 concordance 96.6%,但 $\Delta<5$ 时仅 34.4%;8B 有序预测把 exact 从 52.5% 提到 59.8%、QWK 从 0.734 提到 0.806。⑤消融(Figure 6):二元 SFT 68.3 → 五级 SFT 78.7 → 软有序 81.2(8B),有序监督贡献最大。类别头准确率 76.7%,略高于 GPT-5.4 的 73.3%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多模态输入安全(BeaverTails-V/SPA-VL/VLGuard/HarmImageTest/LLaVAGuard 五任务均值) | unsafe-class F1 (%) | 80.6(SafeAtlas Guard-8B) | 78.3(GuardReasoner-VL-3B,最强基线) | +2.3 |
| 多模态回复安全(BeaverTails-V/SPA-VL 回复均值) | unsafe-class F1 (%) | 77.7(SafeAtlas Guard-8B) | 73.9(Nemotron 3.5 CS-4B) | +3.8 |
| 全部 7 个外部多模态任务平均 | AvgMM F1 (%) | 79.7(SafeAtlas Guard-8B) | 75.6(GuardReasoner-VL-3B) | +4.1 |
| 纯文本安全(HarmBench-P/OpenAI Moderation/HarmBench-R/SafeRLHF,零文本训练) | AvgT F1 (%) | 83.7(SafeAtlas Guard-8B) | 82.5(Qwen3Guard-Gen-8B, loose) | +1.2 |
| 11 个外部任务总平均 | AvgAll F1 (%) | 81.2(SafeAtlas Guard-8B) | 78.8(GuardReasoner-VL-3B) | +2.4 |
| SafeAtlas-Bench 五级分类(图像/请求/回复) | Exact Acc (%) / Within-1 (%) / MAE | 71.50 / 96.60 / 0.326(Guard-8B) | 69.18 / 94.34 / 0.376(Guard-2B) | Acc +2.32,Within-1 +2.26,MAE −0.050 |
| 裁判标准模拟(Llama Guard 4) | 原始一致率 (%) / Cohen's κ | 90.24 / 0.753(Guard-8B) | 89.66 / 0.730(Guard-2B) | +0.58 / +0.023(GuardReasoner-VL 最难模拟:80.79 / 0.617) |
| 与人类五级判断对齐(600 实例) | QWK / Exact (%) | 0.806 / 59.8(8B 有序预测) | 0.734 / 52.5(原始五级标注) | +0.072 / +7.3 |
局限与改进
作者承认的局限:相邻安全级别的语义边界天然模糊,8B 精确五级准确率仅 71.50%,人类对同级别实例的'同等风险'判定一致率也只有 67.6%;连续分数差距小于 5 分时与人类判断的 concordance 仅 34.4%,小分差不能作精确排序解读;数据构建依赖特定裁判模型,其偏差可能被继承;安全判断受政策、文化语境影响,五级标注应视为'结构化监督'而非普适的危害定义。我的补充观察:其一,图像级标注只在 GPT-5.4 与 GPT-4o 完全一致时保留、冲突即丢弃,会系统性流失最困难、最模糊的图像,可能让图像子集偏'干净',泛化到真实难例时存在偏差;其二,评测需逐基准调阈值(附录 Table A3 中 20 到 65 不等),部署时的阈值选择成本被低估,且在验证集上优化 F1 本身有乐观偏差;其三,文本任务是'零训练泛化'而非优化目标,在 HarmImageTest(68.4%)等较弱任务上与专用最优仍有差距;其四,合成数据来自 7 个扩散模型与三套 VLM 的文风,分布可能偏窄;其五,模型只输出结构化字段、不带推理链,在需要审计与申诉的审核场景中可解释性不如带推理的守卫透明。
独立分析的弱点
独立分析的弱点及改进方向:①边界案例完全依赖三个裁判的先验,而 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 均以英文语境训练为主,中文/多文化场景的'safe leaning disputed'可能系统性错位,改进方向是引入多语言、多区域裁判并按文化分层校准映射表。②模拟头只能'复制'现有标准,无法裁决标准间冲突,也未提供按部署方政策定制的接口,可扩展为可调权重的标准插值或政策条件化判定。③连续分数缺乏语义锚定:[0,100] 分数没有运营含义,建议用人类风险感知分位数做单调校准(如 isotonic regression),让'45 分'对应明确的处置建议。④两阶段训练后骨干冻结,新增政策类别时需重做 SFT,灵活性不足,可探索 LoRA 式轻量继续学习或检索式政策注入。⑤数据管线生成 26.8M 图像并含大量越狱内容,构建成本高且有双用途泄露风险,可发布过滤子集加受控访问。⑥评测以 unsafe-class F1 为主,未报告误报/漏报随阈值的完整权衡曲线,而生产环境误杀正常内容的代价高度场景相关,接入企业审核流需要更细的 operating point 分析。
未来方向
作者明确提出未来将把框架扩展到更广泛的安全场景与审核政策。基于本文成果还可自然延伸:①把五级有序+连续分数框架迁移到视频、音频、多轮对话乃至 agent 工具调用轨迹的审核,处理时序累积风险;②为 SafeAtlas-Bench 增设跨文化/多语言子集,检验有序尺度在不同文化语境下的稳健性;③把固定的三个模拟头升级为'政策条件化'判定——输入企业安全政策文档即可输出符合该政策的结论,替代静态的标准模拟;④对 boundary uncertain 实例做主动学习,把有限的人类标注预算集中到信息量最大的边界样本,持续修正五级映射;⑤为有序头引入校准的不确定性估计(如 evidential deep learning),输出'风险分+置信区间',自动决定何时上报人工复审;⑥与推理链守卫结合,在保留结构化输出效率的同时生成可审计的判定理由,兼顾申诉与合规需求;⑦研究连续风险分与下游干预强度(拦截/降权/人工复审)的自动映射策略,把分数真正接入运营决策。
复现评估
复现条件在同类工作中相当好:代码(github.com/zrwang1211/SafeAtlas-VL)、150 万实例数据集与 5,000 实例 SafeAtlas-Bench(huggingface.co/datasets/zrwang1211/SafeAtlas-VL)、三个规模的模型权重(HF collection safeatlas-guard)全部开源。训练硬件为 8×NVIDIA H200,8B 全流程约 44 小时(SFT 约 24h + 头训练约 20h),属中等算力门槛;超参完整披露(SFT lr $5\times10^{-5}$、头 lr $1\times10^{-4}$、$\gamma=0.75$、损失权重 1.0/0.2/0.2、BF16、ZeRO-1),附录给出完整提示词与评测阈值表。需注意:完整数据管线需调用 GPT-5.4、GPT-4o、Qwen3.5 等多个大模型与三个守卫裁判,API 成本不低,从零重建数据集代价大;复现主表须严格对齐评测协议——连续分按各基准专属阈值(20–65 不等)二值化,部分基准沿用 GuardReasoner-VL 切分。总体上,推理与评测开箱即用,数据构建可复现但成本可观。
论文图表
(a) 请求与回复标注的裁判分歧矩阵:Qwen3Guard-Gen(S)、GuardReasoner-VL(GR)、Llama Guard 4(Llama) 两两之间的不一致率,最大可达 23.0%(GR 与 Llama 在请求上),完整一致的情形仅约半数;(b) 五个安全级别上的 unsafe 率统计,验证映射后的单调性。
这是论文立论的实证基础:证明单一裁判作为标注者必然引入偏差,'分歧感知标注'的动机直接来自这张图。
(a) 三类判定目标(图像 228,727 / 请求 528,916 / 回复 745,641)与五级安全分布:回复和请求保留了大量 disputed 与 boundary 案例;(b) 15 个危害类别的分布,如 toxic 12.3%、欺诈 11.4%、非法活动 13.8% 等,覆盖全部类别。
量化展示数据集的规模与组成,说明争议样本被系统性保留而非清洗掉,这是该数据集区别于二元数据集的直接证据。