← 返回 2026-09-01

SafeAtlas-VL:以大规模数据与守卫模型超越二元多模态安全判定 SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu Zhang, Chunyi Li, Yue Shi, Kaiwei Zhang, Zicheng Zhang, Yuan Tian, Qi Jia, Yan Teng, Wei Sun, Ning Liu, Guangtao Zhai 📅 2026-08-29 👍 4 2026-09-01 18:30
内容审核 多模态安全 大视觉语言模型 守卫模型 安全审核数据集 有序回归

构建150万五级安全标注数据集并训练出可输出连续风险分的SOTA守卫模型

前置知识

守卫模型(Guard Model)

专门用于内容安全审核的判别式模型,独立于被审核的生成模型运行。输入可以是单张图像、图文请求(图像+用户指令)或完整的图文对话三元组,输出安全/不安全判定(部分模型还给出违规类别)。代表性工作包括 Llama Guard 4、ShieldGemma 2、GuardReasoner-VL 等,通常以中等规模 VLM 为骨干微调而来。

本文的 SafeAtlas Guard 就是一个多模态守卫模型,理解守卫模型的判定目标(图像/请求/回复)与输出形式,是读懂其任务定义与评测协议的前提。

累积有序回归(Cumulative Ordinal Regression)

处理有序类别标签的经典统计模型(McCullagh 1980 的累积链模型)。模型学习一个一维风险变量 $r_i$ 和 $K-1$ 个单调递增阈值 $\beta_1<\cdots<\beta_{K-1}$,用 $P(Z>k)=\sigma(r_i-\beta_k)$ 对每个累积阈值做二分类,再由累积概率差恢复完整类别分布。相比普通多分类,它显式编码了标签间的顺序与距离。

本文把五级安全标签从五分类改造成软累积有序学习,这是其连续风险分数的数学来源,也是核心创新点之一,不懂累积有序回归就无法理解其头训练阶段。

裁判模型集成与分歧校准(Judge Ensemble)

用多个 LLM 判别器给数据打安全标签的做法。单一裁判都有系统性偏差,常见补救是多数投票,但这会把分歧信息压成硬标签。分歧校准则保留各裁判的组合输出,在第三方校准集上统计每种组合的经验 unsafe 率,再按单调性聚合成更细的有序等级,让'裁判意见不一致的程度'本身成为可用的监督信号。

SafeAtlas-VL 数据集的五级标签正是由 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三个异构裁判的 12 种输出组合校准而来,这是其数据标注流程的核心。

CLIP 图文检索与文本锚点过滤

CLIP 将图像和文本编码到同一向量空间,可用余弦相似度衡量图文相关性,配合 FAISS 近邻检索可高效做大规模语义去重与检索。'文本锚点'指为每个风险类别扩写出的一批具体场景描述(如'伪造驾照的照片'),用它们在海量图像中检索与该风险相关的样本,比只用短类别名精准得多。

本文从 2.38 亿候选图中筛选安全相关图像,靠的就是 8480+ 条文本锚点和 CLIP 相似度阈值(去重 0.95、检索 0.3),是理解其数据构建管线的基础。

unsafe-class F1

以'不安全/有害'类为正类计算的 F1 分数,是安全审核领域的标准评测指标,同时惩罚漏报(有害内容没拦住)和误报(正常内容被误杀)。由于连续风险分数需要二值化后才能与二元基准比较,评测时通常在验证集上选取使 F1 最大的操作阈值 $\delta_b$。

论文主表(Table 3)的全部外部评测都报告 unsafe-class F1,且本文模型输出连续分数需按各基准专属阈值转换,不了解该指标与其阈值协议就看不懂实验部分。

越狱攻击(Jailbreak)

绕过对齐模型安全拒绝机制、诱导其产出有害内容的提示攻击技术。常见策略包括角色注入(给模型分配无限制人格)、虚构场景(把任务包装进故事)、强制服从(明令禁止拒绝)、间接表达(用暗语代称表达有害意图)。数据构建中反向使用这些策略,可以批量生成真实多样的有害请求与回复。

SafeAtlas-VL 用这四种越狱策略生成请求和回复,保证数据集中 unsafe 样本的多样性与真实性,理解这一点才能明白其交互数据为何覆盖'用户恶意、助手失守'等复杂情形。

研究动机

现有多模态安全审核存在三个相互纠缠的问题。第一,判定目标单一且输出退化:Llama Guard 4、GuardReasoner-VL、LLaVAGuard 等守卫要么只判图像、要么只判图文请求或回复,且普遍把安全压缩成二元 safe/unsafe 决策,导致同一次交互中'图像本身有害、用户对良性图起坏心思、助手放大或拒绝该意图'三种风险无法相互比较,模糊的边界案例也被硬标签抹平。第二,监督信号碎片化:Table 1 显示 VLGuard 约 3K、LLaVAGuard 约 4.9K、VLSBench 仅 2.2K、BeaverTails-V 约 30K、SPA-VL 约 100K,且监督残缺——SPA-VL 的请求因构造天然有害、回复只有成对偏好标签,MM-SafetyBench 与 VLSBench 只覆盖 unsafe 单侧。第三,裁判标注不可靠:作者实测三个异构裁判对同一请求/回复判定频繁相左,Figure 2 显示成对分歧率最高约 23%(GuardReasoner-VL 与 Llama Guard 4 在请求上完全分歧达 23.0%),若用二元多数投票,分歧携带的不确定性信息会全部丢失。

本文的目标是本文的目标是搭建一套'超越二元判定'的多模态安全基础设施,具体拆成三件事。其一,构建 SafeAtlas-VL 数据集:把图像、用户请求、助手回复三类判定目标统一放到五级有序安全尺度(safe core、safe leaning disputed、boundary uncertain、unsafe leaning disputed、unsafe core)上,训练集达 1,503,284 个实例、基于 746,895 张独立图像,覆盖 15 个危害大类和 55 个细粒度检索子类,同时提供五级离散标签与连续监督。其二,构建 SafeAtlas-Bench 评测集:从同一管线保留 5,000 个不参与训练的实例(2,000 请求 + 2,000 回复 + 1,000 图像),同时考核五级离散预测能力与连续风险分数质量。其三,在此数据之上训练 SafeAtlas Guard 系列守卫模型(基于 Qwen3-VL 的 2B/4B/8B 三个规模),使其既能按判定目标做条件化五分类,又能输出 [0,100] 区间的连续风险分,还能以辅助头模拟 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三种外部安全标准。

与已有工作不同的是,本文的独特切入角度主要有两点。第一,把裁判分歧从'标注噪声'升格为'校准信号':作者不让三个裁判投票压成二元标签,而是保留 Qwen3Guard(三分类)× GuardReasoner-VL(二分类)× Llama Guard 4(二分类)共 $3\times2\times2=12$ 种输出组合,在 BeaverTails-V 与 SPA-VL 校验集上统计每种组合的经验 unsafe 率,把单调位置相近的组合聚成五级——两端等级要求全票一致,中间三级专门承载分歧信息,并用实证 unsafe 率的单调递增验证了该排序的有效性。第二,用同一把有序标尺横跨图像-请求-回复三个目标,提供绝对安全标注而非偏好对或 unsafe-only 集合:此前数据集要么只监督链路一环,要么用目标专属的评分/偏好,无法支撑'同一交互内跨目标比较风险'这一真实审核需求;SafeAtlas-VL 的'5 levels + Continuous'监督形式在 Table 1 对比的 9 个数据集中独一无二。

核心方法

整套系统的逻辑是'先造数据、再造模型、让模型结构贴合标签语义'。数据侧:从直接站点抓取(146.08M,61.3%)、搜索引擎(38.05M)、Common Crawl(27.27M)汇集 211.4M 真实图像,再用 1.1M 提示词驱动 Ideogram、FLUX、SD/SD2/SDXL/SD3、DALL-E 3 生成 26.8M 合成图像,合计 238.2M 候选;经质量过滤与 CLIP+FAISS 语义去重(>0.95 分组取最优)后,用 8,480+ 条文本锚点做分类学引导检索(>0.3 保留并指派唯一风险类)。随后 Gemma 3、Qwen3.5、GLM-4.6V 随机组合,为每图生成 4 条请求(2 标准+2 越狱)、每请求 4 个回复,单图最多 16 种交互,全部经独立模型交叉校验。标注阶段,图像用 GPT-5.4 与 GPT-4o 双裁判一致后保留,请求/回复用三裁判 12 组合校准映射五级。模型侧分两阶段:先以结构化输出做安全指令微调,让 Qwen3-VL 骨干学会区分三类判定目标;再冻结骨干训练软累积有序头、16 类危害类别头与三个裁判模拟头,推理时同时给出五级标签、连续风险分与多标准判定。

核心创新有三层。第一层是分歧感知标注:不同于'多裁判多数投票',本文保留三个异构裁判的 12 种输出组合,用经验 unsafe 率把位置相近的组合聚成五级——两端要求全票一致,中间三级专门承载分歧;校准显示五级 unsafe 率严格单调:请求 2.7%→21.1%→55.8%→84.7%→96.5%,回复 6.6%→29.8%→48.5%→76.9%→96.6%,说明'争议程度'本身构成可靠的有序维度。第二层是软累积有序学习:普通五分类把标签当离散 token,硬阈值有序回归又假设边界清晰、容易过自信;作者用宽度 $\gamma$ 的高斯核把硬标签软化成分布 $\tilde{p}_i(\ell)\propto\exp(-(\ell-y_i)^2/2\gamma^2)$,转为累积目标后对 $K-1=4$ 个阈值做 BCE 损失,既保序又承认边界模糊。第三层是两阶段解耦:SFT 阶段全参训练学'看什么、判什么',头训练阶段冻结骨干只训轻量头,把连续风险分、危害类别与三个外部裁判标准的模拟同主判定解耦,一个模型同时服务多种审核口径。

方法步骤详情

第一步数据收集与过滤:汇集 238.2M 图像(网络 211.4M+生成 26.8M),剔除重复、过亮过暗与模糊图,CLIP+FAISS 以 0.95 相似度语义去重;GPT-4o/Qwen3.5 为 55 个子类生成 8,480+ 条文本锚点,相似度 >0.3 才保留并指派唯一风险类。第二步交互生成:Gemma 3/Qwen3.5/GLM-4.6V 随机采样,每图 4 条请求、每请求 4 个回复,全部由异于生成方的模型独立校验。第三步标注:图像由 GPT-5.4 与 GPT-4o 独立判定、仅留一致对;请求/回复用 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 三裁判产生 12 种组合,经校准集映射五级。第四步人工验证:抽检 4,500 实例正确率 94.3%,两两比较 non-reversal 达 89.2%。第五步训练:先做 1 epoch 全参 SFT(lr $5\times10^{-5}$,8×H200,8B 约 24 小时);再冻结骨干,以权重 1.0/0.2/0.2 的 $\mathcal{L}_{\text{head}}$ 训练软有序头($\gamma=0.75$)与类别、模拟头,8B 约 20 小时。

技术新颖性

技术新颖性有四点。其一,监督形式的完备性:据 Table 1,这是首个同时为图像、请求、回复提供绝对五级有序标注的大规模数据集,此前最大的 SPA-VL 也只有约 100K 且回复侧是偏好监督,'5 levels + Continuous'在对比的 9 个数据集中独一份。其二,把经典累积链模型(McCullagh 1980)引入 VLM 守卫并用高斯软标签处理边界模糊:阈值经 softplus 重参数化 $\beta_k=\beta_{k-1}+\text{softplus}(\alpha_k)$ 保证严格单调,配合 $\sigma(r_i-\beta_k)$ 的累积概率,形成'判别式头+生成式 SFT'的混合设计;消融证实收益主要来自有序监督而非规模——二元 SFT 68.3 → 五级 SFT 78.7 → 软有序 81.2(8B)。其三,裁判标准模拟头:让单一冻结表征同时逼近三个外部安全标准,8B 上 Llama Guard 4 复现一致率 90.24%、$\kappa=0.753$,为'安全标准的相对性'提供可量化建模。其四,分歧即标注:12 组合校准成五级在安全数据构建中少见,把标注不确定性显式写进了监督信号。

Overview of SafeAtlas-VL and SafeAtlas Guard.
Figure 1: Overview of SafeAtlas-VL and SafeAtlas Guard.
Construction and calibration of the five safety levels.
Figure 3: Construction and calibration of the five safety levels.
Examples of the supervision learned by SafeAtlas Guard.
Figure 5: Examples of the supervision learned by SafeAtlas Guard.
Empirical unsafe rates for all 12 judge-output configurations on the pooled BeaverTails-V and SPA-VL calibration data.
Figure A1: Empirical unsafe rates for all 12 judge-output configurations on the pooled BeaverTails-V and SPA-VL calibration data.

实验结果

核心结果分五块。①多模态检测(Table 3):8B 在 7 个外部多模态任务上 AvgF1 达 79.7%,超最强基线 GuardReasoner-VL-3B(75.6%)4.1 点;输入均值 80.6%(+2.3)、回复均值 77.7%(+3.8,最强基线为 Nemotron 3.5 的 73.9%)。②纯文本零泛化:未用任何文本训练数据,4 项文本任务均值 83.7%,仍超最强文本守卫 Qwen3Guard(82.5%)1.2 点,OpenAI Moderation 上 F1 达 100%。③五级评估(Table 4):精确五级准确率 71.50%、Within-1 96.60%、MAE 0.326,误差几乎全集中在相邻级别。④人类对齐(Table 6):分数差 $\Delta\ge50$ 时 concordance 96.6%,但 $\Delta<5$ 时仅 34.4%;8B 有序预测把 exact 从 52.5% 提到 59.8%、QWK 从 0.734 提到 0.806。⑤消融(Figure 6):二元 SFT 68.3 → 五级 SFT 78.7 → 软有序 81.2(8B),有序监督贡献最大。类别头准确率 76.7%,略高于 GPT-5.4 的 73.3%。

Comparison with representative multimodal safety datasets.
Table 1: Comparison with representative multimodal safety datasets.
Human validation of five-level ordering.
Table 2: Human validation of five-level ordering.
Unsafe-class F1 (%) on seven external multimodal tasks, three SafeAtlas-Bench targets, and four text-only tasks.
Table 3: Unsafe-class F1 (%) on seven external multimodal tasks, three SafeAtlas-Bench targets, and four text-only tasks.
Five-level classification on SafeAtlas-Bench.
Table 4: Five-level classification on SafeAtlas-Bench.
Simulation-head performance, reported as raw agreement (%) / Cohen's 𝜅.
Table 5: Simulation-head performance, reported as raw agreement (%) / Cohen's 𝜅.
Human validation of the risk representation.
Table 6: Human validation of the risk representation.
Composition of the raw image candidate pool before filtering and balanced sampling.
Table A1: Composition of the raw image candidate pool before filtering and balanced sampling.
Ablations over training objectives and data fractions using Qwen3-VL 2B/4B/8B backbones.
Figure 6: Ablations over training objectives and data fractions using Qwen3-VL 2B/4B/8B backbones.
Risk-score distributions of SafeAtlas Guard-8B on the held-out evaluation split.
Figure 7: Risk-score distributions of SafeAtlas Guard-8B on the held-out evaluation split.
Harm-category confusion matrix of SafeAtlas Guard-8B on the non-none subset of SafeAtlas-Bench.
Figure A2: Harm-category confusion matrix of SafeAtlas Guard-8B on the non-none subset of SafeAtlas-Bench.
查看结构化数据
任务指标本文基线提升
多模态输入安全(BeaverTails-V/SPA-VL/VLGuard/HarmImageTest/LLaVAGuard 五任务均值) unsafe-class F1 (%) 80.6(SafeAtlas Guard-8B) 78.3(GuardReasoner-VL-3B,最强基线) +2.3
多模态回复安全(BeaverTails-V/SPA-VL 回复均值) unsafe-class F1 (%) 77.7(SafeAtlas Guard-8B) 73.9(Nemotron 3.5 CS-4B) +3.8
全部 7 个外部多模态任务平均 AvgMM F1 (%) 79.7(SafeAtlas Guard-8B) 75.6(GuardReasoner-VL-3B) +4.1
纯文本安全(HarmBench-P/OpenAI Moderation/HarmBench-R/SafeRLHF,零文本训练) AvgT F1 (%) 83.7(SafeAtlas Guard-8B) 82.5(Qwen3Guard-Gen-8B, loose) +1.2
11 个外部任务总平均 AvgAll F1 (%) 81.2(SafeAtlas Guard-8B) 78.8(GuardReasoner-VL-3B) +2.4
SafeAtlas-Bench 五级分类(图像/请求/回复) Exact Acc (%) / Within-1 (%) / MAE 71.50 / 96.60 / 0.326(Guard-8B) 69.18 / 94.34 / 0.376(Guard-2B) Acc +2.32,Within-1 +2.26,MAE −0.050
裁判标准模拟(Llama Guard 4) 原始一致率 (%) / Cohen's κ 90.24 / 0.753(Guard-8B) 89.66 / 0.730(Guard-2B) +0.58 / +0.023(GuardReasoner-VL 最难模拟:80.79 / 0.617)
与人类五级判断对齐(600 实例) QWK / Exact (%) 0.806 / 59.8(8B 有序预测) 0.734 / 52.5(原始五级标注) +0.072 / +7.3

局限与改进

作者承认的局限:相邻安全级别的语义边界天然模糊,8B 精确五级准确率仅 71.50%,人类对同级别实例的'同等风险'判定一致率也只有 67.6%;连续分数差距小于 5 分时与人类判断的 concordance 仅 34.4%,小分差不能作精确排序解读;数据构建依赖特定裁判模型,其偏差可能被继承;安全判断受政策、文化语境影响,五级标注应视为'结构化监督'而非普适的危害定义。我的补充观察:其一,图像级标注只在 GPT-5.4 与 GPT-4o 完全一致时保留、冲突即丢弃,会系统性流失最困难、最模糊的图像,可能让图像子集偏'干净',泛化到真实难例时存在偏差;其二,评测需逐基准调阈值(附录 Table A3 中 20 到 65 不等),部署时的阈值选择成本被低估,且在验证集上优化 F1 本身有乐观偏差;其三,文本任务是'零训练泛化'而非优化目标,在 HarmImageTest(68.4%)等较弱任务上与专用最优仍有差距;其四,合成数据来自 7 个扩散模型与三套 VLM 的文风,分布可能偏窄;其五,模型只输出结构化字段、不带推理链,在需要审计与申诉的审核场景中可解释性不如带推理的守卫透明。

独立分析的弱点

独立分析的弱点及改进方向:①边界案例完全依赖三个裁判的先验,而 Qwen3Guard、GuardReasoner-VL、Llama Guard 4 均以英文语境训练为主,中文/多文化场景的'safe leaning disputed'可能系统性错位,改进方向是引入多语言、多区域裁判并按文化分层校准映射表。②模拟头只能'复制'现有标准,无法裁决标准间冲突,也未提供按部署方政策定制的接口,可扩展为可调权重的标准插值或政策条件化判定。③连续分数缺乏语义锚定:[0,100] 分数没有运营含义,建议用人类风险感知分位数做单调校准(如 isotonic regression),让'45 分'对应明确的处置建议。④两阶段训练后骨干冻结,新增政策类别时需重做 SFT,灵活性不足,可探索 LoRA 式轻量继续学习或检索式政策注入。⑤数据管线生成 26.8M 图像并含大量越狱内容,构建成本高且有双用途泄露风险,可发布过滤子集加受控访问。⑥评测以 unsafe-class F1 为主,未报告误报/漏报随阈值的完整权衡曲线,而生产环境误杀正常内容的代价高度场景相关,接入企业审核流需要更细的 operating point 分析。

未来方向

作者明确提出未来将把框架扩展到更广泛的安全场景与审核政策。基于本文成果还可自然延伸:①把五级有序+连续分数框架迁移到视频、音频、多轮对话乃至 agent 工具调用轨迹的审核,处理时序累积风险;②为 SafeAtlas-Bench 增设跨文化/多语言子集,检验有序尺度在不同文化语境下的稳健性;③把固定的三个模拟头升级为'政策条件化'判定——输入企业安全政策文档即可输出符合该政策的结论,替代静态的标准模拟;④对 boundary uncertain 实例做主动学习,把有限的人类标注预算集中到信息量最大的边界样本,持续修正五级映射;⑤为有序头引入校准的不确定性估计(如 evidential deep learning),输出'风险分+置信区间',自动决定何时上报人工复审;⑥与推理链守卫结合,在保留结构化输出效率的同时生成可审计的判定理由,兼顾申诉与合规需求;⑦研究连续风险分与下游干预强度(拦截/降权/人工复审)的自动映射策略,把分数真正接入运营决策。

复现评估

复现条件在同类工作中相当好:代码(github.com/zrwang1211/SafeAtlas-VL)、150 万实例数据集与 5,000 实例 SafeAtlas-Bench(huggingface.co/datasets/zrwang1211/SafeAtlas-VL)、三个规模的模型权重(HF collection safeatlas-guard)全部开源。训练硬件为 8×NVIDIA H200,8B 全流程约 44 小时(SFT 约 24h + 头训练约 20h),属中等算力门槛;超参完整披露(SFT lr $5\times10^{-5}$、头 lr $1\times10^{-4}$、$\gamma=0.75$、损失权重 1.0/0.2/0.2、BF16、ZeRO-1),附录给出完整提示词与评测阈值表。需注意:完整数据管线需调用 GPT-5.4、GPT-4o、Qwen3.5 等多个大模型与三个守卫裁判,API 成本不低,从零重建数据集代价大;复现主表须严格对齐评测协议——连续分按各基准专属阈值(20–65 不等)二值化,部分基准沿用 GuardReasoner-VL 切分。总体上,推理与评测开箱即用,数据构建可复现但成本可观。