← 返回 2026-08-18

Ventor-QTest:威胁模型驱动的厂商托管大模型 API 验证 Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo 📅 2026-08-17 👍 13 2026-08-23 18:30
KL散度估计 LLM服务安全 模型部署验证 统计假设检验 黑盒审计

用重复请求与长序列探针黑盒审计第三方 API 是否真的在服务所声称的模型

前置知识

KL 散度(Kullback–Leibler Divergence)

度量两个概率分布差异的非对称指标:$D_{KL}(Q\|P)=\sum_i q_i \log(q_i/p_i)$,非负且仅在两分布相同时为零。本文的核心估计目标是"粗化 KL"——把模型输出经预声明映射 $g_j$ 归入有限类别后,在类别分布上计算的 KL 散度。

论文的 AFL 统计量、logprob 比较器以及潜在偏差 $A_r$ 全部建立在 KL 散度上,不掌握它就无法理解"估计的是什么"以及为何结果是保守下界。

数据处理不等式与结果共粗化

数据处理不等式指出:对分布做任何确定性映射(粗化)$T$ 后散度不增,即 $D_{KL}(TQ\|TP) \le D_{KL}(Q\|P)$。本文把每个提示的无限可能输出通过预声明的有限映射归入类别集合(低参考质量类别并入 OTHER),据此在纯文本上估计一个保守的任务共粗化散度。

这是"只看返回文本、不看 logits 也能估计有意义的分布偏差"的数学合法性来源,也是探针设计可预声明的关键。

多项分布与狄利克雷中心化后验

固定提示重复 $M$ 次采样,各类别计数服从多项分布。为稳定小样本 KL 估计,给参数施加以参考分布为均值的先验 $\theta_{jr}\sim Dirichlet(\tau\pi_j)$($\tau=1$),后验期望粗化 KL 通过 digamma 函数 $\psi$ 计算:$\hat K^{post}_{jr}=\sum_i \frac{a_{ji}}{A_0}[\psi(a_{ji}+1)-\psi(A_0+1)-\log\pi_{ji}]$。

AFL 的有限样本估计器、零偏校正和置信区间完全由这套贝叶斯机制驱动,是读懂第 3.3 节的前提。

置换检验与 Holm 多重比较校正

在零假设下用参数化模拟(本文 20000 次从固定 $\pi_j$ 的多项抽样)构造检验统计量的零分布,得到单侧 p 值;多条路由同时检验时,用 Holm 程序控制族错误率(FWER),避免"检验越多越容易报假阳性"。路由级推断保留重复测量的交叉结构,而非把上下文–路由单元当独立路由。

"官方自检不被拒绝、六个第三方路由全部以 Holm p=0.00035 拒绝"这一主结论完全依赖这套零校准与多重比较框架,误读会导致高估证据强度。

中心化惊奇度与鞅差结构

定义 $e^r_{b,t}=-\log p^r_{b,t}(Y^r_{b,t})-H(p^r_{b,t})$,即目标生成 token 的负对数概率减去参考条件分布的熵。若目标与参考同分布,$e^r_{b,t}$ 条件期望为零,构成鞅差序列;整条序列的平均 $D_{r,b}(T)=\frac{1}{T}\sum_t e^r_{b,t}$ 是 EFL 的构建单元。

EFL 组件完全建立在该统计量上;同时必须理解由于自回归位置共享历史,统计单元是完整运行而非单个 token,区间推断要按运行聚类重采样。

威胁模型与自适应选择性路由

安全分析中预先界定对手能力与攻击面的模型。本文考虑五档逐渐增强的对手:运维偏差、未披露量化、间歇性保真劣化、替换模型/伪造元数据、自适应选择性路由。最后一档最强:提供方用分类器 $h(x)$ 识别审计探针,把疑似审计流量路由到忠实模型 $P$,其余流量路由到廉价替身 $R$。

论文标题中的"威胁模型驱动"即源于此:任何审计声明都必须写明对哪几档对手有效、对哪几档无效(字典分类器 $h(x)=\mathbf{1}[x\in S]$ 可击败一切公开固定探针集)。

研究动机

开源权重模型兴起后,第三方推理托管已成为 LLM 生态的关键一环,但自部署成本高得惊人:以 Kimi K2 为例,其官方部署指南规定 FP8 权重在 128K 上下文下、H200/H20 硬件上的最小部署单元就需要 16 张 GPU。这促使开发者转而通过第三方 API 使用开源模型,执行路径因此离开了模型发布方的可信环境。问题在于:托管 API 中的模型名只是一个"声明"而非远程证明意义上的密码学凭据——客户端能观察到的只有返回文本和由提供方控制的元数据。服务路径完全可能换用旧版 checkpoint、更便宜的替身模型、更低精度的量化部署(FP8/FP4),或不同的推理引擎与解码栈;已有研究证明量化会改变推理效率与任务精度,部署配置差异也会改变可观测输出行为。有些偏差是无恶意的工程选择,有些则可能违反宣传契约,仅凭黑盒观察无法区分。更隐蔽的是,异构副本池或时变路由器可能间歇性地把流量切到严重劣化的配置上,形成"平均偏差温和、上尾却危险"的随机服务窗口过程,而现有审计方法大多只测平均行为,对这类尾部风险视而不见。

本文的目标是论文要回答:能否只用黑盒 API 查询,度量第三方部署相对可信参考的行为偏差?目标分三层。第一层形式化:把托管路由建模为随机过程 $\{Q_{r,b}\}_{b\in\mathcal{B}}$($b$ 为独立抽样的审计窗口),把宣传声明表示为 $C=(m,v,q,\phi,E)$,覆盖模型族、checkpoint 版本、量化精度、解码/服务参数与 API 语义;并区分持续性偏差(跨窗口平均潜在散度 $A_r$)与间歇性偏差(超额最大值泛函 $X_r(m)$)。第二层方法:构建 Ventor-QTest 复合黑盒审计,只要求可信参考端提供 next-token logprob 与前缀续写,目标端只需普通文本生成,输出两个单位不同、不可互换的统计量——平均保真损失 AFL 与极端保真损失 EFL,明确不做人工阈值或加权和合并。第三层实证:在七个托管 DeepSeek 路由快照上验证 AFL 与 logprob 比较器的描述性一致性、揭示路由特异的 EFL,并考察两者与 GPQA-Diamond、Terminal-Bench 的下游关联,为何时应联合报告 AFL 与 EFL 给出证据。

与已有工作不同的是,既有工作各有盲区。Gao et al. 的两样本等价检验把端点当静态分布,单次需 200–250 次目标调用,一个判定要聚合 10 次检验;RUT 只需 100 次目标调用,却要本地做 10000 次参考生成并依赖 logprobs;LLMmap 与 FLIPS 依赖训练好的分类器,只能做闭集版本/实例识别,给不出参照相对的效应量;KBF 用知识边界指纹针对中转与转售 API;KVV 等能力基准花约 4000 次调用直接测功能,但只隐式处理部署正确性,未把路由当作随机过程。Ventor-QTest 的独特切入是过程视角:显式把路由当作跨服务窗口的随机过程,把持续的平均偏差与间歇的上尾偏差拆成两个互补观测,而非坍缩成退化/正常二值标签。同时它不依赖目标端 logits,也不需要本地权重副本,只用重复文本计数重构预声明类别分布,并以零偏校正的粗化 KL 给出带置信区间的效应量。对抗维度上论文不回避软肋:显式承认字典分类器 $h(x)=\mathbf{1}[x\in S]$ 可击败任何限于公开集合 $S$ 的审计,把推理边界写清楚。

核心方法

直觉上:如果目标端真在服务所声称的模型与配置,那么把同一冻结提示重复发送很多次,返回文本的类别频率应收敛到可信参考端暴露的类别分布;同时目标自生成的长序列在参考看来应当"典型"。技术上 Ventor-QTest 由两条互补管线组成。AFL 管线:对 $J=12$ 个冻结受约束上下文,先从可信参考各取 1 次类别概率向量 $\pi_j$(12 个向量被所有路由共享),再把每个上下文原样发给目标 $M$ 次(合计 600 次单 token 调用),将返回文本按预声明映射 $g_j$ 计数,用 $Dirichlet(\tau\pi_j)$、$\tau=1$ 的参考中心化后验估计粗化 KL,逐上下文减去 20000 次参数化零抽样估计的零基线,得窗口内平均统计量 $S_r$,并在联合零分布上做单侧检验。EFL 管线:$B=20$ 次相互独立的运行,每次用新鲜 nonce 挑战让目标生成长度 $T=500$ 的序列,参考端逐位置重打分得中心化惊奇度 $e^r_{b,t}$,整段平均为 $D_{r,b}(500)$,保留全部观测的经验分布并报告上尾摘要。两个统计量单位不同,永不加权合并。

核心创新有三。其一,把"路由"形式化为跨服务窗口的随机过程,用跨窗口平均 $A_r$ 刻画持续偏差、用超额最大值泛函 $X_r(m)$ 刻画间歇性极端偏差——路由可以 $A_r$ 温和而 $X_r(m)$ 显著,这为"单一退化/正常判定不够、AFL 与 EFL 必须成对报告"提供理论动机。其二,AFL 是不需要目标 logits、不需要本地权重副本的粗化 KL 文本计数估计器:以参考分布为狄利克雷先验均值稳定小样本估计,逐上下文扣除参数化零基线(负值保留,截断会向上偏置检验),低参考质量类别($M\pi_{ji}<1$)在目标抽样前并入 OTHER,由数据处理不等式保证估计目标是保守共粗化散度。其三,EFL 利用中心化惊奇度 $e^r_{b,t}=-\log p^r_{b,t}(Y^r_{b,t})-H(p^r_{b,t})$ 的鞅差结构探测上尾:自回归位置共享历史,故统计单元是完整序列而非单个 token,区间按独立运行聚类自助;论文诚实指出该统计量期望含 $D_{KL}(Q\|P)+H(Q)-H(P)$,未知熵差可抵消 KL,因此 EFL 不是 KL 估计器,只能与 AFL 并列报告。

方法步骤详情

第一步,准备:固定 $C=(m,v,q,\phi,E)$、$J=12$ 个冻结上下文与请求配置,发送前做粗粒度参数拒绝检查(A2),运行时 nonce 保证新鲜性(A6:防预计算、不防语义识别)。第二步,参考采集:每上下文向参考查询 1 次得 $\pi_j$,$M\pi_{ji}<1$ 的类别并入 OTHER,$R$ 条路由共享这 12 个向量。第三步,AFL 测量:每上下文向目标发 $M$ 次($N_{target}=RJM=600$ 次单 token 调用),计数 $N^r_{ji}$;设 $\theta^r_{jr}\sim Dirichlet(\tau\pi_j)$($\tau=1$),用 digamma 公式算后验期望粗化 KL,减去 20000 次零抽样估计的逐上下文基线,平均得 $S_r$,对联合零分布做单侧检验并 Holm 校正。第四步,辅助检查:对暴露 logprob 的路由按同一映射聚合得比较器,仅作内部验证。第五步,EFL 测量:$B=20$ 次独立运行,目标生成 $T=500$ token,参考重打分设硬门槛(精确前缀被接受、500 位置全部有效),逐位算 $e^r_{b,t}$、整段平均为 $D_{r,b}(500)$,报告中位数、SD、$q_{0.95}$ 与最大值。第六步,下游探索:各路由跑 GPQA-Diamond 与 Terminal-Bench,按任务暴露四分位分析通过率。

技术新颖性

与最近工作逐项对比:Gao et al. 的两样本等价检验需 200–250 次调用/检验且一个判定聚合 10 次检验,隐式假设端点静态;RUT 把推理转移到本地参考(10000 次生成加 logits),只报告秩均匀性;LLMmap(每参考模型约 1200 次采集调用)与 FLIPS 输出闭集身份标签而非校准效应量;B3IT 与"You've Changed"只监测输出 token 或语言特征分布,不做参考相对的零假设推断;KVV 花 4000 次调用测能力,但未把路由当作分布。Ventor-QTest 的差异化:(1) 首次把部署验证建立在"服务窗口随机过程"上,区分 $A_r$ 与 $X_r(m)$ 两种失效模式;(2) 用参考中心化狄利克雷后验加逐上下文零基线,把纯文本计数变成带置信区间的粗化 KL 估计;(3) EFL 保留全部运行级观测的经验分布而非均值或二值标签,并明确其非 KL 属性;(4) 成本结构不对称:均值组件目标端仅 600 次单 token 调用,运行级把 10000 次前缀重打分开销留在可信参考侧。论文还用先验无关的 Pearson 散度 U 统计量做敏感性检查,确认排序不依赖狄利克雷校正。

Composite Ventor-QTest pipeline. Repeated requests to fixed contexts report AFL as a within-window mean coarsened-KL statistic, while independent long-sequence runs report EFL from the empirical upper tail of all observed centered-surprisal deviations.
Figure 1: Composite Ventor-QTest pipeline. Repeated requests to fixed contexts report AFL as a within-window mean coarsened-KL statistic, while independent long-sequence runs report EFL from the empirical upper tail of all observed centered-surprisal deviations.

实验结果

实验覆盖七个托管 DeepSeek 路由。(1) 一致性:3 个 logprob 路由、36 个上下文–路由单元上,去除上下文固定效应后,文本计数 AFL 与 logprob 比较器的 Pearson $r=0.971$、Spearman $\rho=0.657$;路由级精确置换仅 $3!=6$ 种排列($p=0.167$),属描述性结论;按路由平均 $r=0.989$ 且秩完全一致。(2) AFL 审计:官方自检 $S_r=-0.0007$、Holm $p=0.515$ 不被拒绝,零校准正确;六个第三方路由全部以 Holm $p=0.00035$ 拒绝,偏差为 Aliyun 0.5704、StreamLake 0.2950、Baidu Qianfan 0.1875、Ark 0.1591、DigitalOcean 0.1250、DeepInfra FP8 0.1185。(3) EFL:每路由 20 次 500 token 运行中 DigitalOcean 四项指标全面最高(中位数 0.00876、SD 0.01676、$q_{0.95}$ 0.05414、最大 0.05960),StreamLake 中位数最小(0.00409)却有第二大的 SD(0.01390)与 $q_{0.95}$(0.04817),两统计量排序不同、不可互换;DigitalOcean 四批复测 $S_r$ 均值 0.13265、SD 0.01220。(4) 下游:两统计量与 GPQA-Diamond 准确率几乎无路由级关联;但 EFL 最显著的 DigitalOcean 在 Terminal-Bench 上通过率从最低暴露四分位 82.6% 跌至最高四分位 13.6%,提示长程任务对极端保真损失更敏感。

Latent objects and observed Ventor-QTest statistics. AFL and EFL name the two reported observables; they are not interchangeable estimators of a common loss.
Table 1: Latent objects and observed Ventor-QTest statistics. AFL and EFL name the two reported observables; they are not interchangeable estimators of a common loss.
AFL audit over seven routes. $S_r$ is the mean bias-corrected coarsened-KL statistic over 12 held-out contexts; intervals are 95% posterior credible intervals after subtracting the null baseline.
Table 2: AFL audit over seven routes. $S_r$ is the mean bias-corrected coarsened-KL statistic over 12 held-out contexts; intervals are 95% posterior credible intervals after subtracting the null baseline.
EFL summaries across seven route snapshots. All quantities summarize $D_{r,b}(500)$ over 20 paired runs.
Table 3: EFL summaries across seven route snapshots. All quantities summarize $D_{r,b}(500)$ over 20 paired runs.
Representative operating points for black-box verification methods. Counts are not matched-power comparisons.
Table 4: Representative operating points for black-box verification methods. Counts are not matched-power comparisons.
Auxiliary consistency check for AFL. (a) 36 context–route cells from three logprob-capable route conditions; (b) the seven-route audit, in which the official control remains at the route-level null.
Figure 2: Auxiliary consistency check for AFL. (a) 36 context–route cells from three logprob-capable route conditions; (b) the seven-route audit, in which the official control remains at the route-level null.
查看结构化数据
任务指标本文基线提升
AFL 黑盒统计与 logprob 比较器的一致性(3 个路由、36 个上下文–路由单元) Pearson r / Spearman ρ(去除上下文固定效应) r=0.971 / ρ=0.657;按路由平均后 r=0.989 且秩完全一致(路由级精确置换 p=0.167,仅 6 种排列,属描述性证据) logprob 导出的粗化 KL 比较器(由目标路由提供,作内部一致性参照) 证明纯文本计数统计与提供方 logprob 推导的散度高度一致,无需 logits 即可近似同一估计目标
七路由 AFL 审计(12 个冻结上下文) S_r(偏差校正平均粗化 KL,95% 后验置信区间 + Holm p) 官方自检 −0.0007[−0.0144, 0.0193],p=0.515 不被拒绝;六个第三方路由 0.1185–0.5704,全部 p=0.00035 拒绝零假设 官方端点自检(零假设参考,期望居零) 最大偏差 Aliyun 达 0.5704;所有第三方路由与官方显著区分,同时官方对照组验证了零校准无偏
长序列极端保真损失(每路由 20 次 × 500 位置独立运行) D_500 的中位数 / SD / 经验 q0.95 / 最大值 DigitalOcean 全面最高:0.00876 / 0.01676 / 0.05414 / 0.05960;StreamLake 中位数最小 0.00409 但 q0.95=0.04817、最大 0.04969 官方自检:0.00545 / 0.00835 / 0.02484 / 0.03498 发现 AFL 完全无法捕捉的路由特定上尾风险(StreamLake AFL 中等偏大但 EFL 尾部第二重,DigitalOcean 双高)
GPQA-Diamond 准确率与审计输出的关联 AFL/EFL 与准确率的路由级关联 两个统计量均无可检测的显著关联 —(探索性分析,无外部基线) 表明短型知识问答对保真偏差不敏感,界定了审计结果的适用范围
Terminal-Bench 通过率按任务暴露四分位分析 pass rate(最低暴露四分位 → 最高暴露四分位) DigitalOcean:82.6% → 13.6%(与最显著 EFL 并发;中间四分位缺口非单调) 其他路由未显示同等幅度的随暴露下降 提供"长程智能体任务对极端保真损失更敏感"的探索性证据,支撑联合报告 AFL+EFL 的实践建议

局限与改进

作者坦承的限制:审计结论只在 12 个冻结上下文、预声明粗化映射、声明配置与采集窗口内成立,拒绝有限探针零假设不等于拒绝普遍一致性条件(式 2),也无法定位是 checkpoint、量化还是路由策略变了;多项独立性近似(A4b)会被缓存亲和、批处理或会话路由破坏,过散使区间与 p 值偏乐观;参考类别向量视为固定(A5),参考抽样不确定性与漂移未传播进区间;A3 要求参考端支持 logprob 与前缀续写;运行级统计量不是 KL 估计器,未知熵差 $H(Q)-H(P)$ 可抵消散度项;20 次运行只能描述经验上尾,无法估计稀有事件概率或潜在 $X_r(m)$;对能完美识别审计流量的自适应选择性路由,方法不提供检测保证。我自己的观察:探针集仅 12 个上下文且只覆盖 DeepSeek 一个模型族,跨族泛化未知;路由级一致性检验受限于 $3!=6$ 种排列,证据偏弱;Terminal-Bench 四分位缺口非单调且与基准窗口不同步,因果解释不牢固;运行级组件每路由 10000 次参考重打分,多家提供方同时审计成本不低。

独立分析的弱点

第一,固定且有限的 12 上下文探针集是对抗面上最脆弱的一环:一旦泄露或被识别任务家族,提供方可用字典分类器 $h(x)=\mathbf{1}[x\in S]$ 把审计流量全部路由到忠实模型,使审计失效。改进方向:动态生成探针、使探针分布与真实用户流量匹配(借鉴 RUT 的普通任务提示思路),或设计带密码学承诺的秘密探针协议。第二,12 个上下文带来较宽置信区间(如官方自检[−0.0144, 0.0193]横跨零点),功效受限;可引入序贯检验与自适应停止规则。第三,"参考向量固定"假设在参考自身漂移时失效,可用层次贝叶斯把参考不确定性传播进区间与 p 值。第四,EFL 的符号期望混入熵差项、理论上不是散度;可设计配对探针分离 $D_{KL}(Q\|P)$ 与 $H(Q)-H(P)$,或用极值理论对上尾做参数化拟合,把描述尾部升级为估计 $X_r(m)$。第五,下游探针与基准窗口不同步、每路由仅 20 次运行、四分位缺口非单调;应做时间对齐采集并增加独立窗口,把并发观察升级为因果证据。第六,全部实验限于单一模型族,跨族假阳性率与功效需专门校准。

未来方向

作者指出的方向:用更多独立服务窗口做时间对齐的探针–基准同步采集,确认极端保真损失对长程任务正确性的因果贡献;把 $X_r(m)$ 从动机性概念变成可估计对象;把审计范围从文本生成扩展到完整 API 语义 $E$(工具调用格式、多模态预处理、智能体环境交互)——这些正是 KVV 指出行为审计覆盖不到的能力面。基于本文成果可延伸的方向:(1) 与远程证明/硬件级可信执行结合,弥补"无法归因是哪个组件变化"的短板;(2) 用极值理论(GEV/超阈值 POT 模型)对小样本运行级上尾做参数化推断,估计稀有劣化概率;(3) 面向自适应对手的探针保密机制,例如逐会话轮换探针、基于承诺的探针生成、可公开验证而不可预知的挑战构造;(4) 把 AFL 的参考中心化狄利克雷估计器移植为流式 API 变更监控,与 Log Probability Tracking、B3IT 形成互补的持续审计管道;(5) 利用 12 个共享参考向量做跨提供方的联合推断与方差缩减,实现多厂商排名检验;(6) 成本敏感的审计预算规划:给定漏检/误检的代价,求解 AFL 窗口数与 EFL 运行数的最优配比。

复现评估

代码已开源,位于 GitHub 仓库 Tencent/AI-Infra-Guard 的 services/api_checker/ventor_qtest 路径。复现需要三类资源:(1) 可信参考端点,必须支持 next-token logprob 与 assistant 前缀续写(论文以官方 API 为参考,是最大外部依赖);(2) 被测第三方路由——论文用七个 DeepSeek 快照(Aliyun 0731、Ark 0731、Baidu Qianfan 0731、StreamLake、DeepInfra FP8、DigitalOcean 等),但真实路由状态随时变化,复现完全相同的数字基本不可能,可复现的是方法与流程;(3) 计算成本温和:均值组件每路由 600 次单 token 调用加 12 次共享参考调用,运行级组件每路由 20×500 个目标 token 加 10000 次参考前缀重打分,20000 次零抽样是纯 CPU 模拟。协议细节在附录 B 以采集工件保存,未保存字段也显式声明而非事后重构,对复现友好。总体难度中等:统计代码自包含,主要门槛是 logprob 合规的参考端点、多路由 API 预算,以及下游基准(GPQA-Diamond、Terminal-Bench)的评测框架与智能体运行时。