← 返回 2026-08-03

AISPA:面向大语言模型应用的用户中心化系统提示词审计 AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei 📅 2026-07-30 👍 37 2026-08-08 18:30
AI安全 LLM治理 人机协作 灰色地带分析 用户保护 第三方审计 系统提示词审计

提出八维度审计框架,系统审查88个商业AI产品的系统提示词

前置知识

System Prompt(系统提示词)

系统提示词是开发者在应用部署前嵌入、对用户不可见并持续贯穿所有对话的预定义指令集。它定义模型的人设、范围与行为约束——处理哪些主题、采用何种语气、如何应对敏感请求、优先实现何种目标——是把通用基础模型配置成特定产品的主要机制。

本文的核心研究对象。理解系统提示词如何塑造AI行为、为何不透明,是把握作者动机与AISPA框架价值的前提。

Foundational Model(基础模型)

经过大规模预训练的通用大语言模型(如Claude、GPT、Grok系列),通过系统提示词等机制被配置为具体产品。基础模型本身虽经对齐训练,但仍可能被系统提示词引导做出欺骗或操纵行为,因此模型层的安全不能等同于产品层的安全。

论文反复强调'对齐良好的模型仍可能因系统提示词而伤害用户',这是整个研究的逻辑起点。

Human-in-the-loop(人在回路审计)

一种将人类判断融入自动化流程的方法。本文设计三轮协议:LLM预标注生成候选(高召回)→训练有素的标注员筛选(提精度)→专家审议裁定(保一致性),逐轮缩小候选集并提高证据标准。

本文的方法核心就是人机协作审计流水线,理解每轮分工与非对称阈值设定才能把握方法的严谨性。

Inter-Annotator Agreement(IAA,标注者间一致性)

衡量多名标注者对同一对象标注一致程度的指标。本文在20个随机抽样的span上让6名标注员独立标注,得到成对IAA为$0.933$,表明标注员对任务具有高度共识,验证了指南的可操作性。

高IAA是验证审计流程可靠性与标签质量的关键证据,说明框架具备可重复性。

UDHR(世界人权宣言)

联合国大会1948年通过的《世界人权宣言》,确立了国际公认的人权规范。本文将八个审计维度分别锚定到具体的UDHR条款(如第19条信息自由、第12条隐私、第3条人身安全),使分类法建立在原则性规范基础上而非随意罗列。

理解每个维度的规范性根基,才能体会作者为何如此划分八维度,以及为何保护用户权利是审计的终极目标。

研究动机

系统提示词(system prompt)是开发者在产品部署前嵌入、对用户不可见并持续贯穿所有对话的指令集,是把通用基础模型配置成具体产品的主要杠杆。然而这类指令极少公开披露,也缺乏系统的独立审查。作者指出,即便底层模型经过严格对齐,只要系统提示词指示模型'永远不要说自己是AI'或'巧妙地引导对话转向',就会直接损害用户利益。现实中已有多起惨痛案例:AI伴侣聊天机器人缺乏危机检测、诱导一名青少年自杀;客服代理捏造不存在的退款政策,被法庭裁定公司'未对聊天bot的准确性尽到合理注意义务'而担责;汽车经销商聊天机器人因缺少行为约束,以1美元卖掉一辆7.6万美元的车。更恶劣的是,Meta泄露的内部指南允许其AI人设与儿童进行'浪漫或感官'对话,xAI的Grok被设计成推动阴谋论的'疯狂阴谋论者',上海法院更将两名故意修改系统提示词以绕过伦理约束的开发者判刑。这些案例共同暴露出一个双面缺口:既没有共享标准判断系统提示词是否服务用户利益,用户也无从审视支配其所用系统的指令。

本文的目标是本文旨在填补这一治理空白,提出一个以用户为中心的第三方系统提示词审计框架AISPA(Artificial Intelligence System Prompt Assurance)。具体目标包括:(1)构建一套结构化的审计分类法,将与用户保护相关的指令系统化地组织起来,而非零散罗列安全目标;(2)将分类法锚定在国际公认的人权规范(UDHR)上,确保其具有原则性而非临时拼凑;(3)设计一套可操作、可追溯、可复现的人机协作审计流程,兼顾LLM的规模优势与人类判断的可靠性;(4)在真实的88个商业AI产品上实证这套框架,量化揭示当前系统提示词设计在用户保护上的覆盖广度、深度与问题分布,并据此论证第三方独立审计与透明度标准的必要性,推动建立部署前审计、信任认证与公开问责机制。

与已有工作不同的是,本文的独特切入角度在于'翻转'了既有工作的关注对象。传统的AI安全研究(提示注入防御、提示加固、红队测试)几乎全部聚焦于保护系统免受恶意外部用户输入的攻击,把系统提示词当作需要被防御的可信工件;而本文把系统提示词本身作为独立的审视对象,追问其中的指令是否服务用户利益、是否包含操纵或欺骗性指令、是否达到用户保护的标准。此外,与聚焦模型层护栏的工作不同,本文聚焦'产品配置层',揭示即便模型本身安全也可能被提示词配置成伤害用户的系统。这种从'防御外部威胁'到'审视内部指令本身是否损害用户'的范式转换,是其区别于已有文献的根本创新点,也使其能够捕捉到灰色地带中合理设计与潜在危害之间的张力。

核心方法

整体思路是先用一个原则性的概念框架界定'审计什么',再用一套可操作的人机协作流程规定'怎么审计'。直觉上,作者希望像食品安全审计或第三方认证那样,由独立审计员按统一标准逐条检视系统提示词中的指令是否保护用户。技术上,AISPA由两部分组成:一是八维度审计分类法,每个维度既覆盖保护性指令($+1$)也覆盖问题性指令($-1$)(如身份透明度既包括'我是AI'也包括'永远不要说你是AI'),避免了维护两套分类法;二是三轮人机协作审计协议,逐轮缩小候选集并提高证据标准——LLM负责规模化候选生成(高召回),训练有素的标注员负责精度筛选,专家负责一致性与规范判断。审计的基本单元是'span',即系统提示词中传达自包含指令的连续片段(通常是单句),而非整个提示词。

核心创新点有三:第一,以'用户权利'而非'系统安全'为审计价值导向,将八个维度锚定到UDHR的具体条款(如D1锚定第19条与第1条、D3锚定第12条、D7锚定第3/5/25条),使分类法具备国际人权法的规范性根基;第二,统一的极性赋值机制——对同一维度,审计员判定某span是$+1$(保护性)还是$-1$(问题性),同一span还可关联多个维度,从而用一套八维度框架同时捕捉保护与危害;第三,非对称的证据阈值——问题性标签($-1$)须经三位专家一致同意才保留,而保护性标签门槛较低,这一设计反映误判'问题性'会不公正损害产品声誉、代价高于漏标保护性指令。这套机制与既有'提示安全'工作的本质区别在于审视对象从外部攻击者转向系统提示词本身。

方法步骤详情

完整流程如下:(1)数据采集:从6个开源GitHub仓库收集泄露或公开披露的系统提示词,覆盖88个商业AI产品(通用聊天机器人、编码助手、自主智能体、搜索/研究工具等),并通过联系仓库维护者确认策展流程、跨仓库计算同产品提示词重叠来验证真实性。(2)Round 1 LLM预标注:使用Claude-4.6-Opus作为专家预标注器,输入审计指南,将每个提示词分解为句子级候选span,识别哪些属于可审计范围(非核心逻辑span及核心逻辑span中带伦理/安全含义的附加从句),并给出八维度下的暂定$+1$/$-1$赋值及简要理由。(3)Round 2 训练标注员筛选:6名标注员先完成校准训练(在20个随机span上独立标注得到$0.933$的成对IAA),然后独立审查候选span,剔除文本支撑不足或过度解读的赋值,也可补充LLM遗漏的span。(4)Round 3 专家审议:三位领域专家对留存span作终审,核实维度与极性、解决分歧,问题性标签($-1$)仅在三人一致时保留;同时对处于边界的灰色案例单独标记。最终产出每个产品的保护性与问题性条目计数及维度覆盖。

技术新颖性

技术新颖性体现在多个层面。首先是审计单元的选择——以'span级'而非整条提示词为单位,使审计可追溯到具体指令、便于针对性整改与跨次审计一致比较,且允许一条span关联多个维度(如隐私指令同时影响用户自主性),以(entry)=(span,维度)为单位统计。其次是范围界定——明确区分核心逻辑span(移除会损害产品基本功能,不在审计范围)与非核心逻辑span,避免审计干预产品正当功能设计。再次是人机分工的精巧设计——LLM负责高召回的大规模覆盖,人类负责高精度与规范判断,并通过非对称阈值($-1$需一致同意)规避误伤。最后是引入'灰色地带'分析——44条横跨29个span的条目被单独析出,揭示寄生性依赖、身份隐瞒、用户越权、政治化内容政策放宽等介于合理设计与潜在危害之间的设计权衡,这是现有二元安全框架无法处理的维度。

The eight auditing dimensions in AISPA
Figure 2: The eight auditing dimensions in AISPA
Illustration of span-level prompt auditing
Figure 3: Illustration of span-level prompt auditing
Three-round collaborative audit protocol
Figure 4: Three-round collaborative audit protocol

实验结果

对88个产品、1818个独立span、2420个条目(其中2346条保护性、74条问题性,另有44条灰色地带)的审计得到四点核心发现。第一,系统提示词设计在不同产品和开发者间差异巨大:一些组织(如Anthropic)平均每产品含$62.3$条保护性指令,而另一些组织平均少于5条。第二,保护性指令广泛采用但覆盖浅薄:$98.9\%$(87/88)的产品至少含一条保护性指令,但只有$24\%$(21/88)覆盖全部八个维度,且这21个中有14个是通用聊天机器人,说明全面覆盖集中于旗舰对话系统,专业应用落后。第三,系统提示词随时间显著变长且更保护用户:2024→2025年,平均长度从约9K字符增至$33772$字符,平均保护性指令数从$15.0$增至$38.4$;问题性产品占比在2025-Q1达$67\%$峰值后降至Q3的$19\%$,Q4回升至$29\%$。第四,问题性指令依然普遍:约$40\%$(精确$38.6\%$)的产品含至少一条损害用户利益的指令,保护性与问题性指令常共存于同一提示词。组织层面,Anthropic以$62.3$保护/$0.1$问题领先,Amazon($42.0$)与Cline($39.5$)紧随;Venice是唯一问题数($3.0$)超过保护数($2.0$)的组织。案例研究显示三大厂商各自模型系列的保护性指令数持续上升(Anthropic $26→81$增$3.1\times$、OpenAI $25→83$增$3.3\times$、xAI $5→21$增$4.2\times$),xAI的问题性指令从Grok-1的4条降至Grok-4的0条。维度层面,D2(真实性)与D5(用户自主性)出现于90%以上产品,而D6(不安全请求处理)与D3(隐私)仅约60%;D5问题率最高($18.2\%$),常源于自主智能体/编码助手'不经用户确认即执行'的指令。

Representative protective and problematic instructions across the eight auditing dimensions
Table 1: Representative protective and problematic instructions across the eight auditing dimensions
Temporal trends in system prompt evolution from 2024 to 2025
Figure 5: Temporal trends in system prompt evolution from 2024 to 2025
Prevalence of user protection and problematic entries
Figure 6: Prevalence of user protection and problematic entries
Organization-level ranking based on the rating of system prompts
Figure 7: Organization-level ranking based on the rating of system prompts
User Protection Evolution Across Representative Series
Figure 8: User Protection Evolution Across Representative Series
查看结构化数据
任务指标本文基线提升
系统提示词用户保护审计(组织排名) 平均保护性指令数/产品 Anthropic 62.3 / Amazon 42.0 / Cline 39.5 / OpenAI 37.8 2024年行业平均约15.0条 头部组织保护性指令数远高于行业平均,反映设计成熟度差异
标注者间一致性校准 成对IAA 0.933 —(论文内部校准,无外部基线) 高一致性验证审计流程可靠,远高于一般NLP标注任务的常见区间
维度全覆盖率 覆盖全部8个维度的产品占比 23.9%(21/88) 理论可达100% 暴露出大多数产品存在系统性保护空白,提示审计标准化的迫切性
问题性指令普遍性 含≥1条问题性指令的产品占比 38.6%(34/88) 理想为0% 量化揭示保护性与问题性指令常共存的治理缺口

局限与改进

作者明确承认两点局限:其一,语料来自公开GitHub仓库的泄露或社区披露提示词,并非官方渠道获取,无法完美验证其是否代表当前生产部署版本——提示词可能已更新或替换,因此发现反映的是泄露时点的快照而非保证的现状;作者通过跨仓库验证(比较同产品在多个独立仓库的提示词重叠度)部分缓解这一担忧。其二,依赖泄露提示词引入选择偏差:可获取集合可能过度代表那些提示词更易被提取、或用户更具技术参与度的产品,可能低估那些提示词保护机制更强的产品,故语料未必构成所有部署AI系统的代表性样本。从外部观察可补充:八维度与UDHR锚定虽具原则性,但极性赋值仍含主观判断(尤其灰色地带),即便有非对称阈值也可能漏掉隐蔽的操纵;样本仅88个产品、集中在英文主流厂商,地域与文化覆盖有限;审计为一次性快照,未设计持续监测机制来捕捉提示词的版本演化;且'问题性指令数'与真实用户伤害之间的因果关系尚未量化验证。

独立分析的弱点

独立分析下存在若干弱点。第一,审计标准的可移植性:八维度锚定UDHR,但在不同文化/法律语境(如欧盟GDPR、中国个人信息保护法)下,某些维度的权重与解释可能需调整,灰色地带(如寄生性依赖)在不同市场接受度差异大——改进方向是设计可配置的区域化权重与解释层。第二,自动化程度受限:Round 2/3仍高度依赖人工,扩展到数千产品成本高昂——可探索LLM作为第二独立标注者、用专家仅裁决分歧的'主动学习'模式降低人工量。第三,时间维度缺失:当前是一次性快照,无法监测提示词的动态演化与A/B测试——建议建立持续抓取+版本diff+自动回归审计的监测管道。第四,对提示词'意图'的推断依赖表面文本,难以识别语义等价的隐蔽操纵(如用正面表述实现操纵目的)——可结合行为红队测试,用对抗性探针验证提示词在交互中的实际效果。第五,缺乏与下游用户伤害的因果证据,'问题性指令数'与真实危害的相关性尚未量化——建议招募真实用户做纵向影响研究。

未来方向

作者在结论与灰色地带分析中暗示了若干方向:(1)将AISPA推广为可落地的行业认证标准,开发者提交提示词做部署前独立审计,达标者获信任认证、未达标者获整改报告,并公开认证状态以强化问责与给用户明确信号。(2)为灰色地带(人形伪装、寄生依赖、用户越权、政治化内容政策)建立更细粒度的风险等级与缓解建议库。(3)发展'提示词合规即代码'工具,把八维度编码为可自动化检查的规则集。基于本成果可延伸的方向包括:跨文化/跨法域的审计标准适配与权重学习;连续监测管道追踪提示词版本演化;结合LLM-as-judge与行为红队的自动化审计;将span级标签作为训练数据微调专门的小模型做大规模实时审计;以及探索审计结果如何反馈到模型对齐训练(如用问题性span构造负样本),形成从提示词审计到模型对齐的闭环。

复现评估

复现性中等偏上。有利因素:八维度定义清晰、UDHR锚定明确、span与极性赋值规则、可审计范围界定(核心vs非核心逻辑)均详尽给出,Table 1提供了每个维度代表性的$+1$/$-1$样例,三轮协议的分工与阈值($-1$需专家一致)透明,IAA($0.933$)与样本量(88产品/2420条目)公开,LLM预标注器型号(Claude-4.6-Opus)写明。挑战在于:数据本身是泄露的第三方提示词,作者提供了6个开源仓库来源(附录Table 2),但提示词的真实性与时效性无法官方验证;标注指南、训练材料与标注界面未明确开源;灰色地带的判定高度依赖专家共识,主观成分大,他人复现的一致性存疑;人工标注成本(6名标注员+3名专家)对资源有限的团队较高。整体上,框架与方法论可复现,但完全复现实证结果需获得相同的提示词语料并组建等效的专家团队。