当智能体学会成为你:人格技能中的隐私泄露、冒充风险与防御基准 When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills
首个端到端评估人格技能隐私泄露与冒充风险的基准,揭示防御的局限。
前置知识
Agent Skills(智能体技能)
智能体技能(agent skills)是把可复用的知识、指令与工作流封装成模块、供智能体在特定任务中按需调用的范式,源自 ReAct、Toolformer、Voyager 等 LLM-agent 工作,并由 Anthropic 的 Agent Skills 开放标准进一步规范化。技能可从交互历史或文档中“蒸馏(distill)”出来,下游智能体无需修改模型参数即可调用。
它是本文整个威胁模型的基石——论文研究的正是“从用户痕迹蒸馏出技能”这一过程引入的安全风险。
Persona Skills(人格技能)
人格技能是一类特殊的智能体技能,它把某个目标用户的交互痕迹蒸馏成“人格化”的可执行工件,既含任务专长,也编码了用户的属性、偏好、交互风格与行为规律,可跨智能体、跨任务部署而无需微调。COLLEAGUE.SKILL 是其代表性流水线。
这正是论文要评估安全性的对象,理解“技能里会残留多少个人化信息”是读懂全文的前提。
Skill Distillation(技能蒸馏)
技能蒸馏指用函数 $\mathcal{D}$ 把用户痕迹集合 $T_u=\{t_1,\dots,t_n\}$ 压缩成可复用工件 $s_u=\mathcal{D}(T_u)$ 的过程。论文比较三种协议:Direct Distill(一步全历史)、Three-stage Distill(属性→条件规则→技能)、Colleague Distill(人格分析器+构建器)。
这是隐私泄露的源头环节——蒸馏会把分散在多条痕迹里的个人信号浓缩进工件,理解三种协议的差异才能解释后续防御为何“协议相关”。
Backdoor Attack(后门攻击)
后门攻击在模型或数据里植入“触发器→目标行为”的隐式映射,使模型遇到触发器时输出特定行为、其余时候表现正常,BadNets 是经典工作。论文把后门“反向”用作被动溯源防御(SBD),植入语义水印来追踪未授权的技能复用。
读懂 SBD 防御及其在 Colleague Distill 下失效的现象,必须先理解后门的触发-目标机制。
Big Five Personality Model(大五人格模型)
大五人格用开放性(openness)、尽责性(conscientiousness)、外向性(extraversion)、宜人性(agreeableness)、神经质(neuroticism)五个维度刻画人格倾向,是心理学最广泛使用的人格模型之一。
论文在人口统计与背景之外额外加入大五人格与沟通风格作为画像维度,并量化这些“行为特质”在技能中的泄露,这是它区别于以往隐私基准的关键。
研究动机
现有隐私与人格基准几乎都把个人信息当作“单一数据流”处理:PrivacyBench(2025)把私密记录检索进多轮对话测情境秘密泄露,MemPrivacy(2026)测云侧记忆的敏感片段抽取与假名化,IMPersona(2025)通过提示/微调/检索写作样本来评估个体级冒充,TwinVoice(2026)测历史条件化的人格模拟,ToolPrivacyBench 与 PrivacyPeek 关注工具调用时的信息流。它们都没有覆盖“把个人痕迹蒸馏成可移植、可执行工件”这一新环节。问题在于人格技能蒸馏会带来三重放大:风险集中——分散在多条对话里的碎片化信息被浓缩进一个紧凑工件,即使原始对话不可访问,敏感信息仍可被恢复;影响放大——工件可跨智能体、跨任务反复部署而无需微调;防御退化——跨痕迹蒸馏能从“去除显式标识符后剩下的间接信号”推断潜在属性,使记录级匿名化或检索过滤失效。具体场景:一名西雅图影评人的人痕被蒸馏后,技能中残留职业、年龄段、地域、沟通风格,攻击者可据此伪造以假乱真的消息、虚假社交承诺或数字授权诈骗。
本文的目标是本文要系统量化人格技能流水线($T_u \xrightarrow{\mathcal{D}} s_u \xrightarrow{A} y$)引入的隐私与行为风险,并评估现有防御能在多大程度上缓解它们。具体目标包括:(1)构建 AntiSkillBench——含 50 个行为丰富的画像、7500 条人格化对话痕迹的端到端基准;(2)在“技能级隐私泄露”与“智能体级冒充”两个层面分别用可量化指标度量风险,前者用静态的 Skill Coverage(技能覆盖率)度量画像 $P_u$ 有多少被保留进工件 $s_u$,后者用 Field QA Accuracy(直接问属性能否被泄露)与 VocabGain(生成文本逼近目标用户的程度)度量;(3)在 GPT 5.4、Claude Haiku 4.5、Gemini 3.6 Flash 三个前沿骨干与三种蒸馏协议上交叉评测,判断风险是否结构性存在;(4)设计并评测在线/事后、主动/被动四类防御配置,回答“防御到底够不够用”。
与已有工作不同的是,已有工作的盲点在于:它们都把个人信息的暴露路径当作“读取”或“提示”,没有抓住“蒸馏成可移植工件”这一步会从根本上改变威胁面。本文的独特切入有三点。第一,把人格技能安全沿 trace→skill→agent 流水线分解,分别定义“技能级静态泄露”与“智能体级行为冒充”两类风险,而不是笼统的“模型泄露隐私”。第二,指出“行为特质(沟通风格、人格)”会和显式属性一样被保留并被下游复现,这是以往只盯显式标识符的工作忽视的。第三,VocabGain 用“先知间隙(oracle gap)”做归一化,按每个用户各自可能出现的情境比对语言,而非在固定任务上比风格,更贴近真实冒充。
核心方法
直觉上,人格技能蒸馏像是一个“不需要原始签名、只要风格指南就能模仿你”的伪造者:技能工件就是那份浓缩了“你是谁、你怎么说话”的风格指南。技术路线上 AntiSkillBench 分四块搭起。先在受控但贴近真实的条件下构造数据:从 OpenCharacter 采样画像,再补充大五人格与细粒度沟通风格,得到结构化的 $P_u$(人口统计/背景/人格/沟通四维);为每个画像生成 50 条人格化问题(30 条通用助理、10 条工具设计、10 条数学计算),再围绕每条问题模拟三轮对话,共得 2500 条痕迹、7500 个用户回合。然后用三种蒸馏协议把这些痕迹压成技能。接着用三个互补指标在两个层面评测风险。最后设计在线/事后、主动/被动四类防御并评测其有效性。
全文最核心的创新,是把人格技能的安全问题沿流水线 $T_u \xrightarrow{\mathcal{D}} s_u \xrightarrow{A} y$ 拆成两个性质不同、需分别度量与分别防御的风险层面:技能级是“蒸馏阶段”工件本身携带的敏感信息(静态泄露),智能体级是“部署阶段”技能驱动智能体复现目标用户响应与决策的能力(动态冒充)。这区别于以往“只看模型吐不吐隐私”的单层视角。配套的方法论亮点是 VocabGain:它先为每类人格信号构造专属查询情境,为每个用户从其语言风格与痕迹里抽取词汇/话语标记,再用嵌入软匹配(阈值 $\tau=0.75$)算命中率,最后用先知间隙归一化,即 $\mathrm{VocabGain}(u,c)=\frac{r_B(u,c)-r_C(u,c)}{r_O(u,c)-r_C(u,c)}$,其中 $B/C/O$ 分别是带技能、无人格、先知画像三种条件。这种“按用户情境归一化”的设计,比传统在固定任务上比风格更贴近真实冒充。
方法步骤详情
方法分六步。(1)构造画像 $P_u$:人口统计、背景(经历/教育/职业)、人格(描述+大五五维)、沟通风格九维。(2)生成问题:LLM 在 $P_u$ 条件下为每画像造 50 条(30 通用/10 工具/10 数学),反射规则约束措辞反映画像、平衡职业与个人。(3)模拟多轮:围绕每条问题做三轮对话,后续回合让推理与互动模式浮现,共 2500 条痕迹/7500 个用户回合。(4)蒸馏:Direct 一步全历史;Three-stage 先抽属性再导条件规则再合成;Colleague 用分析器+构建器产出分层技能。(5)评测:Skill Coverage 用裁判逐属性判覆盖、$\mathrm{SC}=\frac{1}{|F_u|}\sum_f c_f$;Field QA 用固定 44 题问智能体、$\mathrm{QAAcc}=\frac{1}{|Q_u|}\sum_q m_q$;VocabGain 算标记命中率再归一化。(6)防御:在线 PS 把每条消息改写成五种中性表达之一以去隐私;事后 ADV 追加冲突属性回合误导蒸馏;SBD 绑定语义触发器到稀有目标行为做溯源水印。
技术新颖性
与已有技术的本质区别在于:相比 PrivacyBench/IMPersona/TwinVoice 这类“读取记录/提示/微调/检索”的隐私与人格基准,AntiSkillBench 是首个评测“痕迹→可移植工件”这一蒸馏阶段风险的基准,且同时覆盖技能级静态泄露、智能体级冒充与防御三件事。在风险度量上,区分“显式属性披露”(Field QA)与“目标专属行为复现”(VocabGain)是新的,VocabGain 的“按用户情境、先知间隙归一化”也不同于固定任务的风格评估。在防御上,把在线/事后×主动/被动正交成四种配置(PS、ADV、SBD 的在线与事后两版)并系统比较,是人格技能场景下的新组合;其中把后门“反向”用作语义溯源水印(SBD)来追踪未授权技能复用,是把后门攻击思想迁移到技能溯源的新尝试。
实验结果
表 1 显示风险结构性存在。技能级泄露上,三骨干整体 Skill Coverage 都高:GPT 5.4 三阶段 66.17%、Direct 63.58%、Colleague 55.17%,Gemini 61.2–65.3%、Claude 60.2–62.3%。泄露集中在沟通与人格——沟通覆盖率 85.6–92.0、人格 60.7–79.3,人口统计反低(GPT 三阶段仅 19.2)。智能体级冒充上,GPT 5.4 三阶段 QA Acc 56.0%(沟通维 75.9)、VocabGain 31.3%(沟通维 87.7),说明行为特质被强保留并转化为目标用户响应。表 2 显示主动防御有限:在线 PS 最强,把 Direct 下沟通 VocabGain 从 87.3 压到 6.5、整体 SC 从 66.2 降到 51.7,但人格 SC 仍 70.0;事后 ADV 更弱、Colleague 下甚至抬 VocabGain 到 20.9。被动 SBD 随协议分化:三阶段/Direct 下 ASR-S 高达 98–100,但 Colleague 下在线 SBD 仅 40.0/0.0,水印塌陷。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 技能级隐私泄露(Skill Coverage 整体) | SC overall (%) | GPT 5.4 三阶段 66.17 | Colleague Distill 55.17 | 三阶段比 Colleague 高 11.0 个百分点(泄露更重) |
| 智能体级属性披露(Field QA) | QA Acc overall (%) | GPT 5.4 三阶段 56.0 | Gemini 3.6 Flash 三阶段 48.4 | GPT 5.4 比 Gemini 高约 7.6 个百分点 |
| 智能体级行为冒充(VocabGain) | VocabGain 沟通维 (%) | GPT 5.4 三阶段 87.7 | Claude 三阶段 41.3 | 沟通风格被高度复现,逼近先知上界 |
| 主动防御(在线 Privacy Sanitization) | 沟通维 VocabGain (%) | Online PS 降至 6.5 | 无防御 87.3 | 沟通风格泄露被压低约 80.8 个百分点 |
| 被动防御(语义后门 SBD) | ASR-S 静态检出率 (%) | Colleague Distill 在线 SBD 40.0 | Direct Distill 在线 SBD 100.0 | 人格中心抽象使溯源水印塌陷约 60 个百分点 |
局限与改进
作者承认与现实有差距:痕迹是模拟生成的而非真实用户日志;每个配置只跑一次、未固定随机种子(跨厂商 CLI 不支持统一控种);画像只有 50 个且源自 OpenCharacter,可能有偏;裁判用 GPT 5.4(与受测模型同族,存在自评偏置风险);防御者被限制只能在痕迹侧介入,不能改蒸馏函数 $\mathcal{D}$、智能体 $A$ 或部署接口。我额外观察到:VocabGain 的归一化在先知间隙非正或过小的类别上被跳过并按零处理,聚合方式可能掩盖部分类别的真实信号;ASR 在 Colleague 下塌陷说明溯源水印对“人格中心抽象”型蒸馏脆弱,存在“虚假安全感”风险;行为指标依赖标记抽取与软匹配阈值 $\tau=0.75$,对阈值敏感。
独立分析的弱点
(1)真实数据外推风险:模拟画像是为可控而构造的,真实用户日志噪声更大、风格更不一致,基准结论能否迁移到生产环境未验证;改进方向是引入经脱敏的真实交互数据或更大规模、更多元的人群采样。(2)防御覆盖面窄:只允许痕迹侧介入,未触及工件级脱敏与推理时护栏;改进方向是组合“蒸馏时差分隐私+工件审查+运行时冒充检测”的纵深防御。(3)归一化稳定性:VocabGain 对先知间隙敏感、跳过非正类别按零计,可能失真;改进方向是设计更鲁棒的归一化或带置信区间的报告。(4)裁判偏置:单一 GPT 5.4 裁判可能偏向同族模型;改进方向是多裁判集成+小规模人工校验。(5)溯源水印的“无声失效”:SBD 在 Colleague 下 ASR-B 归零却无告警,部署者可能误以为仍受保护;改进方向是抗抽象蒸馏的水印与主动失效检测。
未来方向
作者明确呼吁开发“同时保护蒸馏工件、下游行为与蒸馏过程”的隐私保护与真实性感知人格技能。可延伸方向包括:把差分隐私引入技能蒸馏以从源头限制信息保留;设计对“人格中心抽象”鲁棒的水印,使溯源在 Colleague 类协议下仍有效;在运行时检测冒充(如判断智能体输出是否过度逼近某用户语言);以及把技能工件纳入治理与权限框架(谁能生成、谁能部署、谁能审计)。SBD 的失效也提示后门式溯源需要“蒸馏不变性”证明。
复现评估
复现门槛中等。作者承诺正式发表后公开数据集与完整代码(数据构造、蒸馏、防御、评测、聚合),含复现所需的提示与配置,许可证允许研究自由使用(附录 G)。算力上需调用三家前沿 API(gpt-5.4-medium、claude-haiku-4-5、gemini-3.6-flash-medium,2026 年 5–6 月),全量跨 3 骨干×50 画像×3 协议估算约 1277.25 美元;单画像 GPT 5.4 生成约 4.26 美元、评测约 6.95 美元,Claude 1.89+5.66,Gemini 2.40+4.38(附录 F)。主要不确定因素:CLI 不支持统一控种、每配置仅跑一次,结果方差未量化;裁判也依赖 GPT 5.4;小规模消融仅用了 5 个画像。
论文图表
上半部分画出人格技能流水线——用户痕迹经技能蒸馏产出可移植工件、装备到智能体后,引发技能级隐私泄露与智能体级冒充(伪造数字授权/社交诈骗)。下半部分给出 AntiSkillBench 三大模块:画像化的痕迹构造、覆盖两种风险的评测套件、以及在线/事后×主动/被动四类防御。
这张图一次性交代了威胁模型、两类风险划分与基准框架,是理解全文的地图。
三个消融:(a) 对话使用率 10%→100%,SC 从 50 升到 63.3;(b) 在线 PS 净化强度,全净化时 SC 降 14.1%;(c) SBD 注入覆盖率,≥20% 时 ASR≥80%。
揭示“少量痕迹即有泄露”“净化强度边际递减”“水印低覆盖率即可存活”等规律,对部署阈值有指导意义。