← 返回 2026-07-20

智能体谈判中的行为隐私泄漏:通过随机化策略形式化与缓解推断攻击 Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies

Barkha Rani 📅 2026-07-07 👍 5 2026-07-25 18:30
侧信道攻击 差分隐私 自主谈判代理 行为隐私 随机化机制

用自适应高斯噪声保护谈判代理的私有约束,抵御行为侧信道推断攻击

前置知识

差分隐私 (Differential Privacy, DP)

差分隐私要求对相邻输入(如仅差一条记录的数据集)的查询输出分布不可区分,形式化为 $\Pr[\mathcal{M}(x)\in S]\le e^{\varepsilon}\Pr[\mathcal{M}(x')\in S]+\delta$,其中 $\varepsilon$ 越小越私密。本文创新地把“相邻”定义在私有约束空间 $|\theta-\theta'|\le\Delta$ 上,而非数据集上,并作用于可观测报价轨迹的分布。

本文所有理论保证都围绕 $(\varepsilon,\delta)$-DP 展开;理解邻接关系、噪声标定与组合定理是看懂 Theorem 1 与隐私分析的前提。

高斯机制与后处理定理

高斯机制对真实答案 $f(x)$ 加上 $\eta\sim\mathcal{N}(0,\sigma^2)$ 噪声,满足 $\sigma\ge\Delta\sqrt{2\ln(1.25/\delta)}/\varepsilon$,灵敏度 $\Delta=\max|f(x)-f(x')|$。后处理定理指对 DP 输出做任何确定性(或独立)后处理不削弱隐私。本文安全批判 $o_t^{safe}=\mathrm{clip}(\tilde{o}_t,o_{\min},\theta)$ 正是利用这一性质把隐私保证传递下去。

本文用高斯噪声标定每轮预算 $\varepsilon_t=\Delta/\sigma_t$,并依赖后处理定理证明裁剪不破坏 DP——这是机制安全性的理论基石。

顺序组合定理 (Sequential Composition)

若一个机制由 $T$ 个子机制组成,每个满足 $(\varepsilon_t,\delta_t)$-DP,则整体满足 $(\sum_t\varepsilon_t,\sum_t\delta_t)$-DP。高级组合定理给出更紧的界 $\varepsilon_{total}\le\sqrt{2T\ln(1/\delta)}\varepsilon_0+T\varepsilon_0^2$。本文多轮谈判正是顺序组合场景。

谈判是多轮交互,本文用组合定理累加 $\varepsilon_t$ 得到 $\varepsilon_{total}$,并讨论了末轮 $\sigma_T\to0$ 导致 $\varepsilon_T\to\infty$ 的隐患。

Nash 讨价还价与 Rubinstein 交替出价

Nash 讨价还价解在帕累托有效与对称性公理下最大化谈判剩余乘积;Rubinstein 交替出价模型刻画理性双方何时达成协议。本文用 Nash 剩余 $NS=o_T/\theta$(最终成交价与私有约束之比)作为效用度量,要求其不低于确定性基线 90%。

本文把隐私机制置于博弈论框架下,既要防推断又要保 Nash 剩余与收敛,理解这些效用度量才能看懂 Utility Bound (Theorem 3)。

行为侧信道与成员推断

侧信道攻击从可观测的次要信息(如时序、功耗、响应轨迹)推断机密。机器学习中的成员推断、模型反演、属性推断证明输出可泄漏隐私。本文指出谈判的报价轨迹、让步斜率、响应间隔构成“行为轨迹”,即使底层数据加密也能被推断。

本文的核心威胁模型就是“行为侧信道”,理解这条泄漏通路才能理解为何密码学保护不足、为何需要专门的随机化机制。

研究动机

自主谈判代理(如保险定价、采购合同、金融服务中的 LLM 代理)替用户谈判,其私有约束(最高预算 $\theta$、保留价)必须保密。现有防御依赖密码学——安全多方计算 MPC、零知识证明 ZKP、全同态加密 FHE——只能防止“直接披露”约束值,却挡不住一条更隐蔽的泄漏通路:谈判行为本身就是侧信道。作者给出生动例子:Alice 私有预算 $3,000,即便用零知识证明防止保险商直接读取预算,她的代理仍以 $2,600 开价、第二轮 $2,850、第三轮 $2,950,这种“早期大步、后期收敛”的加速让步模式会让精明的对手推断出预算接近 $3,000。报价值序列、让步轨迹、响应时序、收敛速度共同构成富信息的行为痕迹,任何密码学机制都无法阻止这种推断,因为信息从行为结构而非任何披露值泄漏。作者把这类此前从未在序贯谈判中被形式化研究的漏洞命名为“行为隐私泄漏 (behavioral privacy leakage)”。

本文的目标是本文目标是首次为序贯谈判代理形式化“行为差分隐私”,并构造一个可证明满足强保证的随机化机制。具体有三条硬指标:(1) 在可观测谈判轨迹上证明 $(\varepsilon,\delta)$-DP,使得任何满足 $|\theta-\theta'|\le\Delta$ 的相邻约束产生统计不可区分的报价序列;(2) 证明报价序列几乎必然收敛,并在对手保留价允许时达成协议,要求谈判成功率不低于 90%;(3) 证明 Nash 剩余 $NS=o_T/\theta$ 不低于确定性基线的 90%,且收敛轮数不超过基线 1.5 倍。机制要在不显著牺牲谈判效用的前提下,把对抗推断准确率从约 83% 大幅压低,做到“强隐私不付大代价”。

与已有工作不同的是,已有工作存在三处未被填补的空白。其一是密码学谈判文献只保护显式约束数据,完全不触碰行为侧信道,[35] 这篇并发工作虽承认行为推断是开放问题却把随机化让步推迟到未来。其二是经典差分隐私(Laplace 机制、DP-SGD、PATE、联邦学习)专为静态数据库或训练场景设计,邻接关系定义在数据集上,无法直接迁移到多轮策略交互——这里邻接关系必须定义在约束空间上,机制还须同时保收敛与效用。其三是行为 ML 泄漏研究虽证明 AI 系统会通过输出泄漏,但没有形式化序贯谈判轨迹上的推断攻击,也没给收敛保持型防御。Table 1 直观显示:没有任何先前工作同时满足“保护显式数据、行为隐私、收敛保证、实证验证”四列。本文正是首次同时填补这三处的尝试。

核心方法

直觉是把谈判看作一条随时间收敛的报价曲线,在最易暴露私有约束的早期注入最大噪声,临近收敛时收窄噪声以护效用,再用确定性安全批判器把越界报价夹回可行域。路线四步:先定义确定性基线 $o_t=o_1+(\theta-o_1)(t/T)^{\alpha}$,期望最优但让步轨迹完整暴露 $\theta$;再设计相位自适应噪声 $\sigma_t=\sigma_{\max}(1-t/T)^{\beta}$,$t=1$ 最大、$t\to T$ 归零;接着加高斯噪声 $\tilde{o}_t=o_t+\eta_t$,$\eta_t\sim\mathcal{N}(0,\sigma_t^2)$;最后安全批判 $o_t^{safe}=\mathrm{clip}(\tilde{o}_t,o_{\min},\theta)$ 强制可行。每轮 $\varepsilon_t=\Delta/\sigma_t$ 经顺序组合累加成 $\varepsilon_{total}$。整体像投资组合再平衡:早期高波动掩护意图、后期锁定成交,实验 $T=3$、$\sigma_{\max}=0.25$、$\sigma_{\min}=0.05$。

核心创新有三点,与已有方法本质不同。第一,邻接关系定义在约束空间而非数据集上:本文要求相邻预算 $|\theta-\theta'|\le\Delta$ 产生不可区分的轨迹,这是 DP 思想首次适配到序贯策略交互。第二,相位自适应噪声 $\sigma_t=\sigma_{\max}(1-t/T)^{\beta}$:噪声集中在开价轮(此时轨迹最具诊断性),临近成交时归零以护效用——这区别于标准 DP 机制对所有查询用同一噪声强度的做法。第三,安全批判器作为确定性后处理:裁剪 $\mathrm{clip}(\tilde{o}_t,o_{\min},\theta)$ 依据后处理定理保留 DP 保证,同时强制可行。三者叠加,使机制既满足 $(\varepsilon,\delta)$-DP,又能几乎必然收敛、效用仅损失 $O(\sigma_{\max}^2)$——这是密码学(不保行为)、标准 DP(不保收敛)、行为 ML(无形式化防御)都无法同时达成的组合。

方法步骤详情

按 Algorithm 1 执行,输入 $\theta$ 与 $\sigma_{\max},\beta,T$,输出满足 $(\varepsilon,\delta)$-DP 的轨迹 $\tau$。循环 $t=1..T$:基线策略算 $o_t=o_1+(\theta-o_1)(t/T)^{\alpha}$;算相位噪声 $\sigma_t=\sigma_{\max}(1-t/T)^{\beta}$,强制地板 $\sigma_t\ge0.05$ 免末轮 $\varepsilon_T\to\infty$;采样 $\eta_t\sim\mathcal{N}(0,\sigma_t^2)$ 得 $\tilde{o}_t=o_t+\eta_t$;安全批判 $o_t^{safe}=\mathrm{clip}(\tilde{o}_t,o_{\min},\theta)$ 夹回 $[o_{\min},\theta]$ 后发送,达成协议即 break。隐私核算 $\varepsilon_t=\Delta/\sigma_t$($\Delta=1.0$),整体 $\varepsilon_{total}=\sum_t\varepsilon_t$,高级组合定理给更紧界。

技术新颖性

新颖性体现在形式化、机制、理论、实证四层。形式化层:首次提出“行为差分隐私”,定义约束空间邻接结构并配以 $(\varepsilon,\delta)$-DP 保证,把 DP 从数据集语境迁移到报价轨迹分布——这是 Table 1 中唯一同时勾选行为隐私的工作。机制层:相位自适应噪声表 + 安全批判器是首个“按谈判相位校准噪声并在每轮保可行”的策略,与固定噪声或仅加密的方案根本不同。理论层:Theorem 1 在公开代理裁剪假设下证明 $(\varepsilon_{total},\delta_{total})$-DP;Theorem 2 用 Borel-Cantelli 引理证明报价序列几乎必然收敛到 $[o_{\min},\theta]$ 内不动点;Theorem 3 用 Taylor 展开给出 Nash 剩余下界 $E[NS]\ge NS(\pi^*)-O(\sigma_{\max}^2)$。实证层:在 3,000 条合成双边谈判上首次用 XGBoost/随机森林/神经网络三类对手(外加元学习自适应对手)系统评估推断抗性,提供可量化的隐私审计。

Privacy budget composition analysis(隐私预算组合分析)
Fig. 3: Privacy budget composition analysis(隐私预算组合分析)

实验结果

在 3,000 条合成双边谈判($\theta$ 从 $2,000–$8,000 均匀、$T=3$、$\sigma_{\max}=0.25$、$\sigma_{\min}=0.05$、$\Delta=1.0$、8/2 切分)上核心发现:其一,Table 2 推断准确率全面下降——XGBoost 81.7%→38.5%(降 43.2%)、随机森林 83.3%→40.2%(降 43.1%)、神经网络 83.0%→32.5%(降 50.5%),三类一致下降证明保证与推断模型无关;预测均值朴素基线仅约 10%,反证约 83% 非私有准确率确来自行为推断。其二,Table 3 效用几乎无损:成功率 97.0%→90.4%(达标≥90%)、Nash 剩余 0.890→0.908 反升(非对称裁剪)、收敛比 1.08→1.54(实测 1.43×)。其三,Table 4 消融显示 $\sigma_{\max}$ 从 0.05→1.00 时推断准确率 68.5%→26.5%、成功率稳定 90.5%–93.2%、Nash 剩余 0.889→0.954。其四,Table 5 元学习自适应对手仅把神经网络准确率从 32.5% 抬到 34.1%(+1.6%),机制对自适应对手鲁棒。

Comparison with related approaches(与相关方法对比)
Table 1: Comparison with related approaches(与相关方法对比)
Adversarial inference accuracy under baseline and randomized policies(基线与随机化策略下对手推断准确率)
Table 2: Adversarial inference accuracy under baseline and randomized policies(基线与随机化策略下对手推断准确率)
Negotiation utility under baseline and randomized policies(基线与随机化策略下谈判效用)
Table 3: Negotiation utility under baseline and randomized policies(基线与随机化策略下谈判效用)
Ablation: effect of $\sigma_{\max}$ on privacy and utility($\sigma_{\max}$ 对隐私与效用影响的消融)
Table 4: Ablation: effect of $\sigma_{\max}$ on privacy and utility($\sigma_{\max}$ 对隐私与效用影响的消融)
Privacy budget analysis(隐私预算分析)
Fig. 1: Privacy budget analysis(隐私预算分析)
Experimental results(实验结果)
Fig. 2: Experimental results(实验结果)
查看结构化数据
任务指标本文基线提升
对抗约束推断(XGBoost) 推断准确率 38.5% 81.7% −43.2 个百分点
对抗约束推断(随机森林) 推断准确率 40.2% 83.3% −43.1 个百分点
对抗约束推断(神经网络) 推断准确率 32.5% 83.0% −50.5 个百分点
谈判成功率 Success rate 90.4% 97.0%(确定性) 仍满足 ≥90% 目标
Nash 剩余 NS=o_T/θ 0.908 0.890(确定性) +0.018(非对称裁剪所致)
自适应对手鲁棒性 神经网络推断准确率 34.1%(元学习自适应) 32.5%(标准) 仅 +1.6%,攻击增益微弱

局限与改进

作者明确承认多处局限。第一,仅处理单议题双边谈判,多议题/多方需新邻接定义与组合分析(Sec 4.7 仅给出多元高斯雏形)。第二,实验全用 3,000 条合成数据,缺乏大规模真实谈判数据集强化经验主张——作者解释真实数据因保密限制难以获取。第三,$\varepsilon_{total}$ 在典型设置($T=3$、$\sigma_{\max}=0.25$)绝对值偏大,需用 Rényi DP 或零集中 DP 做更紧核算。第四,威胁模型只针对被动对手,能主动出价探测约束的积极对手是重要未来方向。第五,实验裁剪到私有 $\theta$(为与基线对比),而 Theorem 1 的形式保证要求公开代理裁剪 $\bar{\theta}\ge\theta$,二者间的缺口靠经验结果兜底,端到端形式核算留待未来;同时裁剪边界本身是泄漏信道(Sec 7.3)。第六,报告指标均为点估计,未给 bootstrap 置信区间,也未对比固定噪声与 Laplace 机制基线。

独立分析的弱点

独立分析有三处弱点值得改进。其一,裁剪边界泄漏未彻底闭合:安全批判把报价夹到 $[o_{\min},\theta]$,对手若观察到报价从不越过某天花板,可反推 $\theta$;作者虽提出公开代理 $\bar{\theta}\ge\theta$ 作部署配置,但若 $\bar{\theta}$ 过大又压低 Nash 剩余,需在“代理真实性”与“效用”间寻找最优 $\bar{\theta}$ 选择算法,这是可工程化的改进方向。其二,跨谈判组合预算无管理:单次谈判保证充分,但同一代理若被同一对手在多次谈判中关联观测(Sec 7.3 侧信道关联),累积隐私预算会耗尽,应在机制层引入跨会话预算分账与会话标识嵌入。其三,评估偏理想:仅 3,000 合成样本、仅 3 轮、被动对手、用训练集分布外的同结构数据评估;真实谈判中对手可能自适应且数据分布漂移,应加入积极自适应对手(如强化学习驱动的探针出价)与真实子集,并报告置信区间与多基线对比。改进方向是“公开代理裁剪 + 跨会话预算分账 + 主动对手红队评估”三件套。

未来方向

作者点名的未来方向有五:(i) 多议题与多方扩展,需新邻接定义与跨属性组合分析;(ii) 用 Rényi DP 或零集中 DP 做更紧预算核算,缓解 $\sigma_T\to0$ 导致的 $\varepsilon_T\to\infty$;(iii) 把裁剪到公开代理 $\bar{\theta}\ge\theta$ 作为推荐部署配置,闭合形式证明缺口;(iv) 扩展到主动/自适应对手,对手能通过策略性出价探测约束;(v) 报告 bootstrap 置信区间并加固定噪声、Laplace 机制基线。基于成果可延伸的方向有四:第一,把行为 DP 思想迁移到其他 LLM 代理交互(拍卖、招聘、客服谈判),定义各自的“行为邻接”;第二,研究 $\sigma_{\max}$ 作为“承诺装置”的博弈论均衡含义,对手知情后可能更合作;第三,结合安全聚合或联邦差分隐私做跨多代理的组合预算管理;第四,把元学习自适应对手扩展为持续在线的对抗训练循环,形成攻防共同演化基准。

复现评估

复现评估中等偏上但缺开源。算法描述清晰、参数完备($T=3$、$\sigma_{\max}=0.25$、$\sigma_{\min}=0.05$、$\Delta=1.0$),计算开销极低——每轮加噪与裁剪 $O(1)$,无需 GPU,远廉价于 MPC/FHE 的多项式级开销。对手细节充分:XGBoost 100 棵深度 6、随机森林 100 棵 bootstrap、神经网络三层 [128,64,32] ReLU+Adam,训练集 2,000 条。合成数据生成规则($\theta$ 均匀采样、基线策略式 2、$\varepsilon\in\{0.1,0.5,1,2,5\}$)可重建,熟练工程师理论上可在单机数日内复现主表。但论文未提供代码、数据脚本与随机种子,未报告置信区间;Table 3 与 Table 4 在 $\sigma_{\max}=0.25$ 处成功率 90.4% 与 91.8% 的差异仅以“随机种子方差”搪塞而不给区间,精确数值复现打折扣。建议补仓库、种子、bootstrap CI。