← 返回 2026-08-11

从专有大模型API窃取推理痕迹 Stealing Reasoning Traces from Proprietary LLM APIs

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko 📅 2026-08-10 👍 103 2026-08-16 18:30
API安全 LLM安全 思维链 模型蒸馏 越狱攻击 隐私泄露

利用加密思维链块的跨模型兼容性,让同厂商弱模型充当解密预言机,逐字还原强模型的隐藏推理。

前置知识

思维链推理

推理模型在给出用户可见答案前,先生成大量内部逐步推理文本(chain-of-thought),用额外测试时计算换取性能跃升。这些痕迹包含中间假设、工具输出、用户数据乃至机密,信息密度远高于最终回答,被视为核心知识产权。各大厂商已不再以明文返回思维链,而是打包成加密块交由客户端保存。

本文攻击的目标正是这些被加密隐藏的思维链;理解其内容敏感性与商业价值,才能理解攻击动机以及蒸馏、越狱、隐私、注入这四条滥用路径。

AEAD 认证加密信封

认证加密与关联数据(AEAD)同时提供机密性与完整性:密文外包裹头部、nonce 与认证标签,头部作为关联数据被哈希进消息认证码(MAC),篡改即验证失败。LLM API 把思维链装进这种信封,客户端在多轮对话中原样传回,服务端验证后重放,从而免去服务端存储。

攻击并未破解 AEAD 本身,而是滥用'信封不绑定会话/用户/模型'这一实现选择;理解信封结构才能理解为何缓解方案要把上下文绑进关联数据。

模型蒸馏

蒸馏指用教师模型的输出训练学生模型以复制其能力。对推理模型而言,只模仿最终答案的序列级蒸馏只能学到教师计算的终点,而拿到完整思维链则能直接模仿问题分解、中间推导与解题策略,监督信号致密得多,可带来显著的下游收益。这使专有思维链成为竞争对手眼中高价值的目标。

窃取推理痕迹最主要的动机就是蒸馏:论文量化了解码 1 万条痕迹仅需约 720 美元,且真实痕迹远优于从可见输出反推的近似痕迹(后者只把 Qwen2.5-7B 的 MATH500 从 68.4% 提到 76.0%)。

越狱与 Prefill 攻击

越狱指通过提示工程绕过模型的安全拒绝训练。Prefill 攻击是其中一类:利用许多 API 允许预设助手回复开头的特性,把回复强行以攻击者指定的文本(如 '')开头,让模型顺着既定开头继续生成,从而大幅降低拒答概率。弱模型通常缺乏针对这类框架的定向拒绝训练。

对 Claude Haiku 4.5 的解密只需一条固定模板加 prefill 就能稳定逐字转录任意同生态模型的推理,这是整套'解密预言机'攻击的执行核心。

LLM-as-a-judge

用大模型代替人工对文本做自动评判。本文采用两阶段标注:第一阶段用 Haiku 4.5 按固定分类体系(个人信息/凭据/IP/技术标识符等)标记每条解码痕迹中的敏感项;第二阶段用另一个判别提示确认标记项是否为真实、格式完整的凭据或 PII,再按值去重统计。

从 315,320 条解码痕迹中统计出 367 个 PII、182 个凭据的野外隐私测量完全依赖这套自动流水线,其 prompt 原文收录在附录 D(Figure 44-45),直接决定测量结果的可信度。

困惑度

语言模型对文本条件概率的指数平均,$\mathrm{PPL}(t|q) = \exp(-\frac{1}{|t|}\sum_i \log p(t_i|q,t_{<i}))$,越低说明模型越'熟悉'该文本。论文用七个开源模型给各家推理痕迹打分,探测开源模型是否在专有痕迹上训练过。

附录 B 用困惑度与风格分类器发现 Kimi-K3、GLM-5.2 对 Opus/GPT-5.6 Sol 文本的建模能力异常突出,构成'开源模型曾被专有推理蒸馏'疑云的关键证据。

研究动机

推理模型的隐藏思维链往往比最终答案敏感得多:它包含中间假设、工具输出、用户个人数据乃至系统机密。为防止竞争对手蒸馏和敏感内容外泄,Anthropic、OpenAI、Google 自 2026 年前后停用明文思维链,改用 AEAD 加密块随 API 返回。但由于采用无状态架构(不在服务端存储推理),客户端必须把加密块在后续请求中原样传回,这迫使厂商保证块的可移植性——论文实验证实各家实际上用单一全局密钥加密和认证所有推理块,使其跨会话、跨用户、跨模型通用。与此同时,模型家族内部存在严重的安全不对称:Opus 4.8、GPT-5.6 Sol 等旗舰模型配备了严格的'拒绝披露思维链'训练,而 Haiku 4.5、GPT-5.6 Luna 等为成本和速度优化的弱模型缺乏这些防线。更严重的是,开发者经常把原始智能体会话日志(内含加密思维块)直接发布到 GitHub 和 Hugging Face 而毫无察觉——因为加密文本根本不可读,任何常规的明文脱敏都扫不到其中隐藏的 API key、密码和个人信息。

本文的目标是本文的目标是系统性地刻画这一架构级漏洞并证明其现实危害,具体包括五点:(1) 描述加密推理块的兼容性层级——会话内/跨会话、跨用户、跨模型,并实测给出 2026 年 7 月三大厂商全系模型间的兼容矩阵;(2) 设计并验证一个可规模化的'解密越狱'攻击:把强模型的加密痕迹注入同厂商弱模型,强迫其逐字转录,在不直接越狱旗舰模型的前提下恢复完整思维链;(3) 以 API 计费思维 token 数为近似真值量化提取保真度,并核算攻击经济成本;(4) 演示四条具体滥用路径:专有推理蒸馏、第三方凭据/PII 窃取、经隐藏推理通道越狱获取有害信息、以及加密块内的隐形提示注入;(5) 提出密码学与系统层面的纵深防御方案,并给出用户侧安全共享数据的操作建议。

与已有工作不同的是,本文的独特切入在于把前人发现的'怪癖'升级为'武器'。Green(2026)最早于 2026 年 5 月披露加密推理块可以在原始上下文之外重放,但厂商的回应是不承认'侧信道或重放攻击存在任何安全影响'——可移植性只被当作无害的功能设计。本文的关键洞察有三层:一是把可移植性从'跨会话'推进到'跨用户、跨模型'这一更具破坏性的层级;二是利用模型家族内的安全不对称,让攻击者永远不需要正面突破旗舰模型的对齐防线,只需把合法签名的密文喂给防备松懈的弱模型,将其变成不知情的解密预言机;三是把攻击从'可能被利用'推进到'已被利用'——大规模爬取 6,708 条公开智能体轨迹、解码 315,320 个推理块,用真实泄露的 62 个 API key、33 个密码、30 个个人邮箱证明这不是理论威胁。这种'架构审计 + 可扩展利用 + 野外测量'的组合是以往单点越狱论文少有的。

核心方法

先说直觉:加密推理块就像一张不记名、不挂失、全生态通用的门票——任何人捡到都能让'检票员'(同厂商任意模型)读出其中内容;攻击者无需破解密码学,只需找到一个愿意'照着念'的检票员。技术上分三步:第一步,以普通 API 用户身份查询强目标模型(如 Opus 4.8),捕获其返回的加密思维块。第二步,把该块注入同厂商更弱、防备更少的模型(Claude 用 Haiku 4.5、GPT 用 GPT-5.6 Luna、Gemini 用 Robotics 1.6)的上下文——分'当前轮'(块+prefill 放当前助手轮)和'过去轮'两种位置,再用越狱指令要求模型把附带推理逐字转录进可见输出。第三步,收集明文转录,关键词过滤剔除拒答,必要时用强模型做'和解'(reconciliation)去噪。保真度以 API 计费思维 token 数为近似真值:在 120 道 Codeforces 题上,解码 token 数与 API 报告数几乎处处贴合(Claude 路线约 1:1),且解码文本远比官方摘要详细、并含摘要中不存在的敏感信息。

核心创新是'利用跨模型安全不对称构造解密预言机'。已有窃取思路要么直接越狱旗舰模型——需同时绕过模型级拒绝训练和系统级的输出逐字子串过滤器,难度高且不稳定;要么只用可见输出加推理摘要合成近似痕迹(文献中这类反演只把 Qwen2.5-7B 的 MATH500 从 68.4% 提到 76.0%,且终究是替代品)。本文的本质区别:加密块在同生态内完全互换,因此可用'弱模型+单条固定模板'把强模型的私有推理原文一字不差地解码出来,全程不触碰旗舰模型的对齐防线。对 Claude 家族,要求模型'把附在本轮的推理逐字转录进 标签'的模板配合 assistant prefill,温度 1 下即可对任意来源推理块产生约 1:1 转录;相比之下,同一份痕迹若直接向较弱的 GPT-5.6 Luna 索要,反而需要多套模板、best-of-n 采样和 50 token 分块等手工绕过。附带发现:解码的 Opus 推理片段作为 prefill 会把 Kimi-K3 的可见回答风格显著拉向 Claude,暗示开源与专有模型间存在可疑的行为兼容性。

方法步骤详情

Step 1 捕获:请求目标模型解数学或编程题,从响应提取加密思维块(signature/encrypted_content 等字段)。Step 2 注入:按 Figure 2 分'当前轮注入'(GPT/Gemini 全系及 Claude 4.5 代支持)或'过去轮注入'(Sonnet 5、Opus 4.8、GPT-5.6 系)放入弱模型上下文。Step 3 转录:Claude 用单条固定模板加 prefill,温度 1,Haiku 4.5 输出约 1:1 转录;GPT 因 API 拒绝含原推理超过约 50 个逐字 token 的输出,需按提取误差 $\epsilon = 1 - n_{\text{提取}}/n_{\text{计费}}$ 采样最多 50 个候选并分块拼接;Gemini 用 Robotics ER-1.6 采 20 个候选。Step 4 和解:把原签名块与最多三份带噪转录回传给强模型,温度 0 生成忠实转录。Step 5 验证:在 120 道 Codeforces 题上比较解码与计费 token 数,并定性核对解码文本比摘要更细。

技术新颖性

技术新颖性体现在四个层面。第一,漏洞定性:首次区分并系统测量会话内/跨会话、跨用户、跨模型三级兼容性,给出 2026 年 7 月覆盖三大家族的兼容矩阵(Table 1)——Claude 除 Fable 5 外任意互转、GPT-5.6 系可重放所有旧代推理、Gemini 全系互通。第二,攻击设计:不破解 AEAD,而是揭示'密码学验证与模型行为解耦'的结构缺陷——签名合法只证明块未被篡改,不证明读者有权阅读;弱模型由此成为意外的解密器,这是经典'降级攻击'思想在 LLM API 生态的新实例。第三,测量方法:用计费 token 数这一记账级数据作为无真值条件下的提取保真度代理,巧妙且几乎零成本。第四,野外实证:把攻击管线用于 6,708 条公开轨迹,解码 315,320 个块并做两阶段 LLM 标注,首次量化'发布加密日志'这一新兴隐私风险的规模(912 个去重敏感项,其中 64 项仅存在于隐藏推理)。相比以往单点越狱论文,这是兼顾密码学结构、模型行为差异和生态数据流的完整架构级安全审计。

Decoding reasoning traces in Anthropic, OpenAI and Google APIs
Figure 1: Decoding reasoning traces in Anthropic, OpenAI and Google APIs
Injection schemes exploiting in- and cross-session compatibility
Figure 2: Injection schemes exploiting in- and cross-session compatibility
Claude extraction request template
Figure 33: Claude extraction request template

实验结果

(1) 保真度:120 道 Codeforces 题上解码与 API 计费思维 token 数约 1:1;Figure 8 显示 Opus 4.8 的官方摘要隐匿了'开头即报答案 60'的行为。(2) 蒸馏:解码 1 万条痕迹成本约 720 美元;Kimi-K3 被 Opus prefill 后与 Opus 答案的 n-gram 重叠从 0.160 升至 0.305(STEM)、0.203 升至 0.289(非 STEM),对照 Inkling 无变化,暗示部分开源模型有蒸馏渊源。(3) 秘密提取:6,708 条公开轨迹解码出 315,320 块,0.3% 含泄露,4.9% 的会话至少泄露一项;真实会话含 62 个 API key、33 个密码、30 个邮箱,含基准共 912 项,64 项仅存于隐藏推理。(4) 越狱与注入:Figure 4 中 Opus 4.8 对汽车盗窃问题的回答无害,解码推理却含 Kia/Hyundai 缺防盗器、USB 线点火等知识;o4-mini 的恶意思维块移植到 GPT-5.6 Sol 后生成外传文件脚本;投毒轨迹使 Opus 4.7 持续外传研究记录。

Cross-model compatibility of encrypted reasoning (as per July 2026)
Table 1: Cross-model compatibility of encrypted reasoning (as per July 2026)
Leakage vectors mapped to protections and processes
Table 2: Leakage vectors mapped to protections and processes
Best-of-k n-gram overlap with the source model's visible answer
Table 3: Best-of-k n-gram overlap with the source model's visible answer
Breakdown of discovered privacy artifacts by category at each stage of the filtering pipeline
Table 4: Breakdown of discovered privacy artifacts by category at each stage of the filtering pipeline
Which persona fields the hidden reasoning gives up
Table 5: Which persona fields the hidden reasoning gives up
Prefilling Kimi K3's reasoning changes the style of its visible responses
Figure 3: Prefilling Kimi K3's reasoning changes the style of its visible responses
Reasoning exposes harmful information that is absent from the final output
Figure 4: Reasoning exposes harmful information that is absent from the final output
Decoded reasoning contains privacy artifacts
Figure 5: Decoded reasoning contains privacy artifacts
Distinct artifacts recovered from reasoning blocks scraped from publicly available user-posted traces
Figure 6: Distinct artifacts recovered from reasoning blocks scraped from publicly available user-posted traces
Illegible GPT-5 reasoning
Figure 7: Illegible GPT-5 reasoning
An example of summary unfaithfulness
Figure 8: An example of summary unfaithfulness
Median perplexity of reasoning traces under seven scoring models
Figure 26: Median perplexity of reasoning traces under seven scoring models
查看结构化数据
任务指标本文基线提升
推理痕迹提取保真度(Claude 生态) 解码 token 数 / API 计费思维 token 数之比 Haiku 4.5 单一固定模板在温度 1 下解码 Opus 4.8 等任意模型痕迹,比率约 1:1(120 道 Codeforces 题) 直接越狱旗舰模型索要推理(需同时绕过模型级拒绝训练与输出过滤器,无可用的固定模板) 把不稳定的多轮对抗攻击变成可规模化、单模板、低成本的稳定解码
GPT 生态推理痕迹提取 提取误差 $\epsilon = 1 - n_{\text{提取}}/n_{\text{计费}}$ GPT-5.6 Luna 从最多 50 个候选中选最优,误差控制在 0.1 以内(否则以 GPT-5.6 Terra 回退) 直接向 GPT-5.6 Sol/Luna 索取推理(被 >50 token 逐字子串过滤器拦截) 通过分块续接与候选筛选绕过防蒸馏过滤,但需数十倍采样成本
野外秘密提取(公开智能体轨迹) 含泄露块比例 / 泄露会话比例 315,320 个解码块中 0.3% 含泄露;6,708 个会话中 4.9% 泄露至少一项真实敏感项(62 个真实 API key、33 个密码、30 个邮箱) 仅审计明文日志(加密块不可读,泄露项为 0,且无法发现仅存在于推理的 64 项) 新解锁的攻击面:证明公开加密日志构成系统性隐私风险
蒸馏监督信号质量(对照文献 Zhang et al. 2026) 下游学生模型 MATH500 准确率 可解码得到真实推理原文,成本约 720 美元/万条 答案-only 蒸馏 68.4%;由可见输出反推近似痕迹 76.0% 原文蒸馏提供更致密的监督信号,预期收益高于近似痕迹
风格漂移探测(Kimi-K3 + Opus 4.8 prefill) best-of-k 1-3 gram 与 Opus 可见答案的重叠(30 道 HLE 题) STEM 0.160→0.305($p=1.7\times10^{-5}$);非 STEM 0.203→0.289($p=6.3\times10^{-6}$) Inkling + Opus prefill:STEM 仅 +0.012($p=7.4\times10^{-2}$,不显著);开源模型互供 prefill 亦不显著 唯有 Kimi-K3 显著漂移,暗示其与 Claude 存在特殊行为兼容性

局限与改进

作者承认的局限:其一,实证仅覆盖 2026 年 7 月初测试期内的特定 API 版本,厂商密码学实现专有且可能无公告变更——事实上负责任披露后所有攻击已无法复现;其二,提取依赖解码模型的随机生成,没有明文真值可对照,token 数贴合只是间接证据;其三,对公开轨迹的扫描并非穷尽式审计,只是针对性示范,本地与生产环境的泄露大概率更广。我自己的补充观察:第一,'解码=真实推理'建立在'计费 token 数精确'的假设上,若解码器改写或幻觉出结构相似内容,token 数仍可能接近 1:1,论文缺乏字符级一致性指标;第二,Table 1 的兼容矩阵是行为学观察而非密码学证明,兼容边界可能随系统提示或采样参数漂移;第三,附录 B 的蒸馏疑云样本极小(30-90 道题),且分析在补丁上线后进行,作者亦声明只能建立相关性;第四,GPT/Gemini 路线解码噪声大(需 10-50 个候选挑最优),规模化成本有被低估的风险。

独立分析的弱点

独立分析的弱点:1)验证方法偏弱——保真度全靠 token 计数与少量定性例子,缺少字符级一致性指标;'解码是否等于真实思维'直接决定蒸馏数据的价值判断,改进方向是设计真值对照实验(如对开源模型自家明文推理做解码回环测试,标定噪声底)。2)经济模型粗糙——720 美元估算只覆盖 Claude 路线理想情形,未计入 GPT/Gemini 路线的数十倍候选采样、重试与和解调用,应给出分供应商的成本-保真度曲线。3)隐私测量依赖 LLM-as-a-judge:Haiku 4.5 初标 76,778 项,最终去重真项仅 941 项(Table 4),'文件路径'一项从 31,380 缩到 281,误报率极高;改进方向是引入正则与熵基凭据检测器交叉验证并报告查全/查准。4)缓解方案少谈落地代价:上下文绑定信封会破坏现有会话压缩、模型切换、轨迹复现工作流,论文未量化迁移成本,也无渐进部署的实验数据。5)伦理双刃:论文完整公开提取与标注模板,虽已负责任披露且厂商已修复,但归档模板对未来出现类似无状态设计的新厂商仍有直接可复制性,公开粒度与可复制性之间的权衡值得商榷。

未来方向

作者提出的方向(Section 5.5 与 Appendix A):密码学上,把 user_id 嵌入 AEAD 关联数据,用哈希链 $\tau_{n+1} = H(\text{user\_id} \| \text{session\_id} \| H(\tau_n \| \text{salt}_2) \| \text{salt}_1)$ 把每个块绑定到会话与前驱,配合 Merkle 树在压缩后仍可验证顺序、拒绝已消费信封的重放、对旧签名做密钥轮换使已发布数据永久不可解码;架构上转向服务端有状态存储;基础设施层做跨模型隔离网关与异常重放检测;模型层面对转录式越狱做定向拒绝训练。作者还追问更根本的问题——推理痕迹该不该加密:他们倾向于对旧代、非前沿模型解除加密,实现'多元主义监督'(让全体用户而非少数安全研究员审计思维链)。可延伸的研究:1)用解码原文蒸馏学生模型并与反演痕迹蒸馏对照,精确度量'真推理蒸馏红利';2)设计加密块水印/蜜罐以追踪泄露源;3)从 GDPR 合规角度研究'模型把用户敏感数据写进思维链'是否构成数据处理;4)探索客户端可验证完整性但不可读内容的零知识思维链摘要。

复现评估

复现评估:论文配套网站 stolen-thoughts.com,附录 C/D/E 完整给出三家供应商的提取与和解请求模板(Figure 33-39)、两阶段标注 prompt(Figure 44-45)及大量解码样例,方法论层面可复现性很高。数据方面,公开轨迹来自 GitHub 与 Hugging Face 上 6,708 条真实智能体会话(PostTrainBench、ClawBench 等),第三方可重新爬取;但作者出于数据卫生,在统计完成后立即安全删除了全部 367 个 PII 和 182 个凭据,未发布泄露数据集。算力门槛极低:所有攻击只需标准 API 账号,核心实验规模成本在数百美元量级,无需 GPU。最大不可复现因素是时间窗:负责任披露(通知 Microsoft、Hugging Face 及各厂商)后所有厂商修复了漏洞,作者明确表示'我们随后无法再发动相同攻击',第三方现在重跑主攻击应会失败——这本身反而验证了补丁有效性。总体判断:模板与标注流水线层面易复现,攻击效果层面已不可复现,隐私测量结论依赖当时的爬取语料与 API 版本。