迷失于压缩:抽取式提示压缩器的受控跨语言审计 Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors
英语监督的提示压缩器在非英语语言上失效,根源在训练监督而非架构
前置知识
抽取式提示压缩
用一个小模型判断上下文中哪些 token 或句子值得保留、其余直接丢弃,压缩后的提示仍是纯文本、可直接发给任何 LLM API 的成本削减技术。与 gist token、KV-cache 压缩等需要访问模型内部状态的方法不同,它对模型完全透明,是配合商业 API 最实用的一族方法。代表工作包括基于困惑度的 LLMLingua、基于 GPT-4 蒸馏标注的 LLMLingua-2,以及生产系统 Headroom 的 Kompress-v2。
本文审计对象正是这一族方法。理解其『小模型选 token、大模型消费文本』的分工,才能理解为什么选择器的训练数据语言会决定它对非英语文本的破坏方式。
令牌溢价
子词分词器的词表容量主要分配给英语,同样内容用其他语言表达通常消耗更多 token。Petrov 等和 Ahia 等的工作确立了这一不平等。在本文的平行语料上,九种非英语语言的 o200k 溢价从 1.28 倍(中文)到 1.83 倍(拉脱维亚语),印地语在 Qwen2.5 分词器下高达 4.5 倍。
溢价是压缩经济价值的出发点——非英语 token 更贵,压缩收益本应更大。论文的关键转折是证明溢价大小与压缩安全脱钩:中文溢价最小却受损最重。
归一化上下文利用率
论文的核心指标,定义为 $U_{\ell,c} = \frac{acc_{\ell,c} - acc_{\ell,\text{no-context}}}{acc_{\ell,\text{full}} - acc_{\ell,\text{no-context}}}$,即把压缩后准确率投影到『无上下文=0、完整上下文=1』的标尺上,表示压缩保留了多少可用上下文价值。迁移差距则定义为 $\tau_{\ell,c} = U_{\text{EN},c} - U_{\ell,c}$,正值表示该语言受损比英语更重。
论文所有量化结论都以 $U$ 和 $\tau$ 表述,例如中文在 GPT 上 $U=-0.03$ 意味着压缩上下文比不给上下文还糟。不懂这个指标就无法解读论文中的任何数字。
压缩监督与知识蒸馏
学习型压缩器的训练方式:让强模型(如 GPT-4 在英语 MeetingBank 会议记录上)判断哪些 token 可以删除,再把这些判断蒸馏成小分类器的监督信号。因此压缩器学到的『什么算低信息 token』完全由监督数据的语言和领域决定,而与骨干编码器(XLM-R、mBERT、ModernBERT 等多语言预训练模型)的能力是两回事。
论文的核心论断是差距源自监督语言(英语)而非模型架构:多语言编码器携带的跨语言知识没有被英语压缩监督利用。这是理解全文因果链的前提概念。
配对自助法置信区间
在同一批题目上进行有放回重采样(本文 2000 次),每次同时计算两种条件(或两种语言)的指标差,从而得到差值的 95% 置信区间。因为同一题目跨条件、跨语言完全配对,题目难度方差被自然控制,统计功效远高于独立样本比较。
论文中所有『显著』均指该置信区间排除 0。作者同时强调做了数百个检验而无多重校正,结论只建立在跨模型、跨方法、跨压缩率复现的模式上,而非任何单一区间。
keep-rate(请求压缩率与实际压缩率)
keep-rate $\rho$ 指压缩后保留的 token 比例,$\rho=0.33$ 表示保留约三分之一。关键在于压缩器经常达不到请求值:本文记录了实际率从 0.247(XLM-R 过度压缩中文)到 1.20(mBERT 处理中文反而膨胀)的极端偏离。论文将安全预算定义为满足 $U \geq 0.8$ 的最深压缩率。
全文实验按 0.75/0.5/0.33 三档组织,且『请求率与实际率偏离』本身就是论文发现的一类无声失败模式,与选择质量失败并列。
研究动机
抽取式提示压缩(如 LLMLingua-2)通过删除低信息 token 削减 LLM 推理成本,是生产环境中最实用的压缩家族,但这些方法几乎全部在英语上开发、训练和评估。与此同时,子词分词器把词表容量大头分给英语,其他语言本就承受令牌溢价:同一内容在本文九种非英语语言中比英语多花 1.3–1.8 倍 o200k token(拉脱维亚语 1.83 倍最高,印地语在 Qwen2.5 分词器下达 4.5 倍)。这意味着压缩最有价值的语言恰恰是它最未被测试的语言。如果英语监督的压缩器在非英语文本上退化得更厉害,用户会被双重惩罚:token 更贵,压缩造成的质量损失还更大。部署侧已有零星征兆——中文社区 fork headroom-zh 专门加了中文通道,因为上游英语压缩器对汉字几乎是空操作——但此前没有任何工作在受控条件下系统量化这一跨语言风险。
本文的目标是本文的目标是回答一个具体问题:抽取式提示压缩到底是缩小还是放大了非英语语言的成本劣势,以及差距的根源在哪里。为此作者构建了首个受控跨语言审计协议:使用十种语言(EN、PL、FI、ET、LV、LT、UK、ZH 简体、AR、HI,覆盖五个文字系统、四个语系七个语支)的完全平行语料,在目标模型自己的分词器里固定 token 预算,将四个学习型压缩器(三个英语监督、一个多语言训练)与四个预算匹配的确定性基线对比,在十家厂商的十一个目标模型上完成超过 25 万次评估调用,量化各语言在不同压缩率下的上下文利用损失,并区分差距来自压缩器架构、分词器行为、目标模型还是训练监督数据。
与已有工作不同的是,现有研究各自只覆盖拼图一角:分词器不平等研究(Petrov 等、Ahia 等)只测 token 定价不测压缩;LLMLingua-2 的官方评测完全只用英语,尽管其 XLM-R 骨干是多语言的;唯一的多语言压缩器 XProvence 报告了各语言绝对剪枝效果,却从未在与英语共享的目标模型上测量过跨语言迁移差距。本文的独特切入是用『审计』视角设计三层对照:保持语义内容完全不变(平行题目)、在目标分词器中匹配实际达成预算、用 full/no-context 双锚点归一化,把压缩器质量与任务难度、分词器效应和模型行为干净分离。其中最关键的一步是把『压缩监督语言』本身当作受控变量——恰好有三个英语监督压缩器和一个原生多语言监督压缩器可对照,这是文献中首次能直接检验『差距跟着监督数据走还是跟着架构走』。
核心方法
直觉上,这篇论文不做新方法,而是做一次『医学检验』式的受控实验:让十种语言回答同样的阅读理解题(Belebele,每语言 300 道平行题),把各自的上下文用不同压缩器压到相同 token 预算,喂给同一个目标模型,看压缩对各语言准确率的伤害是否不对等。技术上,核心指标是归一化上下文利用率 $U_{\ell,c} = \frac{acc_{\ell,c} - acc_{\ell,\text{no-context}}}{acc_{\ell,\text{full}} - acc_{\ell,\text{no-context}}}$,即压缩后保留了多少『可用上下文价值』;迁移差距为 $\tau_{\ell,c} = U_{\text{EN},c} - U_{\ell,c}$。被审计的学习型压缩器有四个:LLMLingua-2(XLM-R 与 mBERT 骨干,英语蒸馏监督)、Kompress-v2(Headroom 生产栈压缩器)和 XProvence v1/v2(多语言 query-aware 剪枝器);确定性基线有四个:TF-IDF 句抽取、词形还原+停用词删除、前缀截断和随机删词(后两者与实际达成预算逐题匹配)。keep-rate 取 $\rho \in \{0.75, 0.5, 0.33\}$,主目标模型为 gpt-5.4-mini 与 claude-haiku-4-5($n=300$),另九个模型在缩减网格上复现。
核心创新是把『压缩监督语言』作为受控变量纳入审计设计。此前的压缩器论文只报告英语基准,多语言压缩器论文只报告各语言绝对分数,没有人把英语与非英语放在同一目标模型、同一实际预算下做配对差值。本文的关键对照有三层:第一,平行题目加目标分词器预算匹配,排除任务难度与分词器差异的干扰;第二,预算匹配的确定性基线(截断、随机删词)——如果确定性方法在同样预算下无跨语言差距而学习型方法有,差距必然来自压缩器的选择行为本身;第三,四个学习型压缩器恰好构成监督语言的对照实验:三个英语监督(XLM-R、mBERT、ModernBERT 三种骨干)应显示差距,一个原生多语言监督(XProvence v1 在 16 种语言的 MIRACL 上用多语言 LLM aya-expanse-8b 打银标训练)若不显示差距,则根源被锁定在监督数据而非架构。v2 换用翻译版 MS MARCO 训练这一点,又把『多语言监督』细化为『多语言监督+逐语言校准』两个必要条件。
方法步骤详情
审计流程五步。第一步构建数据:Belebele 阅读理解每语言 300 道平行题作主任务;MultiEURLEX 法律文档 24 篇平行文档作长文档任务;长上下文任务把目标段落埋入 7 个同语言干扰段(约 2–3k token,150 题),辅助臂用六个欧洲核心语言。第二步生成压缩:对每题施加 full、no-context 锚点,LLMLingua-2 于 $\rho \in \{0.75, 0.5, 0.33\}$,TF-IDF 同率抽取,词形还原+停用词删除(自然预算实测),以及与实际 o200k 预算匹配的截断和随机删词;另测 Kompress-v2 与 XProvence v1/v2。第三步评估:温度 0,指令语言固定为英语,题干选项随题目语言;主模型 gpt-5.4-mini 和 claude-haiku-4-5($n=300$),gpt-5.6-luna、gemini-3.5-flash、五个开源权重模型及 Nova 2 Lite、Qwen 3.7 Plus 在缩减网格($n=150$)复现,合计 25 万+ 次调用。第四步统计:逐题配对 bootstrap 2000 次重采样,计算 $U$ 值与 95% 置信区间。第五步机制诊断:统计数字 token 与大写词保留率,区分压缩破坏的是事实内容还是语法衔接载体。
技术新颖性
技术新颖性有三点。第一,这是对抽取式提示压缩的首个跨语言受控审计——此前的可迁移性审计只沿其他轴进行(如到扩散语言模型目标的迁移),跨语言轴完全空白。第二,『归一化利用率+逐题预算匹配对照』协议让方法排名可以跨语言公平比较,并得出英语评测无法得出的结论:英语内 LLMLingua-2 在 $\rho=0.33$ 领先 TF-IDF 12–14 个准确点,而九个非英语语言中该优势缩水到 −5 至 +7 点,在 GPT 上的 ET/LT/ZH 和 Claude 上的 FI/ET/LT/ZH 排名反转——即英语评测会给大半语言排出错误的推荐顺序。第三,发现并系统分类了多个英语评测完全看不见的失败模式:mBERT 变体请求压缩中文到 0.75 反而膨胀到 1.20(Han 字符级 WordPiece 破坏预算核算)、Kompress-v2 在中文上近似空操作(实际保留率 0.91–0.96)、XProvence v2 在激进阈值下对 92% 的中文输入返回空上下文且无任何报错。预算控制本身由此被确立为一个独立的迁移失败维度。
实验结果
论文报告三大发现。其一,迁移差距真实且强烈依赖压缩率:$\rho=0.75$ 时各语言几乎无差别(GPT 上仅中文显著),$\rho=0.33$ 时英语保留 57–62% 归一化利用率,立陶宛语仅 10–24%,中文在 GPT-5.4-mini 上跌至 $-0.03$——比不给上下文还糟;而中文令牌溢价反而最小(1.28 倍),说明分词定价与压缩安全脱钩;英语安全预算约 2 倍压缩,其他语言仅约 1.3 倍。其二,差距跟着监督语言而非架构走:三个英语监督压缩器全部出现差距(LLMLingua-2 XLM-R 在 $\rho=0.5$ 均值 +0.23、mBERT 变体 +0.31、Kompress-v2 为 +0.29/+0.39 且 8/8 语言显著),预算匹配的确定性方法无可比差距,多语言训练的 XProvence v1 完全无差距(均值 −0.03,0/9 显著),换用翻译数据训练的 v2 在阈值 0.5 下清空 92% 中文上下文。其三,长上下文压力测试中 LLMLingua-2@0.33 使 GPT 上 LT/LV/PL 三语上下文效用 $\leq 0$,英语仍可用。旁证:11 个目标模型全部复现差距(+0.26 至 +0.40);四个中文厂商模型的中文差距反而最大(+0.70 至 +0.82);MultiEURLEX 分类压缩几乎免费,5% 预算标题启发式 micro-F1 0.47–0.51 反超全文;NLLB 翻译后再压缩以 0.17–0.20 倍成本在 5 语中 3 语反超原生压缩。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Belebele 阅读理解:LLMLingua-2 深压缩(GPT-5.4-mini,n=300 配对题) | 归一化上下文利用率 U | EN 在 ρ=0.33 保留 0.57;LT 仅 0.10,ZH 为 −0.03(低于 no-context 锚点) | 同预算的确定性基线(截断/随机删词)在全部九种语言、全部压缩率上均无显著跨语言差距 | 量化揭示英语监督压缩器在非英语上保留的上下文价值仅为英语的零至三分之一,且 8/9 语言显著 |
| 四个学习型压缩器差距归因(ρ=0.5,GPT-5.4-mini) | 平均迁移差距 τ(EN vs 其余九语) | 英语监督三个全部为正:XLM-R +0.23、mBERT +0.31、Kompress-v2 +0.29(Claude +0.39);XProvence v1 为 −0.03 无差距 | TF-IDF、截断、随机删词、词形还原+停用词四个确定性方法均值在 −0.20 至 −0.09 附近且不显著 | 首次把差距因果定位到压缩监督数据的语言而非骨干架构 |
| 长上下文压力测试(目标段埋于 7 个干扰段,150 题) | 归一化上下文利用率 U | LLMLingua-2@0.33 下 GPT 上 LT/LV/PL ≤0,英语保持可用(Claude 上 EN 0.56 vs 其他语言 0.14–0.33) | 词形还原+停用词删除在自然预算(≈0.72)下全语言保留 44–66% | 证明激进学习压缩在非英语长上下文中净效用为负,确定性方法平滑无悬崖 |
| 翻译套利(NLLB-200 转英语再压缩,GPT-5.4-mini,n=60/语言) | 准确率(%)@ 相对 token 成本 | NLLB+LL2 成本 0.17–0.20 倍,5 语中 3 语匹配或超过原生 LL2@0.33(LT 78.3 vs 68.3,FI 78.3 vs 71.7,ET 68.3 vs 63.3) | 原生语言 LL2@0.33(成本恒为 0.33 倍) | 成本近乎减半且质量持平或更好,支持 translate-then-compress 流水线 |
| MultiEURLEX 一级 EUROVOC 主题分类(24 篇平行法律文档) | micro-F1 | 5% 预算的标题启发式达 0.47–0.51 | 完整文档 0.45–0.48 | 证明跨语言压缩惩罚是『答案依赖分布式内容』任务的属性;表面信号任务压缩到 20 倍几乎免费 |
| 跨 11 目标模型复现(ρ=0.5,缩减网格 n=150) | 平均迁移差距 τ | 10 个模型 +0.26 至 +0.40 且 ZH 列恒定最深(DeepSeek +0.82、Kimi +0.72、Qwen +0.72、MiniMax +0.70) | Nova 2 Lite 仅 2/9 显著(因上下文利用本身弱而非免疫,full−no-context 仅 16pp) | 证明差距跨厂商与代际稳定,新一代 GPT-5.6-luna 亦无改善(+0.35),中文预训练量不构成保护 |
局限与改进
作者承认的局限:十种语言、五个文字系统仍只是世界语言的一小片(六种是印欧语,缺少土耳其语这类黏着语),三个辅助臂只覆盖六个欧洲核心语言;FLORES 衍生段落带污染与翻译腔风险,虽用 no-context 锚点和归一化评分缓解而非消除,且非英语段落是英译文本、句法上更接近英语,故测得的差距对母语原生文本很可能是下界;XProvence 的 query-aware 设定更容易,其零差距是监督语言对照而非同条件质量比较;Claude 的拒答行为(无上下文时拒答率 9–31%,按错误计)是方向不明的行为混淆,但 GPT 上无拒答的结果复现了全部头条模式;段落级聚类 bootstrap 在 GPT 上零翻转(0/177);数百个区间无多重校正。我的补充观察:上下文长度上限约 3k token,远短于生产 RAG 的 10–100 倍长度,外推需谨慎;指令固定为英语而非本地化;翻译套利臂 n=60 偏小;压缩器阵容截止于特定版本(如 Kompress v0.32),对新系统需复检。
独立分析的弱点
弱点一,机制解释仍不完整:论文证明差距与监督数据强相关,但『英语监督的分类器为何破坏非英语语法衔接』只有间接诊断——数字 token 保留率 LT 0.70/LV 0.78/PL 0.70 反而高于 EN 0.61,大写词保留 EN 0.86 最高,case 最小对探针尚在母语者验证中,中文虚词删除假设(把/被/了/的等高频功能词被当作低信息删除)无直接实验。改进方向:训练集成分消融(混入不同比例多语言数据微调 LLMLingua-2,观察差距是否闭合)可直接建立因果。弱点二,XProvence 的安全性部分来自保守校准而非更好的选择:阈值 0.5 下 EN 实际保留 0.47 而 ZH 0.67、HI 0.83,即它在不确定时压得更少,该混淆未被完全剥离;可按实际保留率分桶比较各语言的选择质量。弱点三,Claude 拒答污染了 no-context 锚点与深层预算对比;可将拒答单独建模或以无拒答模型复核。弱点四,XProvence 的 16 种训练语言只覆盖本文九个非英语语言中的四个(FI/ZH/AR/HI),PL/ET/LV/LT/UK 靠骨干零样本泛化也无差距,但论文未对训练与非训练语言做分层统计检验。
未来方向
作者提出的方向:完成母语者验证的 case 最小对探针以直接检验形态机制;补充中文诊断探针检验虚词删除假设;用母语源文本复现翻译套利臂(排除 FLORES 翻译腔对 NLLB 的偏袒,当前 NLLB 本身围绕 FLORES-200 开发,其表现可能是上界);社区应报告跨语言 rate–utility 曲线而非单率英语分数。基于本文成果可延伸的方向:一,把审计协议扩展到非抽取式压缩(gist token、in-context autoencoding、KV-cache 驻留)在开源模型上的跨语言行为;二,训练『逐语言校准感知』的多语言压缩器——论文显示 v2 的失败正是校准失败(中文分数退化、阈值 0.1 下实际率 1.02、阈值 0.5 下 92% 清空),校准是比监督语言更细一层的必要条件;三,把实际保留率监控做成生产中间件:论文指出空操作、过度压缩、空输出、预算漂移四类失败都表现为请求率与实际率的偏离,可零成本报警;四,量化 query-aware 剪枝牺牲前缀缓存复用的经济学(每查询生成唯一上下文),与论文提及但未展开的缓存论点衔接;五,测试指令语言本地化与题目语言的交互。
复现评估
可复现性非常好。论文声明开源全部代码、25000+ 条带实际达成预算的缓存压缩结果、主实验臂 178000+ 条原始评估记录,仓库为 github.com/MantasLukauskas/lost-in-compression,附录 E 给出流水线细节。数据侧 Belebele 与 MultiEURLEX 均为公开平行语料;四个被审计压缩器 LLMLingua-2(XLM-R/mBERT)、Kompress-v2(Headroom)、XProvence v1/v2 均有公开权重(XProvence 与 NLLB 为 CC BY-NC 类许可,限研究用途)。目标模型多为商业 API,25 万次评估调用的费用是复现主网格的主要门槛,但论文提供了清晰的低成本路径:缩减网格(n=150、full/no-context/LLMLingua-2/TF-IDF/截断五条件两比率)即可复现头条模式;确定性基线零算力门槛;NLLB-200-distilled-600M 可在 M 系笔记本 GPU 上以每段约 1–2 秒运行。复现的真正难点在实验编排与逐题预算匹配代码的正确实现,而非资源或数据获取。
论文图表
正文第 1 节引用的令牌溢价图:同一批平行段落在 o200k 分词器下,九种非英语语言相对英语的 token 成本为 1.28 倍(ZH)至 1.83 倍(LV),在 Qwen2.5 分词器下印地语最高达 4.5 倍。论文以此为背景指出:压缩的经济价值在非英语语言本应最大。
提供全文的经济动机基线:令牌溢价衡量『压缩能省多少钱』,而后续结果表明溢价大小与压缩安全完全脱钩(中文溢价最小却受损最重),这一反差是论文的重要洞察。