← 返回 2026-07-31

OmniScope:面向全模态大语言模型的模态解耦Token压缩 OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiaowu Zheng 📅 2026-07-28 👍 6 2026-08-05 19:06
Token压缩 全模态大语言模型 推理加速 视频理解 跨模态对齐

免训练的模态解耦Token压缩框架,共享查询但独立估计各模态显著性,实现3.53倍预填充加速

前置知识

全模态大语言模型(OmniLLM)

全模态大语言模型能够联合处理视觉、听觉和文本三种模态,实现端到端的音视频理解。代表性开源系统如 Qwen2.5-Omni,它由视觉编码器、音频编码器、投影层和LLM主干四部分组成:视频被分解为视频帧序列与音频流,分别经两个编码器转成Token序列 $Z_v=\Phi_v(X_{vid})$ 与 $Z_a=\Phi_a(X_{aud})$,再投影到LLM的嵌入空间与文本Token一起处理。相比只处理图像/文本的视觉语言模型,OmniLLM能捕获视觉场景与声学信号之间的协同语义,在视频问答、内容审核等任务上优势明显。

本文的研究对象与压缩目标都是OmniLLM特有的音视频联合Token,理解其架构(尤其时间窗口交错机制)才能明白为何Token压缩在跨模态场景下尤其困难。

时间窗口交错机制(Time-window Interleaving)

OmniLLM将音频和视频流切成 $W$ 个固定时长的时间窗,每个窗内共时的视觉Token和音频Token拼接成一个跨模态块 $B_i=[Z_v^{(i)};Z_a^{(i)}]$,再按时间顺序排列成LLM的完整输入序列 $X_{LLM}=[B_1,B_2,...,B_W]$。这意味着同一窗口内的音视频Token共同参与自注意力计算。关键后果是:窗口内的冗余Token会稀释分配给真正重要的跨窗口Token的注意力预算,因此压缩不仅省算力,还能增强跨窗口、跨模态的交互。

这是理解本文核心动机(注意力稀释)和方法(为何要在窗口层面分预算)的基础,也是OmniZip等单向引导方法有效的原理所在。

跨模态显著性错配(Cross-modal Salience Mismatch)

对于同一个查询,视觉上决定性的时刻往往在听觉上毫不起眼,而音频关键的片段在视觉上可能几乎没有变化。论文用哨声的例子说明:问题“哨响后裁判做了什么手势”,音频显著性在哨响处早期达峰,视觉显著性则在手势处晚期达峰。作者在1197个查询-视频对上用CLIP与CLAP分别打分并计算Spearman相关,发现约78.3%的样本仅呈现弱相关($|\rho|<0.3$),分布几乎以零为中心。这说明跨模态显著性错配是普遍现象而非偶然个例。

这是整篇论文立论的关键。如果错配普遍,那么用一种模态的显著性去指导另一种模态保留内容的单向引导方法就会在高压缩比下系统性丢失关键信息,这正是本文要解决的核心问题。

Token压缩:剪枝与合并(Pruning & Merging)

Token压缩通过剪枝(直接丢弃)或合并(加权融合相似Token)来减少送入LLM的多模态Token数量,从而降低预填充阶段的计算与显存开销。代表性方法包括基于相似度的Token合并(ToMe,通过二分软匹配把最相似的Token对做平均)、基于查询的文本引导压缩、基于注意力的剪枝(如FastV)。本文视觉侧用剪枝(保留重要Token),音频侧用合并(避免破坏时间连续性),两者分工不同。

理解剪枝与合并的区别及其适用条件,是理解OmniScope为何对视觉用AD-STC剪枝、对音频用逐秒二分软匹配合并的设计依据。

二分软匹配(Bipartite Soft Matching)

二分软匹配是ToMe提出的Token合并算法:将 $N$ 个Token按奇偶下标分成源集 $A$ 与目标集 $B$,计算归一化后的相似度矩阵 $M=\bar{H}_A\bar{H}_B^\top$,每个源Token配对最相似的目标Token,从中选出相似度最高的 $m$ 对进行加权平均合并 $h'_{dst}=(h_{dst}+\sum h_i)/(1+|S(dst)|)$。因为只合并高度相似的Token,信息损失小且保留了时间顺序。本文将其限制在每秒片段内独立执行,以兼顾细粒度与时间连续性。

这是音频压缩模块的核心算法,理解它才能明白为何逐秒合并比相邻合并、能量过滤等粗粒度方法更能保住信息。

研究动机

OmniLLM 把视频拆成视觉帧与音频流,分别编码成Token序列后送入LLM。随着视频时长增加,音视频Token总数急剧膨胀,带来沉重的计算与显存开销并严重拖慢实时部署。Token压缩是直接的解决手段,视觉领域已有大量方法,但面向全模态联合压缩的极少。仅有的 OmniZip 与 OmniSIFT 都采用“单向跨模态引导”——让一种模态的重要性分数决定另一种模态保留哪些Token(OmniZip 用音频指导视频,OmniSIFT 用视频指导音频)。本文指出这背后藏着一个被忽视的隐患:对同一查询,音视频的相关性峰值常常出现在不同时刻(如哨声例中音频早峰、手势晚峰),导致高压缩比下非引导模态里承载答案的关键Token被系统性误删。作者量化了这一现象:在 1197 个查询-视频对上约 78.3% 仅呈现弱相关($|\rho|<0.3$)。更糟的是,注意力图分析显示压缩会显著增强跨窗口交互,于是被误删的Token会把放大的注意力引向次要线索,造成雪上加霜。

本文的目标是本文要构建一个免训练(training-free)、查询感知(query-aware)的全模态Token压缩框架,目标是:第一,在激进压缩比下仍保持接近无损的精度;第二,让框架不依赖任何跨模态引导,从根上规避显著性错配带来的信息丢失;第三,带来可观的预填充加速与显存节省,且音频打分不引入随音频长度二次增长的额外开销。作者还希望方法对模型规模(7B/3B)、压缩比和领域分布都保持鲁棒,从而给出一条适用于 OmniLLM 推理加速的简洁通用设计原则。

与已有工作不同的是,本文的独特切入角度是把“查询”和“显著性估计”解耦对待:查询在模态间是共享的语义锚点,但各模态的相关性分布不应相互借用。这与 OmniZip/OmniSIFT“用一种模态指导另一种”的本质做法完全相反。作者据此提炼出一句设计箴言——共享查询、但不共享显著性估计(share the query across modalities, but not the salience estimates)。在此原则之上,视觉侧用“锚-增量”交替帧策略兼顾全局覆盖与时间增量,音频侧用逐秒Token合并以保住时间连续性,两条支路各自针对本模态的信息结构定制压缩,而非套用同一套规则。

核心方法

OmniScope 是免训练、查询感知的Token压缩框架,整体分三阶段流水线(见 Figure 3)。直觉上,它把查询当作一把共同的“语义尺子”,但让视觉和音频各自拿着尺子量自己的相关性、各自分配压缩预算,互不干涉。具体技术路线:第一阶段查询感知打分,视觉侧用外部 CLIP(ViT-L/14@336px)算帧级余弦相似度 $s_v^{(t)}=\frac{f_I^{(t)}\cdot f_Q}{\|f_I^{(t)}\|_2\|f_Q\|_2}$,音频侧复用 OmniLLM 自带音频编码器输出与LLM嵌入层查询,靠嵌入范数门控 $g_j=\|E_Q^{(j)}\|/\max_k\|E_Q^{(k)}\|$ 给有意义词加权,再聚合得每秒分数并做衰减传播;第二阶段视觉剪枝(AD-STC),按分数按比例分配每位置预算 $n_{keep}^{(i)}=\lfloor\frac{s^{(i)}}{\sum_j s^{(j)}}\cdot N_{budget}+0.5\rfloor$;第三阶段音频合并,每秒内做二分软匹配。两模态压缩比 $\rho_v,\rho_a$ 独立配置(45%保留对应 $\rho_v=0.6,\rho_a=0.25$,25%保留对应 $\rho_v=0.8,\rho_a=0.35$)。

核心创新是把模态解耦贯彻到底,与已有方法的本质区别有三点。其一,OmniZip/OmniSIFT 都依赖单向跨模态指导(音频导视频或视频导音频),而 OmniScope 完全不跨模态比较,每模态仅依据自身查询相关性决定保留量——这直接消除了显著性错配被放大的风险。其二,视觉侧提出 AD-STC,用“锚帧/增量帧”交替分工:锚帧(偶数)靠 DPC-KNN 密度聚类保留空间最独特的Token,增量帧(奇数)捕捉相对前一锚帧的变化,并按保留比 $r$ 自适应切换打分策略,解决了现有视频时空压缩“对所有增量帧一视同仁”导致高压缩比下丢失全局覆盖的通病。其三,音频侧首次在编码后的一维时间嵌入上做逐秒二分软匹配,粒度远细于现有相邻合并/能量剪枝,且只合并不丢弃以保时间完整。

方法步骤详情

完整流程分三步,每步输入输出明确。第一步查询感知打分:输入为视频帧序列、音频段与查询 $q$。视觉用 CLIP 抽帧特征 $f_I^{(t)}$ 与查询特征 $f_Q$,输出每帧分数 $s_v^{(t)}$;音频用模型自带编码器输出 $Z_a$ 与LLM嵌入层查询 $E_Q$,先算门控相似度 $\bar{S}_{ij}=\bar{z}_a^{(i)}\cdot\bar{e}_Q^{(j)}$,权重 $w_{ij}=\text{softmax}_j(g_j\bar{S}_{ij}/\tau)$($\tau=0.05$),取top-5聚合得每秒分 $s_a^{(s)}$,再对高分秒(超80百分位)按 $b_s=\max_{s'}1+(\beta-1)\gamma^{|s-s'|}$($\beta=1.5,\gamma=0.5,R=3$)传播增强。第二步预算分配与视觉剪枝:按 $n_{keep}^{(i)}=\lfloor s^{(i)}/\sum s\cdot N_{budget}+0.5\rfloor$ 分配,$N_{budget}=(1-\rho)N_{total}$;锚帧用 DPC-KNN($k=5$近邻均值密度)保留密度最低的Token,增量帧在 $r\ge\tau_r=0.4$ 时用乘性不可替代性 $\alpha_{intra}^i\times\alpha_{inter}^i$(同时空间时间冗余才删),$r<\tau_r$ 时改用时间差(保留变化最大Token)。第三步音频合并:每秒内Token按奇偶分源/目集,算相似度矩阵 $M=\bar{H}_A\bar{H}_B^\top$,每个源配对最相似目,选相似最高 $m=N-n_{keep}^{(s)}$ 对做平均合并,超出 $\lfloor N/2\rfloor$ 则迭代。最终精简后的音视频Token送入LLM正常推理。

技术新颖性

技术新颖性体现在四方面。其一,提出并量化了“跨模态显著性错配”这一被忽视的失效模式,用 CLIP/CLAP 外部探针在1197对样本上测得78.3%弱相关,从根本上否定了单向跨模态指导的可靠性,并提炼出“共享查询、不共享显著性”的设计箴言。其二,视觉 AD-STC 的锚-增量交替是全新的:锚帧管全局语义、增量帧管时间变化,且增量帧按预算松紧自适应切换“乘性不可替代性”与“时间差”两套准则,弥补了现有视频时空压缩对增量帧一刀切、高压缩比丢全局覆盖的缺陷。其三,音频侧把二分软匹配首次下沉到编码后的一维时间嵌入、按秒切片执行,既解决了 CLAP 等外部模型秒级以上粒度太粗无法逐Token打分的问题,又比相邻合并、能量过滤等信息丢失更小。其四,整套方法免训练,音频打分完全复用正常推理已产生的嵌入,零额外显存开销,而 OmniZip 需抽取完整音频注意力矩阵(随音频长二次增长),这给长视频场景带来显著可扩展性优势。

Overview of OmniScope.
Figure 3: Overview of OmniScope.

实验结果

核心发现可逐实验展开。Table 1 主结果:在 WorldSense、DailyOmni、OmniVideoBench、Video-MME 四基准、7B/3B 两规模上,OmniScope 在所有压缩设置下平均精度均最高。45%保留几乎无损(7B较Full Tokens $+0.30$、3B $+0.03$),是唯一在7B上反超全Token基线的压缩方法;25%激进保留下,7B仅掉 $0.35$ 点而OmniZip掉 $1.55$、FastV掉 $0.82$,3B掉 $1.50$ 而OmniZip掉 $1.87$,验证了显著性错配在高压缩比下确会重创单向引导方法。Table 2 效率:7B在45%保留下预填充 $6299ms\to2195ms$(2.87×加速)、峰值显存 $28.31G\to25.14G$;25%保留下 $6299ms\to1784ms$(3.53×加速)、显存 $24.00G$(降逾15%),端到端约2.1×加速($10.965s\to5.284s$),且音频打分零额外显存。Table 3 查询引导消融:两模态都均匀压缩掉1.65点,证明动态预算不可或缺;本文全面优于视觉导音频($-0.30$差距缩小但仍不及)、音频导视觉等变体,证实单模态分数无法可靠预测另一模态。Table 4/5 视觉与音频策略消融:纯锚、纯增量、单准则均劣于完整AD-STC(纯增量掉1.65最差);音频侧优于均匀采样、平均池化、随机丢弃、能量过滤(后者掉2.75最差)。Fig.4 扫描压缩比显示OmniScope曲线最平缓、退化最优雅。附录Table 8 显示CLIP打分优于Self-Embed,且7B差距(约0.5)小于3B(约0.9),说明大模型自身视觉-文本对齐更好。

Comparison on omnimodal (audio & video) QA benchmarks at 45% and 25% retained ratios.
Table 1: Comparison on omnimodal (audio & video) QA benchmarks at 45% and 25% retained ratios.
Efficiency comparison on WorldSense.
Table 2: Efficiency comparison on WorldSense.
Ablation on query-guided scoring.
Table 3: Ablation on query-guided scoring.
Ablation on vision pruning strategy.
Table 4: Ablation on vision pruning strategy.
Ablation on audio compression strategy.
Table 5: Ablation on audio compression strategy.
Ablation results for video and audio compression ratios.
Figure 4: Ablation results for video and audio compression ratios.
查看结构化数据
任务指标本文基线提升
全模态音视频问答(7B,45%保留) 四基准平均精度 51.65(+0.30 vs Full Tokens) OmniZip 51.15(-0.20)、FastV 51.13(-0.22)、Full Tokens 51.35 唯一反超无压缩基线,较次佳OmniZip高0.50点
全模态音视频问答(7B,25%激进保留) 平均精度相对Full Tokens的降幅Δ −0.35 OmniZip −1.55、FastV −0.82、Random −1.57 精度衰减比OmniZip低约1.20点,鲁棒性显著领先
预填充加速(7B,25%保留) 预填充时间 1784.45ms(3.53×加速) Full Tokens 6299.90ms 3.53×预填充加速、峰值显存降逾15%
显存占用(7B,25%保留) 峰值GPU显存 24.00G Full Tokens 28.31G、OmniZip 26.65G(45%) 较全Token降约15.2%,为所有方法最低
查询引导消融(3B) WorldSense+DailyOmni平均 52.70(完整模态解耦) 音视频均匀压缩51.05(−1.65)、音频导视频51.60(−1.10) 证明各模态独立动态预算最优

局限与改进

局限性来自作者承认与客观观察两方面。其一,本文评测的问答任务模型只生成简短选项答案,解码阶段KV缓存与计算开销可忽略,因此加速主要体现在预填充;在长生成场景(如视频字幕)虽CLIP固定成本会被摊薄(附录C显示其占端到端比例从1Token约13%降到100Token约7%),但论文未给出此类任务的实际精度数据。其二,CLIP视觉打分是LLM推理流水线之外的一次性开销,使45%保留下端到端延迟(5.284s)反而高于FastV(4.584s)和OmniZip(4.508s)。其三,评测仅覆盖 Qwen2.5-Omni 的7B与3B两个规模,未在 GPT-4o、Gemini 或 VITA 等其他OmniLLM上验证,跨架构泛化性存疑。其四,仅与开源可复现的 OmniZip、FastV 比较,OmniSIFT 因需训练且未开源被排除,对比尚不够全面。其五,论文未报告训练成本外的工程部署门槛(如CLIP模型加载、与vLLM/SGLang等推理框架的集成),实际落地收益待验证。

独立分析的弱点

独立分析有四点弱点及改进方向。第一,CLIP外置打分带来固定开销且拖累短问答端到端延迟。改进方向:把视觉打分也做成流式/与LLM流水线重叠,或用更轻量的蒸馏视觉编码器,乃至在足够强的模型上用Self-Embed替代(附录D显示3B上Self-Embed掉约0.9、7B仅约0.5,大模型已基本够用)。第二,方法仅依赖查询文本做相关性,对无明确查询或开放式理解(视频字幕、摘要、密集描述)任务适配性未验证。改进方向:引入无查询的显著性先验(如运动能量、新颖度)或用通用提示作为软查询。第三,所有超参在全基准固定无逐数据集调优,虽显鲁棒但未给出预算分配的比例式是否在极端长视频(128帧上限之外)仍最优,长时序下每秒预算分配可能退化。改进方向:研究时长自适应的预算分配与层次化时间聚合。第四,仅与少数基线对比、且OmniSIFT缺席,结论的说服力受限;同时缺少在真实业务长视频/流式场景的端到端基准。改进方向:补充更多SOTA与真实部署基准。

未来方向

作者未单列未来工作章节,但从成果可延伸出若干方向。作者侧:将“共享查询、不共享显著性”原则推广到更多模态(如文本+图像+音频三模态、触觉);在长生成任务上验证并优化端到端收益;探索把音频打分的范数门控思想迁移到其他需要细粒度对齐的场景。基于本文可延伸:其一,结合KV缓存量化、模型量化等其他效率手段做联合优化,叠加显存与速度收益;其二,研究查询感知预算分配的端到端可微学习版本,用少量数据把打分与分配联合优化而非纯启发式;其三,把AD-STC的锚-增量思想用于纯视频LLM的长视频压缩;其四,将逐秒二分软匹配扩展为可变粒度的层次合并以适配更激进的压缩比;其五,在更多OmniLLM架构(如VITA-1.5、下一代Qwen-Omni)上验证模态解耦原则的普适性。

复现评估

复现性总体良好。作者公开了代码仓库 https://github.com/MAC-AutoML/OmniScope ,并在附录 Table 7 给出全部超参(音频打分 $\tau=0.05$、top-5聚合、邻居增强 $\beta=1.5,\gamma=0.5,R=3,P=80$;AD-STC切换阈值 $\tau_r=0.4$、DPC-KNN近邻 $k=5$),且强调所有基准、两规模共用同一套配置、无逐数据集调参。评测基准均为公开数据集(WorldSense、DailyOmni、OmniVideoBench、Video-MME),基础模型 Qwen2.5-Omni 7B/3B 均开源,FlashAttention-2 启用,视频统一截断128帧。复现门槛主要在算力:需至少能运行7B多模态推理的GPU(论文用峰值28.31G显存档位),并额外加载 CLIP ViT-L/14@336px。难度中等:方法免训练降低了实现复杂度,但AD-STC的DPC-KNN、增量自适应切换与逐秒二分软匹配等模块工程细节较多,且与FlashAttention兼容的FastV适配也需自行处理。整体而言,凭论文与代码足以复现主结果,但完整系统级集成仍需相当工程投入。