OmniDelta:面向全模态大模型token压缩的技能驱动预算分配框架 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
无需训练的层次化预算分配器,在剪枝前自适应分配音视频保留预算
前置知识
全模态大语言模型 (OmniLLM)
OmniLLM 将多模态推理从图像/视频-文本输入扩展到对文本、音频、视频的统一理解。代表系统有 VITA、VideoLLaMA 和 Qwen-Omni,它们把异构的模态 token 放进同一个自回归主干中。例如 Qwen2.5-Omni 把视觉编码器-投影器输出的视频 token(每帧 72 个)和音频编码器-投影器输出的音频 token(每秒 25 个)与文本 token 拼接成一个交错序列 $X = [T; C_1; \dots; C_J]$ 一起送入 LLM 骨干进行 prefilling 和生成。
OmniDelta 的全部压缩对象就是这些进入骨干前的音视频 token。必须先理解 OmniLLM 把音视频 token 按 2 秒时间窗组成时间对齐块 $C_j = [V_j; A_j]$ 的输入组织方式,才能理解为什么预算分配要分模态层和时间层来做。
Token 剪枝 / 压缩 (Token Pruning)
Token 剪枝是在 token 进入 LLM 主干之前移除冗余感知 token 以降低推理成本的通用技术。图像方法用 token merging、early-layer filtering;视频方法利用时间显著性、帧相似性;OmniLLM 压缩则要在音视频之间考虑跨模态相关性,如 OmniZip 用音频注意力引导视频剪枝。本文用音频编码器最终自注意力分数 $\alpha_i$ 估计音频 token 重要性,并用交错时空压缩(ISTC)在视频时间窗内做剪枝。
OmniDelta 明确区分“预算分配”与“token 选择”两件事。读懂本文必须先明白:传统剪枝方法回答的是“保留哪些 token”,而本文回答的是“先该把固定预算花在哪里”,剪枝只是在已分配的局部预算内执行。
Prefilling 成本与自注意力二次复杂度
自注意力对长度为 $L$ 的序列开销随 $L^2$ 增长。OmniLLM 中一段 60 秒、2 FPS 采样的视频含 120 帧,按每帧 72 个视觉 token、每秒 25 个音频 token 计算,仅音视频输入就约 10K token。这些超长多模态上下文会主导 prefilling 计算和 KV-cache 内存,使 token 压缩成为实用 OmniLLM 推理的刚需。
理解 prefilling 成本随序列长度二次增长,才能理解为什么论文报告的 GPU 显存从 30.0G 降到 23.4G、端到端延迟 1.64× 加速这些效率指标如此重要,以及为什么要在进入主干前削减 token。
模态间预算分配 (Inter-Modal Budget Allocation)
在全模态压缩中,模型必须先决定把总保留预算 $K = \text{round}(r(N_a + N_v))$ 中多少分给音频、多少分给视频。一个声音相关的问题可能需要更多音频 token,而视觉细节问题可能需要更多视频 token。直观做法是用查询与音频/视频 token 的直接余弦相似度做路由,但本文证明这种方式由于查询编码“任务意图”、模态 token 编码“样本内容”而不可靠。
这是本文诊断的第一个核心问题(Question 1)。理解“为什么直接相似度不可靠、为什么需要技能池(skill pool)路由”,是理解 OmniDelta 层次化分配顶层设计的钥匙。
技能池 (Skill Pool)
技能池是借鉴 agent skill 方法的思路:用文本描述把可复用能力组织起来。本文用 GPT-5.5-xhigh 离线为音频导向任务(语音对话、说话人、音乐节奏、声音事件)和视频导向任务(物体场景、外观空间关系、OCR、动作运动)抽取诊断关键词并扩展为语义相关词,形成 $S_a$、$S_v$ 两个池。推理时把查询和技能词都映射到模型文本嵌入层后比较余弦相似度,得到有符号模态偏置 $m_q = p_v - p_a$。
技能池是 OmniDelta 区别于 OmniSelect 等用直接余弦相似度路由方法的关键。实验显示技能池路由在 WorldSense 上比直接相似度高出 25.5–28.6 个百分点,是读懂方法论第 3.2.1 节的前提。
Qwen2.5-Omni 与 Thinker 架构
Qwen2.5-Omni 是阿里巴巴的全模态模型,本文用了 7B 和 3B 两个尺寸。其架构含一个 Thinker 模块(多模态理解主干)和 Talker 模块。音视频 token 先经各自的编码器-投影器映射到 LLM 隐藏空间,再进入 Thinker 做逐层上下文化。论文的相似度诊断在 pre-Thinker(输入嵌入)、mid-Thinker(第 14 层)、post-Thinker(LM head 前的最终隐藏态)三个表示阶段都做了评测。
所有实验和诊断(技能相似度、隐藏态路由)都在 Qwen2.5-Omni 上完成,预算公式中的 $\Phi_v, \Phi_a$ 投影管线、72/25 的 token 配额都来自该模型的设定,不了解这些就无法复现主表实验。
研究动机
全模态大模型(OmniLLM)虽能统一理解文本、音频、视频,但超长音视频 token 序列带来巨大显存与推理开销:以 Qwen2.5-Omni 为例,60 秒、2 FPS 采样的视频含 120 帧,按每帧 72 个视觉 token、每秒 25 个音频 token 计算,仅音视频输入就约 10K token,严重拖累 prefilling 与 KV-cache。现有压缩方法(OmniZip、OmniSIFT、EchoingPixels、OmniRefine、OmniFit)几乎都只在“该保留哪些 token”上做文章,却默认固定预算:模态级与模态内预算都固定,OmniFit 甚至用固定逐层计划。作者用两套诊断证明此假设有问题。其一,直接用查询到音视频 token 的余弦相似度做模态路由几乎等同随机猜:400 条 WorldSense 查询上,跨表示阶段(Pre/Mid/Post-Thinker)与池化规则(均值/Top-3),路由准确率徘徊 50–60.8%,最好直接变体也仅 60.8%,因为查询编码“任务意图”、模态 token 编码“样本内容”。其二,模态内均匀预算保留冗余却漏关键证据:即便用带参考答案的 Oracle 剪枝,Uniform–Oracle 仍远低于 Oracle–Oracle,证明剪枝本身无法弥补糟糕的预算切分。
本文的目标是本文的具体目标是把“预算分配”从“token 选择”中分离出来,作为 token 压缩的一个独立、前置环节来研究。给定一个固定的总保留预算 $K = \text{round}(r(N_a + N_v))$,目标是在不改变总保留比例 $r$ 的前提下,自适应地决定这份预算花在哪里:先在音频与视频两个模态之间(根据查询需求)转移预算,再在每个模态内(根据内容复杂度与时间冗余)把预算重新分配到音频片段或视频帧上。作者希望最终得到的局部预算仍能与 OmniZip 等已有剪枝后端兼容,并且完全训练无关(training-free),从而在不重训 Qwen2.5-Omni-7B/3B 的情况下,既提升压缩后的准确率,又在 GPU 显存、首 token 延迟(TTFT)和端到端延迟上同时获益,建立新的准确率-效率 Pareto 前沿。
与已有工作不同的是,已有方法尽管 token 选择机制各异(基于注意力、可学习选择器、逐层/逐块策略),但都没有追问“固定预算应当如何根据查询和输入内容自适应分配”这一互补问题,本文正是切入这个被忽视的空白。独特角度有两点:其一,作者不把模态路由寄托在直接 query-to-modality 相似度上(该相似度被证明不可靠),而是借鉴 agent skill 思路,离线构造音频/视频技能池并用查询-技能相似度驱动模态间预算转移,把“任务意图”与“样本内容”解耦;其二,作者不假设模态内预算均匀,而是用局部复杂度 $C_i^m$(单元内 token 多样性)和时间冗余 $R_i^m$(与上一单元的 token 级相似度)两个信号,在每个模态内做内容感知的重分配。这种“查询驱动 + 内容感知”的层次化分配在文献中尚无对应物,是本文相对 OmniZip、OmniSelect、OmniFit 的本质差异。
核心方法
OmniDelta 把全模态 token 压缩形式化为层次化预算分配:先分配预算、再剪枝。直觉上像三角洲把固定流量的河水分流——总水量(总保留比例 $r$)不变,只改流向与分布。技术分三层:先定总预算 $K = \text{round}(r(N_a + N_v))$,并从压缩先验 $(K_a^0, K_v^0)$(复用 OmniZip 在 25% 下 50% 音频、20% 视频的切分)初始化模态预算。第一层模态间分配:用查询与离线技能池 $S_a, S_v$ 的余弦相似度得有符号偏置 $m_q = p_v - p_a$,按 $\Delta_q = \lambda_q K m_q$ 把预算从较不相关模态转移到较相关模态。第二层模态内分配:以 1 秒音频片段或单帧视频为最小单元,用复杂度 $C_i^m$ 与时间冗余 $R_i^m$ 算出居中分数 $z_i^m$,对冗余单元降下界、对复杂单元升上界,再按保留优先级分配剩余预算。第三层在局部预算内用 OmniZip 风格剪枝(音频用编码器自注意力 $\alpha_i$、视频用交错时空压缩 ISTC)选 token。整个方法训练无关、即插即用,只改预算花在哪。
核心创新是把“预算分配”当作与“token 选择”正交且前置的子问题,并用层次化、查询/内容双驱动的分配器解决,而非在固定预算下只优化选择。与已有方法三点本质区别:(1)模态间路由放弃直接 query-to-modality 相似度(诊断其约随机水平),改用离线技能池 $S_a, S_v$,把查询映射到模型文本嵌入层后比较技能词相似度,从而把任务意图与样本内容解耦——技能池路由在 WorldSense 上比最佳直接变体 60.8% 高出 25.5–28.6 个百分点;(2)模态内不用均匀预算,而用复杂度 $C_i^m$ 与时间冗余 $R_i^m$ 算居中分数 $z_i^m = (R_i^m - C_i^m) - \frac{1}{n_m}\sum(R_j^m - C_j^m)$,构造可行保留区间 $[\ell_i^m, h_i^m]$ 再按优先级 $w_i^m = \frac{1-z_i^m}{2}$ 守恒分配,复杂单元多得、冗余单元少得;(3)与 OmniSelect(需 AudioCLIP)、OmniFit(固定逐层计划)不同,OmniDelta 完全训练无关、仅 $\lambda_q, \lambda_a, \lambda_v$ 三系数,可叠加任意已有剪枝后端。
方法步骤详情
方法分三步。第 1 步模态间意图感知分配:离线用 GPT-5.5-xhigh 从 WorldSense 识别音/视频导向任务并抽词扩展成技能池 $S_a, S_v$;推理时对查询与技能词经 Thinker 输入嵌入层算归一化池化嵌入,取 TopK 得分 $r_m(q)=\frac{1}{k}\sum_{c\in\text{TopK}_k(q,S_m)}e(q)^\top e(c)$,Softmax 得 $[p_a,p_v]$ 与偏置 $m_q=p_v-p_a$,按 $K_a=K_a^0-\lambda_q K m_q$、$K_v=K_v^0+\lambda_q K m_q$ 转移预算并校正使 $K_a+K_v=K$。第 2 步模态内内容感知分配:对每单元(音频 1 秒、视频单帧)算均值 $\mu_i$、复杂度 $C_i^m$、与上一单元冗余 $R_i^m$(相邻单元重采样到等长后对位求余弦再 min-max 归一化),组合为居中分数 $z_i^m=(R_i^m-C_i^m)-\frac{1}{n_m}\sum(R_j^m-C_j^m)$;冗余单元($z_i^m>0$)降下界 $\ell_i^m=k_{0,i}^m-\lambda_m[z_i^m]_++L_i$,复杂单元($z_i^m<0$)升上界 $h_i^m=k_{0,i}^m+\lambda_m[-z_i^m]_++L_i$,按下界起、按优先级 $w_i^m=\frac{1-z_i^m}{2}$ 分配剩余预算使 $\sum k_i^m=K_m$。第 3 步预算内剪枝:音频用编码器自注意力 $\alpha_i=\frac{1}{N_a}\sum_j A_{j,i}$ 在每段内优先保留高分 token,按 2 秒块聚合得保留率作视频窗先验;视频在每 4 帧窗内用 ISTC 交替做时间剪枝(删相邻帧同位高相似 token)与空间剪枝(DPC-KNN)。7B 系数 $(\lambda_q,\lambda_a,\lambda_v)=(0.05,0.20,0.30)$,3B 为 $(0.15,0.10,0.40)$。
技术新颖性
技术新颖性四点。其一,首次把“预算分配”形式化为与 token 选择正交且前置的独立子问题,并用两套对照诊断(直接相似度路由、均匀预算-Oracle 剪枝)给出“分配本身不可被选择弥补”的实验证据,这是方法论上的概念贡献而非又一个剪枝技巧。其二,模态间路由放弃直接相似度改用离线技能池:400 条 WorldSense 查询上技能池路由以 77.7–87.5% 准确率比最佳直接变体 60.8% 高 25.5–28.6 个百分点,验证任务原型比样本内容更能反映查询意图。其三,模态内把局部复杂度(单元内 token 多样性)与时间冗余(与上一单元 token 级相似度)融合成居中分数 $z_i^m$,构造可行区间并按优先级守恒分配,是内容感知、参数极少的闭式重分配器。其四,整体训练无关、即插即用:先验预算复用 OmniZip 切分、剪枝后端沿用 OmniZip,因而不重训 Qwen2.5-Omni 即可与任何已有剪枝叠加,改变的是预算花在哪而非总保留比例,这是相对 OmniSelect(需 AudioCLIP)、OmniSIFT/EchoingPixels(需训练 STE 选择器)、OmniFit(固定逐层计划)的本质区别。
实验结果
核心发现在四基准、两尺寸、两保留率上验证。WorldSense(7B 25%)OmniDelta 44.2% 优于 OmniZip 43.2%(Full 46.8%),20% 下 43.0% 优于 42.7%;3B 25% 44.7% 优于 44.1%。AVUT(7B 25%)61.1% 优于 OmniZip 60.7%(Full 63.8%)。VideoMME(7B 25%)66.4% 略高于 OmniZip 66.3%(Full 67.3%),Short/Med/Long 均接近无损。DailyOmni(7B 25%)58.5% 优于 OmniZip 57.1%,是 7B 25% 下提升最显著(+1.4)的基准。效率(7B):GPU 显存从 Full 30.0G 降到 23.4G(降 22.0%),TTFT 1.69×(3006→1776ms),端到端延迟 1.92s 合 1.64×(3.15→1.92s),且 44.2% 准确率为压缩方法中最高。消融(Table 3)在 OmniZip 基线 56.8 上三层全开达 57.6(+0.8),DailyOmni +1.4 最大,证明三层分配互补。系数敏感性(Fig. 7)27 组 $\lambda$ 下 WorldSense 均值在 43.28–44.29% 窄带且全高于 OmniZip 43.2%,$\lambda_q$ 最敏感、$\lambda_v$ 在 0.30 附近最优。注意技能池路由机制级优势(25.5–28.6pp)仅转化为端到端 +0.5(43.5→44.0)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| WorldSense 音视频问答 (Qwen2.5-Omni-7B, 25% 保留率) | 平均准确率 (%) | 44.2 | OmniZip 43.2 / Full Tokens 46.8 | 较 OmniZip +1.0;较 Full 仅 -2.6 |
| DailyOmni 日常音视频推理 (7B, 25%) | 平均准确率 (%) | 58.5 | OmniZip 57.1 / Full 62.7 | 较 OmniZip +1.4,是四基准中最大提升 |
| AVUT 音频中心基准 (7B, 25%) | 总体准确率 (%) | 61.1 | OmniZip 60.7 / Full 63.8 | 较 OmniZip +0.4 |
| VideoMME-with-audio (7B, 25%) | 平均准确率 (%) | 66.4 | OmniZip 66.3 / Full 67.3 | 较 OmniZip +0.1,接近无损 |
| 实际推理效率 (7B, WorldSense, 25%) | GPU 显存 / 端到端延迟 | 23.4G / 1.92s (1.64× 加速) | Full Tokens 30.0G / 3.15s | 显存 -22.0%,延迟 1.64× 加速,且准确率为压缩方法中最高 |
局限与改进
作者承认的局限主要有三点。第一,技能池路由的诊断准确率优势(比直接相似度高 25.5–28.6 个百分点)并未等比例转化为端到端收益:在 OmniZip 模态内分配后端下,相似度路由与技能池路由的 WorldSense 准确率仅 43.5% 与 44.0%(+0.5),说明路由准确率只是机制级证据,最终性能还取决于模态内分配与具体剪枝后端。第二,模态间先验预算直接复用 OmniZip 的切分(25% 设置下 50% 音频、20% 视频),OmniDelta 只在该先验上做有界转移,先验本身的好坏会限制上界。第三,技能池离线用 GPT-5.5-xhigh 构造、且依赖 WorldSense 的任务类型,跨数据集/语言/领域的泛化能力未被充分验证。此外我观察到:绝对提升普遍较小(0.1–1.4 个百分点),VideoMME/AVUT 上接近持平,说明在“预算花在哪”上的收益存在天花板;实验仅在 Qwen2.5-Omni 7B/3B 上做,未覆盖其他 OmniLLM;三个移位系数 $(\lambda_q, \lambda_a, \lambda_v)$ 需按模型尺寸单独标定,工程调参成本不低。
独立分析的弱点
独立分析的弱点与改进方向如下。其一,绝对增益偏小且不均匀:四基准提升在 +0.1 到 +1.4 之间,VideoMME/AVUT 几乎持平,说明“预算重分配”这一正交维度有用但天花板有限;改进是把预算分配与 token 选择联合微调,或让分配以问答准确率而非启发式复杂度/冗余为监督做可学习化。其二,技能池静态、离线、强依赖 GPT-5.5-xhigh 且面向英文 WorldSense 任务类型,难处理新任务/语言/领域;改进是做可在线扩展的自适应技能库或无监督技能发现。其三,复杂度 $C_i^m$ 与冗余 $R_i^m$ 均为启发式且单元级独立,未考虑跨模态对齐或长程时间结构,在强时间相关任务(事件顺序、跨段因果)上可能失准;可引入轻量跨模态注意力或可微预算头。其四,仅 Qwen2.5-Omni 单一架构族验证、系数需按尺寸重标、先验绑死 OmniZip;改进是做架构无关的自适应先验估计与跨模型迁移。其五,超长视频(>512 帧)下数值守恒与下溢未讨论,建议补边界情况分析。
未来方向
作者明确将“预算分配”定位为与 token 选择互补的新方向,隐含的未来工作包括:把预算分配做成可学习/可微模块(替代当前闭式启发式),并以问答准确率为监督端到端训练;将层次化分配推广到更多模态(如第三路图像/OCR token)和更细粒度单元(子帧、子秒);以及与 KV-cache 压缩、语义块压缩(FastAV/AccKV/DASH)组合实现更深层的推理加速。基于本文成果可延伸的方向有:用技能池路由做查询自适应的多模态检索/RAG;把模态内复杂度-冗余信号用于流式在线场景的动态比特率分配;探索与最新 OmniLLM(VITA、VideoLLaMA、Inclusion 系列)的适配,验证训练无关设计在更广架构上的 Pareto 前沿迁移性;以及用强化学习或偏好优化自动标定 $\lambda$ 系数,消除手工按尺寸调参的工程负担。
复现评估
复现评估中等。有利因素:方法训练无关、只引入三系数 $(\lambda_q,\lambda_a,\lambda_v)$ 且论文给出取值(7B: 0.05/0.20/30;3B: 0.15/0.10/40),剪枝后端沿用公开 OmniZip,主结果含 WorldSense 八类、VideoMME Short/Med/Long、DailyOmni 五子项的完整数值。不利因素:技能池需 GPT-5.5-xhigh 离线构造,普通研究者未必能复刻,技能词表与 prompt 仅称在附录 E、正文未给池内容;实验仅在 NVIDIA H20、Qwen2.5-Omni 7B/3B 上做,未见明确代码/技能池/配置开源声明;WorldSense 诊断集也依赖 GPT-5.5-xhigh 做任务分类与模态关键词选择,复现诊断同样受制于该模型;512 帧(VideoMME)/128 帧、25 音频 token/秒、72 视频 token/帧设置虽明确,但超长视频下数值守恒细节未完全披露,增加忠实复现难度。
论文图表
展示一个音频导向问题的失败案例:左是问题,中是 Thinker 前后词到音/视频 token 的相似度热图,右是 Top-3 边际 $\Delta = s_v - s_a$。post-Thinker 阶段所有词(包括 acoustic salient 的 drum)都偏向视频,说明更深层上下文化反而加剧跨模态混合、丢失所需音频模态。
用具体案例直观说明“为什么直接 query-to-modality 相似度不可靠”,是 Question 1 诊断的图像化证据,支撑技能池路由的动机。
条形图对比直接相似度路由(整查询/模态关键词 × 均值/Top-3 池化 × Pre/Mid/Post-Thinker)与技能池路由的路由准确率。直接变体徘徊 50–60.8%,技能池达 77.7–87.5%,提升 25.5–28.6 个百分点;底行显示对应 WorldSense 准确率仅 43.5%(直接) vs 44.0%(技能池)。
量化证明技能池路由在机制级大幅领先,同时点明“路由优势→端到端收益”的传导有限,是理解方法与结果差距的关键。
示意图说明给定同一局部片段,五种预算分配×剪枝策略(Uniform/Weighted/First-only + Random/Oracle,以及 Oracle-Oracle)会向回答模型暴露不同的可见证据,从而得出不同答案分数。
可视化 Question 2 的诊断设计——同一片段在不同预算分布下信息可见性不同,是论证“模态内均匀预算次优”的核心设定。
柱状图给出视频(上)和音频(下)在 Uniform-Random、Weighted-Random、First-only、Uniform-Oracle、Oracle-Oracle 五种策略下的平均答案分数(0–5)。关键结论:即便用 Oracle 剪枝,Uniform-Oracle 仍远低于 Oracle-Oracle,证明剪枝无法弥补糟糕的预算切分。
用定量分数直接支撑“预算分配是 token 选择之前的关键步骤”这一核心论点,是本文最关键的诊断结果之一。
以 OmniZip 基线(均值 56.8)为参照,逐步开启模态间(A/V)、音频内(A)、视频内(V)分配。三层全开达 57.6(+0.8),其中 A/V+A+V 在 DailyOmni 上 +1.4 提升最大,证明三层分配互补、层次化设计有效。
消融表直接量化每一层预算分配的独立贡献与互补性,是验证方法设计合理性(而非堆模块)的核心证据。