← 返回 2026-07-29

OmniDelta:面向全模态大模型token压缩的技能驱动预算分配框架 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang 📅 2026-07-28 👍 8 2026-08-03 18:30
OmniLLM Qwen2.5-Omni token压缩 全模态大模型 训练无关 预算分配

无需训练的层次化预算分配器,在剪枝前自适应分配音视频保留预算

前置知识

全模态大语言模型 (OmniLLM)

OmniLLM 将多模态推理从图像/视频-文本输入扩展到对文本、音频、视频的统一理解。代表系统有 VITA、VideoLLaMA 和 Qwen-Omni,它们把异构的模态 token 放进同一个自回归主干中。例如 Qwen2.5-Omni 把视觉编码器-投影器输出的视频 token(每帧 72 个)和音频编码器-投影器输出的音频 token(每秒 25 个)与文本 token 拼接成一个交错序列 $X = [T; C_1; \dots; C_J]$ 一起送入 LLM 骨干进行 prefilling 和生成。

OmniDelta 的全部压缩对象就是这些进入骨干前的音视频 token。必须先理解 OmniLLM 把音视频 token 按 2 秒时间窗组成时间对齐块 $C_j = [V_j; A_j]$ 的输入组织方式,才能理解为什么预算分配要分模态层和时间层来做。

Token 剪枝 / 压缩 (Token Pruning)

Token 剪枝是在 token 进入 LLM 主干之前移除冗余感知 token 以降低推理成本的通用技术。图像方法用 token merging、early-layer filtering;视频方法利用时间显著性、帧相似性;OmniLLM 压缩则要在音视频之间考虑跨模态相关性,如 OmniZip 用音频注意力引导视频剪枝。本文用音频编码器最终自注意力分数 $\alpha_i$ 估计音频 token 重要性,并用交错时空压缩(ISTC)在视频时间窗内做剪枝。

OmniDelta 明确区分“预算分配”与“token 选择”两件事。读懂本文必须先明白:传统剪枝方法回答的是“保留哪些 token”,而本文回答的是“先该把固定预算花在哪里”,剪枝只是在已分配的局部预算内执行。

Prefilling 成本与自注意力二次复杂度

自注意力对长度为 $L$ 的序列开销随 $L^2$ 增长。OmniLLM 中一段 60 秒、2 FPS 采样的视频含 120 帧,按每帧 72 个视觉 token、每秒 25 个音频 token 计算,仅音视频输入就约 10K token。这些超长多模态上下文会主导 prefilling 计算和 KV-cache 内存,使 token 压缩成为实用 OmniLLM 推理的刚需。

理解 prefilling 成本随序列长度二次增长,才能理解为什么论文报告的 GPU 显存从 30.0G 降到 23.4G、端到端延迟 1.64× 加速这些效率指标如此重要,以及为什么要在进入主干前削减 token。

模态间预算分配 (Inter-Modal Budget Allocation)

在全模态压缩中,模型必须先决定把总保留预算 $K = \text{round}(r(N_a + N_v))$ 中多少分给音频、多少分给视频。一个声音相关的问题可能需要更多音频 token,而视觉细节问题可能需要更多视频 token。直观做法是用查询与音频/视频 token 的直接余弦相似度做路由,但本文证明这种方式由于查询编码“任务意图”、模态 token 编码“样本内容”而不可靠。

这是本文诊断的第一个核心问题(Question 1)。理解“为什么直接相似度不可靠、为什么需要技能池(skill pool)路由”,是理解 OmniDelta 层次化分配顶层设计的钥匙。

技能池 (Skill Pool)

技能池是借鉴 agent skill 方法的思路:用文本描述把可复用能力组织起来。本文用 GPT-5.5-xhigh 离线为音频导向任务(语音对话、说话人、音乐节奏、声音事件)和视频导向任务(物体场景、外观空间关系、OCR、动作运动)抽取诊断关键词并扩展为语义相关词,形成 $S_a$、$S_v$ 两个池。推理时把查询和技能词都映射到模型文本嵌入层后比较余弦相似度,得到有符号模态偏置 $m_q = p_v - p_a$。

技能池是 OmniDelta 区别于 OmniSelect 等用直接余弦相似度路由方法的关键。实验显示技能池路由在 WorldSense 上比直接相似度高出 25.5–28.6 个百分点,是读懂方法论第 3.2.1 节的前提。

Qwen2.5-Omni 与 Thinker 架构

Qwen2.5-Omni 是阿里巴巴的全模态模型,本文用了 7B 和 3B 两个尺寸。其架构含一个 Thinker 模块(多模态理解主干)和 Talker 模块。音视频 token 先经各自的编码器-投影器映射到 LLM 隐藏空间,再进入 Thinker 做逐层上下文化。论文的相似度诊断在 pre-Thinker(输入嵌入)、mid-Thinker(第 14 层)、post-Thinker(LM head 前的最终隐藏态)三个表示阶段都做了评测。

所有实验和诊断(技能相似度、隐藏态路由)都在 Qwen2.5-Omni 上完成,预算公式中的 $\Phi_v, \Phi_a$ 投影管线、72/25 的 token 配额都来自该模型的设定,不了解这些就无法复现主表实验。

研究动机

全模态大模型(OmniLLM)虽能统一理解文本、音频、视频,但超长音视频 token 序列带来巨大显存与推理开销:以 Qwen2.5-Omni 为例,60 秒、2 FPS 采样的视频含 120 帧,按每帧 72 个视觉 token、每秒 25 个音频 token 计算,仅音视频输入就约 10K token,严重拖累 prefilling 与 KV-cache。现有压缩方法(OmniZip、OmniSIFT、EchoingPixels、OmniRefine、OmniFit)几乎都只在“该保留哪些 token”上做文章,却默认固定预算:模态级与模态内预算都固定,OmniFit 甚至用固定逐层计划。作者用两套诊断证明此假设有问题。其一,直接用查询到音视频 token 的余弦相似度做模态路由几乎等同随机猜:400 条 WorldSense 查询上,跨表示阶段(Pre/Mid/Post-Thinker)与池化规则(均值/Top-3),路由准确率徘徊 50–60.8%,最好直接变体也仅 60.8%,因为查询编码“任务意图”、模态 token 编码“样本内容”。其二,模态内均匀预算保留冗余却漏关键证据:即便用带参考答案的 Oracle 剪枝,Uniform–Oracle 仍远低于 Oracle–Oracle,证明剪枝本身无法弥补糟糕的预算切分。

本文的目标是本文的具体目标是把“预算分配”从“token 选择”中分离出来,作为 token 压缩的一个独立、前置环节来研究。给定一个固定的总保留预算 $K = \text{round}(r(N_a + N_v))$,目标是在不改变总保留比例 $r$ 的前提下,自适应地决定这份预算花在哪里:先在音频与视频两个模态之间(根据查询需求)转移预算,再在每个模态内(根据内容复杂度与时间冗余)把预算重新分配到音频片段或视频帧上。作者希望最终得到的局部预算仍能与 OmniZip 等已有剪枝后端兼容,并且完全训练无关(training-free),从而在不重训 Qwen2.5-Omni-7B/3B 的情况下,既提升压缩后的准确率,又在 GPU 显存、首 token 延迟(TTFT)和端到端延迟上同时获益,建立新的准确率-效率 Pareto 前沿。

与已有工作不同的是,已有方法尽管 token 选择机制各异(基于注意力、可学习选择器、逐层/逐块策略),但都没有追问“固定预算应当如何根据查询和输入内容自适应分配”这一互补问题,本文正是切入这个被忽视的空白。独特角度有两点:其一,作者不把模态路由寄托在直接 query-to-modality 相似度上(该相似度被证明不可靠),而是借鉴 agent skill 思路,离线构造音频/视频技能池并用查询-技能相似度驱动模态间预算转移,把“任务意图”与“样本内容”解耦;其二,作者不假设模态内预算均匀,而是用局部复杂度 $C_i^m$(单元内 token 多样性)和时间冗余 $R_i^m$(与上一单元的 token 级相似度)两个信号,在每个模态内做内容感知的重分配。这种“查询驱动 + 内容感知”的层次化分配在文献中尚无对应物,是本文相对 OmniZip、OmniSelect、OmniFit 的本质差异。

核心方法

OmniDelta 把全模态 token 压缩形式化为层次化预算分配:先分配预算、再剪枝。直觉上像三角洲把固定流量的河水分流——总水量(总保留比例 $r$)不变,只改流向与分布。技术分三层:先定总预算 $K = \text{round}(r(N_a + N_v))$,并从压缩先验 $(K_a^0, K_v^0)$(复用 OmniZip 在 25% 下 50% 音频、20% 视频的切分)初始化模态预算。第一层模态间分配:用查询与离线技能池 $S_a, S_v$ 的余弦相似度得有符号偏置 $m_q = p_v - p_a$,按 $\Delta_q = \lambda_q K m_q$ 把预算从较不相关模态转移到较相关模态。第二层模态内分配:以 1 秒音频片段或单帧视频为最小单元,用复杂度 $C_i^m$ 与时间冗余 $R_i^m$ 算出居中分数 $z_i^m$,对冗余单元降下界、对复杂单元升上界,再按保留优先级分配剩余预算。第三层在局部预算内用 OmniZip 风格剪枝(音频用编码器自注意力 $\alpha_i$、视频用交错时空压缩 ISTC)选 token。整个方法训练无关、即插即用,只改预算花在哪。

核心创新是把“预算分配”当作与“token 选择”正交且前置的子问题,并用层次化、查询/内容双驱动的分配器解决,而非在固定预算下只优化选择。与已有方法三点本质区别:(1)模态间路由放弃直接 query-to-modality 相似度(诊断其约随机水平),改用离线技能池 $S_a, S_v$,把查询映射到模型文本嵌入层后比较技能词相似度,从而把任务意图与样本内容解耦——技能池路由在 WorldSense 上比最佳直接变体 60.8% 高出 25.5–28.6 个百分点;(2)模态内不用均匀预算,而用复杂度 $C_i^m$ 与时间冗余 $R_i^m$ 算居中分数 $z_i^m = (R_i^m - C_i^m) - \frac{1}{n_m}\sum(R_j^m - C_j^m)$,构造可行保留区间 $[\ell_i^m, h_i^m]$ 再按优先级 $w_i^m = \frac{1-z_i^m}{2}$ 守恒分配,复杂单元多得、冗余单元少得;(3)与 OmniSelect(需 AudioCLIP)、OmniFit(固定逐层计划)不同,OmniDelta 完全训练无关、仅 $\lambda_q, \lambda_a, \lambda_v$ 三系数,可叠加任意已有剪枝后端。

方法步骤详情

方法分三步。第 1 步模态间意图感知分配:离线用 GPT-5.5-xhigh 从 WorldSense 识别音/视频导向任务并抽词扩展成技能池 $S_a, S_v$;推理时对查询与技能词经 Thinker 输入嵌入层算归一化池化嵌入,取 TopK 得分 $r_m(q)=\frac{1}{k}\sum_{c\in\text{TopK}_k(q,S_m)}e(q)^\top e(c)$,Softmax 得 $[p_a,p_v]$ 与偏置 $m_q=p_v-p_a$,按 $K_a=K_a^0-\lambda_q K m_q$、$K_v=K_v^0+\lambda_q K m_q$ 转移预算并校正使 $K_a+K_v=K$。第 2 步模态内内容感知分配:对每单元(音频 1 秒、视频单帧)算均值 $\mu_i$、复杂度 $C_i^m$、与上一单元冗余 $R_i^m$(相邻单元重采样到等长后对位求余弦再 min-max 归一化),组合为居中分数 $z_i^m=(R_i^m-C_i^m)-\frac{1}{n_m}\sum(R_j^m-C_j^m)$;冗余单元($z_i^m>0$)降下界 $\ell_i^m=k_{0,i}^m-\lambda_m[z_i^m]_++L_i$,复杂单元($z_i^m<0$)升上界 $h_i^m=k_{0,i}^m+\lambda_m[-z_i^m]_++L_i$,按下界起、按优先级 $w_i^m=\frac{1-z_i^m}{2}$ 分配剩余预算使 $\sum k_i^m=K_m$。第 3 步预算内剪枝:音频用编码器自注意力 $\alpha_i=\frac{1}{N_a}\sum_j A_{j,i}$ 在每段内优先保留高分 token,按 2 秒块聚合得保留率作视频窗先验;视频在每 4 帧窗内用 ISTC 交替做时间剪枝(删相邻帧同位高相似 token)与空间剪枝(DPC-KNN)。7B 系数 $(\lambda_q,\lambda_a,\lambda_v)=(0.05,0.20,0.30)$,3B 为 $(0.15,0.10,0.40)$。

技术新颖性

技术新颖性四点。其一,首次把“预算分配”形式化为与 token 选择正交且前置的独立子问题,并用两套对照诊断(直接相似度路由、均匀预算-Oracle 剪枝)给出“分配本身不可被选择弥补”的实验证据,这是方法论上的概念贡献而非又一个剪枝技巧。其二,模态间路由放弃直接相似度改用离线技能池:400 条 WorldSense 查询上技能池路由以 77.7–87.5% 准确率比最佳直接变体 60.8% 高 25.5–28.6 个百分点,验证任务原型比样本内容更能反映查询意图。其三,模态内把局部复杂度(单元内 token 多样性)与时间冗余(与上一单元 token 级相似度)融合成居中分数 $z_i^m$,构造可行区间并按优先级守恒分配,是内容感知、参数极少的闭式重分配器。其四,整体训练无关、即插即用:先验预算复用 OmniZip 切分、剪枝后端沿用 OmniZip,因而不重训 Qwen2.5-Omni 即可与任何已有剪枝叠加,改变的是预算花在哪而非总保留比例,这是相对 OmniSelect(需 AudioCLIP)、OmniSIFT/EchoingPixels(需训练 STE 选择器)、OmniFit(固定逐层计划)的本质区别。

Overview and main results of OmniDelta
Figure 1: Overview and main results of OmniDelta
Overview of OmniDelta
Figure 6: Overview of OmniDelta

实验结果

核心发现在四基准、两尺寸、两保留率上验证。WorldSense(7B 25%)OmniDelta 44.2% 优于 OmniZip 43.2%(Full 46.8%),20% 下 43.0% 优于 42.7%;3B 25% 44.7% 优于 44.1%。AVUT(7B 25%)61.1% 优于 OmniZip 60.7%(Full 63.8%)。VideoMME(7B 25%)66.4% 略高于 OmniZip 66.3%(Full 67.3%),Short/Med/Long 均接近无损。DailyOmni(7B 25%)58.5% 优于 OmniZip 57.1%,是 7B 25% 下提升最显著(+1.4)的基准。效率(7B):GPU 显存从 Full 30.0G 降到 23.4G(降 22.0%),TTFT 1.69×(3006→1776ms),端到端延迟 1.92s 合 1.64×(3.15→1.92s),且 44.2% 准确率为压缩方法中最高。消融(Table 3)在 OmniZip 基线 56.8 上三层全开达 57.6(+0.8),DailyOmni +1.4 最大,证明三层分配互补。系数敏感性(Fig. 7)27 组 $\lambda$ 下 WorldSense 均值在 43.28–44.29% 窄带且全高于 OmniZip 43.2%,$\lambda_q$ 最敏感、$\lambda_v$ 在 0.30 附近最优。注意技能池路由机制级优势(25.5–28.6pp)仅转化为端到端 +0.5(43.5→44.0)。

WorldSense category results under 25% and 20% audio-visual retained-token settings
Table 1: WorldSense category results under 25% and 20% audio-visual retained-token settings
Results on AVUT, VideoMME, and DailyOmni under 25% and 20% retained-token settings
Table 2: Results on AVUT, VideoMME, and DailyOmni under 25% and 20% retained-token settings
Actual inference efficiency comparison on WorldSense
Table 4: Actual inference efficiency comparison on WorldSense
Shift-ratio sensitivity on WorldSense with Qwen2.5-Omni-7B
Figure 7: Shift-ratio sensitivity on WorldSense with Qwen2.5-Omni-7B
Visualization of budget allocation
Figure 8: Visualization of budget allocation
查看结构化数据
任务指标本文基线提升
WorldSense 音视频问答 (Qwen2.5-Omni-7B, 25% 保留率) 平均准确率 (%) 44.2 OmniZip 43.2 / Full Tokens 46.8 较 OmniZip +1.0;较 Full 仅 -2.6
DailyOmni 日常音视频推理 (7B, 25%) 平均准确率 (%) 58.5 OmniZip 57.1 / Full 62.7 较 OmniZip +1.4,是四基准中最大提升
AVUT 音频中心基准 (7B, 25%) 总体准确率 (%) 61.1 OmniZip 60.7 / Full 63.8 较 OmniZip +0.4
VideoMME-with-audio (7B, 25%) 平均准确率 (%) 66.4 OmniZip 66.3 / Full 67.3 较 OmniZip +0.1,接近无损
实际推理效率 (7B, WorldSense, 25%) GPU 显存 / 端到端延迟 23.4G / 1.92s (1.64× 加速) Full Tokens 30.0G / 3.15s 显存 -22.0%,延迟 1.64× 加速,且准确率为压缩方法中最高

局限与改进

作者承认的局限主要有三点。第一,技能池路由的诊断准确率优势(比直接相似度高 25.5–28.6 个百分点)并未等比例转化为端到端收益:在 OmniZip 模态内分配后端下,相似度路由与技能池路由的 WorldSense 准确率仅 43.5% 与 44.0%(+0.5),说明路由准确率只是机制级证据,最终性能还取决于模态内分配与具体剪枝后端。第二,模态间先验预算直接复用 OmniZip 的切分(25% 设置下 50% 音频、20% 视频),OmniDelta 只在该先验上做有界转移,先验本身的好坏会限制上界。第三,技能池离线用 GPT-5.5-xhigh 构造、且依赖 WorldSense 的任务类型,跨数据集/语言/领域的泛化能力未被充分验证。此外我观察到:绝对提升普遍较小(0.1–1.4 个百分点),VideoMME/AVUT 上接近持平,说明在“预算花在哪”上的收益存在天花板;实验仅在 Qwen2.5-Omni 7B/3B 上做,未覆盖其他 OmniLLM;三个移位系数 $(\lambda_q, \lambda_a, \lambda_v)$ 需按模型尺寸单独标定,工程调参成本不低。

独立分析的弱点

独立分析的弱点与改进方向如下。其一,绝对增益偏小且不均匀:四基准提升在 +0.1 到 +1.4 之间,VideoMME/AVUT 几乎持平,说明“预算重分配”这一正交维度有用但天花板有限;改进是把预算分配与 token 选择联合微调,或让分配以问答准确率而非启发式复杂度/冗余为监督做可学习化。其二,技能池静态、离线、强依赖 GPT-5.5-xhigh 且面向英文 WorldSense 任务类型,难处理新任务/语言/领域;改进是做可在线扩展的自适应技能库或无监督技能发现。其三,复杂度 $C_i^m$ 与冗余 $R_i^m$ 均为启发式且单元级独立,未考虑跨模态对齐或长程时间结构,在强时间相关任务(事件顺序、跨段因果)上可能失准;可引入轻量跨模态注意力或可微预算头。其四,仅 Qwen2.5-Omni 单一架构族验证、系数需按尺寸重标、先验绑死 OmniZip;改进是做架构无关的自适应先验估计与跨模型迁移。其五,超长视频(>512 帧)下数值守恒与下溢未讨论,建议补边界情况分析。

未来方向

作者明确将“预算分配”定位为与 token 选择互补的新方向,隐含的未来工作包括:把预算分配做成可学习/可微模块(替代当前闭式启发式),并以问答准确率为监督端到端训练;将层次化分配推广到更多模态(如第三路图像/OCR token)和更细粒度单元(子帧、子秒);以及与 KV-cache 压缩、语义块压缩(FastAV/AccKV/DASH)组合实现更深层的推理加速。基于本文成果可延伸的方向有:用技能池路由做查询自适应的多模态检索/RAG;把模态内复杂度-冗余信号用于流式在线场景的动态比特率分配;探索与最新 OmniLLM(VITA、VideoLLaMA、Inclusion 系列)的适配,验证训练无关设计在更广架构上的 Pareto 前沿迁移性;以及用强化学习或偏好优化自动标定 $\lambda$ 系数,消除手工按尺寸调参的工程负担。

复现评估

复现评估中等。有利因素:方法训练无关、只引入三系数 $(\lambda_q,\lambda_a,\lambda_v)$ 且论文给出取值(7B: 0.05/0.20/30;3B: 0.15/0.10/40),剪枝后端沿用公开 OmniZip,主结果含 WorldSense 八类、VideoMME Short/Med/Long、DailyOmni 五子项的完整数值。不利因素:技能池需 GPT-5.5-xhigh 离线构造,普通研究者未必能复刻,技能词表与 prompt 仅称在附录 E、正文未给池内容;实验仅在 NVIDIA H20、Qwen2.5-Omni 7B/3B 上做,未见明确代码/技能池/配置开源声明;WorldSense 诊断集也依赖 GPT-5.5-xhigh 做任务分类与模态关键词选择,复现诊断同样受制于该模型;512 帧(VideoMME)/128 帧、25 音频 token/秒、72 视频 token/帧设置虽明确,但超长视频下数值守恒细节未完全披露,增加忠实复现难度。