视频为何依然昂贵?视频与视听大语言模型的推理效率机制综述 Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs
按编码器–连接器–LLM 流水线四阶段梳理视频大模型推理效率机制,给出受控对比与研究议程
前置知识
VideoLLM 编码器–连接器–LLM 流水线
主流 VideoLLM 采用 Video Embedder × LLM 范式:视频编码器(如 CLIP/ViT)把采样帧编码为连续特征,连接器(线性投影、Q-Former、pixel-shuffle 等)将其投影或压缩进 LLM 的 token 空间,与文本提示一起交给冻结或微调过的大语言模型做条件生成;视听系统再额外用音频编码器加另一条连接器接入同步音频。
全文的分类法、成本模型和所有效率方法都挂在流水线的四个阶段上,不理解这条主干就读不懂'方法作用在哪一阶段'。
KV 缓存(KV Cache)
自回归解码时,transformer 把每个 token 在每层的 key/value 向量缓存下来避免重复计算,显存占用约为 $\mathrm{Mem}_{KV} \propto 2B \cdot n_{layers} \cdot L \cdot d_{KV} \cdot b$,随上下文长度 $L$ 线性增长;多轮对话和长视频场景下它会成为显存瓶颈。
阶段 4 的一大半方法(VidKV、ReTaKe、MEDA、ReKV、StreamMem 等)都在压缩、驱逐或卸载这个缓存,是理解 LLM 端省显存机制的前提。
FLOPs 与系统级指标
FLOPs 是与硬件无关的计算量指标,单层注意力约为 $\mathrm{FLOPs}_{\mathrm{attn}} \propto Nd^2 + N^2 d$,MLP 约为 $\propto N d d_{ff}$;但它不等于实际速度——延迟、吞吐、峰值显存还取决于算子实现、访存和并行策略,两者必须区分报告。
本综述反复强调 FLOPs 统计边界(是否含视觉编码器、是否只算 LLM 预填充)不一,是跨论文比较失真的根源。
Token 剪枝与合并
视觉 patch token 在视频里高度冗余。剪枝按注意力分数或重要性丢弃低分 token(如 FastV 在浅层后砍掉一半),合并则把相似 token 融合为一个(如 ToMe 用二部图匹配),二者分别或组合地降低进入 LLM 的 token 数 $N_v$,从而同时削减预填充计算和 KV 显存。
阶段 3 和阶段 4 最大的两个子族都基于它,'保留 25% token 通常近基线、10% 才见分晓'这一核心结论就来自对这些方法的受控对比。
状态空间模型(Mamba)
用选择性状态空间递归替代二次方自注意力,把序列建模降为线性复杂度;VideoMamba 用双向 Mamba 块处理时空 token,VideoMambaPro 进一步解决反向扫描中的信息泄漏与残差问题。
编码器计算一节用它与池化注意力、卷积骨干三类对比精度–算力前沿,是理解'编码器还能怎么提速'的第三条技术路线。
研究动机
视频大语言模型(VideoLLM)在描述、问答、检索等任务上能力强大,但计算与显存代价随帧数和上下文长度急剧膨胀:视频编码器动辄处理数百帧高分辨率画面,逐帧 ViT 产生的 patch token 数为 $N_v^{enc} = T \cdot \frac{H}{P}\cdot\frac{W}{P}$,随后全部进入 LLM 上下文,使注意力计算 $\propto L^2 d$、KV 缓存 $\propto 2B n_{layers} L d_{KV} b$ 同步暴涨,实时、移动端和资源受限部署因此受限。更棘手的是,效率方法往往针对 captioning、QA 等单一任务孤立提出,帧数、分辨率、模态输入、硬件与 FLOPs 统计口径各不相同:两篇论文可能声称相同的每视频 GFLOPs,实际处理的帧数、分辨率与模态却完全不同。这导致读者难以判断算力究竟花在哪个阶段、给定约束下哪种策略最有效。
本文的目标是本文的目标是做一份以视频为中心的推理效率机制系统综述:把 2022 年底以来的 VideoLLM 效率工作,与更早但仍被现役流水线沿用的帧采样和视觉编码器机制统一组织,按其作用于编码器–连接器–LLM 流水线的哪个阶段建立分类法;在共享宿主模型、输入协议与 token 预算可得的条件下汇总文献报告的精度–成本对比,并与跨论文的异质证据明确区分开;同时系统考察视听系统的效率问题,覆盖音频 token 压缩、音频引导的视觉选择与联合 token 预算;最终识别评估协议与视听效率上的研究空白,给出可操作的研究议程。
与已有工作不同的是,已有综述要么按能力与基准梳理视频基础模型与 VideoLLM 架构(Tang、Nguyen、Madan 等),要么把视频当作高效 MLLM 综述的一个应用(Jin 等),或按底层机制梳理跨图像/视频/音频的 token 压缩(Shao 等),以及按编码–预填充–解码或输入/编码器/投影器/LLM 干预点组织流水线视角(Zhang、Wu 等)。本文的独特切入在于三点:一是以视频为中心,把上游时间覆盖与编码器设计和下游连接器压缩、LLM 端 token/显存预算的因果链条显式连接;二是收录了大量在 VideoLLM 出现之前、但至今仍是现役组件或直接前身的帧采样与视觉编码机制(如 TSN、TSM、MViTv2);三是把音频维度纳入效率版图(音频 token 压缩、音频引导视觉选择),而这恰是以往效率综述几乎空白的部分。
核心方法
这篇综述的方法论分四步。第一步是筛选与协议界定:通过 arXiv/Google Scholar 关键词检索加前向与后向引文滚雪球,覆盖截至 2026 年 8 月的论文,从数百个候选中保留 125 篇,入选标准是'贡献或评估某个定向机制且报告了参数量/FLOPs/保留 token 数/延迟/显存的具体效果';定量对比聚焦 7B–8B 语言骨干。第二步是形式化成本:帧数 $T$、分辨率 $H\times W$、patch 大小 $P\times P$ 决定编码器输出 $N_v^{enc}=T\cdot\frac{H}{P}\cdot\frac{W}{P}$;连接器保留 $N_v, N_a$ 个 token,与文本 $N_t$ 组成上下文 $L=N_t+N_v+N_a$;单层注意力 FLOPs $\propto Nd^2+N^2d$,MLP $\propto Ndd_{ff}$,KV 显存 $\propto 2Bn_{layers}Ld_{KV}b$。第三步是把每个机制归入它所消除计算发生的阶段,形成输入构建与选择、编码器计算、编码表征与连接器、LLM 执行与状态四大族及若干子族。第四步是受控对比:凡共享宿主与协议的结果单独成表,其余只作参考性证据。
核心创新是'按流水线阶段归位 + 受控对比'的综述框架。与既有综述按能力、任务或压缩机制组织不同,本文把每个方法归入它所消除计算的阶段——例如编码器最后一个 block 之后的池化算阶段 3,编码前的整帧选择算阶段 1,跨阶段方法(如 HoliTom、FlashVID)在每个阶段各出现一次——从而把'上游时间覆盖度、编码成本如何决定下游 token 与显存预算'这条链路显式化。在此之上,作者严格遵守只引用论文明确报告数值的纪律:不自行从架构推断 FLOPs,不把 token 保留率换算成 FLOPs,并显式记录 FLOPs 统计边界(HoliTom、HieraVid 只算 LLM 预填充,EarlyTom 含视觉编码)。于是像'保留约 25% 视觉 token 常近基线精度、10% 时方法选择才真正重要'这类结论,有了共享宿主(LLaVA-OneVision-7B 32 帧、LLaVA-Video-7B 64 帧、Qwen2-VL-7B)下的受控依据,而非跨论文的虚假可比。
方法步骤详情
阶段 1 输入构建与选择:固定覆盖采样(TSN 分段取样)作为基线;内容驱动的 KTS 分段与 MGSampler 运动显著性;免查询学习选择(AdaFrame 自适应早停、PEEK 蒸馏 caption 教师排序);查询条件选择(AKS 相关性+覆盖度、Q-Frame 帧分辨率自适应、FOCUS 多臂老虎机、AdaRD-Key 相关性–多样性目标);强化学习选择器(TSPO 仅 3.5M 参数、ReFoCUS 1.3B 策略、ViaRL 3B);以及 patch/分辨率预算(LDDR 线性 DPP 联合分配分辨率、MeToM 残差引导 patch 合并)。阶段 2 编码器计算:轻量卷积与池化注意力骨干(TSM、X3D、MoViNet、MViTv2、Hiera、Video Swin),状态空间骨干(VideoMamba 64 帧下吞吐高 6 倍、显存低 40 倍;VideoMambaPro K-400 84.0),紧凑蒸馏(MobileViCLIP-Small 比 InternVideo2-L14 快 55.4 倍、FastVLM TTFT 快 85 倍、LiteFrame 端到端延迟降 35%),编码器内 token 合并(ToMe、EarlyTom)与计算复用(ResidualViT 省 53–56% 编码、STC 缓存复用使编码延迟降 24.5% 且预填充降 45.3%、CoPE 只编码关键帧)。阶段 3 编码表征与连接器:选择合并(VisionZip 保留 6.6% token 获 7.8 倍预填充加速、HoliTom 约 10% FLOPs、FlashVID 10% 保留下 99.1% 相对精度与 6.3 倍预填充加速)、网格池化(InternVL2.5 pixel-shuffle、PLLaVA、STORM Mamba 连接器、NVILA、PVC)、隐式重采样(Q-Former、LLaMA-VID 每帧 2 token、LLaVA-Mini 每帧 1 token 省 77% FLOPs、BLIP-3-Video 每视频 16–32 token、VQToken 压至 0.07% token)、记忆压缩与检索(MovieChat、MA-LMM、∞-Video、Flash-VStream、AdaCM2 处理超两小时视频省 65% 显存)。阶段 4 LLM 执行与状态:解码层剪枝合并(FastV 约砍半预填充、SparseVLM、FrameFusion 1.6–3.6 倍端到端加速、HieraVid 24.5% FLOPs)、稀疏注意力(MMInference 最高 8.3 倍预填充加速)、LLM 自算摘要 token(VoCo-LLaMA、Video-XL 单卡 2048 帧)、KV 压缩(DyCoke 1.5 倍加速、VidKV 约 1.5-bit 量化几乎无损、ReTaKe 8 倍压缩、MEDA 省 72% KV 显存且解码快 2.82 倍)、KV 卸载与检索(ReKV、StreamKV、StreamingTOM)。
技术新颖性
相对既有综述,本文的新颖性体现在三个层面。第一,视频特有的阶段联动分析:作者指出'选择不一定在上游'——查询条件选择器(Frame-Voyager、FlexSelect)要先编码所有候选帧再挑选,只缩短 LLM 上下文却不省编码算力,Frame-Voyager 在其测试设置下甚至比均匀采样多 27.6% 延迟;而 2025–2026 最强的结果都是跨阶段组合(先在 LLM 前剪、再在层内剪),且只有 HoliTom 报告了分离两阶段的消融,'名义压缩比'因此说明不了节省发生在哪里。第二,'省下的算力可再投资'的视频视角:固定 LLM 预算下 token 压缩可换 10–20 倍帧数(EchoPrune、FlashVID),或支持更长训练上下文,压缩反而可能通过提高时间覆盖提升精度,这在图像 VLM 文献中没有对应物。第三,音频维度的系统纳入:OmniZip、DASH 用音频引导视觉压缩,作者同时指出音频编码器成本常被排除在报告的节省之外,使视听收益难以核算。
实验结果
核心结论是:保留约 25% 视觉 token 通常接近基线精度,而 10% 保留率才真正拉开方法差距。最干净的证据来自共享 LLaVA-OneVision-7B、32 帧、LMMS-Eval 的表 V:基线四基准平均 58.4,25% 预算下 HoliTom 以 17.4% FLOPs 达到 100.7% 相对平均(MVBench 58.4 对基线 58.3),VisionZip 99.7%,而预 LLM+层内混合的 DyCoke 只有 92.6%;10% 预算下 HoliTom(6.9% FLOPs)保住 99.1%,FlashVID 99.1%,纯空间选择的 VisionZip 跌至 91.6%,显式建模时间冗余的方法明显更抗压缩。帧选择方面(表 II,LLaVA-Video-7B、64 帧、均匀基线 LongVideoBench 58.9 / Video-MME 64.4):TSPO 以 3.5M 参数选择器取得 63.9(+5.0),QCA 66.1(+1.7),但查询感知选择在 Video-MME 上优势基本消失,且净收益取决于省下的下游计算能否覆盖选择器开销。编码器方面(表 III):Hiera 比 MViTv2-L 快约 2 倍且视频精度高 5.0 点;UniFormerV2 以 0.354B 参数达 K-400 90.0;VideoMambaPro 以 4.7 TFLOPs 得 84.0;MViTv2 与 Video Swin 精度几乎相同却因 5 对 12 视图评测导致 1.13 对 3.38 TFLOPs 的表面差异。LLM 端(表 VII,LLaVA-Video-7B 同骨干复跑):FastV 用 39.3% FLOPs 在 MVBench 掉 3.8 点,HieraVid 用 24.5% FLOPs 在五个设置只掉 0.2–2.1 点,优于相近预算的 FrameFusion;VidKV 以约 1.5-bit 键/1.58-bit 值做视觉 KV 量化,六个基准对 FP16 几乎无损失;ReTaKe 8 倍上下文压缩把 2048 帧装进 16K 上下文且每输出 token 时间降 20%;MMInference 在百万 token 上下文预填充提速最高 8.3 倍、掉点不超过 0.4。流式系统(表 VI):ReKV 的卸载+检索保精度最好(RVS-Ego 63.7,基线 56.2–60.1)但峰值显存 38 GB 接近全缓存的 37.5 GB;硬上限驱逐的 InfiniPot-V(27.8 GB)与 StreamMem(<28 GB)用约 6 个 RVS-Ego 点换约 10 GB 显存节省。视听方面,OmniZip 在 Qwen2.5-Omni-7B 上 35% 保留率下提速 3.42 倍、显存降 1.4 倍(V-MME 66.1),DASH 25% 保留达 66.0。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长视频问答·帧选择 | LongVideoBench 准确率(LLaVA-Video-7B,64 帧) | TSPO 63.9(选择器仅 3.5M 参数) | 均匀采样 58.9 | +5.0 点 |
| 长视频问答·帧选择 | Video-MME 准确率(同一协议) | QCA 66.1 | 均匀采样 64.4 | +1.7 点(查询感知优势在此基准基本消失) |
| 免训练 token 压缩(共享宿主) | 四基准相对平均(LLaVA-OV-7B 32 帧,基线=100%) | HoliTom@10% token 保留 99.1%(6.9% 预填充 FLOPs) | VisionZip@10% 为 91.6%;DyCoke@25% 仅 92.6% | 10% 预算下比纯空间选择高约 7.5 个点 |
| 解码层视觉 token 剪枝 | 预填充 FLOPs 与精度(LLaVA-Video-7B 同骨干) | HieraVid 24.5% FLOPs,五设置仅降 0.2–2.1 点(MVBench 58.3) | FastV 39.3% FLOPs,MVBench 56.6(基线 60.4) | 更少 FLOPs 且精度更高 |
| KV 缓存压缩 | 上下文压缩倍数 / 每输出 token 时延(Qwen2-VL-7B) | ReTaKe 8 倍压缩,2048 帧入 16K 上下文,时延 −20% | 全 KV 缓存 | 8 倍上下文扩展同时更快 |
| 流式视频问答 | RVS-Ego 准确率 / 峰值显存(LLaVA-OV-7B,1 小时 0.5fps 流) | ReKV 63.7 / 38 GB;InfiniPot-V 57.9 / 27.8 GB | 全 KV 基线 56.2–60.1 / 37.5 GB | 精度最高 +7.5;或显存 −10 GB(精度约 −6 点的权衡) |
| 视听 token 压缩 | Video-MME 准确率与端到端加速(Qwen2.5-Omni-7B) | OmniZip:66.1 @ 35% 保留,提速 3.42 倍、显存 −1.4 倍 | 未压缩 Qwen2.5-Omni-7B | 3.42 倍加速下精度反超基线 |
局限与改进
作者明确承认的局限:其一,跨方法对比本质上受限——各方法在不同骨干、基线与 token 预算下报告精度,表 IV 只能作'指示性证据';FLOPs 统计边界不一、帧预算不标准化、基线复现本身会漂移(表 VI 中全 KV 基线 Video-MME w/o 就在 63.3–63.9 间浮动),能量指标则无人报告。其二,效率结果几乎全部以多选题(MCQ)聚合准确率呈现,本综述的所有对比表中没有任何 captioning、检索或时序定位指标;MCQ 可凭粗粒度物体与场景线索作答,token 压缩在 MCQ 上无损不等于生成类任务无损(唯一在 captioning 上评测的选择器 PEEK 因此被迫排除出表 II)。其三,选择器自身成本常被省略:ViaRL 未测选择开销,VideoITG 的 8B 选择器体积主导了效率核算,ReFoCUS 每次选择要付 428 TFLOPs、9 秒、5.3 GB。我的补充观察:综述快照截至 2026 年 8 月,效率方法每月都在涌现;定量对比局限于 7B–8B 宿主,更大规模宿主上的机制证据未纳入表格;且论文只给出定性趋势,没有对'哪个阶段最值得投入'做定量排序。
独立分析的弱点
独立分析可见以下弱点。第一,音频效率证据薄弱:OmniZip/DASH 的音频锚点在部分片段有效、在另一些误导(语音指涉画外事件、可见事件无声),且音频编码器成本常不计入报告的节省,净收益难以核算;改进方向是把音频编码器与分配模块强制纳入成本报告,并训练查询与上下文相关的跨模态预算分配。第二,MCQ 中心的评估可能系统性高估压缩的无损性:应在每个 token 预算上同步抽查 captioning/时序定位等生成类任务,成本很低。第三,选择器开销核算不完整:ReFoCUS 一例说明'选择本身比省下的还贵'完全可能,建议像下游 FLOPs 一样统一要求报告 selector-FLOPs 与选择延迟。第四,跨阶段组合方法(2025–2026 的主流)端到端收益无法归因到具体阶段,目前只有 HoliTom 做了分离消融,社区应把分阶段消融设为标配。第五,帧预算、输入协议与评测口径不统一,使表 IV 这类大表形同虚设,应推广 LLaVA-OneVision-7B + 32 帧 + LMMs-Eval 这类共同装置,并固定硬件–软件栈后再比延迟。第六,我的观察:125 篇里 LLM 侧方法族明显偏小(KV 蒸发/量化/稀疏注意力大多从文本 LLM 平移而来),视频特化的缓存管理(音画异步、字幕 token 与视觉 token 的差异化压缩)仍属空白。
未来方向
作者提出三项优先议程。一是建立可复现的精度–算力协议:同一批视频、提示与模态输入,固定分辨率与解码设置;插件方法共享冻结宿主、候选帧池与帧/token 预算;统一在固定统计边界下报告编码器、连接器与 LLM 预填充 FLOPs,并把选择/分配机制自身的成本计入;同时报告保留 token 数与同输入同算力预算下的任务表现,LLaVA-OneVision-7B+32 帧+LMMs-Eval 已是可行起点。二是按内容域与任务族分别报告效率:利用 Video-MME 的域标注区分静态讲座与快切运动 footage,并把同一预算拿到生成或定位任务上复检,验证 MCQ 无损假设。三是学习音频何时应影响压缩:在视觉可答、音频可答、联合可答与故意冲突的样本上,训练查询与上下文相关的跨模态 token 分配。基于本文成果还可延伸:解码器骨干多样化(Mamba–Transformer 混合如 TimeViper、StatefulTR)下,信息如何在注意力与递归状态间保留并压缩;压缩节省被再投资为 10–20 倍帧数或更长训练上下文后,精度–覆盖度的联合优化;以及在 MLPerf 式共享参考栈上补齐延迟、显存与能耗测量——目前没有任何被综述方法报告能量。此外,把表 V 的共享协议扩展到视听宿主(如 Qwen2.5-Omni-7B)会是音频方向最直接的后续。
复现评估
作为综述,其可复现性主要体现在清单与分类而非实验:作者维护公开仓库 momentslab/awesome-efficient-videollm,收录全部 125 篇方法并按阶段标注(图 4 的 a/+ 标记区分编码器侧与跨阶段方法)。量化表格全部引用原文报告数值、不自行推断,受控表明确标注宿主、帧数与 FLOPs 边界,连基线复现漂移都如实记录,这为第三方复现提供了清晰起点。若要完整复现受控对比,需要跑通 LLaVA-OneVision-7B、LLaVA-Video-7B、Qwen2-VL-7B/Qwen2.5-Omni-7B 等开源宿主与 LMMs-Eval 评测栈,单卡 80GB(A100-80G)量级即可覆盖绝大多数 7B 配置,难度中等;表 VI 的流式协议还需 1 小时 0.5 fps 流复现条件。风险点是各被综述方法的开源程度参差,且部分自报基线与共享基线存在 1–2 点漂移(论文已用 ‡/m 标注)。总体而言:复现本文结论(读表)成本极低,复现具体方法的加速比则取决于相应仓库可用性。
论文图表
2014–2026 的时间轴上排列了综述收录的全部方法,按作用的流水线阶段着色,灰色表示跨阶段方法;视频出现前的帧采样与编码器方法(TSN、TSM、MViTv2、X3D 等)与 2022 年后的 VideoLLM 效率方法(FastV、HoliTom、FlashVID、OmniZip 等)同图呈现。
一图总览 125 篇文献的全景与演进脉络,读者可据此快速定位任何方法所处阶段与年代,是全文清单的索引。
列出 MVBench(3,641 视频/4,000 题)、Video-MME(900/2,700,含音频与字幕)、EgoSchema(5,063)、LongVideoBench(3,763/6,678)、MLVU(1,730/3,102)、RVS-Ego/Movie(32/3,500,开放式)等基准的模态、题型、时长与规模。
界定了后续所有对比表的评测底座,解释为何 MCQ 基准主导效率证据、视听与流式证据为何稀缺。
同一宿主与 64 帧预算下比较 8 个帧选择器:均匀基线 LongVideoBench 58.9 / Video-MME 64.4;TSPO 63.9/65.5,QCA 62.9/66.1,FOCUS 63.5/65.4,MaxInfo 61.5/64.2 等,并标注是否查询感知、是否免训练。
帧选择阶段唯一的受控对比,量化了查询感知选择在 LongVideoBench 最多 +5 点、而在 Video-MME 上优势基本消失的结论。
14 个视觉骨干的参数量、GFLOPs×视图数与 K-400/K-600/MIT/AS/UCF/HMDB 精度:Hiera 87.3 K-400,UniFormerV2 90.0,VideoMambaPro 84.0 @ 0.072B,MViTv2 82.9 @ 225×5 GFLOPs,Video Swin 82.7 @ 282×12 等。
编码器效率方法的完整参考表,也是图 5 精度–算力散点的数据来源,暴露了评测视图数不同导致的 FLOPs 不可比问题。
按 3a–3d、4a、4c 各子族列出 40 余个 token 缩减方法在 7B 级宿主上的参数量、保留预算与 NExT-QA/MSR/MSVD/MVBench/V-MME/EgoSchema/ActNet 成绩,如 OmniZip 66.1 V-MME @35%、HoliTom 61.2 EgoSchema @10%。
全文最大的一张汇总表,覆盖阶段 3 与阶段 4 的主要机制,但作者明确说明行间宿主与协议不同、只作指示性证据。
HoliTom 在同一冻结宿主上复跑的受控对比:25% 预算下 HoliTom 17.4% FLOPs 得 100.7% 相对平均,VisionZip 99.7%,DyCoke 92.6%;10% 预算下 HoliTom 6.9% FLOPs 仍 99.1%,VisionZip 跌至 91.6%;下块补充 FlashVID、EarlyTom、VidCom2、MMG-Vid 的自报结果。
全文最干净的受控证据,直接支撑'25% 近基线、10% 见分晓、显式建模时间冗余更抗压缩'的核心结论。
上半部:Qwen2-VL-7B 离线长视频 QA,ReTaKe(8 倍压缩)MLVU 69.8,InfiniPot-V 与 StreamMem 各约 62–67 分;下半部:LLaVA-OV-7B 流式 QA(RVS-Ego/RVS-Movie),ReKV 63.7/54.4 @38 GB,InfiniPot-V 57.9/51.4 @27.8 GB,StreamMem 57.6/52.7 @<28 GB,全缓存基线 37.5 GB。
量化了流式系统的检索–驱逐权衡:ReKV 保精度但显存接近全缓存,硬上限驱逐用约 6 点精度换约 10 GB 显存。
同一骨干、约 30% token 预算下:基线 100% FLOPs 得 MVBench 60.4/NExT-QA 80.2/EgoSchema 59.4;FastV 39.3% FLOPs 掉至 56.6/77.2/55.1;FrameFusion 23.8% FLOPs 得 56.7/78.8/56.8;HieraVid 24.5% FLOPs 得 58.3/79.9/59.2。
阶段 4 唯一的同骨干受控对比,证明'先跨帧合并再按重要性剪枝'的时间感知级联优于通用 FastV 式剪枝。