UltraViT:面向大视觉语言模型的端侧低延迟视觉编码器 UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
面向端侧部署的低延迟异构视觉编码器,配合两阶段生成式预训练实现SOTA。
前置知识
大视觉语言模型(LVLM)
大视觉语言模型由视觉编码器、跨模态对齐投影器(通常是轻量MLP)和大型语言模型三部分组成。视觉编码器把高分辨率图像 $I$ 消化为视觉 token 序列 $F \in \mathbb{R}^{N \times C}$,投影器将这些特征对齐到语言空间,LLM 再以自回归方式结合图像 token 和文本查询进行推理。代表架构如 LLaVA-OV 通常采用 SigLIP-400M 这类重型编码器作为固定的特征提取器。
UltraViT 的全部优化都聚焦于 LVLM 三件套中的视觉编码器这一环节,理解 LVLM 的数据流才能理解为什么编码器会成为端侧延迟瓶颈。
金字塔视觉Transformer(Pyramidal ViT)
金字塔结构借鉴自 CNN,将网络划分为多个 stage,每个 stage 逐步将空间分辨率下采样 2 倍、同时扩展通道容量。高分辨率 stage 处理大量 token 适合局部卷积,低分辨率 stage token 数量少适合全局注意力。UltraViT 采用四 stage 金字塔,stem 先下采样 4 倍,各 stage 配置 $C_{1-4}=[192,512,768,1536]$、块数 $N_{1-4}=[4,7,10,2]$。
金字塔结构是 UltraViT 异构混合器设计和原生 16× token 压缩的基础,不同 stage 选用不同空间混合器的关键依据正是各 stage 的 token 分辨率差异。
空间混合器(Spatial Mixer)与Meta架构块
空间混合器负责在 token 序列 $X \in \mathbb{R}^{N \times C}$($N=H\times W$)上聚合空间信息,常见形式包括卷积、稀疏注意力、完整自注意力等。UltraViT 严格保留 [54] 提出的 Meta 架构块:残差连接环绕一个主 token 混合器和一个通道混合器(MLP),即 $Y = X + \text{TokenMixer}(\text{Norm}(X))$、$Z = Y + \text{MLP}(\text{Norm}(Y))$,只模块化地替换内部 TokenMixer。
本文的核心创新之一就是设计并系统对比四种空间混合器(卷积/稀疏/通道分割注意力/完整单头注意力),理解 Meta 架构块才能看懂异构设计如何在统一骨架下插拔不同混合器。
知识蒸馏与稠密蒸馏(Dense Distillation)
知识蒸馏是将大教师模型的知识迁移到小学生模型,稠密蒸馏指在特征图层面逐 patch 对齐。UltraViT 用 Pixel Shuffle 把学生特征按 $r \times r$ 空间块重排到通道维($C_S \to C_S \cdot r^2$)以匹配教师分辨率,再用稠密余弦损失 $\mathcal{L}_{dense}$ 和经教师冻结注意力池化的全局损失 $\mathcal{L}_{global}$ 双目标,最终 $\mathcal{L}_{distill}=0.5\mathcal{L}_{dense}+0.5\mathcal{L}_{global}$。
稠密蒸馏是 UltraViT 两阶段预训练的第一阶段,也是替代传统对比学习、获取稠密定位能力的关键,理解它能看清本文为何比 CLIP 类训练更省数据。
移动NPU与INT8量化推理
NPU(神经网络处理单元)是手机端专用 AI 加速硬件,与 GPU/CPU 的访存与计算特性差异巨大——多头注意力会因切分嵌入维度导致内存碎片化和访存低效。UltraViT 全部延迟测量均在物理 Samsung Galaxy S25 Ultra 上完成:用 Qualcomm Neural Processing SDK(QNN)编译、INT8 全量化、原生端侧基准测试。
本文反复强调'真实端侧延迟'而非 FLOPs 或代理设备指标,单头注意力优于多头、各种混合器优化(S1-S4)的动机都源于 NPU 的访存特性,这是读懂架构选择的前提。
研究动机
大型视觉语言模型(LVLMs)参数量巨大,难以部署到资源受限的移动与边缘设备。以往压缩 LVLM 的工作几乎只盯着两个方向:一是通过 token 稀疏化或压缩削减视觉上下文长度(如 VisionZip、PyramidDrop、VisPruner、HiRED),二是把更小的语言模型与更高效跨模态交互结合。然而视觉编码器本身几乎被忽视,业界普遍直接套用 CLIP-ViT-L 或 SigLIP-400M 这类重型模型作固定特征提取器。论文给出关键数据:在端侧 LLaVA-OV(SigLIP-400M + 1.5B Qwen2.5)中,对一张 $1024\times1024$ 图像,仅视觉特征提取这一阶段在移动设备上就可能占到端到端推理时间的近 50%。当 LLM 主干被压到 0.5B–1.5B 后,编码器相对延迟负担反而被放大。同时,已有高效 ViT 多为 ImageNet 分类优化,且把单一空间混合器均匀复制到全网,既未为 LVLM 稠密理解设计,也未真正基于端侧延迟选型。
本文的目标是本文的目标是从零开始设计一个明确面向端侧 LVLM 部署、以真实延迟为导向的视觉编码器 UltraViT,使它既在移动 NPU 上高效执行,又具备 LVLM 推理所必需的稠密表示能力,从而彻底摆脱事后视觉 token 压缩器。除了架构本身,作者还想解决第二个目标——预训练范式:标准对比训练(CLIP/SigLIP)对 LVLM 而言信号过粗,且与生成式 token 生成存在根本错配(经验上需要丢弃最后一层才能接入 LLM);而掩码图像建模(MIM)/DINO 这类重构目标虽能产生强稠密定位,却缺少 LLM 所需的高层语义。因此本文希望提出一套更省数据、更能匹配生成式下游的预训练策略。
与已有工作不同的是,本文的独特切入角度有三层。第一,据作者所知这是首个针对'移动端 LVLM 视觉编码器'进行系统化、基于真实端侧延迟的块级搜索的工作——他们不依赖 FLOPs 或 GPU/CPU 代理测量,而是对每个候选块在广泛配置网格上做 NPU 实测。第二,与以往高效 ViT 用同质化(一种或两种)混合器铺满全网的做法不同,UltraViT 提出异构架构:在不同 stage 根据分辨率与通道维度选用不同的、且专门为 NPU 改造的空间混合器。第三,预训练上跳出了对比学习窠臼,提出稠密蒸馏+冻结容量混合 LLM 生成式预训练的两阶段范式,既绕开对比信号错配,又用强且已对齐视觉的冻结解码器把'语言建模负担'从参数受限的视觉编码器身上卸掉。
核心方法
UltraViT 的整体思路是'架构与训练协同设计'。架构上采用经典四 stage 金字塔,stem 先 4× 下采样,各 stage 通道 $C_{1-4}=[192,512,768,1536]$、块数 $N_{1-4}=[4,7,10,2]$,以 Meta 架构块为统一骨架,仅模块化替换空间混合器,最终选型为:Stage 1 卷积、Stage 2 卷积+稀疏注意力交错、Stage 3 通道分割注意力、Stage 4 完整单头注意力,末端由多尺度聚合器融合后期语义与早期高分辨率细节。训练上分三阶段:先在 DataComp-1B 子集(150M 样本)稠密蒸馏 25 epoch(LR $1\times10^{-4}$,batch 32k),再接冻结且已视觉对齐的 Qwen2 LLM 做生成式预训练(85M 样本,1 epoch,LR $1\times10^{-5}$,batch 192),最后在 LLaVA-OV 框架内监督微调(7.1M 样本),所得 LVLM 命名为 UltraVLM。全部模型在 32 张 H100 上用 PyTorch+DeepSpeed 训练。
核心创新点可归纳为两个本质区别。其一,架构层面:把'同质化混合器'升级为'延迟驱动的异构混合器'。作者不假设全网应该用同一种归纳偏置,而是基于一个核心假设——网络不同深度需要根本不同的归纳偏置与计算原语,再用真实 NPU 延迟实测来为每个 stage 选混合器。其二,预训练层面:用'稠密蒸馏 + 冻结视觉对齐 LLM 的生成式监督'取代对比学习。关键洞察是对比信号对生成式下游太粗、MIM 重构特征又太低层,而直接把编码器接到一个已对齐视觉的强冻结 LLM 上做下一 token 预测,能逼迫编码器专注产出'对 LLM 真正有用的高层视觉语义',避免小文本解码器把语言建模负担压到视觉编码器上。为兼顾对齐深度与算力,作者还提出在 0.5B 与 1.5B 冻结 LLM 间动态切换的容量混合策略。
方法步骤详情
方法分五步。第一步块选择:对四种空间混合器候选(卷积、稀疏注意力、CPSA、完整单头注意力)在 Galaxy S25 Ultra 上对宽配置网格做 INT8 量化实测,得 Fig. 3 每 stage 吞吐曲线,再为每 stage 圈定子集、用多 caption SigLIP 损失训练并按端速+精度排序(Table 1)。第二步架构(Fig. 1):金字塔 stem 4× 下采样,下采样块用 1×1+步长 DW conv+SE,末端多尺度聚合器融合多 stage 特征。第三步稠密蒸馏:用 Pixel Shuffle 把学生 token 重排到通道维匹配教师分辨率,计算 patch 级稠密余弦损失与经教师冻结注意力池化的全局余弦损失,加权为 $\mathcal{L}_{distill}=0.5\mathcal{L}_{dense}+0.5\mathcal{L}_{global}$。第四步生成式预训练:接已视觉对齐并冻结的 Qwen2 LLM,在 0.5B/1.5B 间动态切换,仅训编码器。第五步代入 LLaVA-OV 组成 UltraVLM,沿用其三阶段配方(共 7.1M 样本)。
技术新颖性
技术新颖性体现在三点。其一是异构架构本身与对应的端侧改造:稀疏混合器针对 NPU 做了四项关键改造——(S1) 单头替多头、(S2) 把离散采样算子 $\mathcal{S}$ 直接融合进 QKV 投影(用步长卷积实现)、(S3) 用最近邻上采样替代转置深度卷积、(S4) 把 Q/K 映到低维($C_{qk}=16$)并将 V 压缩 4 倍;Fig. 2(left) 展示四项改造逐项带来可观端速提升。完整注意力阶段也改用单头以避免多头切分嵌入维导致的内存碎片化(Fig. 2 right 验证单头 $H=1$ 最快)。其二是稠密蒸馏中的结构重对齐:用 Pixel Shuffle 重排而非粗暴下采样教师特征,最大程度保留对稠密预测至关重要的细粒度空间信息。其三是生成式预训练的容量混合策略:通过在 0.5B/1.5B 冻结 LLM 间动态切换,既获得与 1.5B 相当的对齐深度,又显著降低预训练算力(Table 5(b) 显示动态切换在 DocVQA/InfoVQA/MMSTAR/SQA 上匹配或超过纯 1.5B)。
实验结果
论文从多维度验证。精度上(Table 2),UltraVLM 在多数基准超过同配方重训的 FastVLM,尤其 TextVQA +6.0%、DocVQA +5.1%、ChartQA +6.2%;即便 FastVLM 用两倍多微调监督(16.1M vs 7.1M)仍被超越。限制到同 256 token 预算时,UltraVLM 在多数基准反超 QwenVL-2/2.5/3。token 压缩上(Table 3),UltraVLM 原生实现 16.0× token 削减与 19.1× 编码器加速,超越 VisionZip、PyramidDrop(约 4.6–5.7× token 但编码器无加速)等事后剪枝方法,是唯一同时加速编码器的方法。效率上(Fig. 4),UltraViT 在 512×512 下比 FastViT 快约 1.7×,跨分辨率一致。预训练数据效率上(Table 4),用约 3× 更少总样本(4.1B vs 13B)即达 SOTA。消融(Table 5)显示稠密蒸馏在 fine-grained 任务增益更大且随教师规模可继续提升,生成式阶段动态切换与纯 1.5B 相当或更优。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| TextVQA(文字视觉问答) | 准确率 | 68.9 | FastVLM(同配方重训) 62.9 | +6.0 个百分点 |
| DocVQA(文档视觉问答) | 准确率 | 71.8 | FastVLM 66.7 | +5.1 个百分点 |
| ChartQA(图表问答) | 准确率 | 72.2 | FastVLM 66.0 | +6.2 个百分点 |
| MMSTAR | 准确率 | 49.8 | FastVLM 44.1 | +5.7 个百分点 |
| 视觉编码器推理吞吐(512×512, Galaxy S25) | inf./sec | 148.9 | FastViT ~91.4 / SigLIP-400M | 比 FastViT 快约1.7×,比 SigLIP-400M 快19.1× |
| token 压缩比 | 相对 LLaVA-OV 的 token 数 | 16.0× | VisionZip/PyramidDrop/VisPruner/HiRED 约4.6–5.7× | 原生压缩且唯一同时加速编码器 |
局限与改进
论文未设独立'局限性'章节,但从内容可归纳若干隐含限制。首先,端侧基准与训练高度耦合特定硬件与栈——所有 NPU 延迟均在 Samsung Galaxy S25 Ultra、Qualcomm QNN SDK、INT8 全量化下测得,结论对其它芯片(如联发科、苹果 NPU)或更高精度(FP16)的泛化未做验证。其次,预训练依赖大型高分辨率教师模型与已视觉对齐的冻结 LLM,这意味着该方案实际背负了对教师和 LLM 的隐性依赖与数据需求(150M DataComp-1B 子集 + 85M 数据混合 + 4M LLaVA-OV 对齐样本),小团队未必能复现。第三,所有比较均在 LLaVA-OV 框架内进行,未在其它 LVLM 主干(如 QwenVL 原生框架)上验证 UltraViT 作为即插即用编码器的迁移性,'新 SOTA'的结论受框架约束。第四,论文将单头注意力作为全网默认,但未深入讨论这对需要多头多样性任务的潜在上限影响;生成式预训练仅 1 epoch 且算力差异(0.5B/1.5B 切换比例)未充分披露。最后,未提供开源代码/权重的明确说明,可复现性存疑。
独立分析的弱点
从独立视角看,UltraViT 有若干值得改进之处。第一,端侧延迟高度依赖编译栈与量化精度,INT8 对权重与激活量化敏感,对超分辨率、HDR 等分布外输入可能出现精度塌陷——改进方向是引入量化感知训练或混合精度策略,并在更多芯片上做基准。第二,异构混合器的搜索空间目前是手工设计的四种混合器与有限配置网格,本质上仍是'人工+实测'的启发式搜索,未与现代 NAS/可微搜索结合;可考虑用端侧延迟可微代理自动搜索每个 stage 的混合器组合。第三,生成式预训练的容量混合策略缺乏理论解释,0.5B/1.5B 的切换比例与调度是经验设定,未来可建模为课程学习或多教师蒸馏的形式化问题。第四,多尺度聚合器被描述为轻量但细节不足,其与金字塔各 stage 的特征对齐方式、是否引入显著额外延迟、对空间接地任务的贡献均值得消融。第五,比较面局限于 LLaVA-OV 框架,若与近期的原生多模态预训练(如直接从大规模图像-文本-交错数据从头训 LVLM)结合,结论可能不同。
未来方向
作者在结论中暗示的延伸包括:将异构、延迟感知的设计理念推广到更高分辨率/视频 LVLM 编码(视频 token 量更大、编码器瓶颈更严重),以及用更强的教师与更长的稠密蒸馏继续压榨表示力(Table 5(a) 显示更大教师仍有增益)。基于本文成果可进一步延伸的方向有:把端侧延迟可微搜索与可微 NAS 结合实现全自动 stage 级混合器选择;将容量混合生成式预训练推广为一般化的'多冻结解码器蒸馏'框架,并接入多模态大模型做端到端训练;探索 UltraViT 在 3B/7B 等 LLM 主干上、以及在非 LLaVA 框架(QwenVL/InternVL)下的迁移性与上限;以及研究 NPU 友好的更高阶稀疏/线性注意力变体在 Stage 3/4 的潜力。
复现评估
复现性总体偏难。论文给出了关键训练超参(稠密蒸馏 25 epoch、LR $1\times10^{-4}$、batch 32k;生成式预训练 1 epoch、LR $1\times10^{-5}$、batch 192;监督微调 7.1M 样本),并说明用 32 张 H100 + PyTorch + DeepSpeed,端侧基准在 Galaxy S25 Ultra、QNN SDK、INT8 全量化下完成,相对透明。但存在若干缺口:未公开代码与权重,未明确教师模型的具体身份与分辨率、4M LLaVA-OV 视觉对齐的细节、容量混合的切换比例/调度;稠密蒸馏中 Pixel Shuffle 的非整数比情形与分辨率对齐下采样的具体实现也未完全给出。此外 150M DataComp-1B 子集是'随机采样',可复现需要明确采样种子/清单。综合看,架构与训练流程思路清晰可复刻大方向,但要做到数值一致需作者公开代码与数据清单。
论文图表