← 返回 2026-07-29

Mage-VL:高效的编解码器原生流式多模态基础模型 Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu 📅 2026-07-27 👍 32 2026-08-03 18:30
AI4AI 数据流水线 System 1/2 双系统 VLM 可变分辨率训练 多模态大模型 流式感知 视觉编码器 视频理解 视频编解码

编解码器原生视觉tokenizer+事件门控,4B参数实时流式多模态模型

前置知识

Codec-Native Tokenization(编解码器原生token化)

借鉴传统视频编解码器(如 HEVC/H.265)的思路,把视频帧分成 I 帧(锚帧,完整编码)和 P 帧(预测帧,仅编码运动残差)。Mage-ViT 在 patch 选择阶段就让 tokenizer 只保留运动剧烈、信息密度高的 patch,从而在送入 ViT 之前就把冗余的背景 token 砍掉,而不是先算完所有 patch 再做剪枝。

这是本文区别于所有「先稠密编码后压缩」的视频 VLM 的核心机制,理解它才能理解为什么 Mage-VL 能做到 75% token 削减和 3.5× 推理加速。

Moravec's Paradox(莫拉维克悖论)

原指 AI 容易完成人类觉得困难的高层推理,却难以完成人类觉得简单的感知与运动任务。本文把它现代版地迁移到 VLM:现有大模型在复杂离线视觉推理(写代码、读文档)上极强,却在「实时感知连续视频流并响应动态事件」这种看似简单的任务上既慢又差。

这是全文的问题来源——它解释了为什么不能简单地把更强的图像 VLM 搬到视频流上用。

System 1 / System 2 双系统认知架构

借鉴认知科学(Kahneman):System 1 是快速、低延迟的直觉反应(对应本文的「事件门」cognition gate),决定何时开口;System 2 是缓慢、深思熟虑的推理(对应冻结的语言解码器),决定说什么。本文用一个轻量 gate 持续监听视觉流,触发时再调用 System 2 生成回复。

理解这个架构才能看懂 Stage 5 的训练目标和 SoccerNet-Caption 评测指标(TriggerAcc/TimVal 测的是 System 1 的「什么时候说话」)。

Linear/Attentive Probing(线性探针/注意力探针评测)

冻结视觉编码器,只在顶部训练一个线性分类头(图像)或带注意力的轻量头(视频),用下游分类准确率衡量表征质量。这样可以在不被 LLM 干扰的情况下,纯净评估 ViT 本身的特征好坏。

Table 1 用这套协议证明「仅用 560M 图像训练的 Mage-ViT 能匹配用几十亿图文对训练的 SigLIP2」,这是本文最重要的反共识发现之一。

Motion Vector(运动向量)与 Residual Energy(残差能量)

传统视频编码中,运动向量描述相邻帧间像素块的运动方向和幅度,残差能量描述预测误差的大小。两者结合可以估计每个 patch 的「编码代价」S∈R^{T×H×W},代价高意味着该区域信息量大、需要更多比特,因此值得分配视觉 token。

这是 codec-driven patchifier 选择 top-k patch 的依据,理解它才能看懂为什么这套机制对传统 codec(HEVC)和神经 codec(DCVC-RT)都通用。

研究动机

现有开源 VLM(Qwen-VL、InternVL、LLaVA-OneVision、Keye-VL、Kimi-VL 等)在面对连续视频流时陷入了莫拉维克悖论的现代版本:它们在稀疏抽帧的复杂离线推理上表现优异,却在「实时响应动态视觉事件」这类看似简单的感知任务上既慢又差。根因是一个结构性错配——物理感知是连续、事件驱动的,而这些模型的视觉编码器(如 Kimi-VL 继承的 SigLIP2)是在数十亿静态图文对上预训练的,处理视频时普遍采用固定分辨率下的均匀抽帧。这种策略完全忽略了时空冗余:即使场景只有一小部分在变化,静态背景区域也会被一遍遍重新编码,导致计算量随视频时长迅速膨胀,且很容易错过短时关键事件。作者在 Figure 7 用 2026 世界杯直播做案例:常规传球阶段模型本应保持沉默,但传统方法却把整个画面反复编码再判断,既浪费算力又难以做到事件触发的低延迟响应。

本文的目标是作者要做一个 codec-native 的流式基础模型 Mage-VL,达成三个具体目标:(1) 在送入视觉编码器之前就用编解码器信号剔除时空冗余 patch,把视觉 token 削减 75% 以上(实际达到 1/8 或更少);(2) 在不继承任何「十亿级图文对预训练编码器」的前提下,仅用约 560M 无标注图像 + 100M 无标注视频帧从零训练出与 SigLIP2 等旗舰编码器持平或更好的 Mage-ViT;(3) 在同一模型内同时支持静态图像理解、长短视频离线推理、以及事件触发的主动流式交互,并在 4B 参数量级上达到比 15B 的 Phi-4-reasoning-vision 更好的综合表现与最高 3.5× 的端到端推理加速。

与已有工作不同的是,已有视频 VLM 的 token 削减思路(LLaMA-VID、LongVU、VideoChat-Flash、FastV、ToMe 等)几乎都遵循一个范式:先把整帧稠密编码,再在特征层做剪枝/合并或挑选整帧。这相当于「先花满钱再省」,仍留有大量时空冗余。Mage-VL 抓住的是更上游的点——直接借用视频编解码器几十年来成熟的全局最优比特分配信号(运动向量+残差能量,或神经 codec 的负对数似然),在 patch 化阶段就只保留真正有信息量的 patch。同时,它把「主动流式」从机制层面做成了视觉前端的原生能力(rolling codec-token 窗口 + System 1 gate),而不是在传统帧式编码器外面套一层 streaming 模块。这个「让 codec 思路下沉到 tokenizer」和「让生物双系统架构成为前端原生设计」的视角,是它和所有 prior work 的本质区别。

核心方法

直觉上,Mage-VL 像在模仿人的视觉系统:视网膜前端会主动过滤掉冗余背景、只对动态运动敏感(对应 codec-driven patchifier 只保留运动/熵高的 patch),同时大脑有快速反应通道(System 1 event gate)和深思熟虑通道(System 2 因果解码器)。技术上它由三块组成:从零训练的 codec-native 视觉编码器 Mage-ViT(24 层 ViT,hidden 1024,16 头,16×16 patch),一个两层 MLP 的视觉-语言投影器,以及用 Qwen3-4B-Instruct-2507 初始化的因果语言解码器。视频输入被划成 I 帧(锚帧,全部 patch 保留)和 P 帧(预测帧,仅保留 codec 重要性 top-k 的 patch),所有被保留的 patch 携带其在原始时空网格上的 3D rotary 位置编码被打包成 canvas,保证稀疏化后空间-时间关系不丢失。这套统一接口让同一模型能无缝处理单图、短视频、长视频和超长流。

最本质的创新是「codec-native 的 token 分配」与「双系统主动流式」二合一。前者的核心是把视频编解码器的比特分配图 S∈R^{T×H×W}(HEVC 下由运动向量幅值和 P 帧残差能量加权得到,神经 codec DCVC-RT 下由学习到的概率模型的负对数似然得到)当作 spatio-temporal 重要性的天然代理,从而在送入昂贵的 ViT 之前就只保留 I 帧全量 patch + P 帧 top-k patch(64 帧 clip 在 4096 token 预算下减少约 75%)。后者的核心是用一个冻结的视觉主干 + 一个事件保留特征提取器(EPFE)维护一个仅服务于 gate 的循环记忆 M_{per},gate 在每个候选时间步预测 silent/speak 二元 token,当 p_{speak}≥τ 时才触发冻结的语言模型用最近 N 段 codec canvas 做自回归生成。这跟以往「在稠密帧编码器外挂流式模块」完全不同——它把流式做成了视觉前端的原生属性。

方法步骤详情

整套方法分五阶段渐进训练。Stage 1(多模态对齐):用约 350M 稠密图像 caption + 4.2M 短视频 caption 做 warm-up,直接训练完整模型而非只训投影器,让 Mage-ViT token 关联物体/属性/OCR/图表/文档/空间关系。Stage 2(指令微调+短时序定位):混入约 54M 图像指令样本(来自 LLaVA-OneVision-1.5、FineVision、OpenBee 以及 LLaVA-OneVision-2 的空间/GUI 数据)和 3.4M 段 30–180 秒视频 caption,把模型从描述者变成通用助手。Stage 3(时间窗扩展):保留 20M Stage-2 图像指令,引入 LLaVA-Video、TimeLens、VideoChat-Flash、Molmo2 及自有时间结构化 caption,教模型理解分钟级的事件演化与跨段依赖;该阶段还引入 AI4AI 诊断来动态选择最优分辨率和帧数(最终采用 384 像素 + 384 帧,并把 RoPE base θ 调到 8M 稳定长上下文)。Stage 4(codec-native 长上下文适配):把 35 万长视频 caption 转成 codec-native 表示(rolling 窗口:稠密锚帧 + 稀疏预测帧),由于预测 patch 机制,相同 token 预算下能覆盖 8 倍长度的视频。Stage 5(主动流式对齐):冻结视觉主干、EPFE 和语言模型,只微调 cognition gate,在约 335 万流式样本(280 万来自 180 秒 caption 转换,54 万来自 MatchTime/LiveCC/StreamingVLM)上训练,对每个 caption 起始时间戳标 speak、其它候选时间戳标 silent,用类加权交叉熵 $\mathcal{L}_{gate} = -\sum_t w_{g_t} \log p(g_t | g_{<t}, M_{per})$,$g_t \in \{silent, speak\}$ 优化,并强制 no-future-frame 约束(决策只依赖当前时间步之前的观测)。

技术新颖性

新颖性体现在五点:(1) 视觉编码器从零训练(仅 560M 图像 + 100M 视频),与「必须继承十亿级图文对预训练编码器」的惯例相反,却仍匹配 SigLIP2、MoonViT;(2) codec-driven patchifier 同时支持传统 codec(HEVC)和神经 codec(DCVC-RT),且证明两者在 token 选择上是「同一信号的不同估计」(局部时间可预测性),从而可跨 codec 家族迁移无需重训;(3) 用一个超大 patch grid(16×16 vs OV-Encoder 的 14×14)以更少 token 拿到相当或更好的表征质量;(4) variable-resolution 预训练带来单调的 token-budget 缩放,不像固定分辨率模型那样在高分辨率退化;(5) Zero-Vision SFT 发现——跳过视觉 SFT、用纯文本推理 SFT 反而能释放多模态 RL 的潜力(24 个基准均分 54.28% vs 48.96%,且 RL 步数减半)。这些都是对当前 VLM 缩放实践的直接挑战。

Codec-driven patchifier of Mage-ViT
Figure 2: Codec-driven patchifier of Mage-ViT
Proactive streaming framework of Mage-VL
Figure 3: Proactive streaming framework of Mage-VL
Iterative prompt-optimization pipeline for image recaptioning
Figure 4: Iterative prompt-optimization pipeline for image recaptioning
Constructing proactive streaming supervision from timestamped video captions
Figure 5: Constructing proactive streaming supervision from timestamped video captions

实验结果

核心结论可以按五个维度逐一拆解。(1) 视觉表征质量(Table 1):Mage-ViT 用远小于 SigLIP2 的预训练数据量,在 ImageNet 线性探针拿到 85.69%(SigLIP2 是 85.92%),CIFAR-10 99.33% 为全场最高,SUN397 82.01%、Food-101 95.60% 都极具竞争力;视频侧在 16 帧均匀采样下 HMDB-51 达 85.13%、K400 84.83%,Diving-48 60.45%,均超越 SigLIP 和 DINOv3;切到 codec 稀疏采样(同样 4096 token 但覆盖 64 帧)后 Diving-48 跳升到 64.14%(+3.69%)。(2) 分辨率缩放(Figure 6):固定分辨率基线(SigLIP2、OV-Encoder)超过最优 token 预算后会持续退化,SigLIP2 在 ImageNet 从 256 token 的 ~85.9% 跌到 676 token 的 ~84.7%;Mage-ViT 却单调上升,676 token 时 Food-101 >96.1%、ImageNet >86.3%。(3) 图像理解(Table 3):与共享同一 Qwen3-4B LLM 的 Qwen3-VL-4B 对比,Mage-VL 在文档/OCR/图表上多数领先——DocVQA 95.14 vs 94.69、InfoVQA 80.33 vs 79.50、ChartQA 84.88 vs 83.96、OCRBench 81.80 vs 81.60;空间智能尤其亮眼,CrossPoint 80.00 vs 26.90(+53.1!)、CV-Bench-3D 94.75 vs 92.30、EmbSpatial 82.67 vs 77.50,且用约 1/4 参数大幅超过 15B 的 Phi-4-R-V。(4) 视频理解(Table 4):VideoMME +4.3(64.0 vs 59.7)、MLVU-dev +7.2(68.7 vs 61.5)、LongVideoBench +3.5、LVBench +2.6、NextQA +3.3、最惊人的是 VideoEval-Pro +24.5(45.2 vs 20.7)和 JumpScore 45.60 vs 3.82;时间定位 Timelens-Charades/ActivityNet/QVHighlight 分别 +7.6/+17.1/+22.5;视频空间推理 VSI-Bench 64.3 vs 53.3(+11.0);referring video tracking Ref-DAVIS17 25.83 vs 7.48、MeViS 22.55 vs 3.16。(5) 流式(Table 6/7):SoccerNet-Caption 上 Mage-VL 拿到 TriggerAcc 79.21、TimVal 55.54、F1 16.35、ROC-AUC 83.14、PR-AUC 9.30,全面超过在分布内训练的 StreamMind(TimVal 47.36),而 JoyAI 虽 TriggerAcc 97.98 但 TimVal 仅 19.25、F1 3.55(属于退化成「全猜 silent」);OVO-Bench 上以 64.00% 创下流式架构新 SOTA(Real-Time 79.84%、Backward 48.15%),超过 Qwen3-VL-4B 的 63.00% 和 HERMES-7B 的 59.20%。(6) 效率(Table 5):NextQA 上 tc8 配置 415 秒 vs Qwen3-VL 1460 秒(3.5× 加速)且准确率更高(80.8% vs 79.8%);VideoMME tc8 在 270 秒就接近 Qwen3-VL 463 秒的水平。(7) AI4AI 与 Zero-Vision SFT(Table 8/9):优化后的 caption 流水线让 InfoVQA +5.62、OCRBench +3.80;Zero-Vision SFT + RL 比 Quick Start + RL 在 24 个基准上均分 +5.33%,且 RL 收敛步数从 4415 减到 2175(-50.7%)。

Image and video representation quality of Mage-ViT
Table 1: Image and video representation quality of Mage-ViT
Cross-codec robustness of codec-guided patch selection
Table 2: Cross-codec robustness of codec-guided patch selection
Image understanding and spatial intelligence
Table 3: Image understanding and spatial intelligence
Video understanding and temporal grounding
Table 4: Video understanding and temporal grounding
Video performance and evaluation efficiency across token/codec budgets
Table 5: Video performance and evaluation efficiency across token/codec budgets
Response timing evaluation on SoccerNet-Caption
Table 6: Response timing evaluation on SoccerNet-Caption
Results on OVO-Bench
Table 7: Results on OVO-Bench
Downstream performance comparison before and after image captioning pipeline optimization
Table 8: Downstream performance comparison before and after image captioning pipeline optimization
Effectiveness of Skipping Vision SFT before Multimodal RL
Table 9: Effectiveness of Skipping Vision SFT before Multimodal RL
Effect of the visual-token budget on image representation quality
Figure 6: Effect of the visual-token budget on image representation quality
Codec-native proactive streaming on a 2026 World Cup broadcast (England vs. Argentina)
Figure 7: Codec-native proactive streaming on a 2026 World Cup broadcast (England vs. Argentina)
Codec inputs versus uniform frame sampling across input budgets
Figure 8: Codec inputs versus uniform frame sampling across input budgets
查看结构化数据
任务指标本文基线提升
ImageNet 线性探针(图像表征) Top-1 Accuracy (%) 85.69 SigLIP2 85.92 / DINOv3 85.38 持平 SigLIP2,但预训练数据量小约一个数量级
Diving-48 视频识别(codec 4096 token / 64帧) Top-1 Accuracy (%) 64.14 OV-Encoder(Codec) 65.32 / SigLIP2(Chunk) 62.30 相比自身 chunk 模式 +3.69%,验证 codec 稀疏采样对细粒度动作的优势
VideoEval-Pro 长视频问答 Score 45.2 Qwen3-VL-4B 20.7 +24.5,本文最大单项提升之一
VSI-Bench 视频空间推理 Score 64.3 Qwen3-VL-4B 53.3 / Phi-4-R-V-15B 25.5 +11.0 over Qwen3-VL-4B
CrossPoint 跨视角点对应(静态空间) Accuracy (%) 80.00 Qwen3-VL-4B 26.90 +53.1,源自 codec patchification 对几何一致性的保留
Timelens-QVHighlight 时间定位 Score 57.4 Qwen3-VL-4B 34.9 +22.5
SoccerNet-Caption 触发时机 TimVal (%) 55.54 StreamMind 47.36 / JoyAI 19.25 SOTA,且无需分布内训练
OVO-Bench 综合 Avg (%) 64.00 Qwen3-VL-4B 63.00 / HERMES-7B 59.20 流式架构新 SOTA
NextQA 端到端推理时延 Wall-clock (s) @ Accuracy 415s @ 80.8% Qwen3-VL-4B 1460s @ 79.8% 3.5× 加速且准确率更高
Zero-Vision SFT+RL 综合(24基准均分) Accuracy (%) 54.28 Quick Start + RL 48.96 +5.33,RL 步数减少 50.7%

局限与改进

作者坦承的局限:(1) 复杂 agentic 工作流和数学推理上仍弱于 Qwen3-VL,原因归结为高质量纯文本数据不足、缺乏文本-多模态联合预训练以及省略了 RL 后训练;(2) 论文自己承认 motion-spatial synergy 没法做严格的单变量消融——因为五阶段训练高度耦合(joint pre-training recipe),只能用跨 benchmark 的经验证据间接支持;(3) streaming 评测里 SoccerNet 用的是严格零容忍 canvas-position 匹配,但 OVO-Bench 走的是 SimpleStream 的 recent-window(4 帧)协议,两套协议未必能直接横向比;(4) Stage 5 只训 gate、语言模型冻结,意味着主动回复时只用最近 N 段滑窗,长程事件链难以串联。我自己的观察:(a) Table 5 里 Mage-VL 在 Charades、TempCompass、MV-Bench、MMVU 等「依赖单帧外观」的任务上反而落后 Qwen3-VL,说明 codec 稀疏化对外观稠密型任务并非免费午餐;(b) tc8 配置在 LongVideoBench(56.2)和 LVBench(38.9)上明显低于 tc32,低预算场景对长视频仍有损失;(c) Figure 8 中 MV-Bench 是少数 codec 优势消失的边界情形,论文坦诚但未给量化边界条件。

独立分析的弱点

弱点一:外观稠密型视频任务上 codec 稀疏化有系统性代价。Charades(34.1 vs Qwen3-VL 45.9)、TempCompass(72.7 vs 62.3 反向落后)、MV-Bench(65.1 vs 66.7)都暴露——当任务答案藏在静态外观而非运动里时,砍掉 75% token 会丢信息。改进方向:可以做一个内容自适应的预算调节器,让 importance map 在「运动信号」之外也加入「查询相关显著性」(比如根据用户问题动态加权 patch)。弱点二:长程事件链在 Stage 5 只靠滑窗 + gate,没有显式长期记忆模块,作者虽提到 Flash-VStream、StreamingVLM 等用了压缩/滚动状态,但 Mage-VL 自己没集成。改进方向:把 EPFE 的循环状态显式接入语言生成路径,或借鉴 episodic memory 做事件级检索。弱点三:模型规模与生态——只放了 4B 一个尺寸,缺少 7B/13B 的缩放曲线,也缺乏对纯音频/多模态流的扩展,作者提到未来要做「native audio-visual stream fusion」。弱点四:训练数据虽然公开来源,但 caption 重写流水线依赖 GPT-5、GPT-4.1、Qwen3-VL-32B、GitHub Copilot 等闭源组件,复现成本极高;可以转向开源 rubric 模型做替代研究。弱点五:streaming 监督只来源于 caption 起止时间戳,本质是「描述性事件」,对开放域交互(提问、纠错、多轮)覆盖不足。

未来方向

作者明确提出的方向:(1) 把 Zero-Vision SFT + RL 正式纳入主模型训练,以补齐 agentic 和数学推理短板;(2) 扩展到原生音视频流融合(native audio-visual stream fusion);(3) 推向 embodied 与 edge 部署场景。基于本文成果我认为可延伸的方向还包括:把 codec-native 思路推广到 3D/点云/BEV 序列(自动驾驶),因为「时间可预测性」对空间冗余同样适用;在 cognition gate 上引入显式置信度校准和拒绝选项,避免幻觉式主动评论;研究「单 codec 多任务」——同一重要性图既能驱动 token 选择也能驱动镜头分割/事件边界检测;以及把 AI4AI 流水线与 SkillOpt-Lite 这类自优化数据系统更深度耦合,做端到端的数据-模型协同缩放律。

复现评估

可复现性总体偏中等。积极方面:代码(github.com/microsoft/Mage)、模型权重(HuggingFace microsoft/mage collection)、项目页都已开源,主要训练超参(Stage 1 学习率 $10^{-3}$、Stage 2 降到 $5 \times 10^{-5}$、负采样比 $r=0.1$、tc8/tc16/tc32 三个推理预算点、token budget $B=4096$、64 帧 clip、3D rotary PE、RoPE base θ=8M、空间分辨率 384、Stage 3 时序 384 帧)都写明了,测评全部走 lmms-eval 官方模板无 prompt tuning,wall-clock 在 8×B200 单节点上测——协议清晰。消极方面:caption 重写流水线强依赖 GPT-5、GPT-4.1、Qwen3-VL-32B、GitHub Copilot,这些闭源/半闭源组件普通团队难以等价复现;350M 图文对里 265M 来自「约 10 亿公开图文对过滤」,未给出完整过滤脚本;约 560M 图像 + 100M 视频帧的精确清单只列了数据集名(LAION-400M、COYO-700M、OBELICS、Zero250M、ImageNet-21K、HowTo100M、Panda-70M)而未给最终采样清单;算力上从零训练 24 层 ViT + 5 阶段 4B LLM 大概率需要数百卡级别 GPU,对学术组不友好。复现 Mage-ViT 单变量实验相对可行,复现完整 Mage-VL 较难。