Mage-VL:高效的编解码器原生流式多模态基础模型 Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
编解码器原生视觉tokenizer+事件门控,4B参数实时流式多模态模型
前置知识
Codec-Native Tokenization(编解码器原生token化)
借鉴传统视频编解码器(如 HEVC/H.265)的思路,把视频帧分成 I 帧(锚帧,完整编码)和 P 帧(预测帧,仅编码运动残差)。Mage-ViT 在 patch 选择阶段就让 tokenizer 只保留运动剧烈、信息密度高的 patch,从而在送入 ViT 之前就把冗余的背景 token 砍掉,而不是先算完所有 patch 再做剪枝。
这是本文区别于所有「先稠密编码后压缩」的视频 VLM 的核心机制,理解它才能理解为什么 Mage-VL 能做到 75% token 削减和 3.5× 推理加速。
Moravec's Paradox(莫拉维克悖论)
原指 AI 容易完成人类觉得困难的高层推理,却难以完成人类觉得简单的感知与运动任务。本文把它现代版地迁移到 VLM:现有大模型在复杂离线视觉推理(写代码、读文档)上极强,却在「实时感知连续视频流并响应动态事件」这种看似简单的任务上既慢又差。
这是全文的问题来源——它解释了为什么不能简单地把更强的图像 VLM 搬到视频流上用。
System 1 / System 2 双系统认知架构
借鉴认知科学(Kahneman):System 1 是快速、低延迟的直觉反应(对应本文的「事件门」cognition gate),决定何时开口;System 2 是缓慢、深思熟虑的推理(对应冻结的语言解码器),决定说什么。本文用一个轻量 gate 持续监听视觉流,触发时再调用 System 2 生成回复。
理解这个架构才能看懂 Stage 5 的训练目标和 SoccerNet-Caption 评测指标(TriggerAcc/TimVal 测的是 System 1 的「什么时候说话」)。
Linear/Attentive Probing(线性探针/注意力探针评测)
冻结视觉编码器,只在顶部训练一个线性分类头(图像)或带注意力的轻量头(视频),用下游分类准确率衡量表征质量。这样可以在不被 LLM 干扰的情况下,纯净评估 ViT 本身的特征好坏。
Table 1 用这套协议证明「仅用 560M 图像训练的 Mage-ViT 能匹配用几十亿图文对训练的 SigLIP2」,这是本文最重要的反共识发现之一。
Motion Vector(运动向量)与 Residual Energy(残差能量)
传统视频编码中,运动向量描述相邻帧间像素块的运动方向和幅度,残差能量描述预测误差的大小。两者结合可以估计每个 patch 的「编码代价」S∈R^{T×H×W},代价高意味着该区域信息量大、需要更多比特,因此值得分配视觉 token。
这是 codec-driven patchifier 选择 top-k patch 的依据,理解它才能看懂为什么这套机制对传统 codec(HEVC)和神经 codec(DCVC-RT)都通用。
研究动机
现有开源 VLM(Qwen-VL、InternVL、LLaVA-OneVision、Keye-VL、Kimi-VL 等)在面对连续视频流时陷入了莫拉维克悖论的现代版本:它们在稀疏抽帧的复杂离线推理上表现优异,却在「实时响应动态视觉事件」这类看似简单的感知任务上既慢又差。根因是一个结构性错配——物理感知是连续、事件驱动的,而这些模型的视觉编码器(如 Kimi-VL 继承的 SigLIP2)是在数十亿静态图文对上预训练的,处理视频时普遍采用固定分辨率下的均匀抽帧。这种策略完全忽略了时空冗余:即使场景只有一小部分在变化,静态背景区域也会被一遍遍重新编码,导致计算量随视频时长迅速膨胀,且很容易错过短时关键事件。作者在 Figure 7 用 2026 世界杯直播做案例:常规传球阶段模型本应保持沉默,但传统方法却把整个画面反复编码再判断,既浪费算力又难以做到事件触发的低延迟响应。
本文的目标是作者要做一个 codec-native 的流式基础模型 Mage-VL,达成三个具体目标:(1) 在送入视觉编码器之前就用编解码器信号剔除时空冗余 patch,把视觉 token 削减 75% 以上(实际达到 1/8 或更少);(2) 在不继承任何「十亿级图文对预训练编码器」的前提下,仅用约 560M 无标注图像 + 100M 无标注视频帧从零训练出与 SigLIP2 等旗舰编码器持平或更好的 Mage-ViT;(3) 在同一模型内同时支持静态图像理解、长短视频离线推理、以及事件触发的主动流式交互,并在 4B 参数量级上达到比 15B 的 Phi-4-reasoning-vision 更好的综合表现与最高 3.5× 的端到端推理加速。
与已有工作不同的是,已有视频 VLM 的 token 削减思路(LLaMA-VID、LongVU、VideoChat-Flash、FastV、ToMe 等)几乎都遵循一个范式:先把整帧稠密编码,再在特征层做剪枝/合并或挑选整帧。这相当于「先花满钱再省」,仍留有大量时空冗余。Mage-VL 抓住的是更上游的点——直接借用视频编解码器几十年来成熟的全局最优比特分配信号(运动向量+残差能量,或神经 codec 的负对数似然),在 patch 化阶段就只保留真正有信息量的 patch。同时,它把「主动流式」从机制层面做成了视觉前端的原生能力(rolling codec-token 窗口 + System 1 gate),而不是在传统帧式编码器外面套一层 streaming 模块。这个「让 codec 思路下沉到 tokenizer」和「让生物双系统架构成为前端原生设计」的视角,是它和所有 prior work 的本质区别。
核心方法
直觉上,Mage-VL 像在模仿人的视觉系统:视网膜前端会主动过滤掉冗余背景、只对动态运动敏感(对应 codec-driven patchifier 只保留运动/熵高的 patch),同时大脑有快速反应通道(System 1 event gate)和深思熟虑通道(System 2 因果解码器)。技术上它由三块组成:从零训练的 codec-native 视觉编码器 Mage-ViT(24 层 ViT,hidden 1024,16 头,16×16 patch),一个两层 MLP 的视觉-语言投影器,以及用 Qwen3-4B-Instruct-2507 初始化的因果语言解码器。视频输入被划成 I 帧(锚帧,全部 patch 保留)和 P 帧(预测帧,仅保留 codec 重要性 top-k 的 patch),所有被保留的 patch 携带其在原始时空网格上的 3D rotary 位置编码被打包成 canvas,保证稀疏化后空间-时间关系不丢失。这套统一接口让同一模型能无缝处理单图、短视频、长视频和超长流。
最本质的创新是「codec-native 的 token 分配」与「双系统主动流式」二合一。前者的核心是把视频编解码器的比特分配图 S∈R^{T×H×W}(HEVC 下由运动向量幅值和 P 帧残差能量加权得到,神经 codec DCVC-RT 下由学习到的概率模型的负对数似然得到)当作 spatio-temporal 重要性的天然代理,从而在送入昂贵的 ViT 之前就只保留 I 帧全量 patch + P 帧 top-k patch(64 帧 clip 在 4096 token 预算下减少约 75%)。后者的核心是用一个冻结的视觉主干 + 一个事件保留特征提取器(EPFE)维护一个仅服务于 gate 的循环记忆 M_{per},gate 在每个候选时间步预测 silent/speak 二元 token,当 p_{speak}≥τ 时才触发冻结的语言模型用最近 N 段 codec canvas 做自回归生成。这跟以往「在稠密帧编码器外挂流式模块」完全不同——它把流式做成了视觉前端的原生属性。
方法步骤详情
整套方法分五阶段渐进训练。Stage 1(多模态对齐):用约 350M 稠密图像 caption + 4.2M 短视频 caption 做 warm-up,直接训练完整模型而非只训投影器,让 Mage-ViT token 关联物体/属性/OCR/图表/文档/空间关系。Stage 2(指令微调+短时序定位):混入约 54M 图像指令样本(来自 LLaVA-OneVision-1.5、FineVision、OpenBee 以及 LLaVA-OneVision-2 的空间/GUI 数据)和 3.4M 段 30–180 秒视频 caption,把模型从描述者变成通用助手。Stage 3(时间窗扩展):保留 20M Stage-2 图像指令,引入 LLaVA-Video、TimeLens、VideoChat-Flash、Molmo2 及自有时间结构化 caption,教模型理解分钟级的事件演化与跨段依赖;该阶段还引入 AI4AI 诊断来动态选择最优分辨率和帧数(最终采用 384 像素 + 384 帧,并把 RoPE base θ 调到 8M 稳定长上下文)。Stage 4(codec-native 长上下文适配):把 35 万长视频 caption 转成 codec-native 表示(rolling 窗口:稠密锚帧 + 稀疏预测帧),由于预测 patch 机制,相同 token 预算下能覆盖 8 倍长度的视频。Stage 5(主动流式对齐):冻结视觉主干、EPFE 和语言模型,只微调 cognition gate,在约 335 万流式样本(280 万来自 180 秒 caption 转换,54 万来自 MatchTime/LiveCC/StreamingVLM)上训练,对每个 caption 起始时间戳标 speak、其它候选时间戳标 silent,用类加权交叉熵 $\mathcal{L}_{gate} = -\sum_t w_{g_t} \log p(g_t | g_{<t}, M_{per})$,$g_t \in \{silent, speak\}$ 优化,并强制 no-future-frame 约束(决策只依赖当前时间步之前的观测)。
技术新颖性
新颖性体现在五点:(1) 视觉编码器从零训练(仅 560M 图像 + 100M 视频),与「必须继承十亿级图文对预训练编码器」的惯例相反,却仍匹配 SigLIP2、MoonViT;(2) codec-driven patchifier 同时支持传统 codec(HEVC)和神经 codec(DCVC-RT),且证明两者在 token 选择上是「同一信号的不同估计」(局部时间可预测性),从而可跨 codec 家族迁移无需重训;(3) 用一个超大 patch grid(16×16 vs OV-Encoder 的 14×14)以更少 token 拿到相当或更好的表征质量;(4) variable-resolution 预训练带来单调的 token-budget 缩放,不像固定分辨率模型那样在高分辨率退化;(5) Zero-Vision SFT 发现——跳过视觉 SFT、用纯文本推理 SFT 反而能释放多模态 RL 的潜力(24 个基准均分 54.28% vs 48.96%,且 RL 步数减半)。这些都是对当前 VLM 缩放实践的直接挑战。
实验结果
核心结论可以按五个维度逐一拆解。(1) 视觉表征质量(Table 1):Mage-ViT 用远小于 SigLIP2 的预训练数据量,在 ImageNet 线性探针拿到 85.69%(SigLIP2 是 85.92%),CIFAR-10 99.33% 为全场最高,SUN397 82.01%、Food-101 95.60% 都极具竞争力;视频侧在 16 帧均匀采样下 HMDB-51 达 85.13%、K400 84.83%,Diving-48 60.45%,均超越 SigLIP 和 DINOv3;切到 codec 稀疏采样(同样 4096 token 但覆盖 64 帧)后 Diving-48 跳升到 64.14%(+3.69%)。(2) 分辨率缩放(Figure 6):固定分辨率基线(SigLIP2、OV-Encoder)超过最优 token 预算后会持续退化,SigLIP2 在 ImageNet 从 256 token 的 ~85.9% 跌到 676 token 的 ~84.7%;Mage-ViT 却单调上升,676 token 时 Food-101 >96.1%、ImageNet >86.3%。(3) 图像理解(Table 3):与共享同一 Qwen3-4B LLM 的 Qwen3-VL-4B 对比,Mage-VL 在文档/OCR/图表上多数领先——DocVQA 95.14 vs 94.69、InfoVQA 80.33 vs 79.50、ChartQA 84.88 vs 83.96、OCRBench 81.80 vs 81.60;空间智能尤其亮眼,CrossPoint 80.00 vs 26.90(+53.1!)、CV-Bench-3D 94.75 vs 92.30、EmbSpatial 82.67 vs 77.50,且用约 1/4 参数大幅超过 15B 的 Phi-4-R-V。(4) 视频理解(Table 4):VideoMME +4.3(64.0 vs 59.7)、MLVU-dev +7.2(68.7 vs 61.5)、LongVideoBench +3.5、LVBench +2.6、NextQA +3.3、最惊人的是 VideoEval-Pro +24.5(45.2 vs 20.7)和 JumpScore 45.60 vs 3.82;时间定位 Timelens-Charades/ActivityNet/QVHighlight 分别 +7.6/+17.1/+22.5;视频空间推理 VSI-Bench 64.3 vs 53.3(+11.0);referring video tracking Ref-DAVIS17 25.83 vs 7.48、MeViS 22.55 vs 3.16。(5) 流式(Table 6/7):SoccerNet-Caption 上 Mage-VL 拿到 TriggerAcc 79.21、TimVal 55.54、F1 16.35、ROC-AUC 83.14、PR-AUC 9.30,全面超过在分布内训练的 StreamMind(TimVal 47.36),而 JoyAI 虽 TriggerAcc 97.98 但 TimVal 仅 19.25、F1 3.55(属于退化成「全猜 silent」);OVO-Bench 上以 64.00% 创下流式架构新 SOTA(Real-Time 79.84%、Backward 48.15%),超过 Qwen3-VL-4B 的 63.00% 和 HERMES-7B 的 59.20%。(6) 效率(Table 5):NextQA 上 tc8 配置 415 秒 vs Qwen3-VL 1460 秒(3.5× 加速)且准确率更高(80.8% vs 79.8%);VideoMME tc8 在 270 秒就接近 Qwen3-VL 463 秒的水平。(7) AI4AI 与 Zero-Vision SFT(Table 8/9):优化后的 caption 流水线让 InfoVQA +5.62、OCRBench +3.80;Zero-Vision SFT + RL 比 Quick Start + RL 在 24 个基准上均分 +5.33%,且 RL 收敛步数从 4415 减到 2175(-50.7%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ImageNet 线性探针(图像表征) | Top-1 Accuracy (%) | 85.69 | SigLIP2 85.92 / DINOv3 85.38 | 持平 SigLIP2,但预训练数据量小约一个数量级 |
| Diving-48 视频识别(codec 4096 token / 64帧) | Top-1 Accuracy (%) | 64.14 | OV-Encoder(Codec) 65.32 / SigLIP2(Chunk) 62.30 | 相比自身 chunk 模式 +3.69%,验证 codec 稀疏采样对细粒度动作的优势 |
| VideoEval-Pro 长视频问答 | Score | 45.2 | Qwen3-VL-4B 20.7 | +24.5,本文最大单项提升之一 |
| VSI-Bench 视频空间推理 | Score | 64.3 | Qwen3-VL-4B 53.3 / Phi-4-R-V-15B 25.5 | +11.0 over Qwen3-VL-4B |
| CrossPoint 跨视角点对应(静态空间) | Accuracy (%) | 80.00 | Qwen3-VL-4B 26.90 | +53.1,源自 codec patchification 对几何一致性的保留 |
| Timelens-QVHighlight 时间定位 | Score | 57.4 | Qwen3-VL-4B 34.9 | +22.5 |
| SoccerNet-Caption 触发时机 | TimVal (%) | 55.54 | StreamMind 47.36 / JoyAI 19.25 | SOTA,且无需分布内训练 |
| OVO-Bench 综合 | Avg (%) | 64.00 | Qwen3-VL-4B 63.00 / HERMES-7B 59.20 | 流式架构新 SOTA |
| NextQA 端到端推理时延 | Wall-clock (s) @ Accuracy | 415s @ 80.8% | Qwen3-VL-4B 1460s @ 79.8% | 3.5× 加速且准确率更高 |
| Zero-Vision SFT+RL 综合(24基准均分) | Accuracy (%) | 54.28 | Quick Start + RL 48.96 | +5.33,RL 步数减少 50.7% |
局限与改进
作者坦承的局限:(1) 复杂 agentic 工作流和数学推理上仍弱于 Qwen3-VL,原因归结为高质量纯文本数据不足、缺乏文本-多模态联合预训练以及省略了 RL 后训练;(2) 论文自己承认 motion-spatial synergy 没法做严格的单变量消融——因为五阶段训练高度耦合(joint pre-training recipe),只能用跨 benchmark 的经验证据间接支持;(3) streaming 评测里 SoccerNet 用的是严格零容忍 canvas-position 匹配,但 OVO-Bench 走的是 SimpleStream 的 recent-window(4 帧)协议,两套协议未必能直接横向比;(4) Stage 5 只训 gate、语言模型冻结,意味着主动回复时只用最近 N 段滑窗,长程事件链难以串联。我自己的观察:(a) Table 5 里 Mage-VL 在 Charades、TempCompass、MV-Bench、MMVU 等「依赖单帧外观」的任务上反而落后 Qwen3-VL,说明 codec 稀疏化对外观稠密型任务并非免费午餐;(b) tc8 配置在 LongVideoBench(56.2)和 LVBench(38.9)上明显低于 tc32,低预算场景对长视频仍有损失;(c) Figure 8 中 MV-Bench 是少数 codec 优势消失的边界情形,论文坦诚但未给量化边界条件。
独立分析的弱点
弱点一:外观稠密型视频任务上 codec 稀疏化有系统性代价。Charades(34.1 vs Qwen3-VL 45.9)、TempCompass(72.7 vs 62.3 反向落后)、MV-Bench(65.1 vs 66.7)都暴露——当任务答案藏在静态外观而非运动里时,砍掉 75% token 会丢信息。改进方向:可以做一个内容自适应的预算调节器,让 importance map 在「运动信号」之外也加入「查询相关显著性」(比如根据用户问题动态加权 patch)。弱点二:长程事件链在 Stage 5 只靠滑窗 + gate,没有显式长期记忆模块,作者虽提到 Flash-VStream、StreamingVLM 等用了压缩/滚动状态,但 Mage-VL 自己没集成。改进方向:把 EPFE 的循环状态显式接入语言生成路径,或借鉴 episodic memory 做事件级检索。弱点三:模型规模与生态——只放了 4B 一个尺寸,缺少 7B/13B 的缩放曲线,也缺乏对纯音频/多模态流的扩展,作者提到未来要做「native audio-visual stream fusion」。弱点四:训练数据虽然公开来源,但 caption 重写流水线依赖 GPT-5、GPT-4.1、Qwen3-VL-32B、GitHub Copilot 等闭源组件,复现成本极高;可以转向开源 rubric 模型做替代研究。弱点五:streaming 监督只来源于 caption 起止时间戳,本质是「描述性事件」,对开放域交互(提问、纠错、多轮)覆盖不足。
未来方向
作者明确提出的方向:(1) 把 Zero-Vision SFT + RL 正式纳入主模型训练,以补齐 agentic 和数学推理短板;(2) 扩展到原生音视频流融合(native audio-visual stream fusion);(3) 推向 embodied 与 edge 部署场景。基于本文成果我认为可延伸的方向还包括:把 codec-native 思路推广到 3D/点云/BEV 序列(自动驾驶),因为「时间可预测性」对空间冗余同样适用;在 cognition gate 上引入显式置信度校准和拒绝选项,避免幻觉式主动评论;研究「单 codec 多任务」——同一重要性图既能驱动 token 选择也能驱动镜头分割/事件边界检测;以及把 AI4AI 流水线与 SkillOpt-Lite 这类自优化数据系统更深度耦合,做端到端的数据-模型协同缩放律。
复现评估
可复现性总体偏中等。积极方面:代码(github.com/microsoft/Mage)、模型权重(HuggingFace microsoft/mage collection)、项目页都已开源,主要训练超参(Stage 1 学习率 $10^{-3}$、Stage 2 降到 $5 \times 10^{-5}$、负采样比 $r=0.1$、tc8/tc16/tc32 三个推理预算点、token budget $B=4096$、64 帧 clip、3D rotary PE、RoPE base θ=8M、空间分辨率 384、Stage 3 时序 384 帧)都写明了,测评全部走 lmms-eval 官方模板无 prompt tuning,wall-clock 在 8×B200 单节点上测——协议清晰。消极方面:caption 重写流水线强依赖 GPT-5、GPT-4.1、Qwen3-VL-32B、GitHub Copilot,这些闭源/半闭源组件普通团队难以等价复现;350M 图文对里 265M 来自「约 10 亿公开图文对过滤」,未给出完整过滤脚本;约 560M 图像 + 100M 视频帧的精确清单只列了数据集名(LAION-400M、COYO-700M、OBELICS、Zero250M、ImageNet-21K、HowTo100M、Panda-70M)而未给最终采样清单;算力上从零训练 24 层 ViT + 5 阶段 4B LLM 大概率需要数百卡级别 GPU,对学术组不友好。复现 Mage-ViT 单变量实验相对可行,复现完整 Mage-VL 较难。
论文图表
左图是 Mage-VL-4B 与 Qwen3-VL-4B、Phi-4-MM(5.6B)、Phi-4-reasoning-vision(15B) 在空间/视频/视觉理解三类 benchmark 上的雷达图对比;右图展示 codec-native 视频处理流程——从世界杯流式输入中用运动和残差信号选出动态 patch,token 减少约 75%,并支持实时在线 VideoQA。
这是全文的「门面」:一张图同时给出能力定位(雷达图)和方法直觉(codec token 选择 → 实时问答),帮助读者立刻判断本文卖点和贡献边界。