← 返回 2026-07-17

VideoChat3:面向高效与通用视频理解的全开源视频多模态大模型 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang 📅 2026-07-16 👍 163 2026-07-22 18:54
全开源 指令微调 时序定位 流式视频理解 视频多模态大模型 高效视频tokenization

全开源4B视频大模型,以3D视觉编码与自适应帧分辨率实现高效通用理解

前置知识

Video MLLM(视频多模态大语言模型)

由视觉编码器、投影模块和大语言模型(LLM)三部分组成的系统。视觉编码器把视频帧转成视觉token,投影模块把它对齐到LLM的词嵌入空间,LLM再基于这些token和文本进行推理并生成回答。常见做法是从图像MLLM继承图像tokenizer,再通过稀疏采样把若干帧当作独立图像编码。

理解本文需要先建立『视频=视觉token序列喂给LLM』这个基本范式,才能体会I3D-ViT在token进入LLM之前就做时序压缩的价值。

Vision Transformer(ViT)与视觉Tokenizer

ViT把一张图切成patch,每个patch经过线性投影成一个token,再用自注意力在2D空间内建模。在视频场景下,传统做法是逐帧用2D ViT编码,token数量随帧数线性增长,很快超出LLM上下文预算,这就是VideoChat3要解决的核心矛盾。

本文的关键创新是把预训练的2D ViT『膨胀』成3D版本,理解2D自注意力到3D时空自注意力的扩展方式是读懂方法部分的前提。

时序定位(Temporal Grounding)

给定一段自然语言查询(如『婴儿被绑在汽车座椅上』),在视频中找出对应事件的起止时间戳(如107s–119s)。它和传统的视频问答不同:QA只需要回答内容,时序定位还要精确指出『何时发生』,常用mIoU作为评估指标。

时序定位是VideoChat3重点突破的能力之一,Table 2中三组TimeLens指标和VUE-TR都直接评测这项能力,本文相对Qwen3-VL-4B有+6.4到+20.6的大幅提升。

流式视频理解(Streaming/Online Video)

区别于『看完整个视频再回答』的离线设定,流式场景下视频帧持续到达,模型必须因果地处理输入、维护历史记忆,并自己判断『何时已经有足够证据可以回答』。代表性评测有ODVBench、OVOBench、OVO-Timing等。

VideoChat3的Adaptive Frame Resolution和Silence/Standby/Response状态机就是专门为流式场景设计的,理解这种主动响应范式才能看懂Stage-3的训练损失设计。

多阶段课程学习(Multi-stage Curriculum)

把训练拆成多个阶段,由易到难:先让视觉编码器学会产生语言可用的表征,再做模态对齐,再做通用指令微调,最后做长视频与流式微调。每个阶段的学习率、可训练模块、数据配比都不同,前一阶段权重作为下一阶段的初始化。

VideoChat3用4个stage(Stage 0–3)逐步构建能力,Table 1给出了详细配置,理解这种渐进式训练是把握其数据工程的关键。

研究动机

当前开源视频MLLM在真实场景部署中存在三个被作者点名的硬伤。第一是泛化能力受限:为一个时长/帧率/视角优化的模型迁移到另一类视频就明显掉点,比如为短视频调优的模型在长视频中无法跨段聚合证据,为离线问答设计的模型面对实时流式输入时既不知道何时该回答,也无法高效增量处理。第二是计算开销爆炸:直接把图像MLLM扩展到视频会让视觉token随帧数线性增长,由于LLM注意力对序列长度是平方复杂度,处理长视频或高帧率流就变得不可承受。第三是可复现性差:表现强的模型要么完全闭源(如Gemini、GPT-5),要么只放权重但训练数据、训练配方、数据构造流水线完全不公开,社区难以判断性能到底来自架构还是数据,也无法公平比较或在其基础上迭代。在通用视频理解维度上,作者用Qwen3-VL-4B等开源模型作为baseline,发现它们在MotionBench、TempCompass、时序定位等任务上仍显著弱于专有模型,凸显了这条路线还有大量空白。

本文的目标是本文的目标是用4B参数打造一个真正『全开源+高效+通用』的视频MLLM。具体可量化为四个层面:(1)在通用视频理解的四大维度——时序感知(MotionBench/TempCompass等)、长视频(Video-MME/LVBench)、推理(MMVU/Video-MMMU)、时序定位(TimeLens/VUE-TR)——上同时达到或超过同等甚至更大规模的开源模型;(2)在高帧率、长视频、流式场景下显著降低视觉token数量、FLOPs和显存,比如在2048帧时把推理延迟压到Qwen3-VL-4B的一半以下;(3)让模型不只是被动回答,还要在流式场景中主动判断何时该收集证据、何时该作答;(4)完整释放模型权重、训练代码、训练策略、所有训练数据集以及数据构造流水线,使整个训练栈可被审查、可被复现。

与已有工作不同的是,已有工作要么把token压缩放在每帧独立编码之后(VideoChat-Flash的层次化压缩、LongVU的自适应时空压缩、Video-XL-2的任务感知KV稀疏化),要么依赖编解码器码流做显著性分配(LLaVA-OneVision-2)。这些方法都是在『视觉token已经进入LLM上下文』之后才做减法,没有真正利用相邻帧在视觉编码器内部的强冗余。VideoChat3的独特切入角度是『把时空结构建模和冗余削减尽可能前移到tokenizer内部』——通过把预训练的2D ViT膨胀成3D ViT,在帧进入LLM之前就完成局部时空注意力与池化,把『编码端线性代价』换『解码端平方代价』。同时把流式推理建模成『LLM状态↔视觉预算』的闭环:让模型自己用状态token控制下一帧的分辨率,这在此前的response-state方法中从未出现过。

核心方法

VideoChat3沿用经典的ViT—MLP Projector—LLM架构,但在视觉编码这一层做了彻底重构。直觉上,它模仿人看球赛:中场传递时只用眼角余光粗看,前锋突入禁区时立刻集中精力看细节。技术上分两条线并行压缩时空冗余。时间维度上提出I3D-ViT(Inflated 3D Vision Transformer),把预训练的图像ViT的2D空间自注意力膨胀成3D时空自注意力:把连续$T$帧组成一个chunk,在chunk内做联合时空注意力,再沿时间维做池化,把token数压到原来的$1/T$。空间维度上提出Adaptive Frame Resolution用于流式感知:模型在每个流式窗口输出一个状态token(Silence/Standby/Response),该token直接决定下一个窗口的像素预算$B$,从$224^2$到$448^2$像素动态切换。两者组合后,默认$T=4$的配置下加上$2\times2$的空间pixel-shuffle合并,达到$16\times$的时空压缩比。这种『把冗余消化在tokenizer里』的设计让长视频和高帧率流的处理成本可控。

本文最本质的创新是『把时空建模和冗约压缩前移到视觉tokenizer内部』,并用一个状态token把LLM的语义判断和视觉输入的分辨率绑定成闭环。具体体现在两点:第一,I3D-ViT不把每帧当独立图像,而是把连续$T$帧打包成chunk,用『从2D空间注意力膨胀而来的3D时空注意力』在chunk内做联合建模,再沿时间维池化。这样在token进入LLM之前就已经压缩了$T$倍,加上$2\times2$空间合并共$4T$倍(默认$T=4$即$16\times$)。第二,流式推理被建模为状态条件化的闭环:模型在每个窗口预测状态$s_t\in\{\text{Silence},\text{Standby},\text{Response}\}$,再用一个确定性控制器$b_{t+1}=B_{\text{low}}/B_{\text{high}}$决定下一窗口的像素预算。这把『何时回答』『回答得多细致』『下一帧要多大算力』三件事用同一个状态token统一了。这和过去『帧级选择』『下游token路由』『codec显著性』的方法在哲学上完全不同——它把视觉预算也变成模型自己学出来的策略。

方法步骤详情

VideoChat3分tokenizer预训练、数据构造、四阶段课程、流式推理四环节。第一步Stage-0:用MoonViT初始化I3D-ViT,挂轻量projector和临时LLM(Qwen3-4B),在7.59M图文对上做projector热身→全参数联合训练,训练后丢掉临时LLM只保留ViT。第二步构造三套数据:Academic2M(2.27M)用Qwen3-VL-235B-A22B把短答案重写成带时间戳的详尽回答;LV116K(116.2K)用PySceneDetect切分后逐段标注再聚合;OL617K(617K)把视频-QA转成流式样本并标注Silence/Standby/Response状态token。第三步四阶段训练:Stage-1用3.47M caption对齐,Stage-2用10.33M样本指令微调(lr $5\times10^{-5}$),Stage-3用3.41M样本做长视频+流式微调(context 98304)。第四步流式推理:每窗口先输出状态token,控制器据此决定下一帧像素预算,训练和部署严格对齐。

技术新颖性

和已有技术的差异可从三个层面看。相对VideoChat-Flash、LongVU、Video-XL-2这类『编码后再压缩』的方法,I3D-ViT在token进入LLM之前就完成局部时空建模与池化,把计算从LLM的平方复杂度阶段挪到ViT的近线性阶段,工程上更优。相对LLaVA-OneVision-2依赖codec码流做显著性分配,本文不依赖任何外部编解码信号,让模型用状态token自己学策略。流式部分$\langle\text{Standby}\rangle$→放大下一窗口分辨率这一闭环,是过去response-state工作从未做过的——它们的状态token只控制『要不要回答』,VideoChat3同时控制『要不要回答』和『下一帧要多大预算』。此外state-transition mask损失$L_{\text{state}}=-\frac{1}{\sum_t m_t}\sum_t m_t\log p_\theta(s_t|V_{\le t},y_{<t})$通过随机采样等量『保持位置』,避免模型学到『看上一状态预测下一状态』的捷径,是流式监督上的细节创新。

VideoChat3架构图:ViT—MLP Projector—LLM,I3D-ViT在视觉token进入LLM前做时空压缩
Figure 2: VideoChat3架构图:ViT—MLP Projector—LLM,I3D-ViT在视觉token进入LLM前做时空压缩
Adaptive Frame Resolution示意图:状态token控制下一流式窗口的像素预算
Figure 3: Adaptive Frame Resolution示意图:状态token控制下一流式窗口的像素预算
标注增强示例:把简短答案重写成带时间戳的证据grounded响应
Figure 5: 标注增强示例:把简短答案重写成带时间戳的证据grounded响应
VideoChat3-LV116K长视频数据合成流水线
Figure 7: VideoChat3-LV116K长视频数据合成流水线
流式训练的状态转换监督mask
Figure 9: 流式训练的状态转换监督mask

实验结果

VideoChat3-4B在通用、流式、效率三类实验上数据亮眼。通用视频(Table 2):相对Qwen3-VL-4B在19个可比指标上18项提升,MotionBench 61.7、TempCompass 75.6均为全开源最佳;MMVU +5.9,TimeLens +9.7/+6.4/+8.3,VUE-TR v1/v2 +15.0/+20.6,MomentSeeker +12.1;TimeLens三split甚至超过GPT-5。流式(Table 3):ODVBench 72.3比7B StreamForest高12.4分,StreamingBench 83.0、River 42.8均最佳;OVO-Timing F1 35.5比带2B模块的Em-Garde还高4.5。效率(Table 4):相同patch数下视觉token仅Qwen3-VL-4B一半;2048帧延迟44.449s→20.412s,FLOPs减60%+。消融:I3D-ViT相对MoonViT视频+7.5;OL617K使OVO-Timing从4.0跃升到35.5。

VideoChat3四阶段训练配置
Table 1: VideoChat3四阶段训练配置
通用视频理解benchmark横向对比(时序感知/长视频/推理/时序定位)
Table 2: 通用视频理解benchmark横向对比(时序感知/长视频/推理/时序定位)
推理成本对比(NVIDIA H200 + FlashAttention-2)
Table 4: 推理成本对比(NVIDIA H200 + FlashAttention-2)
MoonViT vs I3D-ViT在图像和视频benchmark上的对比
Table 5: MoonViT vs I3D-ViT在图像和视频benchmark上的对比
查看结构化数据
任务指标本文基线提升
MotionBench(细粒度动作理解) accuracy 61.7 Qwen3-VL-4B 58.6 / Molmo2-4B 61.6 全开源最佳,+3.1/+0.1
TempCompass(时序理解) accuracy 75.6 Qwen3-VL-4B 70.8 / Molmo2-4B 72.8 全开源最佳,+4.8/+2.8
TimeLens 时序定位(Charades/ActivityNet/QVHighlights) mIoU 56.1 / 54.6 / 67.0 Qwen3-VL-4B 46.4 / 48.2 / 58.7 +9.7 / +6.4 / +8.3
VUE-TR v1/v2 时序定位 mIoU 47.9 / 40.2 Qwen3-VL-4B 32.9 / 19.6 +15.0 / +20.6
ODVBench 在线目标感知 Overall 72.3 StreamForest-7B 60.5 +11.8
OVO-Timing 主动响应 Avg. F1 35.5 Qwen3-VL-4B 8.1 / Em-Garde 31.0 +27.4 / +4.5(无需2B辅助模块)
长视频推理延迟@2048帧 Total Latency (s) 20.412 Qwen3-VL-4B 44.449 2.2×加速,FLOPs降60%+,显存省26.14GB

局限与改进

作者承认及可观察到的局限主要有几点。首先相对专有模型仍有明显差距:LVBench上VideoChat3仅56.7而Gemini 3 Pro达77.0、Gemini 2.5 Pro达75.7;Video-MME上70.1 vs Gemini 3 Pro的88.6,长视频上4B开源与超大规模专有模型间还有巨大鸿沟。其次TOMATO上VideoChat3(37.9)略低于Molmo2-4B(39.8),VideoEval-Pro开放式split也唯一退步,并非所有维度全面领先。第三ProactiveVQA上仍落后专门的MMDuet-2(43.4 vs 25.1),主动响应在复杂多模态对话场景还有空间。第四整套数据构造高度依赖Qwen3-VL-235B-A22B做重写与判别,训练数据质量被这个外部大模型天花板限制,且不可避免引入其偏见。第五I3D-ViT视觉编码器延迟显著高于baseline(512帧2.595s vs 0.578s),只有序列足够长整体收益才显现,短序列反而是劣势。最后流式benchmark平均时长仍偏短,小时级真实直播未被系统评测。

独立分析的弱点

我从独立角度看到几个可改进点。第一状态机粒度过粗:只有Silence/Standby/Response三态、像素预算只有$224^2$和$448^2$两档,无法表达『中等重要性』或『需要OCR级细节』等更细的注意力等级,改进方向是把状态和预算参数化为连续变量或引入多级Standby。第二对teacher模型依赖过强:Academic2M重写、LV116K段落标注、OL617K证据定位都依赖Qwen3-VL-235B-A22B,其系统性偏见(倾向某些动词、忽略某些视觉细节)会被蒸进4B模型,改进方向是引入多个异构teacher交叉验证或用人类标注做小规模锚定校准。第三编码器延迟在短序列偏高:512帧就要2.595s,对<1s响应的实时应用是硬伤,改进方向是引入早退机制、token剪枝或针对短序列走轻量分支。第四状态损失2:2:1比例和budget阈值都是手工设定缺乏理论依据,改进方向是用RL在目标benchmark上直接优化这些超参。第五公开评测集中在标准benchmark,缺乏产品级长流(1小时直播、多机位)的端到端验证。

未来方向

作者在结论和相关工作里隐含指出的方向包括:把VideoChat3扩展为支持音频和文本的多模态实时流(当前仅视觉)、把状态策略从teacher-forced升级为RL训练以获得更稳健的时机判断、把I3D-ViT的思想推广到3D场景和embodied agent的连续观察中。基于本文成果可以延伸的方向我想到几点:第一,把『状态token控制下一帧预算』的思想推广到控制采样率(FPS)和KV cache保留策略,进一步降低长流式场景的显存占用;第二,把state-transition mask推广到更一般的『稀疏决策点』训练,比如工具调用、检索触发的token级监督;第三,把整套『全开源+小模型+大teacher蒸馏』的范式移植到音频、3D等其他模态,验证它是否能成为通用范式;第四,研究如何用人类反馈(RLHF/DPO)替换teacher模型的判别角色,让数据流水线摆脱对单一闭源/开源大模型的依赖。

复现评估

复现性是本文最大卖点,也是它和Qwen3-VL、Molmo2拉开差距的关键。作者通过HuggingFace(MCG-NJU/videochat3)、GitHub(MCG-NJU/VideoChat3)和项目主页同时释放了:模型权重、训练代码、完整训练策略(Table 1给出四stage的batch size、学习率、数据量、可训练模块等详细超参)、三套完整数据集(Academic2M/LV116K/OL617K)以及数据构造流水线脚本。训练数据规模庞大——四stage合计约25M样本、最大packed seq 98304——配合大量数据源(LLaVA-Pretrain、CapRL-2M、Honey-Data、Dolci、ShareGemini等),完整复现需数百卡级算力(效率评测基于H200)。复现难度评估:架构和训练循环可1:1复现,数据流水线虽开源但teacher模型Qwen3-VL-235B-A22B调用成本和数据源获取成本不低,小团队难完全照搬。整体看,这是2026年开源视频MLLM中复现门槛最低的工作之一,适合做后续研究baseline。