VideoChat3:面向高效与通用视频理解的全开源视频多模态大模型 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
全开源4B视频大模型,以3D视觉编码与自适应帧分辨率实现高效通用理解
前置知识
Video MLLM(视频多模态大语言模型)
由视觉编码器、投影模块和大语言模型(LLM)三部分组成的系统。视觉编码器把视频帧转成视觉token,投影模块把它对齐到LLM的词嵌入空间,LLM再基于这些token和文本进行推理并生成回答。常见做法是从图像MLLM继承图像tokenizer,再通过稀疏采样把若干帧当作独立图像编码。
理解本文需要先建立『视频=视觉token序列喂给LLM』这个基本范式,才能体会I3D-ViT在token进入LLM之前就做时序压缩的价值。
Vision Transformer(ViT)与视觉Tokenizer
ViT把一张图切成patch,每个patch经过线性投影成一个token,再用自注意力在2D空间内建模。在视频场景下,传统做法是逐帧用2D ViT编码,token数量随帧数线性增长,很快超出LLM上下文预算,这就是VideoChat3要解决的核心矛盾。
本文的关键创新是把预训练的2D ViT『膨胀』成3D版本,理解2D自注意力到3D时空自注意力的扩展方式是读懂方法部分的前提。
时序定位(Temporal Grounding)
给定一段自然语言查询(如『婴儿被绑在汽车座椅上』),在视频中找出对应事件的起止时间戳(如107s–119s)。它和传统的视频问答不同:QA只需要回答内容,时序定位还要精确指出『何时发生』,常用mIoU作为评估指标。
时序定位是VideoChat3重点突破的能力之一,Table 2中三组TimeLens指标和VUE-TR都直接评测这项能力,本文相对Qwen3-VL-4B有+6.4到+20.6的大幅提升。
流式视频理解(Streaming/Online Video)
区别于『看完整个视频再回答』的离线设定,流式场景下视频帧持续到达,模型必须因果地处理输入、维护历史记忆,并自己判断『何时已经有足够证据可以回答』。代表性评测有ODVBench、OVOBench、OVO-Timing等。
VideoChat3的Adaptive Frame Resolution和Silence/Standby/Response状态机就是专门为流式场景设计的,理解这种主动响应范式才能看懂Stage-3的训练损失设计。
多阶段课程学习(Multi-stage Curriculum)
把训练拆成多个阶段,由易到难:先让视觉编码器学会产生语言可用的表征,再做模态对齐,再做通用指令微调,最后做长视频与流式微调。每个阶段的学习率、可训练模块、数据配比都不同,前一阶段权重作为下一阶段的初始化。
VideoChat3用4个stage(Stage 0–3)逐步构建能力,Table 1给出了详细配置,理解这种渐进式训练是把握其数据工程的关键。
研究动机
当前开源视频MLLM在真实场景部署中存在三个被作者点名的硬伤。第一是泛化能力受限:为一个时长/帧率/视角优化的模型迁移到另一类视频就明显掉点,比如为短视频调优的模型在长视频中无法跨段聚合证据,为离线问答设计的模型面对实时流式输入时既不知道何时该回答,也无法高效增量处理。第二是计算开销爆炸:直接把图像MLLM扩展到视频会让视觉token随帧数线性增长,由于LLM注意力对序列长度是平方复杂度,处理长视频或高帧率流就变得不可承受。第三是可复现性差:表现强的模型要么完全闭源(如Gemini、GPT-5),要么只放权重但训练数据、训练配方、数据构造流水线完全不公开,社区难以判断性能到底来自架构还是数据,也无法公平比较或在其基础上迭代。在通用视频理解维度上,作者用Qwen3-VL-4B等开源模型作为baseline,发现它们在MotionBench、TempCompass、时序定位等任务上仍显著弱于专有模型,凸显了这条路线还有大量空白。
本文的目标是本文的目标是用4B参数打造一个真正『全开源+高效+通用』的视频MLLM。具体可量化为四个层面:(1)在通用视频理解的四大维度——时序感知(MotionBench/TempCompass等)、长视频(Video-MME/LVBench)、推理(MMVU/Video-MMMU)、时序定位(TimeLens/VUE-TR)——上同时达到或超过同等甚至更大规模的开源模型;(2)在高帧率、长视频、流式场景下显著降低视觉token数量、FLOPs和显存,比如在2048帧时把推理延迟压到Qwen3-VL-4B的一半以下;(3)让模型不只是被动回答,还要在流式场景中主动判断何时该收集证据、何时该作答;(4)完整释放模型权重、训练代码、训练策略、所有训练数据集以及数据构造流水线,使整个训练栈可被审查、可被复现。
与已有工作不同的是,已有工作要么把token压缩放在每帧独立编码之后(VideoChat-Flash的层次化压缩、LongVU的自适应时空压缩、Video-XL-2的任务感知KV稀疏化),要么依赖编解码器码流做显著性分配(LLaVA-OneVision-2)。这些方法都是在『视觉token已经进入LLM上下文』之后才做减法,没有真正利用相邻帧在视觉编码器内部的强冗余。VideoChat3的独特切入角度是『把时空结构建模和冗余削减尽可能前移到tokenizer内部』——通过把预训练的2D ViT膨胀成3D ViT,在帧进入LLM之前就完成局部时空注意力与池化,把『编码端线性代价』换『解码端平方代价』。同时把流式推理建模成『LLM状态↔视觉预算』的闭环:让模型自己用状态token控制下一帧的分辨率,这在此前的response-state方法中从未出现过。
核心方法
VideoChat3沿用经典的ViT—MLP Projector—LLM架构,但在视觉编码这一层做了彻底重构。直觉上,它模仿人看球赛:中场传递时只用眼角余光粗看,前锋突入禁区时立刻集中精力看细节。技术上分两条线并行压缩时空冗余。时间维度上提出I3D-ViT(Inflated 3D Vision Transformer),把预训练的图像ViT的2D空间自注意力膨胀成3D时空自注意力:把连续$T$帧组成一个chunk,在chunk内做联合时空注意力,再沿时间维做池化,把token数压到原来的$1/T$。空间维度上提出Adaptive Frame Resolution用于流式感知:模型在每个流式窗口输出一个状态token(Silence/Standby/Response),该token直接决定下一个窗口的像素预算$B$,从$224^2$到$448^2$像素动态切换。两者组合后,默认$T=4$的配置下加上$2\times2$的空间pixel-shuffle合并,达到$16\times$的时空压缩比。这种『把冗余消化在tokenizer里』的设计让长视频和高帧率流的处理成本可控。
本文最本质的创新是『把时空建模和冗约压缩前移到视觉tokenizer内部』,并用一个状态token把LLM的语义判断和视觉输入的分辨率绑定成闭环。具体体现在两点:第一,I3D-ViT不把每帧当独立图像,而是把连续$T$帧打包成chunk,用『从2D空间注意力膨胀而来的3D时空注意力』在chunk内做联合建模,再沿时间维池化。这样在token进入LLM之前就已经压缩了$T$倍,加上$2\times2$空间合并共$4T$倍(默认$T=4$即$16\times$)。第二,流式推理被建模为状态条件化的闭环:模型在每个窗口预测状态$s_t\in\{\text{Silence},\text{Standby},\text{Response}\}$,再用一个确定性控制器$b_{t+1}=B_{\text{low}}/B_{\text{high}}$决定下一窗口的像素预算。这把『何时回答』『回答得多细致』『下一帧要多大算力』三件事用同一个状态token统一了。这和过去『帧级选择』『下游token路由』『codec显著性』的方法在哲学上完全不同——它把视觉预算也变成模型自己学出来的策略。
方法步骤详情
VideoChat3分tokenizer预训练、数据构造、四阶段课程、流式推理四环节。第一步Stage-0:用MoonViT初始化I3D-ViT,挂轻量projector和临时LLM(Qwen3-4B),在7.59M图文对上做projector热身→全参数联合训练,训练后丢掉临时LLM只保留ViT。第二步构造三套数据:Academic2M(2.27M)用Qwen3-VL-235B-A22B把短答案重写成带时间戳的详尽回答;LV116K(116.2K)用PySceneDetect切分后逐段标注再聚合;OL617K(617K)把视频-QA转成流式样本并标注Silence/Standby/Response状态token。第三步四阶段训练:Stage-1用3.47M caption对齐,Stage-2用10.33M样本指令微调(lr $5\times10^{-5}$),Stage-3用3.41M样本做长视频+流式微调(context 98304)。第四步流式推理:每窗口先输出状态token,控制器据此决定下一帧像素预算,训练和部署严格对齐。
技术新颖性
和已有技术的差异可从三个层面看。相对VideoChat-Flash、LongVU、Video-XL-2这类『编码后再压缩』的方法,I3D-ViT在token进入LLM之前就完成局部时空建模与池化,把计算从LLM的平方复杂度阶段挪到ViT的近线性阶段,工程上更优。相对LLaVA-OneVision-2依赖codec码流做显著性分配,本文不依赖任何外部编解码信号,让模型用状态token自己学策略。流式部分$\langle\text{Standby}\rangle$→放大下一窗口分辨率这一闭环,是过去response-state工作从未做过的——它们的状态token只控制『要不要回答』,VideoChat3同时控制『要不要回答』和『下一帧要多大预算』。此外state-transition mask损失$L_{\text{state}}=-\frac{1}{\sum_t m_t}\sum_t m_t\log p_\theta(s_t|V_{\le t},y_{<t})$通过随机采样等量『保持位置』,避免模型学到『看上一状态预测下一状态』的捷径,是流式监督上的细节创新。
实验结果
VideoChat3-4B在通用、流式、效率三类实验上数据亮眼。通用视频(Table 2):相对Qwen3-VL-4B在19个可比指标上18项提升,MotionBench 61.7、TempCompass 75.6均为全开源最佳;MMVU +5.9,TimeLens +9.7/+6.4/+8.3,VUE-TR v1/v2 +15.0/+20.6,MomentSeeker +12.1;TimeLens三split甚至超过GPT-5。流式(Table 3):ODVBench 72.3比7B StreamForest高12.4分,StreamingBench 83.0、River 42.8均最佳;OVO-Timing F1 35.5比带2B模块的Em-Garde还高4.5。效率(Table 4):相同patch数下视觉token仅Qwen3-VL-4B一半;2048帧延迟44.449s→20.412s,FLOPs减60%+。消融:I3D-ViT相对MoonViT视频+7.5;OL617K使OVO-Timing从4.0跃升到35.5。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MotionBench(细粒度动作理解) | accuracy | 61.7 | Qwen3-VL-4B 58.6 / Molmo2-4B 61.6 | 全开源最佳,+3.1/+0.1 |
| TempCompass(时序理解) | accuracy | 75.6 | Qwen3-VL-4B 70.8 / Molmo2-4B 72.8 | 全开源最佳,+4.8/+2.8 |
| TimeLens 时序定位(Charades/ActivityNet/QVHighlights) | mIoU | 56.1 / 54.6 / 67.0 | Qwen3-VL-4B 46.4 / 48.2 / 58.7 | +9.7 / +6.4 / +8.3 |
| VUE-TR v1/v2 时序定位 | mIoU | 47.9 / 40.2 | Qwen3-VL-4B 32.9 / 19.6 | +15.0 / +20.6 |
| ODVBench 在线目标感知 | Overall | 72.3 | StreamForest-7B 60.5 | +11.8 |
| OVO-Timing 主动响应 | Avg. F1 | 35.5 | Qwen3-VL-4B 8.1 / Em-Garde 31.0 | +27.4 / +4.5(无需2B辅助模块) |
| 长视频推理延迟@2048帧 | Total Latency (s) | 20.412 | Qwen3-VL-4B 44.449 | 2.2×加速,FLOPs降60%+,显存省26.14GB |
局限与改进
作者承认及可观察到的局限主要有几点。首先相对专有模型仍有明显差距:LVBench上VideoChat3仅56.7而Gemini 3 Pro达77.0、Gemini 2.5 Pro达75.7;Video-MME上70.1 vs Gemini 3 Pro的88.6,长视频上4B开源与超大规模专有模型间还有巨大鸿沟。其次TOMATO上VideoChat3(37.9)略低于Molmo2-4B(39.8),VideoEval-Pro开放式split也唯一退步,并非所有维度全面领先。第三ProactiveVQA上仍落后专门的MMDuet-2(43.4 vs 25.1),主动响应在复杂多模态对话场景还有空间。第四整套数据构造高度依赖Qwen3-VL-235B-A22B做重写与判别,训练数据质量被这个外部大模型天花板限制,且不可避免引入其偏见。第五I3D-ViT视觉编码器延迟显著高于baseline(512帧2.595s vs 0.578s),只有序列足够长整体收益才显现,短序列反而是劣势。最后流式benchmark平均时长仍偏短,小时级真实直播未被系统评测。
独立分析的弱点
我从独立角度看到几个可改进点。第一状态机粒度过粗:只有Silence/Standby/Response三态、像素预算只有$224^2$和$448^2$两档,无法表达『中等重要性』或『需要OCR级细节』等更细的注意力等级,改进方向是把状态和预算参数化为连续变量或引入多级Standby。第二对teacher模型依赖过强:Academic2M重写、LV116K段落标注、OL617K证据定位都依赖Qwen3-VL-235B-A22B,其系统性偏见(倾向某些动词、忽略某些视觉细节)会被蒸进4B模型,改进方向是引入多个异构teacher交叉验证或用人类标注做小规模锚定校准。第三编码器延迟在短序列偏高:512帧就要2.595s,对<1s响应的实时应用是硬伤,改进方向是引入早退机制、token剪枝或针对短序列走轻量分支。第四状态损失2:2:1比例和budget阈值都是手工设定缺乏理论依据,改进方向是用RL在目标benchmark上直接优化这些超参。第五公开评测集中在标准benchmark,缺乏产品级长流(1小时直播、多机位)的端到端验证。
未来方向
作者在结论和相关工作里隐含指出的方向包括:把VideoChat3扩展为支持音频和文本的多模态实时流(当前仅视觉)、把状态策略从teacher-forced升级为RL训练以获得更稳健的时机判断、把I3D-ViT的思想推广到3D场景和embodied agent的连续观察中。基于本文成果可以延伸的方向我想到几点:第一,把『状态token控制下一帧预算』的思想推广到控制采样率(FPS)和KV cache保留策略,进一步降低长流式场景的显存占用;第二,把state-transition mask推广到更一般的『稀疏决策点』训练,比如工具调用、检索触发的token级监督;第三,把整套『全开源+小模型+大teacher蒸馏』的范式移植到音频、3D等其他模态,验证它是否能成为通用范式;第四,研究如何用人类反馈(RLHF/DPO)替换teacher模型的判别角色,让数据流水线摆脱对单一闭源/开源大模型的依赖。
复现评估
复现性是本文最大卖点,也是它和Qwen3-VL、Molmo2拉开差距的关键。作者通过HuggingFace(MCG-NJU/videochat3)、GitHub(MCG-NJU/VideoChat3)和项目主页同时释放了:模型权重、训练代码、完整训练策略(Table 1给出四stage的batch size、学习率、数据量、可训练模块等详细超参)、三套完整数据集(Academic2M/LV116K/OL617K)以及数据构造流水线脚本。训练数据规模庞大——四stage合计约25M样本、最大packed seq 98304——配合大量数据源(LLaVA-Pretrain、CapRL-2M、Honey-Data、Dolci、ShareGemini等),完整复现需数百卡级算力(效率评测基于H200)。复现难度评估:架构和训练循环可1:1复现,数据流水线虽开源但teacher模型Qwen3-VL-235B-A22B调用成本和数据源获取成本不低,小团队难完全照搬。整体看,这是2026年开源视频MLLM中复现门槛最低的工作之一,适合做后续研究baseline。
论文图表
这张图用柱状图把VideoChat3和两个主要对手在MotionBench、TempCompass、VideoMME、LVBench、MMVU、VideoMME-v2、Charades/ActivityNet/QVHighlights时序定位、OVOBench、StreamingBench等11个指标上做横向对比,并附了4个典型问答样例(细粒度动作、长视频QA、时序定位、在线主动响应)。
这是全文最直观的『能力地图』,一眼就能看出VideoChat3在哪些维度领先、领先多少。读者用它快速判断『这个模型适合我的任务吗』,是决定是否继续精读的关键。