← 返回 2026-05-27

LLaVA-OneVision-2:迈向下一代感知智能 LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng 📅 2026-05-25 👍 27 2026-07-13 08:36
多模态大模型 感知智能 时序定位 视觉token压缩 视频理解 长视频处理

把视频当码率流处理,codec-stream 在事件级定位上 +44.8。

前置知识

视频编解码器(Video Codec)

H.264/HEVC 把视频切成 I 帧(完整编码)与 P/B 帧(用运动矢量+残差编码相对参考的变化)。P/B 帧的字节数、运动矢量、亮度残差共同构成「视频的预测难度信号」,远比解码后像素更结构化。

本文 codec-stream 完全建立在码流之上:码率决定时间分组,MV+残差决定空间显著性。理解 codec 结构才能看懂「为什么码率流是比帧采样更合理的观察单位」。

视觉Token压缩(Visual Token Reduction)

MLLM 处理视频时 token 数随帧数线性膨胀。一系列工作压缩 token:ToMe 合并相似、TokenLearner 学习选择、PruMerge 训练式、LLaVA-Pruner 训练无关。这些都在像素空间或模型内部操作,与视频压缩结构脱钩。

本文属于压缩谱系最右端「codec-native」路线,理解前面四代局限(错过关键帧、启发式信息损失、训练复杂、codec 质量依赖)才能体会到 codec-stream 的实质进步。

时序定位(Temporal Grounding)

时序定位:给定视频与文本查询,输出事件在时间轴上的起止戳(秒)。代表 benchmark 有 Charades-STA、ActivityNet、QVHighlights,用 mIoU 或 R1@IoU 评估。比纯视频问答更精细,要求秒级定位。

本文把时序定位作为 codec-stream 的核心战场,新提 JumpScore。低帧预算(4-16 帧)下均匀采样会错过事件边界,codec-stream 通过码率峰值定位转换时刻,带来 9.7 点提升。

3D RoPE 与共享坐标系

RoPE 用旋转矩阵编码位置,3D RoPE 把 (t, h, w) 三维都纳入,使视觉 token 具备时空坐标。本文让 codec 块、采样帧、图像共享同一 3D RoPE,共用一套编码器参数。

统一坐标系是 codec-stream 以 plugin 方式工作的关键。如果每种输入需要单独 RoPE,编码器就无法无缝处理混合输入,mixed-batch 训练也无从谈起。

Native-Resolution Vision Transformer

传统 ViT 把图片 resize 到固定尺寸(如 224/336),会损失细节。Native-Resolution ViT 支持任意长宽比,通过 2D 窗口注意力控制算力,让任意尺寸图片在原始分辨率下处理,本文用 OneVision-Encoder 实现 16k patches。

codec-stream 选择 patch 而非帧作为压缩单位,正因为 native-resolution 使 patch-level 选择有实际意义:被选中的 patch 保留真实像素细节,被丢掉的 patch 信息真的损失。

研究动机

现有 8B 级开源视频多模态大模型(Qwen3-VL、InternVL-3.5、Keye-VL-1.5、LLaVA-OV-1.5)几乎全部沿用「帧中心」观察范式:把视频解码成像素帧后,均匀采样 8–32 帧或混分辨率采样(稀疏高分辨率关键帧+密集低分辨率上下文帧),每帧的所有 patch 全量进入语言模型。这一范式存在三个本质问题。第一,大量关键信息被丢弃:在长视频中,目标事件可能只占 1% 时长,但均匀采样会以同样概率错过它们,作者在 JumpScore 上验证 Qwen3-VL-8B 仅得到 30.1 mAP,而真实任务要求 0.1 秒精度的事件定位。第二,patch 利用率低:大多数 patch 并不包含判别性证据,例如在静态背景帧中,所有 patch 都在重复编码几乎相同的内容,白白消耗 token 预算。第三,忽视了视频的「预测结构」:视频编解码器 H.264/HEVC 已经把视频分解为 I 帧(完整编码)和 P/B 帧(用运动矢量和残差编码相对于参考的变化),这本身就是视频「哪里有变化、变化多大」的精确信号,却被解码过程丢弃了。这些问题共同导致长视频理解、时序定位、跟踪类任务在 8B 模型上长期停滞。

本文的目标是本文的具体目标是设计一个统一的多模态架构,在视频理解、时序定位、空间定位、操控轨迹推理四个任务上同时达到 8B 级别的 SOTA,并提出可量化的提升指标:相比 Qwen3-VL-8B,在 18 个视频任务平均分上 +4.3,在 11 个空间推理任务平均分上 +5.3,在 4 个跟踪任务平均 J&F 上 +15.6,在新提出的 JumpScore 上从 30.1 提升到 74.9(提升 +44.8)。同时通过 codec-stream vs 帧采样的对照实验证明,codec-stream 输入相比帧采样在时序定位上单独贡献 +9.7 点的绝对提升。

与已有工作不同的是,本文的独特切入角度是「以码率流为基本观察单位」,这与已有四条压缩路线(早期稀疏采样、启发式 token 压缩、学习式 token 选择、codec-aligned 帧 token)形成鲜明对比。前三类工作在解码后的像素空间操作,信息已被截断;第四类工作虽然引入 codec 但仍把 token 与固定 GOP 槽位对齐,而 codec-stream 真正让 token 密度跟随码率-残差画像变化:高码率区(快速运动、视角切换、视觉突变)自然获得密集 token,低码率区(可预测的平稳段)被稀疏化,从而把视觉预算集中到「事件承载」内容上。这一视角的核心洞察是「视频的预测难度本身就是最合理的事件检测器」,不需要额外学习一个事件分割模型。

核心方法

LLaVA-OneVision-2 的方法直觉可以这样理解:把视频当作一本「按难度排版的书」,而不是均匀切片的胶片。一段视频里,真正承载事件的只是少数几个瞬间(比如跳绳的每次起跳、苹果被拿起放下),其余时间是可预测的重复或静止。H.264/HEVC 在编码时就已经识别出哪些段难(高码率)、哪些段容易(低码率),这恰好就是模型应该「看仔细」的线索。技术路线上,作者把整个流程拆成四块:OneVision-Encoder 作为统一视觉编码器(原生分辨率 + 窗口注意力 + 共享 3D RoPE);codec-stream tokenization 作为输入侧证据分配机制(码率决定时间组、运动残差决定 patch 选择);一个两层的 MLP connector 把视觉 token 投影到语言空间;最后用 Qwen3-8B 作为语言模型解码器,在四阶段渐进训练中学习「看哪里」。

本文最本质的创新是 codec-stream tokenization 把 codec 码率流作为 token 分配的「第一性信号」。这与已有 codec 类工作(EMA、Video-LaVIT、RLT)的关键区别在于:已有工作把 codec 字段当作「另一种 token 类型」,而 codec-stream 把 codec 字段当作「token 应该出现在哪里的指针」。具体实现上,作者设计了三个耦合机制:一是基于 P 帧数据包字节数的累积码率阈值自适应切分可变长度 GOP(码率高则组短,码率低则组长),把「按帧数等距分配」换成「按码率分配」;二是基于运动矢量+亮度残差的 saliency map 在每个 GOP 内挑选 2×2 patch 块,把「帧级选择」换成「patch 块级选择」,并把块大小与 OneVision-Encoder 自带的 2×2 merge 对齐,避免后续合并把无关 patch 拼到一起;三是基于累积权重曲线的分层时序分配(per-frame attenuation + peak mass),防止单帧霸占整个 GOP 的预算。本质上,这是一种「事件驱动的视觉注意力预算」,与人类视觉系统会自然把注意力分配到运动突变处的机制一致。

方法步骤详情

完整的 codec-stream 流程可拆成六步。第一步:对原始视频用 H.264/HEVC 编码,提取 I 帧(空间完整)、P/B 帧的运动矢量 $d_t$ 与亮度残差 $r_t^Y$,每个 P/B 帧数据包附带字节数 bytes(q) 与时间戳 $\tau(q)$。第二步:按时间分箱(bin 宽度 $\Delta$),累加每个 bin 内的 P/B 帧包字节数得到 $e_b$,并据此计算目标每组码率配额 $\theta = \max(1, K_{tar})$。第三步:按公式 $\min\{i \geq s_k : (i - s_k + 1 \geq L_{max}) \lor (i - s_k + 1 \geq L_{min} \land \sum e_b \geq \theta)\}$ 触发新的时间组边界,再用字典序规则(先选码率谷,再选最近点)在邻域内精炼,得到可变长度 GOP $[s_k, c_k]$。第四步:对每个 GOP 内每个 P 帧计算显著性图 $S_t(x) = M_t(x) + R_t(x)$,其中 $M_t$ 是运动矢量幅度的百分位归一化,$R_t$ 是亮度残差相对零值 128 的绝对偏差再归一化。第五步:对显著性图做 2×2 patch 块聚合得分 $A_{t,i,j} = \sum_{\alpha,\beta \in \{0,1\}} \sum_{x \in P_{2i+\alpha, 2j+\beta}} S_t(x)$,再融合块级码率先验,得到每个候选块的最终得分。第六步:对每帧候选按得分降序排序,按公式 $\hat{A}_z = A_{t,i,j} / \sqrt{1 + \lambda \rho_t(z)}$ 衰减同帧重复候选(防止单帧霸占),计算帧级分配权重 $w_t$,再按累积权重曲线 $F_k(\ell) = \sum_{n=0}^{\ell} w_{t_n} / \sum_n w_{t_n}$ 把 GOP 划分成 $m_k$ 个 P-canvas,每个 P-canvas 从对应时间窗内的高分非重复块中抽取 patch 装入。GOP 的首个 I 帧作为 anchor I-canvas,其余 P-canvas 携带运动残差证据。所有 canvas 的 patch 通过 patch embedding + 共享 3D RoPE 进入 OneVision-Encoder,编码器对 codec-stream 输入使用 $\kappa_u$ 作为 group id 实现 group-visible attention,确保同一 GOP 内的 token 互相可见但跨 GOP 隔离。整个流程在训练与推理时配置相同,无额外学习参数。

技术新颖性

技术新颖性体现在三个层面。第一,把 codec 信号从「特征」提升为「分配器」:已有 codec-aware 工作(EMA、Video-LaVIT)把 codec 字段直接当作 token 序列或额外输入分支,而 codec-stream 让 codec 字段决定哪些 pixel-level 位置生成 token,这是观察单位的根本转换。第二,在 patch 块粒度上把空间显著性、块级码率先验、per-frame 衰减三者耦合,并把 2×2 块与 OneVision-Encoder 的 2×2 merge 操作对齐,使得选中块直接对应 4 个空间相干 patch token,避免了 ToMe 类相似合并把不相关 patch 错误合并的问题。第三,把「组(group)」作为一阶注意力可见性单元:通过 $\kappa_u$ 让同一可变长度 GOP 内的 token 共享注意力可见性,不同 GOP 之间隔离,这比固定 4-slot 分组更适配 codec 自身的预测结构。综合起来,这是第一个把「码率流-运动残差-原生分辨率 2×2 块-统一 3D RoPE-group-visible attention」全链路打通并端到端训练的开源 8B MLLM。

LLaVA-OneVision-2 architecture.
Figure 2: LLaVA-OneVision-2 architecture.
Codec-stream tokenization.
Figure 3: Codec-stream tokenization.
Codec-stream grouping by cumulative bit-cost.
Figure 4: Codec-stream grouping by cumulative bit-cost.
LLaVA-OneVision-2 data mixtures.
Figure 5: LLaVA-OneVision-2 data mixtures.

实验结果

实验结果分四个维度展开。视频理解(18 任务):LLaVA-OV-2-8B 平均 62.5,比 Qwen3-VL-8B 的 58.2 高 +4.3,在 LongVideoBench(66.9 vs 68.0)、VideoMME-Long+sub(76.3 vs 75.6)等长视频任务上小幅领先或持平,最大差距出现在 JumpScore(74.9 vs 30.1,+44.8)、VSI-Bench(70.9 vs 59.1,+11.8)、ReVSI(57.6 vs 48.9,+8.7)、QVHighlights(66.4 vs 59.4,+7.0)、ActivityNet 时序定位(53.8 vs 46.8,+7.0)。空间推理(11 任务):LLaVA-OV-2-8B 平均 63.5 同样领先 Qwen3-VL-8B 的 58.2(+5.3),其中 CrossPoint 从 26.9 跃升到 61.9(+35.0)、TraceSpatial-3D 从 8.0 跃升到 31.0(近 4 倍),CV-Bench 2D/3D、EmbSpatial、SAT 等也达到 8B 最优。图像与文档理解(11 任务):平均 79.7,与 Qwen3-VL-8B 的 80.7 几乎持平(差距 -1.0),但 V*-Bench 取得 85.9 的最佳,这说明长视频 + 空间训练没有牺牲通用图像能力。跟踪(RVOS, 4 任务 J&F):LLaVA-OV-2-8B 平均 48.0,大幅领先 Qwen3-VL-8B 的 32.4(+15.6);DAVIS 58.7 vs 41.3(+17.4)、MeViS-U 45.7 vs 28.4(+17.3)、REVOS-Ref 58.2 vs 37.8(+20.4)、REVOS-Reason 29.2 vs 21.9(+7.3)。Codec-stream vs 帧采样的对照:在匹配 token 预算下,codec-stream 在 4 个时序定位 benchmark(QVHighlights、Charades-STA、ActivityNet、JumpScore)上平均带来 +9.7 点的提升(从 35.5 到 45.2),JumpScore 平均从 37.9 跃升到 55.2(+17.3),其中 4 帧预算下从 32.5 提升到 39.4(+21.2% 相对)。长视频问答(LVBench、VideoMME-L+sub、MLVU-dev、VideoEval-Pro)上 codec-stream 保持小幅领先或持平(+1.2 到 +2.6 平均),证明码流证据分配不会以牺牲语义覆盖为代价。Per-skill ablation(Figure 8):在 VideoMME-v2 上,codec-stream 在视觉识别(+13.5)、视觉引导音频描述(+10.8)、视听推理(+9.0)、事件排序(+5.6)、基础计数(+4.8)上显著领先;但帧采样在运动轨迹、运动属性、二元交互、未来事件预测上更强,清晰揭示了 codec-stream 的能力边界——擅长事件级定位与显著性,弱于需要密集轨迹连续性的细粒度运动分析。

Video understanding benchmarks for 8B-class MLLMs.
Table 1: Video understanding benchmarks for 8B-class MLLMs.
Extended long-video frame-budget sweep.
Table 3: Extended long-video frame-budget sweep.
Numerical values for the video QA and JumpScore curves in Figure 7.
Table 4: Numerical values for the video QA and JumpScore curves in Figure 7.
Numerical values for the temporal grounding curves in Figure 7.
Table 5: Numerical values for the temporal grounding curves in Figure 7.
Representative cycles from the JumpScore benchmark.
Figure 6: Representative cycles from the JumpScore benchmark.
Codec-stream inputs versus frame sampling.
Figure 7: Codec-stream inputs versus frame sampling.
查看结构化数据
任务指标本文基线提升
JumpScore 时序定位 mAP (δ=0.1/0.2/0.3 平均) 74.9 Qwen3-VL-8B: 30.1 +44.8 绝对
QVHighlights 时序定位 mAP 66.4 Qwen3-VL-8B: 59.4 +7.0
Charades-STA 时序定位 R1 53.5 Qwen3-VL-8B: 48.3 +5.2
ActivityNet 时序定位 R1 53.8 Qwen3-VL-8B: 46.8 +7.0
VSI-Bench 视频空间智能 准确率 70.9 Qwen3-VL-8B: 59.1 +11.8
ReVSI 视频空间智能 准确率 57.6 Qwen3-VL-8B: 48.9 +8.7
CrossPoint 跨视角空间 准确率 61.9 Qwen3-VL-8B: 26.9 +35.0
TraceSpatial-3D 3D 空间轨迹 准确率 31.0 Qwen3-VL-8B: 8.0 近 4 倍
DAVIS 视频跟踪 J&F 58.7 Qwen3-VL-8B: 41.3 +17.4
MeViS-U 视频跟踪 J&F 45.7 Qwen3-VL-8B: 28.4 +17.3
REVOS-Ref 视频跟踪 J&F 58.2 Qwen3-VL-8B: 37.8 +20.4
Codec-stream vs 帧采样(4 任务平均) 匹配 token 预算下的平均分 45.2 帧采样 35.5 +9.7
Codec-stream vs 帧采样(JumpScore 平均) mAP 55.2 帧采样 37.9 +17.3
LongVideoBench 长视频 准确率 66.9 Qwen3-VL-8B: 68.0 -1.1 (基本持平)
MLVU-dev 长视频 准确率 76.6 Qwen3-VL-8B: 78.1 -1.5 (基本持平)

局限与改进

作者在论文中通过 Figure 8 的 per-skill ablation 明确承认了 codec-stream 的能力边界:在需要密集轨迹连续性的任务(运动轨迹、运动属性、二元交互、未来事件预测)上,帧采样优于 codec-stream。这是因为 codec-stream 用稀疏 patch 块覆盖 P 帧,丢失了帧级纹理细节与微小时序变化;而这些细节恰恰是判断「动作下一步往哪走」「两人如何互动」的关键信号。此外,codec-stream 仅在 Stage 4 的 10–15 分钟视频字幕语料上启用,说明这一能力需要显式监督才能学到,不能自然从图像/短视频迁移。独立观察到的局限包括:第一,codec 预处理增加工程复杂度,需要完整的 H.264/HEVC 解码流水线与码率/运动矢量解析,部署门槛高于纯帧采样;第二,本文只验证到 768 帧上限,小时级或更长的视频仍是「外推区」,作者在结论中明确承认这是未来工作;第三,对图像/文档理解这一通用能力,平均分比 Qwen3-VL-8B 略低 1.0 分,在 OCRBench(78.2 vs 84.7)、InfoVQA(74.4 vs 83.4)等文字密集任务上差距更明显,说明空间+长视频训练以轻微牺牲 OCR 为代价;第四,JumpScore 仅有 189 段视频,集中在 30–90 秒、室内场景、跳绳单一动作,生态有效性(criterion validity)有限。

独立分析的弱点

独立分析三个具体弱点。弱点一:对静态细节高度敏感的任务存在回归风险。如图 8 所示,codec-stream 在「未来事件预测」上落后帧采样 11.7 分,在「二元交互」上落后 5.6 分。原因在于 codec 用显著性挑选 patch,会把「看似静止但承载隐含语义」的区域(如眼神方向、手部细微姿态)误判为低显著性而丢弃。改进方向:在显著性打分中加入一个轻量级「语义先验」,例如对头部、手部、人脸检测框周围的 patch 强制保留最小覆盖率;或者训练一个二分类器预测「该 patch 是否对下游任务有用」作为残差项。弱点二:对 codec 编码质量的依赖未量化。论文假设输入视频已用 H.264/HEVC 编码,但未对比不同编码参数(CRF、preset、profile)对 codec-stream 性能的影响。如果用户传入的是高 CRF 低码率视频,运动矢量与残差本身就有量化误差,可能误导显著性。改进方向:在数据训练中加入不同 CRF 等级的样本增强,并在推理前提供 codec 质量自检模块,对低质量码流自动回退到帧采样。弱点三:训练数据规模与训练算力透明度不足。论文没有给出总训练 token 数、GPU 小时数、单阶段 epoch 数等关键复现信息,只说明训练混合是 50% codec-patchified video + 37.5% 均匀采样视频 + 12.5% 图像。改进方向:补充训练配置卡片(类似 LLaVA-OneVision-1.5 的 release),尤其是 Stage 4 中 codec 流式 tokenization 引入后是否需要更长 warmup 或更小学习率。

未来方向

作者在结论中明确指出三个延伸方向:一是把 codec-aligned 范式推向流式感知(streaming perception)与小时级甚至更长的 codec-context 建模,使视觉证据能持续更新、压缩、检索;二是把 codec-stream 与时序定位强化学习(GRPO 类)结合,因为 §9.3 显示 RL 后训练方法(VideoChat-R1、Time-R1、Video-R1)与 codec-stream 是正交的、可叠加的;三是进一步统一多种 codec 信号(本文只用 P 帧码率与 MV+残差),可探索 B 帧的双向预测信号与场景切换检测。基于成果的可延伸方向:第一,把 codec-stream 与 agent 框架结合,使模型在长视频交互中能「按需放大」感兴趣的时间段(类似人类快进-倒带行为);第二,把 2D/3D 空间语料与 codec-stream 联合训练,使空间推理也能受益于事件级视觉预算分配(目前 2D/3D 训练仍用帧采样);第三,设计 codec-aware 评测协议,要求模型同时输出「在哪些时间戳看了哪些 patch」,以提升模型可解释性。

复现评估

复现评估整体偏正面。开源情况:代码已开源在 https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-2,模型权重在 https://huggingface.co/lmms-lab-encoder/LLaVA-OneVision-2-8B-Instruct,训练数据在 https://huggingface.co/datasets/mvp-lab/LLaVA-OneVision-2-Data,JumpScore 数据集在 https://huggingface.co/datasets/lmms-lab-encoder/JumpScore,四件套齐全。数据规模:视频字幕 ~8M(从 30s 到 15min 四档分层),2D/3D 空间语料 4M,再加上 LLaVA-OV-1.5 的 85M 中训练数据 + 22M 指令数据 + FineVision 24M,总数据规模在 1 亿级,中小团队获取可行但训练成本高。算力需求:8B 模型 + 多阶段训练(从 30 帧到 768 帧),且 Stage 4 启用 codec-stream 需额外 codec 解码开销,推测需要至少 64 张 H100/A100 训练两周以上,个人研究者难以完整复现。复现难度:中等偏低——架构与训练流程都有清晰公式和分阶段说明,mixed-batch 组成与 frame-budget schedule 在 §5 中明文给出;但 codec 解码端需实现 H.264/HEVC 码率与运动矢量解析(可基于 FFmpeg + 自定义解析器),细节工程量较大。评测:基于 LMMs-Eval 与 lmms-eval-ov2 评测器,默认 prompt 与解码策略,benchmark 选用公开榜单,结果可被独立验证。