LLaVA-OneVision-2:迈向下一代感知智能 LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
把视频当码率流处理,codec-stream 在事件级定位上 +44.8。
前置知识
视频编解码器(Video Codec)
H.264/HEVC 把视频切成 I 帧(完整编码)与 P/B 帧(用运动矢量+残差编码相对参考的变化)。P/B 帧的字节数、运动矢量、亮度残差共同构成「视频的预测难度信号」,远比解码后像素更结构化。
本文 codec-stream 完全建立在码流之上:码率决定时间分组,MV+残差决定空间显著性。理解 codec 结构才能看懂「为什么码率流是比帧采样更合理的观察单位」。
视觉Token压缩(Visual Token Reduction)
MLLM 处理视频时 token 数随帧数线性膨胀。一系列工作压缩 token:ToMe 合并相似、TokenLearner 学习选择、PruMerge 训练式、LLaVA-Pruner 训练无关。这些都在像素空间或模型内部操作,与视频压缩结构脱钩。
本文属于压缩谱系最右端「codec-native」路线,理解前面四代局限(错过关键帧、启发式信息损失、训练复杂、codec 质量依赖)才能体会到 codec-stream 的实质进步。
时序定位(Temporal Grounding)
时序定位:给定视频与文本查询,输出事件在时间轴上的起止戳(秒)。代表 benchmark 有 Charades-STA、ActivityNet、QVHighlights,用 mIoU 或 R1@IoU 评估。比纯视频问答更精细,要求秒级定位。
本文把时序定位作为 codec-stream 的核心战场,新提 JumpScore。低帧预算(4-16 帧)下均匀采样会错过事件边界,codec-stream 通过码率峰值定位转换时刻,带来 9.7 点提升。
3D RoPE 与共享坐标系
RoPE 用旋转矩阵编码位置,3D RoPE 把 (t, h, w) 三维都纳入,使视觉 token 具备时空坐标。本文让 codec 块、采样帧、图像共享同一 3D RoPE,共用一套编码器参数。
统一坐标系是 codec-stream 以 plugin 方式工作的关键。如果每种输入需要单独 RoPE,编码器就无法无缝处理混合输入,mixed-batch 训练也无从谈起。
Native-Resolution Vision Transformer
传统 ViT 把图片 resize 到固定尺寸(如 224/336),会损失细节。Native-Resolution ViT 支持任意长宽比,通过 2D 窗口注意力控制算力,让任意尺寸图片在原始分辨率下处理,本文用 OneVision-Encoder 实现 16k patches。
codec-stream 选择 patch 而非帧作为压缩单位,正因为 native-resolution 使 patch-level 选择有实际意义:被选中的 patch 保留真实像素细节,被丢掉的 patch 信息真的损失。
研究动机
现有 8B 级开源视频多模态大模型(Qwen3-VL、InternVL-3.5、Keye-VL-1.5、LLaVA-OV-1.5)几乎全部沿用「帧中心」观察范式:把视频解码成像素帧后,均匀采样 8–32 帧或混分辨率采样(稀疏高分辨率关键帧+密集低分辨率上下文帧),每帧的所有 patch 全量进入语言模型。这一范式存在三个本质问题。第一,大量关键信息被丢弃:在长视频中,目标事件可能只占 1% 时长,但均匀采样会以同样概率错过它们,作者在 JumpScore 上验证 Qwen3-VL-8B 仅得到 30.1 mAP,而真实任务要求 0.1 秒精度的事件定位。第二,patch 利用率低:大多数 patch 并不包含判别性证据,例如在静态背景帧中,所有 patch 都在重复编码几乎相同的内容,白白消耗 token 预算。第三,忽视了视频的「预测结构」:视频编解码器 H.264/HEVC 已经把视频分解为 I 帧(完整编码)和 P/B 帧(用运动矢量和残差编码相对于参考的变化),这本身就是视频「哪里有变化、变化多大」的精确信号,却被解码过程丢弃了。这些问题共同导致长视频理解、时序定位、跟踪类任务在 8B 模型上长期停滞。
本文的目标是本文的具体目标是设计一个统一的多模态架构,在视频理解、时序定位、空间定位、操控轨迹推理四个任务上同时达到 8B 级别的 SOTA,并提出可量化的提升指标:相比 Qwen3-VL-8B,在 18 个视频任务平均分上 +4.3,在 11 个空间推理任务平均分上 +5.3,在 4 个跟踪任务平均 J&F 上 +15.6,在新提出的 JumpScore 上从 30.1 提升到 74.9(提升 +44.8)。同时通过 codec-stream vs 帧采样的对照实验证明,codec-stream 输入相比帧采样在时序定位上单独贡献 +9.7 点的绝对提升。
与已有工作不同的是,本文的独特切入角度是「以码率流为基本观察单位」,这与已有四条压缩路线(早期稀疏采样、启发式 token 压缩、学习式 token 选择、codec-aligned 帧 token)形成鲜明对比。前三类工作在解码后的像素空间操作,信息已被截断;第四类工作虽然引入 codec 但仍把 token 与固定 GOP 槽位对齐,而 codec-stream 真正让 token 密度跟随码率-残差画像变化:高码率区(快速运动、视角切换、视觉突变)自然获得密集 token,低码率区(可预测的平稳段)被稀疏化,从而把视觉预算集中到「事件承载」内容上。这一视角的核心洞察是「视频的预测难度本身就是最合理的事件检测器」,不需要额外学习一个事件分割模型。
核心方法
LLaVA-OneVision-2 的方法直觉可以这样理解:把视频当作一本「按难度排版的书」,而不是均匀切片的胶片。一段视频里,真正承载事件的只是少数几个瞬间(比如跳绳的每次起跳、苹果被拿起放下),其余时间是可预测的重复或静止。H.264/HEVC 在编码时就已经识别出哪些段难(高码率)、哪些段容易(低码率),这恰好就是模型应该「看仔细」的线索。技术路线上,作者把整个流程拆成四块:OneVision-Encoder 作为统一视觉编码器(原生分辨率 + 窗口注意力 + 共享 3D RoPE);codec-stream tokenization 作为输入侧证据分配机制(码率决定时间组、运动残差决定 patch 选择);一个两层的 MLP connector 把视觉 token 投影到语言空间;最后用 Qwen3-8B 作为语言模型解码器,在四阶段渐进训练中学习「看哪里」。
本文最本质的创新是 codec-stream tokenization 把 codec 码率流作为 token 分配的「第一性信号」。这与已有 codec 类工作(EMA、Video-LaVIT、RLT)的关键区别在于:已有工作把 codec 字段当作「另一种 token 类型」,而 codec-stream 把 codec 字段当作「token 应该出现在哪里的指针」。具体实现上,作者设计了三个耦合机制:一是基于 P 帧数据包字节数的累积码率阈值自适应切分可变长度 GOP(码率高则组短,码率低则组长),把「按帧数等距分配」换成「按码率分配」;二是基于运动矢量+亮度残差的 saliency map 在每个 GOP 内挑选 2×2 patch 块,把「帧级选择」换成「patch 块级选择」,并把块大小与 OneVision-Encoder 自带的 2×2 merge 对齐,避免后续合并把无关 patch 拼到一起;三是基于累积权重曲线的分层时序分配(per-frame attenuation + peak mass),防止单帧霸占整个 GOP 的预算。本质上,这是一种「事件驱动的视觉注意力预算」,与人类视觉系统会自然把注意力分配到运动突变处的机制一致。
方法步骤详情
完整的 codec-stream 流程可拆成六步。第一步:对原始视频用 H.264/HEVC 编码,提取 I 帧(空间完整)、P/B 帧的运动矢量 $d_t$ 与亮度残差 $r_t^Y$,每个 P/B 帧数据包附带字节数 bytes(q) 与时间戳 $\tau(q)$。第二步:按时间分箱(bin 宽度 $\Delta$),累加每个 bin 内的 P/B 帧包字节数得到 $e_b$,并据此计算目标每组码率配额 $\theta = \max(1, K_{tar})$。第三步:按公式 $\min\{i \geq s_k : (i - s_k + 1 \geq L_{max}) \lor (i - s_k + 1 \geq L_{min} \land \sum e_b \geq \theta)\}$ 触发新的时间组边界,再用字典序规则(先选码率谷,再选最近点)在邻域内精炼,得到可变长度 GOP $[s_k, c_k]$。第四步:对每个 GOP 内每个 P 帧计算显著性图 $S_t(x) = M_t(x) + R_t(x)$,其中 $M_t$ 是运动矢量幅度的百分位归一化,$R_t$ 是亮度残差相对零值 128 的绝对偏差再归一化。第五步:对显著性图做 2×2 patch 块聚合得分 $A_{t,i,j} = \sum_{\alpha,\beta \in \{0,1\}} \sum_{x \in P_{2i+\alpha, 2j+\beta}} S_t(x)$,再融合块级码率先验,得到每个候选块的最终得分。第六步:对每帧候选按得分降序排序,按公式 $\hat{A}_z = A_{t,i,j} / \sqrt{1 + \lambda \rho_t(z)}$ 衰减同帧重复候选(防止单帧霸占),计算帧级分配权重 $w_t$,再按累积权重曲线 $F_k(\ell) = \sum_{n=0}^{\ell} w_{t_n} / \sum_n w_{t_n}$ 把 GOP 划分成 $m_k$ 个 P-canvas,每个 P-canvas 从对应时间窗内的高分非重复块中抽取 patch 装入。GOP 的首个 I 帧作为 anchor I-canvas,其余 P-canvas 携带运动残差证据。所有 canvas 的 patch 通过 patch embedding + 共享 3D RoPE 进入 OneVision-Encoder,编码器对 codec-stream 输入使用 $\kappa_u$ 作为 group id 实现 group-visible attention,确保同一 GOP 内的 token 互相可见但跨 GOP 隔离。整个流程在训练与推理时配置相同,无额外学习参数。
技术新颖性
技术新颖性体现在三个层面。第一,把 codec 信号从「特征」提升为「分配器」:已有 codec-aware 工作(EMA、Video-LaVIT)把 codec 字段直接当作 token 序列或额外输入分支,而 codec-stream 让 codec 字段决定哪些 pixel-level 位置生成 token,这是观察单位的根本转换。第二,在 patch 块粒度上把空间显著性、块级码率先验、per-frame 衰减三者耦合,并把 2×2 块与 OneVision-Encoder 的 2×2 merge 操作对齐,使得选中块直接对应 4 个空间相干 patch token,避免了 ToMe 类相似合并把不相关 patch 错误合并的问题。第三,把「组(group)」作为一阶注意力可见性单元:通过 $\kappa_u$ 让同一可变长度 GOP 内的 token 共享注意力可见性,不同 GOP 之间隔离,这比固定 4-slot 分组更适配 codec 自身的预测结构。综合起来,这是第一个把「码率流-运动残差-原生分辨率 2×2 块-统一 3D RoPE-group-visible attention」全链路打通并端到端训练的开源 8B MLLM。
实验结果
实验结果分四个维度展开。视频理解(18 任务):LLaVA-OV-2-8B 平均 62.5,比 Qwen3-VL-8B 的 58.2 高 +4.3,在 LongVideoBench(66.9 vs 68.0)、VideoMME-Long+sub(76.3 vs 75.6)等长视频任务上小幅领先或持平,最大差距出现在 JumpScore(74.9 vs 30.1,+44.8)、VSI-Bench(70.9 vs 59.1,+11.8)、ReVSI(57.6 vs 48.9,+8.7)、QVHighlights(66.4 vs 59.4,+7.0)、ActivityNet 时序定位(53.8 vs 46.8,+7.0)。空间推理(11 任务):LLaVA-OV-2-8B 平均 63.5 同样领先 Qwen3-VL-8B 的 58.2(+5.3),其中 CrossPoint 从 26.9 跃升到 61.9(+35.0)、TraceSpatial-3D 从 8.0 跃升到 31.0(近 4 倍),CV-Bench 2D/3D、EmbSpatial、SAT 等也达到 8B 最优。图像与文档理解(11 任务):平均 79.7,与 Qwen3-VL-8B 的 80.7 几乎持平(差距 -1.0),但 V*-Bench 取得 85.9 的最佳,这说明长视频 + 空间训练没有牺牲通用图像能力。跟踪(RVOS, 4 任务 J&F):LLaVA-OV-2-8B 平均 48.0,大幅领先 Qwen3-VL-8B 的 32.4(+15.6);DAVIS 58.7 vs 41.3(+17.4)、MeViS-U 45.7 vs 28.4(+17.3)、REVOS-Ref 58.2 vs 37.8(+20.4)、REVOS-Reason 29.2 vs 21.9(+7.3)。Codec-stream vs 帧采样的对照:在匹配 token 预算下,codec-stream 在 4 个时序定位 benchmark(QVHighlights、Charades-STA、ActivityNet、JumpScore)上平均带来 +9.7 点的提升(从 35.5 到 45.2),JumpScore 平均从 37.9 跃升到 55.2(+17.3),其中 4 帧预算下从 32.5 提升到 39.4(+21.2% 相对)。长视频问答(LVBench、VideoMME-L+sub、MLVU-dev、VideoEval-Pro)上 codec-stream 保持小幅领先或持平(+1.2 到 +2.6 平均),证明码流证据分配不会以牺牲语义覆盖为代价。Per-skill ablation(Figure 8):在 VideoMME-v2 上,codec-stream 在视觉识别(+13.5)、视觉引导音频描述(+10.8)、视听推理(+9.0)、事件排序(+5.6)、基础计数(+4.8)上显著领先;但帧采样在运动轨迹、运动属性、二元交互、未来事件预测上更强,清晰揭示了 codec-stream 的能力边界——擅长事件级定位与显著性,弱于需要密集轨迹连续性的细粒度运动分析。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| JumpScore 时序定位 | mAP (δ=0.1/0.2/0.3 平均) | 74.9 | Qwen3-VL-8B: 30.1 | +44.8 绝对 |
| QVHighlights 时序定位 | mAP | 66.4 | Qwen3-VL-8B: 59.4 | +7.0 |
| Charades-STA 时序定位 | R1 | 53.5 | Qwen3-VL-8B: 48.3 | +5.2 |
| ActivityNet 时序定位 | R1 | 53.8 | Qwen3-VL-8B: 46.8 | +7.0 |
| VSI-Bench 视频空间智能 | 准确率 | 70.9 | Qwen3-VL-8B: 59.1 | +11.8 |
| ReVSI 视频空间智能 | 准确率 | 57.6 | Qwen3-VL-8B: 48.9 | +8.7 |
| CrossPoint 跨视角空间 | 准确率 | 61.9 | Qwen3-VL-8B: 26.9 | +35.0 |
| TraceSpatial-3D 3D 空间轨迹 | 准确率 | 31.0 | Qwen3-VL-8B: 8.0 | 近 4 倍 |
| DAVIS 视频跟踪 | J&F | 58.7 | Qwen3-VL-8B: 41.3 | +17.4 |
| MeViS-U 视频跟踪 | J&F | 45.7 | Qwen3-VL-8B: 28.4 | +17.3 |
| REVOS-Ref 视频跟踪 | J&F | 58.2 | Qwen3-VL-8B: 37.8 | +20.4 |
| Codec-stream vs 帧采样(4 任务平均) | 匹配 token 预算下的平均分 | 45.2 | 帧采样 35.5 | +9.7 |
| Codec-stream vs 帧采样(JumpScore 平均) | mAP | 55.2 | 帧采样 37.9 | +17.3 |
| LongVideoBench 长视频 | 准确率 | 66.9 | Qwen3-VL-8B: 68.0 | -1.1 (基本持平) |
| MLVU-dev 长视频 | 准确率 | 76.6 | Qwen3-VL-8B: 78.1 | -1.5 (基本持平) |
局限与改进
作者在论文中通过 Figure 8 的 per-skill ablation 明确承认了 codec-stream 的能力边界:在需要密集轨迹连续性的任务(运动轨迹、运动属性、二元交互、未来事件预测)上,帧采样优于 codec-stream。这是因为 codec-stream 用稀疏 patch 块覆盖 P 帧,丢失了帧级纹理细节与微小时序变化;而这些细节恰恰是判断「动作下一步往哪走」「两人如何互动」的关键信号。此外,codec-stream 仅在 Stage 4 的 10–15 分钟视频字幕语料上启用,说明这一能力需要显式监督才能学到,不能自然从图像/短视频迁移。独立观察到的局限包括:第一,codec 预处理增加工程复杂度,需要完整的 H.264/HEVC 解码流水线与码率/运动矢量解析,部署门槛高于纯帧采样;第二,本文只验证到 768 帧上限,小时级或更长的视频仍是「外推区」,作者在结论中明确承认这是未来工作;第三,对图像/文档理解这一通用能力,平均分比 Qwen3-VL-8B 略低 1.0 分,在 OCRBench(78.2 vs 84.7)、InfoVQA(74.4 vs 83.4)等文字密集任务上差距更明显,说明空间+长视频训练以轻微牺牲 OCR 为代价;第四,JumpScore 仅有 189 段视频,集中在 30–90 秒、室内场景、跳绳单一动作,生态有效性(criterion validity)有限。
独立分析的弱点
独立分析三个具体弱点。弱点一:对静态细节高度敏感的任务存在回归风险。如图 8 所示,codec-stream 在「未来事件预测」上落后帧采样 11.7 分,在「二元交互」上落后 5.6 分。原因在于 codec 用显著性挑选 patch,会把「看似静止但承载隐含语义」的区域(如眼神方向、手部细微姿态)误判为低显著性而丢弃。改进方向:在显著性打分中加入一个轻量级「语义先验」,例如对头部、手部、人脸检测框周围的 patch 强制保留最小覆盖率;或者训练一个二分类器预测「该 patch 是否对下游任务有用」作为残差项。弱点二:对 codec 编码质量的依赖未量化。论文假设输入视频已用 H.264/HEVC 编码,但未对比不同编码参数(CRF、preset、profile)对 codec-stream 性能的影响。如果用户传入的是高 CRF 低码率视频,运动矢量与残差本身就有量化误差,可能误导显著性。改进方向:在数据训练中加入不同 CRF 等级的样本增强,并在推理前提供 codec 质量自检模块,对低质量码流自动回退到帧采样。弱点三:训练数据规模与训练算力透明度不足。论文没有给出总训练 token 数、GPU 小时数、单阶段 epoch 数等关键复现信息,只说明训练混合是 50% codec-patchified video + 37.5% 均匀采样视频 + 12.5% 图像。改进方向:补充训练配置卡片(类似 LLaVA-OneVision-1.5 的 release),尤其是 Stage 4 中 codec 流式 tokenization 引入后是否需要更长 warmup 或更小学习率。
未来方向
作者在结论中明确指出三个延伸方向:一是把 codec-aligned 范式推向流式感知(streaming perception)与小时级甚至更长的 codec-context 建模,使视觉证据能持续更新、压缩、检索;二是把 codec-stream 与时序定位强化学习(GRPO 类)结合,因为 §9.3 显示 RL 后训练方法(VideoChat-R1、Time-R1、Video-R1)与 codec-stream 是正交的、可叠加的;三是进一步统一多种 codec 信号(本文只用 P 帧码率与 MV+残差),可探索 B 帧的双向预测信号与场景切换检测。基于成果的可延伸方向:第一,把 codec-stream 与 agent 框架结合,使模型在长视频交互中能「按需放大」感兴趣的时间段(类似人类快进-倒带行为);第二,把 2D/3D 空间语料与 codec-stream 联合训练,使空间推理也能受益于事件级视觉预算分配(目前 2D/3D 训练仍用帧采样);第三,设计 codec-aware 评测协议,要求模型同时输出「在哪些时间戳看了哪些 patch」,以提升模型可解释性。
复现评估
复现评估整体偏正面。开源情况:代码已开源在 https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-2,模型权重在 https://huggingface.co/lmms-lab-encoder/LLaVA-OneVision-2-8B-Instruct,训练数据在 https://huggingface.co/datasets/mvp-lab/LLaVA-OneVision-2-Data,JumpScore 数据集在 https://huggingface.co/datasets/lmms-lab-encoder/JumpScore,四件套齐全。数据规模:视频字幕 ~8M(从 30s 到 15min 四档分层),2D/3D 空间语料 4M,再加上 LLaVA-OV-1.5 的 85M 中训练数据 + 22M 指令数据 + FineVision 24M,总数据规模在 1 亿级,中小团队获取可行但训练成本高。算力需求:8B 模型 + 多阶段训练(从 30 帧到 768 帧),且 Stage 4 启用 codec-stream 需额外 codec 解码开销,推测需要至少 64 张 H100/A100 训练两周以上,个人研究者难以完整复现。复现难度:中等偏低——架构与训练流程都有清晰公式和分阶段说明,mixed-batch 组成与 frame-budget schedule 在 §5 中明文给出;但 codec 解码端需实现 H.264/HEVC 码率与运动矢量解析(可基于 FFmpeg + 自定义解析器),细节工程量较大。评测:基于 LMMs-Eval 与 lmms-eval-ov2 评测器,默认 prompt 与解码策略,benchmark 选用公开榜单,结果可被独立验证。
论文图表
时间线纵轴列出五个阶段:2018 早期帧/片段采样(I3D、SlowFast、TSN)、2019-2021 启发式 token 压缩(H2O、ToMe、DynamicViT、LLaVA-Pruner)、2022-2023 学习式 token 选择(PruMerge、TokenLearner、SmartEvo-ViT)、2024-2025 codec-aligned MLLM(EMA、Video-LaVIT)、2026+ native codec representation(LLaVA-OneVision-2)。每阶段下方给出压缩粒度、主要趋势与局限性。
这张图给整篇论文的定位——「我们处于 codec-native 时代的开端」——提供了历史坐标系。读者看完能立刻明白 codec-stream 不是凭空出现,而是压缩谱系的最新演进,且每代方法的局限都被下一代针对性解决。
横轴是 codec 减去 frame sampling 的分差(±区间),纵轴列出 10 项技能:视觉识别 +13.5、视觉引导音频描述 +10.8、视听推理 +9.0、音频引导视觉描述 +8.5、事件排序 +5.6、基础计数 +4.8(codec 占优),运动轨迹 -3.1、运动属性 -5.1、二元交互 -5.6、未来事件预测 -11.7(帧采样占优)。
这张图是论文诚实的「能力地图」。它告诉读者 codec-stream 不是万能药——擅长事件级定位与显著性,弱于需要密集轨迹连续性的细粒度运动分析。任何决定是否采纳 codec-stream 的工程师,看完这张图就知道在哪些场景下回退到帧采样更稳妥。
6 个模型在 11 个空间推理 + 11 个图像/文档 benchmark 上的得分。LLaVA-OV-2-8B 在空间平均 63.5 上领先,在图像/文档平均 79.7 与 Qwen3-VL-8B 的 80.7 基本持平,但在 V*-Bench 上以 85.9 取得最佳。
这张表回答了读者的关键疑问:长视频+空间训练是否牺牲了通用图像能力?答案是几乎不牺牲,在 V*-Bench 等高分辨率感知任务上甚至占优,但 OCR/InfoVQA 等文字密集任务上略弱于专用模型。
6 个模型在 DAVIS、MeViS-U、REVOS-Ref、REVOS-Reason 四个跟踪 split 上,每个 split 报 F、HOTA、J&F 三指标。LLaVA-OV-2-8B 在 Overall 41.0 vs Qwen3-VL-8B 30.8(+10.2),DAVIS/MeViS/REVOS-Ref 的 J&F 提升分别为 +17.4/+17.3/+20.4。
跟踪是论文宣称的「跨帧一致性」核心证据。LLaVA-OV-2 用 ID-consistent point tracks 作为 SAM2 prompts,跳过了专门的分割头训练,仅靠点跟踪+预训练 SAM2 就能在 J&F 上超越所有基线,验证了「codec-stream 提供的密集证据对跨帧对应有用」的论断。